AI-translated from English; not yet reviewed by a fluent editor.
# Execute o Mellum2.1 localmente e confira a primeira resposta
> O repositório GGUF atual da JetBrains documenta um caminho com llama.cpp para servir o Mellum2.1 localmente. Instale o runtime, envie uma solicitação de completion e confira a resposta antes de experimentar um agente.
By BIG CHANGE Editorial
Published: 2026-10-09T17:10:04.232Z
Updated: 2026-10-09T17:10:04.232Z
Canonical: https://bigchange.ai/blog/run-jetbrains-mellum21-locally-llama-cpp

Conceptual illustration of a computer that can host a local model server; no Mellum2.1 installation or test is depicted. AI-generated illustration by BIG CHANGE.
O Mellum2.1 da JetBrains está disponível como um modelo de 12 bilhões de parâmetros, dos quais 2,5 bilhões estão ativos. Tanto o repositório BF16 quanto um repositório GGUF separado estão no Hugging Face. Para a primeira execução local, o repositório GGUF documenta um caminho com llama.cpp: baixe um arquivo quantizado quando necessário, inicie um servidor local, envie um prompt e examine a resposta antes de dar acesso a qualquer agente de programação a um repositório.
Este é um guia de configuração baseado em documentação. A BIG CHANGE não instalou o Mellum2.1 nem executou os comandos abaixo. O teste de sucesso é receber uma completion local do servidor; isso não comprova qualidade de código, confiabilidade do agente ou desempenho no seu hardware.
### O que você precisa
- Um computador Windows, macOS ou Linux com memória e armazenamento suficientes para o modelo escolhido e seu runtime. O cartão da JetBrains informa que o modelo original é BF16 e tem contexto de 131.072 tokens. O repositório GGUF recomenda o arquivo Q4\_K\_M de 8,1 GB. Esse é o tamanho do arquivo, não uma estimativa completa da memória em tempo de execução: o runtime, o contexto e outros processos precisam de recursos adicionais. A JetBrains não publica um requisito mínimo de memória.
- É necessária uma conexão à internet para o download inicial do software e do modelo. A própria solicitação de inferência pode ser enviada ao servidor local.
- llama.cpp e um terminal. O repositório documenta `winget install llama.cpp` para Windows e um comando `llama serve` para servir localmente.
O modelo é lançado sob a licença Apache 2.0. Não há taxa de uso dos pesos listada; a JetBrains não quantifica custos de hardware, energia, armazenamento ou infraestrutura que você decidir alugar. O cartão BF16 atual diz que nenhum provedor de inferência atende esse repositório. O GGUF é um artefato quantizado separado, com seu próprio guia rápido para llama.cpp.
### Etapa 1: Instale o llama.cpp e inicie o servidor local
No PowerShell do Windows, instale o llama.cpp usando o [guia rápido GGUF oficial do Mellum2.1](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF):
```powershell
winget install llama.cpp
```
Abra um novo terminal se o comando `llama` ainda não estiver no seu PATH. Inicie o build Q4\_K\_M recomendado e vincule-o explicitamente ao computador local na porta 8080:
```powershell
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080
```
O repositório GGUF documenta este ID de modelo e quantização para `llama serve`; também documenta a instalação no Windows. A [referência do servidor llama.cpp](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) documenta `--host` e `--port`; o endpoint de exemplo do repositório é `http://localhost:8080/v1` . No macOS e no Linux, o mesmo repositório GGUF documenta a instalação do llama.cpp com `curl -LsSf https://llama.app/install.sh | sh` e depois o mesmo comando de servidor.
O processo precisa baixar o modelo antes da primeira resposta. O arquivo Q4\_K\_M está listado como 8,1 GB. Neste teste, vincule o servidor apenas ao seu próprio computador; não o exponha à rede nem coloque credenciais no prompt. O repositório também lista um arquivo MXFP4\_MOE menor, de 7,0 GB, e variantes Q6\_K, Q8\_0 e BF16 maiores. A quantização altera o artefato do modelo; só o tamanho do arquivo não mostra se um computador específico consegue servi-lo com contexto ou velocidade úteis.
Se o comando não iniciar, confira primeiro o ID exato do modelo, o espaço em disco disponível, a versão do llama.cpp e o texto completo do erro. Uma falha de alocação de memória é motivo para parar e consultar as opções do runtime e as configurações de contexto na documentação atual do llama.cpp; não é prova de que o modelo tenha defeito. Não presuma que o contexto publicado de 131.072 tokens cabe no seu computador.
### Etapa 2: Envie um prompt de teste
Deixe o servidor rodando. Em uma segunda janela do PowerShell, envie uma solicitação curta à API local:
```powershell
$body = @{
model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
messages = @(
@{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
)
# Author-selected budget for this short smoke test; not a JetBrains recommendation.
max_tokens = 512
temperature = 0.6
top_p = 0.95
top_k = 20
} | ConvertTo-Json -Depth 5
$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body
$choice = $response.choices[0]
[pscustomobject]@{
finish_reason = $choice.finish_reason
has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
content = $choice.message.content
}
```
O ID do modelo, o endpoint local e os valores de amostragem seguem o exemplo de API do repositório. `max_tokens = 512` é um valor limitado escolhido para este teste curto, não uma recomendação do cartão do modelo. O Mellum2.1 é um modelo de raciocínio; o cartão GGUF diz que ele emite reasoning em blocos `<think>...</think>` . O código informa se o campo separado `reasoning_content` não está vazio, sem imprimir esse campo. Dependendo do formato de reasoning do runtime, `content` ainda pode conter texto `<think>` . O prompt é um teste rápido, não um benchmark de qualidade do modelo.
A verificação básica só passa se a solicitação retornar uma completion em vez de um erro de conexão ou do servidor, se `finish_reason` não for `length` e se o `content` final contiver `MELLUM21-LOCAL-OK` . Um HTTP bem-sucedido, sozinho, não basta: um modelo de raciocínio pode gastar um orçamento de saída pequeno antes de produzir o texto final solicitado. Se a saída estiver vazia, o marcador faltar ou `finish_reason` for `length` , considere o teste inconclusivo; aumente o orçamento de saída limitado e tente de novo em vez de diagnosticar falha do modelo. Se o PowerShell indicar falha de conexão, confirme se o primeiro terminal ainda mostra o servidor rodando e se a solicitação usa a porta 8080. Se o servidor retornar um erro, salve a mensagem exata e resolva o problema antes de testar um agente de programação. Uma resposta bem-sucedida confirma que esse caminho de inferência local pode responder a uma solicitação; não confirma que o modelo pode editar código com segurança.
### Etapa 3: Confira antes de conectar um agente
Mantenha a primeira avaliação separada de um projeto ativo. Use um repositório descartável com uma tarefa pequena e conhecida e registre o artefato e a quantização do modelo, a versão do llama.cpp, o sistema operacional, a configuração de contexto, o prompt, a saída, o tempo decorrido e o uso de recursos. Peça uma alteração delimitada, examine o diff proposto e rode você mesmo os testes existentes do repositório. Para comparar, repita a mesma tarefa com sua versão de referência atual. Um prompt ou uma execução de teste bem-sucedida não é um benchmark.
Um servidor de modelos retorna texto e, dependendo do runtime e do formato da solicitação, pode oferecer suporte a fluxos estruturados de chamadas de ferramentas. Ele não decide sozinho quais ferramentas um agente pode usar nem as executa com segurança. O agente ao redor controla acesso ao repositório, comandos do shell, edições de arquivos e execução de testes. Comece com acesso somente para leitura ou rigidamente limitado, exija aprovação para escritas e comandos, revise cada diff e mantenha segredos fora do repositório de teste e dos prompts. Pare se o agente ultrapassar a tarefa, alterar arquivos sem relação ou não conseguir explicar um teste com falha.
Para uso privado, confirme onde a inferência acontece e como seu agente está configurado. Um processo local do modelo pode manter prompts no seu computador quando as solicitações permanecem no endpoint local, mas o agente ainda pode chamar serviços externos para outros recursos. Antes de usar código ou dados privados, confira acesso à rede, logs, telemetria e permissões de ferramentas no aplicativo.
### Etapa 4: O que as evidências publicadas mostram e o que não mostram
A JetBrains descreve o Mellum2.1 como um modelo mixture-of-experts de 12B, com 2,5B de parâmetros ativos, precisão BF16 e contexto de 131.072 tokens. O cartão do modelo diz que o lançamento usa Apache 2.0 e descreve pós-treinamento que incluiu aprendizado por reforço em ambientes de software isolados. A JetBrains também publica resultados de benchmark, incluindo avaliações de programação agêntica. Esses resultados são informados pela própria JetBrains; não são medições da BIG CHANGE e não preveem a taxa de processamento do seu hardware nem os resultados do seu projeto.
Um detalhe do lançamento mudou entre as páginas de publicação. O anúncio da JetBrains de 8 de outubro dizia que as versões GGUF chegariam “em breve”. Em 9 de outubro, o repositório GGUF oficial no Hugging Face está acessível e inclui guias rápidos para llama.cpp, Ollama e outros. Este guia usa o repositório GGUF atualmente publicado. O repositório BF16 continua sendo um artefato separado; confira os dois repositórios antes de repetir essas etapas.
### A grande mudança
Agora é possível seguir um guia rápido publicado para uma build quantizada do Mellum2.1 com llama.cpp e consultá-la por um endpoint local compatível com OpenAI. Isso torna prática uma primeira verificação de inferência auto-hospedada sem depender da implantação de um provedor de inferência para o repositório BF16. Uma resposta prova que o caminho de serviço funciona; não prova qualidade do agente, adequação, privacidade em toda a cadeia de ferramentas ou prontidão para produção.
### Fontes e leituras adicionais
- [JetBrains: “Mellum2.1 Gets to Work” (8 de outubro de 2026)](https://blog.jetbrains.com/ai/2026/10/mellum2-1-gets-to-work-a-fast-open-model-for-coding-agents/) — descrição do lançamento e declaração inicial sobre a disponibilidade do GGUF.
- [Cartão do modelo JetBrains Mellum2.1 BF16](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking) — detalhes do modelo, instruções para vLLM e Transformers, benchmarks e licença.
- [Repositório JetBrains Mellum2.1 GGUF](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF) — quantizações atuais, tamanhos de arquivo, comandos do llama.cpp e exemplo de API local.
- [Projeto llama.cpp](https://github.com/ggml-org/llama.cpp) — código-fonte do runtime e informações de lançamento.
## Sources
- [Mellum2.1 Gets to Work: A Fast Open Model for Coding Agents](https://blog.jetbrains.com/ai/2026/10/mellum2-1-gets-to-work-a-fast-open-model-for-coding-agents/) — Post de lançamento da JetBrains; reflete a declaração de 8 de outubro de que as builds GGUF ainda estavam por chegar.
- [Cartão do modelo JetBrains/Mellum2.1-12B-A2.5B-Thinking](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking) — Detalhes oficiais do artefato BF16, guias rápidos do cartão do modelo, tabela de benchmarks e status dos provedores de inferência; os valores de benchmark são informados pela JetBrains.
- [Cartão do modelo e guia rápido JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF) — Artefato GGUF oficial atual, tamanhos dos arquivos quantizados, guia rápido do llama.cpp para Windows e endpoint local compatível com OpenAI.
- [llama.cpp](https://github.com/ggml-org/llama.cpp) — Referência do projeto de runtime; nenhuma versão do runtime é afirmada.
Newsletter da BIG CHANGE
A visão ampla, no seu ritmo.
Matérias recentes sobre IA e robótica, mudanças que merecem atenção e ideias práticas para usar. Escolha um briefing diário, um resumo semanal ou uma perspectiva mensal.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
Sua privacidade, sua escolha.
O armazenamento necessário ajuda a proteger o site e a lembrar suas escolhas. O Google Analytics opcional permanece desativado até você autorizá-lo. Você pode ler todas as matérias usando apenas o armazenamento necessário. Detalhes de privacidade