O Mellum2.1 da JetBrains está disponível como um modelo com 12 mil milhões de parâmetros, dos quais 2,5 mil milhões estão ativos. Tanto o repositório BF16 como um repositório GGUF separado estão disponíveis no Hugging Face. Para a primeira execução local, o repositório GGUF descreve uma via com llama.cpp: descarregue um ficheiro quantizado quando necessário, inicie um servidor local, envie um prompt e examine a resposta antes de dar acesso a qualquer agente de programação a um repositório.
Este é um guia de configuração baseado na documentação. A BIG CHANGE não instalou o Mellum2.1 nem executou os comandos abaixo. A verificação de sucesso consiste numa completion local devolvida pelo servidor; não demonstra a qualidade do código, a fiabilidade do agente ou o desempenho no seu hardware.
O que é necessário
- Um computador Windows, macOS ou Linux com memória e armazenamento suficientes para o modelo escolhido e o respetivo runtime. O cartão da JetBrains indica que o modelo original é BF16 e tem um contexto de 131 072 tokens. O repositório GGUF recomenda o ficheiro Q4_K_M de 8,1 GB. Este é o tamanho do ficheiro, não uma estimativa completa da memória em execução: o runtime, o contexto e outros processos precisam de memória adicional. A JetBrains não publica um requisito mínimo de memória.
- É necessária uma ligação à Internet para a transferência inicial do software e do modelo. O próprio pedido de inferência pode ser enviado para o servidor local.
- llama.cpp e um terminal. O repositório documenta
winget install llama.cpppara Windows e um comandollama servepara servir localmente.
O modelo é disponibilizado ao abrigo da licença Apache 2.0. Não é indicada uma taxa de utilização dos pesos; a JetBrains não quantifica os custos de hardware, eletricidade, armazenamento ou infraestrutura que decida alugar. O cartão BF16 atual indica que nenhum fornecedor de inferência serve esse repositório. O repositório GGUF é um artefacto quantizado separado, com o seu próprio guia rápido para llama.cpp.
Passo 1: Instale o llama.cpp e inicie o servidor local
No PowerShell do Windows, instale o llama.cpp através do guia rápido GGUF oficial do Mellum2.1:
winget install llama.cppAbra um novo terminal se o comando llama ainda não estiver no seu PATH. Inicie a compilação Q4_K_M recomendada e associe-a explicitamente ao computador local na porta 8080:
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080O repositório GGUF documenta este ID de modelo e esta quantização para llama serve; documenta também a instalação no Windows. A referência do servidor llama.cpp documenta --host e --port; o endpoint de exemplo do repositório é http://localhost:8080/v1 . No macOS e Linux, o mesmo repositório GGUF documenta a instalação do llama.cpp com curl -LsSf https://llama.app/install.sh | sh e depois o mesmo comando de serviço.
O processo tem de descarregar o modelo antes da primeira resposta. O ficheiro Q4_K_M está indicado como tendo 8,1 GB. Para este teste, associe o servidor apenas ao seu próprio computador; não o exponha à rede nem coloque credenciais no prompt. O repositório também lista um ficheiro MXFP4_MOE mais pequeno, de 7,0 GB, e variantes Q6_K, Q8_0 e BF16 maiores. A quantização altera o artefacto do modelo; o tamanho do ficheiro, por si só, não indica se um determinado computador o consegue servir com um comprimento de contexto ou velocidade úteis.
Se o comando não arrancar, verifique primeiro o ID exato do modelo, o espaço disponível em disco, a versão do llama.cpp e o texto integral do erro. Uma falha na alocação de memória é motivo para parar e consultar as opções do runtime e as definições de contexto na documentação atual do llama.cpp; não prova que o modelo tenha defeito. Não presuma que o contexto publicado de 131 072 tokens cabe no seu computador.
Passo 2: Envie um prompt de teste rápido
Deixe o servidor em execução. Numa segunda janela do PowerShell, envie um pedido curto para a API local:
$body = @{
model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
messages = @(
@{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
)
# Author-selected budget for this short smoke test; not a JetBrains recommendation.
max_tokens = 512
temperature = 0.6
top_p = 0.95
top_k = 20
} | ConvertTo-Json -Depth 5
$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body
$choice = $response.choices[0]
[pscustomobject]@{
finish_reason = $choice.finish_reason
has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
content = $choice.message.content
}O ID do modelo, o endpoint local e os valores de amostragem seguem o exemplo de API do repositório. max_tokens = 512 é um valor limitado escolhido aqui para este teste curto, não uma recomendação do cartão do modelo. O Mellum2.1 é um modelo de raciocínio; o cartão GGUF diz que emite raciocínio em blocos <think>...</think> . O código indica se o campo separado reasoning_content não está vazio sem o imprimir. Consoante o formato de raciocínio do runtime, content ainda pode conter texto <think> . O prompt é um teste rápido, não um benchmark da qualidade do modelo.
A verificação básica só passa se o pedido devolver uma completion em vez de um erro de ligação ou do servidor, se finish_reason não for length e se o content final contiver MELLUM21-LOCAL-OK . Um HTTP bem-sucedido, por si só, não basta: um modelo de raciocínio pode gastar um orçamento de saída pequeno antes de produzir o texto final pedido. Se a saída estiver vazia, faltar o marcador ou finish_reason for length , considere o teste inconclusivo; aumente o orçamento limitado de saída e tente novamente em vez de diagnosticar uma falha do modelo. Se o PowerShell indicar uma falha de ligação, confirme que o primeiro terminal ainda mostra o servidor em execução e que o pedido usa a porta 8080. Se o servidor devolver um erro, guarde a mensagem exata e resolva-o antes de testar um agente de programação. Uma resposta bem-sucedida confirma que esta via local de inferência consegue responder a um pedido; não confirma que o modelo consegue editar código com segurança.
Passo 3: Verifique-o antes de ligar um agente
Mantenha a primeira avaliação separada de um projeto ativo. Use um repositório descartável com uma tarefa pequena e conhecida, e registe o artefacto e a quantização do modelo, a versão do llama.cpp, o sistema operativo, a definição de contexto, o prompt, a saída, o tempo decorrido e os recursos utilizados. Peça uma alteração limitada, examine o diff proposto e execute por si os testes existentes no repositório. Se quiser comparar, repita a mesma tarefa com a sua versão de referência atual. Um prompt ou uma execução de teste bem-sucedida não é um benchmark.
Um servidor de modelos devolve texto e, dependendo do runtime e do formato do pedido, pode suportar fluxos estruturados de chamadas de ferramentas. Não decide, por si só, que ferramentas um agente pode usar nem as executa em segurança. O agente envolvente controla o acesso ao repositório, comandos da shell, edições de ficheiros e execução de testes. Comece com acesso só de leitura ou estritamente limitado, exija aprovação para escritas e comandos, reveja todos os diffs e mantenha segredos fora do repositório de teste e dos prompts. Pare se o agente exceder a tarefa, alterar ficheiros sem relação ou não conseguir explicar um teste falhado.
Para uso privado, confirme onde decorre a inferência e como está configurado o agente. Um processo local do modelo pode manter os prompts no seu computador quando os pedidos permanecem no endpoint local, mas o agente ainda pode chamar serviços externos para outras funcionalidades. Antes de usar código ou dados privados, verifique o acesso à rede, os registos, a telemetria e as permissões das ferramentas nessa aplicação.
Passo 4: O que as provas publicadas mostram e não mostram
A JetBrains descreve o Mellum2.1 como um modelo mixture-of-experts de 12B com 2,5B parâmetros ativos, precisão BF16 e contexto de 131 072 tokens. O cartão do modelo diz que o lançamento usa Apache 2.0 e descreve um pós-treino que incluiu aprendizagem por reforço em ambientes de software isolados. A JetBrains também publica resultados de benchmarks, incluindo avaliações de programação agentiva. Esses resultados são comunicados pela própria JetBrains; não são medições da BIG CHANGE nem preveem o débito do seu hardware ou os resultados do seu projeto.
Um detalhe do lançamento mudou entre os locais de publicação. A publicação de lançamento da JetBrains de 8 de outubro dizia que as versões GGUF chegariam “em breve”. Em 9 de outubro, o repositório GGUF oficial no Hugging Face está acessível e inclui guias rápidos para llama.cpp, Ollama e outros. Este guia usa o repositório GGUF publicado atualmente. O repositório BF16 continua a ser um artefacto separado; verifique alterações em ambos antes de repetir estes passos.
A grande mudança
Pode agora seguir um guia rápido publicado para uma compilação quantizada do Mellum2.1 com llama.cpp e consultá-la através de um endpoint local compatível com OpenAI. Isto torna prática uma primeira verificação de inferência autoalojada sem depender da implantação de um fornecedor de inferência para o repositório BF16. Uma resposta prova que a via de serviço funciona; não prova a qualidade do agente, a adequação, a privacidade de toda a cadeia de ferramentas ou a preparação para produção.
Fontes e leitura adicional
- JetBrains: “Mellum2.1 Gets to Work” (8 de outubro de 2026) — descrição do lançamento e declaração inicial sobre a disponibilidade do GGUF.
- Cartão do modelo JetBrains Mellum2.1 BF16 — detalhes do modelo, instruções para vLLM e Transformers, benchmarks e licença.
- Repositório JetBrains Mellum2.1 GGUF — quantizações atuais, tamanhos de ficheiros, comandos llama.cpp e exemplo de API local.
- Projeto llama.cpp — código-fonte do runtime e informações de lançamento.



