O Mellum2.1 da JetBrains está disponível como um modelo de 12 bilhões de parâmetros, dos quais 2,5 bilhões estão ativos. Tanto o repositório BF16 quanto um repositório GGUF separado estão no Hugging Face. Para a primeira execução local, o repositório GGUF documenta um caminho com llama.cpp: baixe um arquivo quantizado quando necessário, inicie um servidor local, envie um prompt e examine a resposta antes de dar acesso a qualquer agente de programação a um repositório.
Este é um guia de configuração baseado em documentação. A BIG CHANGE não instalou o Mellum2.1 nem executou os comandos abaixo. O teste de sucesso é receber uma completion local do servidor; isso não comprova qualidade de código, confiabilidade do agente ou desempenho no seu hardware.
O que você precisa
- Um computador Windows, macOS ou Linux com memória e armazenamento suficientes para o modelo escolhido e seu runtime. O cartão da JetBrains informa que o modelo original é BF16 e tem contexto de 131.072 tokens. O repositório GGUF recomenda o arquivo Q4_K_M de 8,1 GB. Esse é o tamanho do arquivo, não uma estimativa completa da memória em tempo de execução: o runtime, o contexto e outros processos precisam de recursos adicionais. A JetBrains não publica um requisito mínimo de memória.
- É necessária uma conexão à internet para o download inicial do software e do modelo. A própria solicitação de inferência pode ser enviada ao servidor local.
- llama.cpp e um terminal. O repositório documenta
winget install llama.cpppara Windows e um comandollama servepara servir localmente.
O modelo é lançado sob a licença Apache 2.0. Não há taxa de uso dos pesos listada; a JetBrains não quantifica custos de hardware, energia, armazenamento ou infraestrutura que você decidir alugar. O cartão BF16 atual diz que nenhum provedor de inferência atende esse repositório. O GGUF é um artefato quantizado separado, com seu próprio guia rápido para llama.cpp.
Etapa 1: Instale o llama.cpp e inicie o servidor local
No PowerShell do Windows, instale o llama.cpp usando o guia rápido GGUF oficial do Mellum2.1:
winget install llama.cppAbra um novo terminal se o comando llama ainda não estiver no seu PATH. Inicie o build Q4_K_M recomendado e vincule-o explicitamente ao computador local na porta 8080:
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080O repositório GGUF documenta este ID de modelo e quantização para llama serve; também documenta a instalação no Windows. A referência do servidor llama.cpp documenta --host e --port; o endpoint de exemplo do repositório é http://localhost:8080/v1 . No macOS e no Linux, o mesmo repositório GGUF documenta a instalação do llama.cpp com curl -LsSf https://llama.app/install.sh | sh e depois o mesmo comando de servidor.
O processo precisa baixar o modelo antes da primeira resposta. O arquivo Q4_K_M está listado como 8,1 GB. Neste teste, vincule o servidor apenas ao seu próprio computador; não o exponha à rede nem coloque credenciais no prompt. O repositório também lista um arquivo MXFP4_MOE menor, de 7,0 GB, e variantes Q6_K, Q8_0 e BF16 maiores. A quantização altera o artefato do modelo; só o tamanho do arquivo não mostra se um computador específico consegue servi-lo com contexto ou velocidade úteis.
Se o comando não iniciar, confira primeiro o ID exato do modelo, o espaço em disco disponível, a versão do llama.cpp e o texto completo do erro. Uma falha de alocação de memória é motivo para parar e consultar as opções do runtime e as configurações de contexto na documentação atual do llama.cpp; não é prova de que o modelo tenha defeito. Não presuma que o contexto publicado de 131.072 tokens cabe no seu computador.
Etapa 2: Envie um prompt de teste
Deixe o servidor rodando. Em uma segunda janela do PowerShell, envie uma solicitação curta à API local:
$body = @{
model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
messages = @(
@{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
)
# Author-selected budget for this short smoke test; not a JetBrains recommendation.
max_tokens = 512
temperature = 0.6
top_p = 0.95
top_k = 20
} | ConvertTo-Json -Depth 5
$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body
$choice = $response.choices[0]
[pscustomobject]@{
finish_reason = $choice.finish_reason
has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
content = $choice.message.content
}O ID do modelo, o endpoint local e os valores de amostragem seguem o exemplo de API do repositório. max_tokens = 512 é um valor limitado escolhido para este teste curto, não uma recomendação do cartão do modelo. O Mellum2.1 é um modelo de raciocínio; o cartão GGUF diz que ele emite reasoning em blocos <think>...</think> . O código informa se o campo separado reasoning_content não está vazio, sem imprimir esse campo. Dependendo do formato de reasoning do runtime, content ainda pode conter texto <think> . O prompt é um teste rápido, não um benchmark de qualidade do modelo.
A verificação básica só passa se a solicitação retornar uma completion em vez de um erro de conexão ou do servidor, se finish_reason não for length e se o content final contiver MELLUM21-LOCAL-OK . Um HTTP bem-sucedido, sozinho, não basta: um modelo de raciocínio pode gastar um orçamento de saída pequeno antes de produzir o texto final solicitado. Se a saída estiver vazia, o marcador faltar ou finish_reason for length , considere o teste inconclusivo; aumente o orçamento de saída limitado e tente de novo em vez de diagnosticar falha do modelo. Se o PowerShell indicar falha de conexão, confirme se o primeiro terminal ainda mostra o servidor rodando e se a solicitação usa a porta 8080. Se o servidor retornar um erro, salve a mensagem exata e resolva o problema antes de testar um agente de programação. Uma resposta bem-sucedida confirma que esse caminho de inferência local pode responder a uma solicitação; não confirma que o modelo pode editar código com segurança.
Etapa 3: Confira antes de conectar um agente
Mantenha a primeira avaliação separada de um projeto ativo. Use um repositório descartável com uma tarefa pequena e conhecida e registre o artefato e a quantização do modelo, a versão do llama.cpp, o sistema operacional, a configuração de contexto, o prompt, a saída, o tempo decorrido e o uso de recursos. Peça uma alteração delimitada, examine o diff proposto e rode você mesmo os testes existentes do repositório. Para comparar, repita a mesma tarefa com sua versão de referência atual. Um prompt ou uma execução de teste bem-sucedida não é um benchmark.
Um servidor de modelos retorna texto e, dependendo do runtime e do formato da solicitação, pode oferecer suporte a fluxos estruturados de chamadas de ferramentas. Ele não decide sozinho quais ferramentas um agente pode usar nem as executa com segurança. O agente ao redor controla acesso ao repositório, comandos do shell, edições de arquivos e execução de testes. Comece com acesso somente para leitura ou rigidamente limitado, exija aprovação para escritas e comandos, revise cada diff e mantenha segredos fora do repositório de teste e dos prompts. Pare se o agente ultrapassar a tarefa, alterar arquivos sem relação ou não conseguir explicar um teste com falha.
Para uso privado, confirme onde a inferência acontece e como seu agente está configurado. Um processo local do modelo pode manter prompts no seu computador quando as solicitações permanecem no endpoint local, mas o agente ainda pode chamar serviços externos para outros recursos. Antes de usar código ou dados privados, confira acesso à rede, logs, telemetria e permissões de ferramentas no aplicativo.
Etapa 4: O que as evidências publicadas mostram e o que não mostram
A JetBrains descreve o Mellum2.1 como um modelo mixture-of-experts de 12B, com 2,5B de parâmetros ativos, precisão BF16 e contexto de 131.072 tokens. O cartão do modelo diz que o lançamento usa Apache 2.0 e descreve pós-treinamento que incluiu aprendizado por reforço em ambientes de software isolados. A JetBrains também publica resultados de benchmark, incluindo avaliações de programação agêntica. Esses resultados são informados pela própria JetBrains; não são medições da BIG CHANGE e não preveem a taxa de processamento do seu hardware nem os resultados do seu projeto.
Um detalhe do lançamento mudou entre as páginas de publicação. O anúncio da JetBrains de 8 de outubro dizia que as versões GGUF chegariam “em breve”. Em 9 de outubro, o repositório GGUF oficial no Hugging Face está acessível e inclui guias rápidos para llama.cpp, Ollama e outros. Este guia usa o repositório GGUF atualmente publicado. O repositório BF16 continua sendo um artefato separado; confira os dois repositórios antes de repetir essas etapas.
A grande mudança
Agora é possível seguir um guia rápido publicado para uma build quantizada do Mellum2.1 com llama.cpp e consultá-la por um endpoint local compatível com OpenAI. Isso torna prática uma primeira verificação de inferência auto-hospedada sem depender da implantação de um provedor de inferência para o repositório BF16. Uma resposta prova que o caminho de serviço funciona; não prova qualidade do agente, adequação, privacidade em toda a cadeia de ferramentas ou prontidão para produção.
Fontes e leituras adicionais
- JetBrains: “Mellum2.1 Gets to Work” (8 de outubro de 2026) — descrição do lançamento e declaração inicial sobre a disponibilidade do GGUF.
- Cartão do modelo JetBrains Mellum2.1 BF16 — detalhes do modelo, instruções para vLLM e Transformers, benchmarks e licença.
- Repositório JetBrains Mellum2.1 GGUF — quantizações atuais, tamanhos de arquivo, comandos do llama.cpp e exemplo de API local.
- Projeto llama.cpp — código-fonte do runtime e informações de lançamento.



