O Mellum2.1 da JetBrains está disponível como um modelo com 12 mil milhões de parâmetros, dos quais 2,5 mil milhões estão ativos. Tanto o repositório BF16 como um repositório GGUF separado estão disponíveis no Hugging Face. Para a primeira execução local, o repositório GGUF descreve uma via com llama.cpp: descarregue um ficheiro quantizado quando necessário, inicie um servidor local, envie um prompt e examine a resposta antes de dar acesso a qualquer agente de programação a um repositório.

Este é um guia de configuração baseado na documentação. A BIG CHANGE não instalou o Mellum2.1 nem executou os comandos abaixo. A verificação de sucesso consiste numa completion local devolvida pelo servidor; não demonstra a qualidade do código, a fiabilidade do agente ou o desempenho no seu hardware.

O que é necessário

  • Um computador Windows, macOS ou Linux com memória e armazenamento suficientes para o modelo escolhido e o respetivo runtime. O cartão da JetBrains indica que o modelo original é BF16 e tem um contexto de 131 072 tokens. O repositório GGUF recomenda o ficheiro Q4_K_M de 8,1 GB. Este é o tamanho do ficheiro, não uma estimativa completa da memória em execução: o runtime, o contexto e outros processos precisam de memória adicional. A JetBrains não publica um requisito mínimo de memória.
  • É necessária uma ligação à Internet para a transferência inicial do software e do modelo. O próprio pedido de inferência pode ser enviado para o servidor local.
  • llama.cpp e um terminal. O repositório documenta winget install llama.cpp para Windows e um comando llama serve para servir localmente.

O modelo é disponibilizado ao abrigo da licença Apache 2.0. Não é indicada uma taxa de utilização dos pesos; a JetBrains não quantifica os custos de hardware, eletricidade, armazenamento ou infraestrutura que decida alugar. O cartão BF16 atual indica que nenhum fornecedor de inferência serve esse repositório. O repositório GGUF é um artefacto quantizado separado, com o seu próprio guia rápido para llama.cpp.

Passo 1: Instale o llama.cpp e inicie o servidor local

No PowerShell do Windows, instale o llama.cpp através do guia rápido GGUF oficial do Mellum2.1:

PowerShell
winget install llama.cpp

Abra um novo terminal se o comando llama ainda não estiver no seu PATH. Inicie a compilação Q4_K_M recomendada e associe-a explicitamente ao computador local na porta 8080:

PowerShell
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080

O repositório GGUF documenta este ID de modelo e esta quantização para llama serve; documenta também a instalação no Windows. A referência do servidor llama.cpp documenta --host e --port; o endpoint de exemplo do repositório é http://localhost:8080/v1 . No macOS e Linux, o mesmo repositório GGUF documenta a instalação do llama.cpp com curl -LsSf https://llama.app/install.sh | sh e depois o mesmo comando de serviço.

O processo tem de descarregar o modelo antes da primeira resposta. O ficheiro Q4_K_M está indicado como tendo 8,1 GB. Para este teste, associe o servidor apenas ao seu próprio computador; não o exponha à rede nem coloque credenciais no prompt. O repositório também lista um ficheiro MXFP4_MOE mais pequeno, de 7,0 GB, e variantes Q6_K, Q8_0 e BF16 maiores. A quantização altera o artefacto do modelo; o tamanho do ficheiro, por si só, não indica se um determinado computador o consegue servir com um comprimento de contexto ou velocidade úteis.

Se o comando não arrancar, verifique primeiro o ID exato do modelo, o espaço disponível em disco, a versão do llama.cpp e o texto integral do erro. Uma falha na alocação de memória é motivo para parar e consultar as opções do runtime e as definições de contexto na documentação atual do llama.cpp; não prova que o modelo tenha defeito. Não presuma que o contexto publicado de 131 072 tokens cabe no seu computador.

Passo 2: Envie um prompt de teste rápido

Deixe o servidor em execução. Numa segunda janela do PowerShell, envie um pedido curto para a API local:

PowerShell
$body = @{
  model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
  messages = @(
    @{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
  )
  # Author-selected budget for this short smoke test; not a JetBrains recommendation.
  max_tokens = 512
  temperature = 0.6
  top_p = 0.95
  top_k = 20
} | ConvertTo-Json -Depth 5

$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body

$choice = $response.choices[0]
[pscustomobject]@{
  finish_reason = $choice.finish_reason
  has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
  content = $choice.message.content
}

O ID do modelo, o endpoint local e os valores de amostragem seguem o exemplo de API do repositório. max_tokens = 512 é um valor limitado escolhido aqui para este teste curto, não uma recomendação do cartão do modelo. O Mellum2.1 é um modelo de raciocínio; o cartão GGUF diz que emite raciocínio em blocos <think>...</think> . O código indica se o campo separado reasoning_content não está vazio sem o imprimir. Consoante o formato de raciocínio do runtime, content ainda pode conter texto <think> . O prompt é um teste rápido, não um benchmark da qualidade do modelo.

A verificação básica só passa se o pedido devolver uma completion em vez de um erro de ligação ou do servidor, se finish_reason não for length e se o content final contiver MELLUM21-LOCAL-OK . Um HTTP bem-sucedido, por si só, não basta: um modelo de raciocínio pode gastar um orçamento de saída pequeno antes de produzir o texto final pedido. Se a saída estiver vazia, faltar o marcador ou finish_reason for length , considere o teste inconclusivo; aumente o orçamento limitado de saída e tente novamente em vez de diagnosticar uma falha do modelo. Se o PowerShell indicar uma falha de ligação, confirme que o primeiro terminal ainda mostra o servidor em execução e que o pedido usa a porta 8080. Se o servidor devolver um erro, guarde a mensagem exata e resolva-o antes de testar um agente de programação. Uma resposta bem-sucedida confirma que esta via local de inferência consegue responder a um pedido; não confirma que o modelo consegue editar código com segurança.

Passo 3: Verifique-o antes de ligar um agente

Mantenha a primeira avaliação separada de um projeto ativo. Use um repositório descartável com uma tarefa pequena e conhecida, e registe o artefacto e a quantização do modelo, a versão do llama.cpp, o sistema operativo, a definição de contexto, o prompt, a saída, o tempo decorrido e os recursos utilizados. Peça uma alteração limitada, examine o diff proposto e execute por si os testes existentes no repositório. Se quiser comparar, repita a mesma tarefa com a sua versão de referência atual. Um prompt ou uma execução de teste bem-sucedida não é um benchmark.

Um servidor de modelos devolve texto e, dependendo do runtime e do formato do pedido, pode suportar fluxos estruturados de chamadas de ferramentas. Não decide, por si só, que ferramentas um agente pode usar nem as executa em segurança. O agente envolvente controla o acesso ao repositório, comandos da shell, edições de ficheiros e execução de testes. Comece com acesso só de leitura ou estritamente limitado, exija aprovação para escritas e comandos, reveja todos os diffs e mantenha segredos fora do repositório de teste e dos prompts. Pare se o agente exceder a tarefa, alterar ficheiros sem relação ou não conseguir explicar um teste falhado.

Para uso privado, confirme onde decorre a inferência e como está configurado o agente. Um processo local do modelo pode manter os prompts no seu computador quando os pedidos permanecem no endpoint local, mas o agente ainda pode chamar serviços externos para outras funcionalidades. Antes de usar código ou dados privados, verifique o acesso à rede, os registos, a telemetria e as permissões das ferramentas nessa aplicação.

Passo 4: O que as provas publicadas mostram e não mostram

A JetBrains descreve o Mellum2.1 como um modelo mixture-of-experts de 12B com 2,5B parâmetros ativos, precisão BF16 e contexto de 131 072 tokens. O cartão do modelo diz que o lançamento usa Apache 2.0 e descreve um pós-treino que incluiu aprendizagem por reforço em ambientes de software isolados. A JetBrains também publica resultados de benchmarks, incluindo avaliações de programação agentiva. Esses resultados são comunicados pela própria JetBrains; não são medições da BIG CHANGE nem preveem o débito do seu hardware ou os resultados do seu projeto.

Um detalhe do lançamento mudou entre os locais de publicação. A publicação de lançamento da JetBrains de 8 de outubro dizia que as versões GGUF chegariam “em breve”. Em 9 de outubro, o repositório GGUF oficial no Hugging Face está acessível e inclui guias rápidos para llama.cpp, Ollama e outros. Este guia usa o repositório GGUF publicado atualmente. O repositório BF16 continua a ser um artefacto separado; verifique alterações em ambos antes de repetir estes passos.

A grande mudança

Pode agora seguir um guia rápido publicado para uma compilação quantizada do Mellum2.1 com llama.cpp e consultá-la através de um endpoint local compatível com OpenAI. Isto torna prática uma primeira verificação de inferência autoalojada sem depender da implantação de um fornecedor de inferência para o repositório BF16. Uma resposta prova que a via de serviço funciona; não prova a qualidade do agente, a adequação, a privacidade de toda a cadeia de ferramentas ou a preparação para produção.

Fontes e leitura adicional