AI-translated from English; not yet reviewed by a fluent editor.

# Execute o Mellum2.1 localmente e verifique a primeira resposta

> O repositório GGUF atual da JetBrains descreve uma forma de disponibilizar localmente o Mellum2.1 com llama.cpp. Instale o runtime, envie um pedido de completion e verifique-o antes de experimentar um agente.

By BIG CHANGE Editorial

Published: 2026-10-09T17:10:04.232Z
Updated: 2026-10-09T17:10:04.232Z
Canonical: https://bigchange.ai/blog/run-jetbrains-mellum21-locally-llama-cpp

![An unbranded desktop computer tower with a small orange indicator stands on a warm ivory floor.](https://bigchange.ai/api/media/file/mellum21-local-inference-hero-v1.png)
Conceptual illustration of a computer that can host a local model server; no Mellum2.1 installation or test is depicted. AI-generated illustration by BIG CHANGE.

O Mellum2.1 da JetBrains está disponível como um modelo com 12 mil milhões de parâmetros, dos quais 2,5 mil milhões estão ativos. Tanto o repositório BF16 como um repositório GGUF separado estão disponíveis no Hugging Face. Para a primeira execução local, o repositório GGUF descreve uma via com llama.cpp: descarregue um ficheiro quantizado quando necessário, inicie um servidor local, envie um prompt e examine a resposta antes de dar acesso a qualquer agente de programação a um repositório.

Este é um guia de configuração baseado na documentação. A BIG CHANGE não instalou o Mellum2.1 nem executou os comandos abaixo. A verificação de sucesso consiste numa completion local devolvida pelo servidor; não demonstra a qualidade do código, a fiabilidade do agente ou o desempenho no seu hardware.

### O que é necessário

- Um computador Windows, macOS ou Linux com memória e armazenamento suficientes para o modelo escolhido e o respetivo runtime. O cartão da JetBrains indica que o modelo original é BF16 e tem um contexto de 131 072 tokens. O repositório GGUF recomenda o ficheiro Q4\_K\_M de 8,1 GB. Este é o tamanho do ficheiro, não uma estimativa completa da memória em execução: o runtime, o contexto e outros processos precisam de memória adicional. A JetBrains não publica um requisito mínimo de memória.
- É necessária uma ligação à Internet para a transferência inicial do software e do modelo. O próprio pedido de inferência pode ser enviado para o servidor local.
- llama.cpp e um terminal. O repositório documenta `winget install llama.cpp` para Windows e um comando `llama serve` para servir localmente.

O modelo é disponibilizado ao abrigo da licença Apache 2.0. Não é indicada uma taxa de utilização dos pesos; a JetBrains não quantifica os custos de hardware, eletricidade, armazenamento ou infraestrutura que decida alugar. O cartão BF16 atual indica que nenhum fornecedor de inferência serve esse repositório. O repositório GGUF é um artefacto quantizado separado, com o seu próprio guia rápido para llama.cpp.

### Passo 1: Instale o llama.cpp e inicie o servidor local

No PowerShell do Windows, instale o llama.cpp através do [guia rápido GGUF oficial do Mellum2.1](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF):

```powershell
winget install llama.cpp
```

Abra um novo terminal se o comando `llama` ainda não estiver no seu PATH. Inicie a compilação Q4\_K\_M recomendada e associe-a explicitamente ao computador local na porta 8080:

```powershell
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080
```

O repositório GGUF documenta este ID de modelo e esta quantização para `llama serve`; documenta também a instalação no Windows. A [referência do servidor llama.cpp](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) documenta `--host` e `--port`; o endpoint de exemplo do repositório é `http://localhost:8080/v1` . No macOS e Linux, o mesmo repositório GGUF documenta a instalação do llama.cpp com `curl -LsSf https://llama.app/install.sh | sh` e depois o mesmo comando de serviço.

O processo tem de descarregar o modelo antes da primeira resposta. O ficheiro Q4\_K\_M está indicado como tendo 8,1 GB. Para este teste, associe o servidor apenas ao seu próprio computador; não o exponha à rede nem coloque credenciais no prompt. O repositório também lista um ficheiro MXFP4\_MOE mais pequeno, de 7,0 GB, e variantes Q6\_K, Q8\_0 e BF16 maiores. A quantização altera o artefacto do modelo; o tamanho do ficheiro, por si só, não indica se um determinado computador o consegue servir com um comprimento de contexto ou velocidade úteis.

Se o comando não arrancar, verifique primeiro o ID exato do modelo, o espaço disponível em disco, a versão do llama.cpp e o texto integral do erro. Uma falha na alocação de memória é motivo para parar e consultar as opções do runtime e as definições de contexto na documentação atual do llama.cpp; não prova que o modelo tenha defeito. Não presuma que o contexto publicado de 131 072 tokens cabe no seu computador.

### Passo 2: Envie um prompt de teste rápido

Deixe o servidor em execução. Numa segunda janela do PowerShell, envie um pedido curto para a API local:

```powershell
$body = @{
  model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
  messages = @(
    @{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
  )
  # Author-selected budget for this short smoke test; not a JetBrains recommendation.
  max_tokens = 512
  temperature = 0.6
  top_p = 0.95
  top_k = 20
} | ConvertTo-Json -Depth 5

$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body

$choice = $response.choices[0]
[pscustomobject]@{
  finish_reason = $choice.finish_reason
  has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
  content = $choice.message.content
}
```

O ID do modelo, o endpoint local e os valores de amostragem seguem o exemplo de API do repositório. `max_tokens = 512` é um valor limitado escolhido aqui para este teste curto, não uma recomendação do cartão do modelo. O Mellum2.1 é um modelo de raciocínio; o cartão GGUF diz que emite raciocínio em blocos `<think>...</think>` . O código indica se o campo separado `reasoning_content` não está vazio sem o imprimir. Consoante o formato de raciocínio do runtime, `content` ainda pode conter texto `<think>` . O prompt é um teste rápido, não um benchmark da qualidade do modelo.

A verificação básica só passa se o pedido devolver uma completion em vez de um erro de ligação ou do servidor, se `finish_reason` não for `length` e se o `content` final contiver `MELLUM21-LOCAL-OK` . Um HTTP bem-sucedido, por si só, não basta: um modelo de raciocínio pode gastar um orçamento de saída pequeno antes de produzir o texto final pedido. Se a saída estiver vazia, faltar o marcador ou `finish_reason` for `length` , considere o teste inconclusivo; aumente o orçamento limitado de saída e tente novamente em vez de diagnosticar uma falha do modelo. Se o PowerShell indicar uma falha de ligação, confirme que o primeiro terminal ainda mostra o servidor em execução e que o pedido usa a porta 8080. Se o servidor devolver um erro, guarde a mensagem exata e resolva-o antes de testar um agente de programação. Uma resposta bem-sucedida confirma que esta via local de inferência consegue responder a um pedido; não confirma que o modelo consegue editar código com segurança.

### Passo 3: Verifique-o antes de ligar um agente

Mantenha a primeira avaliação separada de um projeto ativo. Use um repositório descartável com uma tarefa pequena e conhecida, e registe o artefacto e a quantização do modelo, a versão do llama.cpp, o sistema operativo, a definição de contexto, o prompt, a saída, o tempo decorrido e os recursos utilizados. Peça uma alteração limitada, examine o diff proposto e execute por si os testes existentes no repositório. Se quiser comparar, repita a mesma tarefa com a sua versão de referência atual. Um prompt ou uma execução de teste bem-sucedida não é um benchmark.

Um servidor de modelos devolve texto e, dependendo do runtime e do formato do pedido, pode suportar fluxos estruturados de chamadas de ferramentas. Não decide, por si só, que ferramentas um agente pode usar nem as executa em segurança. O agente envolvente controla o acesso ao repositório, comandos da shell, edições de ficheiros e execução de testes. Comece com acesso só de leitura ou estritamente limitado, exija aprovação para escritas e comandos, reveja todos os diffs e mantenha segredos fora do repositório de teste e dos prompts. Pare se o agente exceder a tarefa, alterar ficheiros sem relação ou não conseguir explicar um teste falhado.

Para uso privado, confirme onde decorre a inferência e como está configurado o agente. Um processo local do modelo pode manter os prompts no seu computador quando os pedidos permanecem no endpoint local, mas o agente ainda pode chamar serviços externos para outras funcionalidades. Antes de usar código ou dados privados, verifique o acesso à rede, os registos, a telemetria e as permissões das ferramentas nessa aplicação.

### Passo 4: O que as provas publicadas mostram e não mostram

A JetBrains descreve o Mellum2.1 como um modelo mixture-of-experts de 12B com 2,5B parâmetros ativos, precisão BF16 e contexto de 131 072 tokens. O cartão do modelo diz que o lançamento usa Apache 2.0 e descreve um pós-treino que incluiu aprendizagem por reforço em ambientes de software isolados. A JetBrains também publica resultados de benchmarks, incluindo avaliações de programação agentiva. Esses resultados são comunicados pela própria JetBrains; não são medições da BIG CHANGE nem preveem o débito do seu hardware ou os resultados do seu projeto.

Um detalhe do lançamento mudou entre os locais de publicação. A publicação de lançamento da JetBrains de 8 de outubro dizia que as versões GGUF chegariam “em breve”. Em 9 de outubro, o repositório GGUF oficial no Hugging Face está acessível e inclui guias rápidos para llama.cpp, Ollama e outros. Este guia usa o repositório GGUF publicado atualmente. O repositório BF16 continua a ser um artefacto separado; verifique alterações em ambos antes de repetir estes passos.

### A grande mudança

Pode agora seguir um guia rápido publicado para uma compilação quantizada do Mellum2.1 com llama.cpp e consultá-la através de um endpoint local compatível com OpenAI. Isto torna prática uma primeira verificação de inferência autoalojada sem depender da implantação de um fornecedor de inferência para o repositório BF16. Uma resposta prova que a via de serviço funciona; não prova a qualidade do agente, a adequação, a privacidade de toda a cadeia de ferramentas ou a preparação para produção.

### Fontes e leitura adicional

- [JetBrains: “Mellum2.1 Gets to Work” (8 de outubro de 2026)](https://blog.jetbrains.com/ai/2026/10/mellum2-1-gets-to-work-a-fast-open-model-for-coding-agents/) — descrição do lançamento e declaração inicial sobre a disponibilidade do GGUF.
- [Cartão do modelo JetBrains Mellum2.1 BF16](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking) — detalhes do modelo, instruções para vLLM e Transformers, benchmarks e licença.
- [Repositório JetBrains Mellum2.1 GGUF](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF) — quantizações atuais, tamanhos de ficheiros, comandos llama.cpp e exemplo de API local.
- [Projeto llama.cpp](https://github.com/ggml-org/llama.cpp) — código-fonte do runtime e informações de lançamento.

## Sources

- [Mellum2.1 Gets to Work: A Fast Open Model for Coding Agents](https://blog.jetbrains.com/ai/2026/10/mellum2-1-gets-to-work-a-fast-open-model-for-coding-agents/) — Publicação de lançamento da JetBrains; reflete a declaração de 8 de outubro de que as versões GGUF ainda estavam para chegar.
- [Cartão do modelo JetBrains/Mellum2.1-12B-A2.5B-Thinking](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking) — Detalhes oficiais do artefacto BF16, guias rápidos do cartão do modelo, tabela de benchmarks e estado dos fornecedores de inferência; valores comunicados pela JetBrains.
- [Cartão do modelo e guia rápido JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF) — Artefacto GGUF oficial atual, tamanhos dos ficheiros quantizados, guia rápido llama.cpp para Windows e endpoint local compatível com OpenAI.
- [llama.cpp](https://github.com/ggml-org/llama.cpp) — Referência do projeto de runtime; não é indicada uma versão do runtime.
