AI-translated from English; not yet reviewed by a fluent editor.
# Patakbuhin ang Mellum2.1 nang lokal at suriin ang unang sagot
> Inilalarawan ng kasalukuyang GGUF repository ng JetBrains ang paraan gamit ang llama.cpp para patakbuhin nang lokal ang Mellum2.1. I-install ang runtime, magpadala ng completion request, at suriin ito bago sumubok ng agent.
By BIG CHANGE Editorial
Published: 2026-10-09T17:10:04.232Z
Updated: 2026-10-09T17:10:04.232Z
Canonical: https://bigchange.ai/blog/run-jetbrains-mellum21-locally-llama-cpp

Conceptual illustration of a computer that can host a local model server; no Mellum2.1 installation or test is depicted. AI-generated illustration by BIG CHANGE.
Available ang Mellum2.1 ng JetBrains bilang modelong may 12 bilyong parameter at 2.5 bilyong aktibong parameter. Parehong live sa Hugging Face ang BF16 repository at hiwalay na GGUF repository. Para sa unang lokal na run, inilalarawan ng GGUF repository ang ruta sa llama.cpp: mag-download ng quantized file kapag kailangan, magsimula ng lokal na server, magpadala ng prompt, at siyasatin ang sagot bago bigyan ng access sa repository ang anumang coding agent.
Gabay ito sa setup batay sa dokumentasyon. Hindi nag-install ang BIG CHANGE ng Mellum2.1 o nagpatakbo ng mga command sa ibaba. Ang tagumpay ay lokal na completion na ibinalik ng server; hindi nito pinatutunayan ang kalidad ng code, pagiging maaasahan ng agent, o performance sa hardware mo.
### Mga kailangan
- Isang Windows, macOS, o Linux computer na may sapat na memory at storage para sa napiling modelo at runtime. Ayon sa card ng JetBrains, BF16 ang orihinal na modelo at 131,072 token ang context nito. Inililista ng GGUF repository ang inirerekomendang Q4\_K\_M file na 8.1 GB. Laki iyon ng file, hindi kumpletong tantiya ng memory na kailangan sa runtime: mangangailangan pa ng dagdag ang runtime, context, at iba pang proseso. Walang inilalathalang minimum memory requirement ang JetBrains.
- Kailangan ng internet connection para sa unang download ng software at modelo. Puwedeng sa lokal na server ipadala ang inference request mismo.
- llama.cpp at terminal. Inilalarawan ng repository ang `winget install llama.cpp` para sa Windows at isang `llama serve` command para sa lokal na serving.
Inilabas ang modelo sa ilalim ng Apache 2.0. Walang nakalistang bayad sa paggamit ng weights; hindi binibilang ng JetBrains ang gastos sa hardware, kuryente, storage, o anumang imprastrakturang uupahan mo. Sinasabi ng kasalukuyang BF16 model card na walang inference provider na nagseserbisyo sa repository na iyon. Hiwalay na quantized artifact ang GGUF repository at may sarili itong llama.cpp quickstart.
### Hakbang 1: I-install ang llama.cpp at simulan ang lokal na server
Sa Windows, gamitin ang PowerShell para i-install ang llama.cpp sa pamamagitan ng [opisyal na Mellum2.1 GGUF quickstart](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF):
```powershell
winget install llama.cpp
```
Magbukas ng bagong terminal kung ang `llama` command ay wala pa sa PATH. Simulan ang inirerekomendang Q4\_K\_M build at tahasang i-bind ito sa lokal na computer sa port 8080:
```powershell
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080
```
Inilalarawan ng GGUF repository ang model ID at quantization na ito para sa `llama serve`; inilalarawan din nito ang Windows install route. Ang [sanggunian ng llama.cpp server](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) ay nagdodokumento ng `--host` at `--port`; ang halimbawang endpoint ng repository ay `http://localhost:8080/v1` . Sa macOS at Linux, inilalarawan ng parehong GGUF repository ang pag-install ng llama.cpp gamit ang `curl -LsSf https://llama.app/install.sh | sh` at pagkatapos ay ang parehong serve command.
Dapat munang i-download ng proseso ang modelo bago ang unang sagot. Nakalista ang Q4\_K\_M file na 8.1 GB. Para sa pagsusulit na ito, i-bind ang server sa sarili mong computer lang; huwag itong ilantad sa network o maglagay ng credentials sa prompt. Inililista rin ng repository ang mas maliit na 7.0 GB MXFP4\_MOE file at mas malalaking Q6\_K, Q8\_0, at BF16 variant. Binabago ng quantization ang model artifact; hindi ipinapakita ng laki ng file lamang kung kaya itong patakbuhin ng isang partikular na computer sa kapaki-pakinabang na context length o bilis.
Kung hindi magsimula ang command, tingnan muna ang eksaktong model ID, libreng disk space, bersyon ng llama.cpp, at buong error text. Dahilan para huminto ang memory allocation failure at suriin ang mga runtime option at context setting ayon sa kasalukuyang dokumentasyon ng llama.cpp; hindi ito ebidensiyang depektibo ang modelo. Huwag ipagpalagay na magkakasya sa makina mo ang inilathalang 131,072-token context.
### Hakbang 2: Magpadala ng smoke-test prompt
Iwanang tumatakbo ang server. Sa ikalawang PowerShell window, magpadala ng maikling request sa lokal na API nito:
```powershell
$body = @{
model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
messages = @(
@{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
)
# Author-selected budget for this short smoke test; not a JetBrains recommendation.
max_tokens = 512
temperature = 0.6
top_p = 0.95
top_k = 20
} | ConvertTo-Json -Depth 5
$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body
$choice = $response.choices[0]
[pscustomobject]@{
finish_reason = $choice.finish_reason
has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
content = $choice.message.content
}
```
Sinusunod ng model ID, lokal na endpoint, at sampling value ang API example ng repository. `max_tokens = 512` ay limitadong halagang pinili rito para sa maikling pagsusuri, hindi rekomendasyon sa model card. Thinking model ang Mellum2.1; ayon sa GGUF card, naglalabas ito ng reasoning sa `<think>...</think>` blocks. Iniuulat ng code kung hindi walang laman ang hiwalay na `reasoning_content` field nang hindi inililimbag ang field na iyon. Depende sa reasoning format ng runtime, maaari pa ring maglaman ng `content` ang `<think>` text. Smoke test ang prompt na ito, hindi benchmark ng kalidad ng modelo.
Pumapasa lang ang batayang pagsusuri kung completion ang ibinabalik ng request sa halip na connection o server error, `finish_reason` ay hindi `length` , at may `content` ang panghuling `MELLUM21-LOCAL-OK` . Hindi sapat ang matagumpay na HTTP lamang: maaaring maubos ng thinking model ang maliit na output budget bago gawin ang hinihinging final text. Kung walang laman ang output, wala ang marker, o `finish_reason` ay `length` , ituring na walang tiyak na resulta ang pagsusuri; dagdagan ang limitadong output budget at subukan muli sa halip na maghinuha ng pagkabigo ng modelo. Kung mag-ulat ang PowerShell ng connection failure, tiyaking nagpapakitang tumatakbo pa ang server sa unang terminal at port 8080 ang request. Kung magbalik ng error ang server, itala ang eksaktong mensahe at ayusin iyon bago subukan ang coding agent. Pinatutunayan lang ng matagumpay na sagot na nakasasagot sa isang request ang lokal na inference path na ito; hindi nito pinatutunayang ligtas mag-edit ng code ang modelo.
### Hakbang 3: Suriin ito bago magkabit ng agent
Ihiwalay ang unang evaluation sa live na proyekto. Gumamit ng disposable repository na may alam at maliit na gawain, at itala ang model artifact at quantization, bersyon ng llama.cpp, operating system, context setting, prompt, output, lumipas na oras, at paggamit ng resources. Humingi ng limitadong pagbabago, siyasatin ang iminungkahing diff, at ikaw mismo ang magpatakbo ng mga kasalukuyang test ng repository. Ulitin ang parehong gawain sa kasalukuyang baseline kung gusto mo ng paghahambing. Hindi benchmark ang isang prompt o isang matagumpay na test run.
Nagbabalik ng text ang model server at, depende sa runtime at request format, maaari nitong suportahan ang structured tool-call workflows. Hindi nito kusang itinatakda kung anong tools ang magagamit ng agent o ligtas na pinatatakbo ang mga iyon. Kinokontrol ng nakapaligid na agent ang access sa repository, shell command, pag-edit ng file, at pagpapatakbo ng test. Magsimula sa read-only o mahigpit na limitadong access, mangailangan ng pag-apruba para sa writes at command, suriin ang bawat diff, at ilayo ang secrets sa test repository at mga prompt. Huminto kung lalampas sa gawain ang agent, magbabago ng mga walang-kaugnayang file, o hindi maipaliwanag ang pumalyang test.
Para sa pribadong paggamit, tiyakin kung saan tumatakbo ang inference at paano naka-configure ang agent. Maaaring panatilihin ng lokal na proseso ng modelo sa computer mo ang mga prompt kapag nananatili sa lokal na endpoint ang mga request, pero maaari pa ring tumawag ang agent sa mga panlabas na serbisyo para sa ibang feature. Suriin ang network access, logging, telemetry, at tool permission ng application bago gumamit ng pribadong code o data.
### Hakbang 4: Ano ang ipinapakita at hindi ipinapakita ng inilathalang ebidensiya
Inilalarawan ng JetBrains ang Mellum2.1 bilang 12B mixture-of-experts model na may 2.5B aktibong parameter, BF16 precision, at 131,072-token context. Sinasabi ng model card na Apache 2.0 ang release at inilalarawan ang post-training na may reinforcement learning sa mga sandboxed software environment. Naglalathala rin ang JetBrains ng benchmark result, kabilang ang mga evaluation sa agentic coding. Sariling iniulat ng JetBrains ang mga score na iyon; hindi iyon mga sukat ng BIG CHANGE at hindi nito hinuhulaan ang throughput ng hardware mo o ang resulta ng proyekto mo.
Nagbago ang isang detalye ng release sa pagitan ng mga lugar na pinagpublikahan. Sinabi ng launch post ng JetBrains noong Oktubre 8 na “coming soon” ang GGUF builds. Noong Oktubre 9, naa-access na ang opisyal na Hugging Face GGUF repository at may quickstart para sa llama.cpp, Ollama, at iba pa. Ang kasalukuyang inilathalang GGUF repository ang ginagamit ng gabay na ito. Hiwalay na artifact pa rin ang BF16 repository; tingnan kung may pagbabago sa parehong repository bago ulitin ang mga hakbang.
### Ang malaking pagbabago
Maaari mo nang sundan ang inilathalang llama.cpp quickstart para sa quantized Mellum2.1 build at tanungin ito sa pamamagitan ng lokal na OpenAI-compatible endpoint. Nagiging praktikal nito ang unang self-hosted inference check nang hindi umaasa sa deployment ng inference provider para sa BF16 repository. Pinatutunayan ng sagot na gumagana ang serving path; hindi nito pinatutunayan ang kalidad ng agent, pagiging angkop, privacy sa buong toolchain, o kahandaan para sa production.
### Mga source at karagdagang babasahin
- [JetBrains: “Mellum2.1 Gets to Work” (Oktubre 8, 2026)](https://blog.jetbrains.com/ai/2026/10/mellum2-1-gets-to-work-a-fast-open-model-for-coding-agents/) — paglalarawan ng launch at orihinal na pahayag tungkol sa availability ng GGUF.
- [JetBrains Mellum2.1 BF16 model card](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking) — detalye ng modelo, gabay sa vLLM at Transformers, benchmark, at lisensya.
- [JetBrains Mellum2.1 GGUF repository](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF) — kasalukuyang quantization, laki ng file, llama.cpp command, at lokal na API example.
- [Proyekto ng llama.cpp](https://github.com/ggml-org/llama.cpp) — source ng runtime at impormasyon sa release.
## Sources
- [Mellum2.1 Gets to Work: A Fast Open Model for Coding Agents](https://blog.jetbrains.com/ai/2026/10/mellum2-1-gets-to-work-a-fast-open-model-for-coding-agents/) — Post ng JetBrains tungkol sa launch; sumasalamin sa pahayag noong Oktubre 8 na paparating pa noon ang GGUF builds.
- [JetBrains/Mellum2.1-12B-A2.5B-Thinking model card](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking) — Opisyal na detalye ng BF16 artifact, quickstart ng model card, benchmark table, at status ng inference provider; sariling iniulat ng JetBrains ang mga benchmark value.
- [JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF model card at quickstart](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF) — Kasalukuyang opisyal na GGUF artifact, laki ng quantized file, Windows llama.cpp quickstart, at lokal na OpenAI-compatible endpoint.
- [llama.cpp](https://github.com/ggml-org/llama.cpp) — Sanggunian ng runtime project; walang bersyon ng runtime na ipinapahayag.
Newsletter ng BIG CHANGE
Ang kabuuang larawan, sa sarili mong bilis.
Mga kamakailang kuwento tungkol sa AI at robotics, mga pagbabagong dapat bantayan, at mga praktikal na ideyang magagamit. Pumili ng araw-araw na briefing, lingguhang digest, o buwanang pananaw.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
Privacy mo, pasya mo.
Tumutulong ang kinakailangang storage na panatilihing ligtas ang site at tandaan ang mga pinili mo. Nananatiling naka-off ang opsyonal na Google Analytics hangga’t hindi mo ito pinapahintulutan. Mababasa mo ang lahat ng kuwento gamit lamang ang kinakailangang storage. Mga detalye tungkol sa privacy