Available ang Mellum2.1 ng JetBrains bilang modelong may 12 bilyong parameter at 2.5 bilyong aktibong parameter. Parehong live sa Hugging Face ang BF16 repository at hiwalay na GGUF repository. Para sa unang lokal na run, inilalarawan ng GGUF repository ang ruta sa llama.cpp: mag-download ng quantized file kapag kailangan, magsimula ng lokal na server, magpadala ng prompt, at siyasatin ang sagot bago bigyan ng access sa repository ang anumang coding agent.
Gabay ito sa setup batay sa dokumentasyon. Hindi nag-install ang BIG CHANGE ng Mellum2.1 o nagpatakbo ng mga command sa ibaba. Ang tagumpay ay lokal na completion na ibinalik ng server; hindi nito pinatutunayan ang kalidad ng code, pagiging maaasahan ng agent, o performance sa hardware mo.
Mga kailangan
- Isang Windows, macOS, o Linux computer na may sapat na memory at storage para sa napiling modelo at runtime. Ayon sa card ng JetBrains, BF16 ang orihinal na modelo at 131,072 token ang context nito. Inililista ng GGUF repository ang inirerekomendang Q4_K_M file na 8.1 GB. Laki iyon ng file, hindi kumpletong tantiya ng memory na kailangan sa runtime: mangangailangan pa ng dagdag ang runtime, context, at iba pang proseso. Walang inilalathalang minimum memory requirement ang JetBrains.
- Kailangan ng internet connection para sa unang download ng software at modelo. Puwedeng sa lokal na server ipadala ang inference request mismo.
- llama.cpp at terminal. Inilalarawan ng repository ang
winget install llama.cpppara sa Windows at isangllama servecommand para sa lokal na serving.
Inilabas ang modelo sa ilalim ng Apache 2.0. Walang nakalistang bayad sa paggamit ng weights; hindi binibilang ng JetBrains ang gastos sa hardware, kuryente, storage, o anumang imprastrakturang uupahan mo. Sinasabi ng kasalukuyang BF16 model card na walang inference provider na nagseserbisyo sa repository na iyon. Hiwalay na quantized artifact ang GGUF repository at may sarili itong llama.cpp quickstart.
Hakbang 1: I-install ang llama.cpp at simulan ang lokal na server
Sa Windows, gamitin ang PowerShell para i-install ang llama.cpp sa pamamagitan ng opisyal na Mellum2.1 GGUF quickstart:
winget install llama.cppMagbukas ng bagong terminal kung ang llama command ay wala pa sa PATH. Simulan ang inirerekomendang Q4_K_M build at tahasang i-bind ito sa lokal na computer sa port 8080:
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080Inilalarawan ng GGUF repository ang model ID at quantization na ito para sa llama serve; inilalarawan din nito ang Windows install route. Ang sanggunian ng llama.cpp server ay nagdodokumento ng --host at --port; ang halimbawang endpoint ng repository ay http://localhost:8080/v1 . Sa macOS at Linux, inilalarawan ng parehong GGUF repository ang pag-install ng llama.cpp gamit ang curl -LsSf https://llama.app/install.sh | sh at pagkatapos ay ang parehong serve command.
Dapat munang i-download ng proseso ang modelo bago ang unang sagot. Nakalista ang Q4_K_M file na 8.1 GB. Para sa pagsusulit na ito, i-bind ang server sa sarili mong computer lang; huwag itong ilantad sa network o maglagay ng credentials sa prompt. Inililista rin ng repository ang mas maliit na 7.0 GB MXFP4_MOE file at mas malalaking Q6_K, Q8_0, at BF16 variant. Binabago ng quantization ang model artifact; hindi ipinapakita ng laki ng file lamang kung kaya itong patakbuhin ng isang partikular na computer sa kapaki-pakinabang na context length o bilis.
Kung hindi magsimula ang command, tingnan muna ang eksaktong model ID, libreng disk space, bersyon ng llama.cpp, at buong error text. Dahilan para huminto ang memory allocation failure at suriin ang mga runtime option at context setting ayon sa kasalukuyang dokumentasyon ng llama.cpp; hindi ito ebidensiyang depektibo ang modelo. Huwag ipagpalagay na magkakasya sa makina mo ang inilathalang 131,072-token context.
Hakbang 2: Magpadala ng smoke-test prompt
Iwanang tumatakbo ang server. Sa ikalawang PowerShell window, magpadala ng maikling request sa lokal na API nito:
$body = @{
model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
messages = @(
@{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
)
# Author-selected budget for this short smoke test; not a JetBrains recommendation.
max_tokens = 512
temperature = 0.6
top_p = 0.95
top_k = 20
} | ConvertTo-Json -Depth 5
$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body
$choice = $response.choices[0]
[pscustomobject]@{
finish_reason = $choice.finish_reason
has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
content = $choice.message.content
}Sinusunod ng model ID, lokal na endpoint, at sampling value ang API example ng repository. max_tokens = 512 ay limitadong halagang pinili rito para sa maikling pagsusuri, hindi rekomendasyon sa model card. Thinking model ang Mellum2.1; ayon sa GGUF card, naglalabas ito ng reasoning sa <think>...</think> blocks. Iniuulat ng code kung hindi walang laman ang hiwalay na reasoning_content field nang hindi inililimbag ang field na iyon. Depende sa reasoning format ng runtime, maaari pa ring maglaman ng content ang <think> text. Smoke test ang prompt na ito, hindi benchmark ng kalidad ng modelo.
Pumapasa lang ang batayang pagsusuri kung completion ang ibinabalik ng request sa halip na connection o server error, finish_reason ay hindi length , at may content ang panghuling MELLUM21-LOCAL-OK . Hindi sapat ang matagumpay na HTTP lamang: maaaring maubos ng thinking model ang maliit na output budget bago gawin ang hinihinging final text. Kung walang laman ang output, wala ang marker, o finish_reason ay length , ituring na walang tiyak na resulta ang pagsusuri; dagdagan ang limitadong output budget at subukan muli sa halip na maghinuha ng pagkabigo ng modelo. Kung mag-ulat ang PowerShell ng connection failure, tiyaking nagpapakitang tumatakbo pa ang server sa unang terminal at port 8080 ang request. Kung magbalik ng error ang server, itala ang eksaktong mensahe at ayusin iyon bago subukan ang coding agent. Pinatutunayan lang ng matagumpay na sagot na nakasasagot sa isang request ang lokal na inference path na ito; hindi nito pinatutunayang ligtas mag-edit ng code ang modelo.
Hakbang 3: Suriin ito bago magkabit ng agent
Ihiwalay ang unang evaluation sa live na proyekto. Gumamit ng disposable repository na may alam at maliit na gawain, at itala ang model artifact at quantization, bersyon ng llama.cpp, operating system, context setting, prompt, output, lumipas na oras, at paggamit ng resources. Humingi ng limitadong pagbabago, siyasatin ang iminungkahing diff, at ikaw mismo ang magpatakbo ng mga kasalukuyang test ng repository. Ulitin ang parehong gawain sa kasalukuyang baseline kung gusto mo ng paghahambing. Hindi benchmark ang isang prompt o isang matagumpay na test run.
Nagbabalik ng text ang model server at, depende sa runtime at request format, maaari nitong suportahan ang structured tool-call workflows. Hindi nito kusang itinatakda kung anong tools ang magagamit ng agent o ligtas na pinatatakbo ang mga iyon. Kinokontrol ng nakapaligid na agent ang access sa repository, shell command, pag-edit ng file, at pagpapatakbo ng test. Magsimula sa read-only o mahigpit na limitadong access, mangailangan ng pag-apruba para sa writes at command, suriin ang bawat diff, at ilayo ang secrets sa test repository at mga prompt. Huminto kung lalampas sa gawain ang agent, magbabago ng mga walang-kaugnayang file, o hindi maipaliwanag ang pumalyang test.
Para sa pribadong paggamit, tiyakin kung saan tumatakbo ang inference at paano naka-configure ang agent. Maaaring panatilihin ng lokal na proseso ng modelo sa computer mo ang mga prompt kapag nananatili sa lokal na endpoint ang mga request, pero maaari pa ring tumawag ang agent sa mga panlabas na serbisyo para sa ibang feature. Suriin ang network access, logging, telemetry, at tool permission ng application bago gumamit ng pribadong code o data.
Hakbang 4: Ano ang ipinapakita at hindi ipinapakita ng inilathalang ebidensiya
Inilalarawan ng JetBrains ang Mellum2.1 bilang 12B mixture-of-experts model na may 2.5B aktibong parameter, BF16 precision, at 131,072-token context. Sinasabi ng model card na Apache 2.0 ang release at inilalarawan ang post-training na may reinforcement learning sa mga sandboxed software environment. Naglalathala rin ang JetBrains ng benchmark result, kabilang ang mga evaluation sa agentic coding. Sariling iniulat ng JetBrains ang mga score na iyon; hindi iyon mga sukat ng BIG CHANGE at hindi nito hinuhulaan ang throughput ng hardware mo o ang resulta ng proyekto mo.
Nagbago ang isang detalye ng release sa pagitan ng mga lugar na pinagpublikahan. Sinabi ng launch post ng JetBrains noong Oktubre 8 na “coming soon” ang GGUF builds. Noong Oktubre 9, naa-access na ang opisyal na Hugging Face GGUF repository at may quickstart para sa llama.cpp, Ollama, at iba pa. Ang kasalukuyang inilathalang GGUF repository ang ginagamit ng gabay na ito. Hiwalay na artifact pa rin ang BF16 repository; tingnan kung may pagbabago sa parehong repository bago ulitin ang mga hakbang.
Ang malaking pagbabago
Maaari mo nang sundan ang inilathalang llama.cpp quickstart para sa quantized Mellum2.1 build at tanungin ito sa pamamagitan ng lokal na OpenAI-compatible endpoint. Nagiging praktikal nito ang unang self-hosted inference check nang hindi umaasa sa deployment ng inference provider para sa BF16 repository. Pinatutunayan ng sagot na gumagana ang serving path; hindi nito pinatutunayan ang kalidad ng agent, pagiging angkop, privacy sa buong toolchain, o kahandaan para sa production.
Mga source at karagdagang babasahin
- JetBrains: “Mellum2.1 Gets to Work” (Oktubre 8, 2026) — paglalarawan ng launch at orihinal na pahayag tungkol sa availability ng GGUF.
- JetBrains Mellum2.1 BF16 model card — detalye ng modelo, gabay sa vLLM at Transformers, benchmark, at lisensya.
- JetBrains Mellum2.1 GGUF repository — kasalukuyang quantization, laki ng file, llama.cpp command, at lokal na API example.
- Proyekto ng llama.cpp — source ng runtime at impormasyon sa release.



