JetBrainsov Mellum2.1 dostupan je kao model sa 12 milijardi parametara, od kojih je 2,5 milijardi aktivno. I BF16 repozitorijum i zaseban GGUF repozitorijum trenutno su dostupni na Hugging Face-u. Za prvo lokalno pokretanje, GGUF repozitorijum opisuje put sa llama.cpp: preuzmite kvantizovanu datoteku po potrebi, pokrenite lokalni server, pošaljite mu prompt i pregledajte odgovor pre nego što bilo kom agentu za kodiranje date pristup repozitorijumu.

Ovo je vodič za podešavanje zasnovan na dokumentaciji. BIG CHANGE nije instalirao Mellum2.1 niti pokrenuo komande ispod. Provera uspeha je lokalni completion koji vraća server; to ne dokazuje kvalitet koda, pouzdanost agenta niti performanse na vašem hardveru.

Šta vam je potrebno

  • Windows, macOS ili Linux računar sa dovoljno memorije i prostora za izabrani model i njegovo okruženje. JetBrainsova kartica navodi da je originalni model BF16 sa kontekstom od 131.072 tokena. GGUF repozitorijum preporučuje datoteku Q4_K_M od 8,1 GB. To je veličina datoteke, a ne potpuna procena memorije tokom rada: okruženju, kontekstu i drugim procesima potrebni su dodatni resursi. JetBrains ne objavljuje minimalni zahtev za memoriju.
  • Internet veza za početno preuzimanje softvera i modela. Sam zahtev za inferenciju može da ide lokalnom serveru.
  • llama.cpp i terminal. Repozitorijum dokumentuje winget install llama.cpp za Windows i komandu llama serve za lokalno posluživanje.

Model je objavljen pod licencom Apache 2.0. Za težine nije navedena naknada za upotrebu; JetBrains ne kvantifikuje troškove hardvera, struje, prostora niti infrastrukture koju odlučite da iznajmite. BF16 kartica trenutno navodi da nijedan provajder inferencije ne poslužuje taj repozitorijum. GGUF repozitorijum je zaseban kvantizovani artefakt sa sopstvenim brzim vodičem za llama.cpp.

Korak 1: instalirajte llama.cpp i pokrenite lokalni server

U PowerShell-u na Windowsu instalirajte llama.cpp pomoću zvaničnog GGUF brzog vodiča za Mellum2.1.

PowerShell
winget install llama.cpp

Otvorite novi terminal ako komanda llama još nije na vašem PATH-u. Pokrenite preporučenu Q4_K_M verziju i izričito je vežite za lokalni računar na portu 8080:

PowerShell
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080

GGUF repozitorijum dokumentuje ovaj ID modela i kvantizaciju za llama serve; dokumentuje i instalaciju na Windowsu. Referentna dokumentacija servera llama.cpp opisuje --host i --port; primer krajnje tačke u repozitorijumu je http://localhost:8080/v1. Na macOS-u i Linuxu isti GGUF repozitorijum dokumentuje instalaciju llama.cpp pomoću curl -LsSf https://llama.app/install.sh | sh a zatim istu komandu za posluživanje.

Proces mora da preuzme model pre prvog odgovora. Za datoteku Q4_K_M navedeno je 8,1 GB. Za ovaj test vežite server samo za svoj računar; nemojte ga izlagati mreži niti stavljati akreditive u prompt. Repozitorijum navodi i manju datoteku MXFP4_MOE od 7,0 GB, kao i veće varijante Q6_K, Q8_0 i BF16. Kvantizacija menja artefakt modela; sama veličina datoteke ne govori da li određeni računar može da ga posluži korisnom dužinom konteksta ili brzinom.

Ako komanda ne uspe da se pokrene, prvo proverite tačan ID modela, dostupan prostor na disku, verziju llama.cpp i ceo tekst greške. Neuspešna alokacija memorije razlog je da stanete i uporedite opcije okruženja i podešavanja konteksta sa aktuelnom dokumentacijom llama.cpp; to nije dokaz da je model neispravan. Ne pretpostavljajte da će objavljeni kontekst od 131.072 tokena stati na vaš računar.

Korak 2: pošaljite probni prompt

Ostavite server pokrenut. U drugom PowerShell prozoru pošaljite kratak zahtev njegovom lokalnom API-ju:

PowerShell
$body = @{
  model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
  messages = @(
    @{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
  )
  # Author-selected budget for this short smoke test; not a JetBrains recommendation.
  max_tokens = 512
  temperature = 0.6
  top_p = 0.95
  top_k = 20
} | ConvertTo-Json -Depth 5

$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body

$choice = $response.choices[0]
[pscustomobject]@{
  finish_reason = $choice.finish_reason
  has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
  content = $choice.message.content
}

ID modela, lokalna krajnja tačka i vrednosti uzorkovanja prate primer API-ja u repozitorijumu. max_tokens = 512 je ograničena vrednost izabrana za ovu kratku proveru, a ne preporuka model-kartice. Mellum2.1 je model za razmišljanje; GGUF kartica navodi da emituje razmišljanje u <think>...</think> blokovima. Kod javlja da li je zasebno polje reasoning_content neprazno, ali ga ne ispisuje. U zavisnosti od formata razmišljanja okruženja, content i dalje može da sadrži <think> tekst. Prompt je probni test, a ne benchmark kvaliteta modela.

Osnovna provera prolazi samo ako zahtev vrati completion umesto greške veze ili servera, finish_reason nije length i završni content sadrži MELLUM21-LOCAL-OK. Sam HTTP uspeh nije dovoljan: model za razmišljanje može da potroši mali budžet izlaza pre nego što proizvede traženi završni tekst. Ako je izlaz prazan, nedostaje oznaka ili je finish_reason jednak length, smatrajte proveru neodlučnom; povećajte ograničeni budžet izlaza i pokušajte ponovo, umesto da dijagnostikujete kvar modela. Ako PowerShell prijavi neuspelu vezu, potvrdite da prvi terminal i dalje prikazuje pokrenut server i da zahtev koristi port 8080. Ako server vrati grešku, sačuvajte tačnu poruku i rešite je pre testiranja agenta za kodiranje. Uspešan odgovor potvrđuje da ovaj lokalni put inferencije može da odgovori na jedan zahtev; ne potvrđuje da model može bezbedno da menja kod.

Korak 3: proverite ga pre povezivanja agenta

Prvu procenu odvojite od aktivnog projekta. Koristite privremeni repozitorijum sa poznatim, malim zadatkom i zabeležite artefakt i kvantizaciju modela, verziju llama.cpp, operativni sistem, podešavanje konteksta, prompt, izlaz, proteklo vreme i upotrebu resursa. Zatražite ograničenu izmenu, pregledajte predloženi diff i sami pokrenite postojeće testove repozitorijuma. Radi poređenja ponovite isti zadatak sa trenutnom polaznom verzijom. Jedan prompt ili jedno uspešno pokretanje testa nije benchmark.

Server modela vraća tekst i, u zavisnosti od formata okruženja i zahteva, može da podrži strukturisane tokove poziva alata. Sam po sebi ne određuje koje alate agent može da koristi niti ih bezbedno izvršava. Okolni agent kontroliše pristup repozitorijumu, shell komande, izmene datoteka i izvršavanje testova. Počnite sa pristupom samo za čitanje ili strogo ograničenim pristupom, zahtevajte odobrenje za upise i komande, pregledajte svaki diff i držite tajne izvan testnog repozitorijuma i promptova. Zaustavite se ako agent pokušava da prekorači zadatak, menja nepovezane datoteke ili ne ume da objasni neuspešan test.

Za privatnu upotrebu proverite gde se inferencija izvršava i kako je agent podešen. Lokalni proces modela može da zadrži promptove na vašem računaru kada zahtevi ostanu na lokalnoj krajnjoj tački, ali agent i dalje može da poziva spoljne usluge za druge funkcije. Pre upotrebe privatnog koda ili podataka proverite mrežni pristup, evidencije, telemetriju i dozvole alata u toj aplikaciji.

Korak 4: šta objavljeni dokazi pokazuju, a šta ne

JetBrains opisuje Mellum2.1 kao 12B model mešavine eksperata sa 2,5B aktivnih parametara, BF16 preciznošću i kontekstom od 131.072 tokena. Kartica modela navodi izdanje pod Apache 2.0 i opisuje naknadno treniranje koje je obuhvatilo učenje potkrepljivanjem u izolovanim softverskim okruženjima. JetBrains objavljuje i rezultate benchmarka, uključujući procene agentnog kodiranja. To su rezultati koje je prijavio JetBrains; nisu merenja BIG CHANGE-a niti predviđaju protok vašeg hardvera ili ishode vašeg projekta.

Jedan detalj izdanja promenio se između mesta objave. JetBrainsova objava od 8. oktobra rekla je da GGUF verzije „uskoro stižu“. Dana 9. oktobra zvanični GGUF repozitorijum na Hugging Face-u dostupan je i sadrži brze vodiče za llama.cpp, Ollama i druge. Ovaj vodič koristi trenutno objavljeni GGUF repozitorijum. BF16 repozitorijum ostaje zaseban artefakt; pre ponavljanja ovih koraka proverite promene u oba repozitorijuma.

Velika promena

Sada možete pratiti objavljeni llama.cpp brzi vodič za kvantizovanu verziju Mellum2.1 i upitovati je preko lokalne krajnje tačke kompatibilne sa OpenAI-jem. To čini praktičnom prvu proveru lokalne inferencije bez oslanjanja na postavljanje provajdera inferencije za BF16 repozitorijum. Odgovor dokazuje da put posluživanja radi; ne dokazuje kvalitet agenta, prikladnost, privatnost celog lanca alata niti spremnost za produkciju.

Izvori i dodatno čitanje