Mellum2.1 компаније JetBrains доступан је као модел са 12 милијарди параметара, од којих је 2,5 милијарди активно. И BF16 спремиште и засебно GGUF спремиште доступни су на Hugging Face-у. За прво локално покретање, GGUF спремиште описује поступак са llama.cpp: преузмите квантизовану датотеку по потреби, покрените локални сервер, пошаљите prompt и прегледајте одговор пре него што било ком агенту за програмирање дате приступ спремишту.
Ово је упутство за подешавање засновано на документацији. BIG CHANGE није инсталирао Mellum2.1 нити је покренуо команде у наставку. Успешна провера значи да је сервер вратио локални completion; то не потврђује квалитет кода, поузданост агента нити перформансе на вашем хардверу.
Шта вам је потребно
- Windows, macOS или Linux рачунар са довољно меморије и простора за изабрани модел и његово окружење. На JetBrains-овој картици се наводи да је оригинални модел у формату BF16 и да му је контекст 131.072 token-а. GGUF спремиште препоручује датотеку Q4_K_M од 8,1 GB. То је величина датотеке, а не потпуна процена меморије за рад: окружењу, контексту и другим процесима потребно је још ресурса. JetBrains не објављује минимални захтев за меморију.
- Интернет веза је потребна за почетно преузимање софтвера и модела. Сам inference захтев може да иде локалном серверу.
- llama.cpp и терминал. Спремиште описује
winget install llama.cppза Windows иllama serveкоманду за локално сервирање.
Модел је објављен под лиценцом Apache 2.0. За тежине није наведена накнада; JetBrains не квантификује трошкове хардвера, струје, складишта нити инфраструктуре коју изнајмите. На тренутној BF16 картици модела пише да ниједан inference провајдер не нуди услугу за то спремиште. GGUF је засебан квантизовани артефакт са сопственим llama.cpp брзим водичем.
1. корак: инсталирајте llama.cpp и покрените локални сервер
У Windows PowerShell-у инсталирајте llama.cpp помоћу званичног GGUF брзог водича за Mellum2.1:
winget install llama.cppОтворите нови терминал ако команда llama још није у PATH-у. Покрените препоручену Q4_K_M верзију и изричито је вежите за локални рачунар на порту 8080:
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080GGUF спремиште описује овај ID модела и квантизацију за llama serve; описује и поступак инсталације на Windows-у. Референца за llama.cpp сервер документује --host и --port; пример крајње тачке у спремишту је http://localhost:8080/v1 . На macOS-у и Linux-у исто GGUF спремиште описује инсталацију llama.cpp помоћу curl -LsSf https://llama.app/install.sh | sh и затим исту команду за сервирање.
Процес мора да преузме модел пре првог одговора. За датотеку Q4_K_M наведено је 8,1 GB. За овај тест вежите сервер само за свој рачунар; немојте га излагати мрежи нити стављати акредитиве у prompt. Спремиште наводи и мању датотеку MXFP4_MOE од 7,0 GB, као и веће варијанте Q6_K, Q8_0 и BF16. Квантизација мења артефакт модела; сама величина датотеке не говори да ли одређени рачунар може да га сервира корисном дужином контекста или брзином.
Ако команда не може да се покрене, прво проверите тачан ID модела, расположиви простор на диску, верзију llama.cpp и цео текст грешке. Неуспела додела меморије разлог је да станете и проверите опције окружења и подешавања контекста према актуелној документацији llama.cpp; то није доказ да је модел неисправан. Немојте претпоставити да ће објављени контекст од 131.072 token-а стати на ваш рачунар.
2. корак: пошаљите smoke-test prompt
Оставите сервер да ради. У другом PowerShell прозору пошаљите кратак захтев његовом локалном API-ју:
$body = @{
model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
messages = @(
@{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
)
# Author-selected budget for this short smoke test; not a JetBrains recommendation.
max_tokens = 512
temperature = 0.6
top_p = 0.95
top_k = 20
} | ConvertTo-Json -Depth 5
$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body
$choice = $response.choices[0]
[pscustomobject]@{
finish_reason = $choice.finish_reason
has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
content = $choice.message.content
}ID модела, локална крајња тачка и sampling вредности прате API пример спремишта. max_tokens = 512 је ограничена вредност изабрана за ову кратку проверу, а не препорука са картице модела. Mellum2.1 је thinking модел; на GGUF картици пише да излаже reasoning у <think>...</think> блоковима. Код пријављује да ли је засебно reasoning_content поље непразно, а да га не исписује. У зависности од формата reasoning-а у окружењу, content и даље може да садржи <think> текст. Prompt је smoke test, а не benchmark квалитета модела.
Основна провера је успешна само ако захтев врати completion, а не грешку везе или сервера, ако finish_reason није length и ако завршни content садржи MELLUM21-LOCAL-OK . Сам успешан HTTP одговор није довољан: thinking модел може да потроши мали излазни буџет пре него што направи тражени завршни текст. Ако је излаз празан, маркер недостаје или је finish_reason једнак length , сматрајте проверу неубедљивом; повећајте ограничени излазни буџет и покушајте поново уместо да дијагностикујете квар модела. Ако PowerShell пријави неуспелу везу, проверите да ли први терминал и даље приказује покренут сервер и да ли захтев користи порт 8080. Ако сервер врати грешку, сачувајте тачну поруку и решите је пре тестирања агента за кодирање. Успешан одговор потврђује да овај локални inference пут може да одговори на један захтев; не потврђује да модел може безбедно да мења код.
3. корак: проверите модел пре повезивања агента
Прву процену одвојте од активног пројекта. Користите привремено спремиште са познатим малим задатком и забележите артефакт и квантизацију модела, верзију llama.cpp, оперативни систем, подешавање контекста, prompt, излаз, протекло време и потрошњу ресурса. Затражите ограничену измену, прегледајте предложени diff и сами покрените постојеће тестове спремишта. Ако желите поређење, поновите исти задатак са тренутном основном верзијом. Један prompt или једно успешно покретање теста није benchmark.
Сервер модела враћа текст и, у зависности од окружења и формата захтева, може да подржи структурисане токове позива алата. Сам по себи не одлучује које алате агент може да користи нити их безбедно извршава. Окружујући агент контролише приступ спремишту, shell команде, измене датотека и покретање тестова. Почните са приступом само за читање или строго ограниченим приступом, тражите одобрење за писање и команде, прегледајте сваки diff и не стављајте тајне у тестно спремиште ни prompt-ове. Зауставите се ако агент прекорачи задатак, измени неповезане датотеке или не уме да објасни неуспели тест.
За приватну употребу потврдите где се inference извршава и како је агент подешен. Локални процес модела може да задржи prompt-ове на вашем рачунару ако захтеви остају на локалној крајњој тачки, али агент може да позива спољне услуге за друге функције. Пре употребе приватног кода или података проверите приступ мрежи, евиденције, телеметрију и дозволе алата у апликацији.
4. корак: шта објављени докази показују, а шта не
JetBrains описује Mellum2.1 као 12B mixture-of-experts модел са 2,5B активних параметара, BF16 прецизношћу и контекстом од 131.072 token-а. На картици модела пише да је објављен под Apache 2.0 и описује post-training који је укључивао reinforcement learning у изолованим софтверским окружењима. JetBrains објављује и резултате benchmark-а, укључујући оцене агентског кодирања. Те оцене је сам пријавио JetBrains; оне нису мерења BIG CHANGE-а нити предвиђају проток вашег хардвера или исходе вашег пројекта.
Један детаљ издања се променио између места објављивања. У објави о лансирању од 8. октобра JetBrains је рекао да GGUF верзије „ускоро стижу“. Дана 9. октобра доступно је званично GGUF спремиште на Hugging Face-у са брзим водичима за llama.cpp, Ollama и друге алате. Овај водич користи тренутно објављено GGUF спремиште. BF16 спремиште остаје засебан артефакт; проверите оба спремишта на измене пре понављања ових корака.
Велика промена
Сада можете да пратите објављени llama.cpp брзи водич за квантизовану верзију Mellum2.1 и да је испробате преко локалне OpenAI-компатибилне крајње тачке. Тако је практична прва провера inference-а на сопственој инфраструктури, без ослањања на deployment inference провајдера за BF16 спремиште. Одговор доказује да путања сервирања ради; не доказује квалитет агента, прикладност, приватност целог ланца алата нити спремност за продукцију.
Извори и додатно читање
- JetBrains: „Mellum2.1 Gets to Work“ (8. октобар 2026) — опис лансирања и првобитна изјава о доступности GGUF-а.
- JetBrains Mellum2.1 BF16 картица модела — детаљи о моделу, упутства за vLLM и Transformers, benchmark-и и лиценца.
- JetBrains Mellum2.1 GGUF спремиште — тренутне квантизације, величине датотека, llama.cpp команде и пример локалног API-ја.
- llama.cpp пројекат — изворни код окружења и информације о издањима.



