JetBrains का Mellum2.1 12 अरब पैरामीटर वाला मॉडल है, जिनमें से 2.5 अरब सक्रिय हैं। BF16 repository और अलग GGUF repository, दोनों Hugging Face पर उपलब्ध हैं। पहली स्थानीय शुरुआत के लिए GGUF repository llama.cpp का तरीका बताता है: ज़रूरत पर quantized फ़ाइल डाउनलोड करें, स्थानीय सर्वर शुरू करें, prompt भेजें और किसी भी coding agent को repository की पहुँच देने से पहले जवाब देखें।
यह दस्तावेज़-आधारित सेटअप गाइड है। BIG CHANGE ने Mellum2.1 इंस्टॉल नहीं किया और नीचे दिए आदेश नहीं चलाए। सफलता की जाँच है कि सर्वर स्थानीय completion लौटाए; इससे code की गुणवत्ता, agent की विश्वसनीयता या आपके hardware पर प्रदर्शन सिद्ध नहीं होता।
आपको क्या चाहिए
- चुने हुए मॉडल और रनटाइम के लिए पर्याप्त मेमोरी और स्टोरेज वाला Windows, macOS या Linux कंप्यूटर। JetBrains के card के अनुसार मूल मॉडल BF16 है और इसका context 131,072 tokens का है। GGUF repository 8.1 GB की Q4_K_M फ़ाइल सुझाता है। यह फ़ाइल का आकार है, रनटाइम मेमोरी का पूरा अनुमान नहीं: रनटाइम, context और अन्य प्रक्रियाओं को अतिरिक्त संसाधन चाहिए। JetBrains न्यूनतम मेमोरी आवश्यकता प्रकाशित नहीं करता।
- सॉफ़्टवेयर और मॉडल के शुरुआती डाउनलोड के लिए इंटरनेट कनेक्शन चाहिए। inference अनुरोध स्वयं स्थानीय सर्वर को भेजा जा सकता है।
- llama.cpp और एक terminal। Repository Windows के लिए
winget install llama.cppबताता है और स्थानीय serving के लिएllama servecommand देता है।
मॉडल Apache 2.0 के तहत जारी किया गया है। weights के उपयोग का कोई शुल्क सूचीबद्ध नहीं है; JetBrains hardware, बिजली, स्टोरेज या किराए के infrastructure की लागत नहीं बताता। मौजूदा BF16 model card कहता है कि कोई inference provider उस repository को सेवा नहीं देता। GGUF repository एक अलग quantized artifact है और उसका अपना llama.cpp quickstart है।
चरण 1: llama.cpp इंस्टॉल करें और स्थानीय सर्वर शुरू करें
Windows में PowerShell से llama.cpp इंस्टॉल करने के लिए आधिकारिक Mellum2.1 GGUF quickstart:
winget install llama.cppअगर llama command अभी PATH में नहीं है तो नया terminal खोलें। सुझाया Q4_K_M build शुरू करें और उसे port 8080 पर स्थानीय कंप्यूटर से स्पष्ट रूप से bind करें:
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080GGUF repository इस model ID और quantization को llama serve के लिए बताता है; Windows install का तरीका भी दर्ज है। llama.cpp server संदर्भ में --host और --port का दस्तावेज़ देता है; repository का उदाहरण endpoint http://localhost:8080/v1 है। macOS और Linux पर वही GGUF repository curl -LsSf https://llama.app/install.sh | sh से llama.cpp इंस्टॉल करने और फिर वही serve command चलाने का तरीका बताता है।
पहले जवाब से पहले प्रक्रिया को मॉडल डाउनलोड करना होगा। Q4_K_M फ़ाइल 8.1 GB सूचीबद्ध है। इस परीक्षण में सर्वर केवल अपने कंप्यूटर से bind रखें; उसे network पर न खोलें और prompt में credentials न डालें। Repository 7.0 GB की छोटी MXFP4_MOE फ़ाइल और बड़े Q6_K, Q8_0 और BF16 variants भी सूचीबद्ध करता है। Quantization मॉडल artifact बदलता है; केवल फ़ाइल आकार से यह पता नहीं चलता कि कोई खास कंप्यूटर उपयोगी context लंबाई या गति पर उसे चला सकेगा।
अगर command शुरू नहीं होता, तो पहले सटीक model ID, उपलब्ध disk space, llama.cpp version और पूरा error text देखें। Memory allocation failure होने पर रुकें और वर्तमान llama.cpp दस्तावेज़ के अनुसार runtime विकल्प तथा context settings जाँचें; यह मॉडल में दोष का प्रमाण नहीं है। यह न मानें कि प्रकाशित 131,072-token context आपके कंप्यूटर में समा जाएगा।
चरण 2: smoke-test prompt भेजें
सर्वर चलता रहने दें। दूसरे PowerShell विंडो में उसके स्थानीय API को छोटा अनुरोध भेजें:
$body = @{
model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
messages = @(
@{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
)
# Author-selected budget for this short smoke test; not a JetBrains recommendation.
max_tokens = 512
temperature = 0.6
top_p = 0.95
top_k = 20
} | ConvertTo-Json -Depth 5
$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body
$choice = $response.choices[0]
[pscustomobject]@{
finish_reason = $choice.finish_reason
has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
content = $choice.message.content
}Model ID, स्थानीय endpoint और sampling मान repository के API उदाहरण के अनुसार हैं। max_tokens = 512 इस छोटे परीक्षण के लिए चुना सीमित मान है, model-card की सिफारिश नहीं। Mellum2.1 thinking model है; GGUF card कहता है कि यह reasoning को <think>...</think> blocks में निकालता है। Code अलग reasoning_content field खाली न होने की सूचना देता है, लेकिन field को प्रिंट नहीं करता। Runtime के reasoning format के आधार पर content में अभी भी <think> text हो सकता है। Prompt smoke test है, मॉडल-गुणवत्ता benchmark नहीं।
बुनियादी जाँच तभी पास होती है जब अनुरोध connection या server error के बजाय completion लौटाए, finish_reason , length न हो और अंतिम content में MELLUM21-LOCAL-OK हो। केवल HTTP सफलता पर्याप्त नहीं: thinking model माँगा गया final text देने से पहले छोटा output budget खर्च कर सकता है। Output खाली हो, marker न हो या finish_reason का मान length हो, तो जाँच को अनिर्णायक मानें; मॉडल की विफलता बताने के बजाय सीमित output budget बढ़ाकर फिर कोशिश करें। PowerShell connection failure बताए तो पुष्टि करें कि पहले terminal में सर्वर अभी चल रहा है और अनुरोध port 8080 इस्तेमाल करता है। Server error लौटाए तो सटीक संदेश सहेजें और coding agent जाँचने से पहले समस्या हल करें। सफल जवाब केवल यह पुष्टि करता है कि यह स्थानीय inference path एक अनुरोध का जवाब दे सकता है; यह नहीं कि मॉडल code सुरक्षित रूप से बदल सकता है।
चरण 3: agent जोड़ने से पहले जाँचें
पहला मूल्यांकन live project से अलग रखें। एक ज्ञात छोटे काम वाले अस्थायी repository का उपयोग करें और model artifact तथा quantization, llama.cpp version, operating system, context setting, prompt, output, लगा समय और संसाधन उपयोग दर्ज करें। सीमित बदलाव माँगें, प्रस्तावित diff देखें और repository के मौजूदा tests स्वयं चलाएँ। तुलना के लिए यही काम अपने मौजूदा baseline के साथ दोहराएँ। एक prompt या एक सफल test run benchmark नहीं है।
Model server text लौटाता है और runtime तथा request format के आधार पर structured tool-call workflows का समर्थन कर सकता है। वह स्वयं तय नहीं करता कि agent कौन-से tools इस्तेमाल करे और न उन्हें सुरक्षित रूप से चलाता है। आसपास का agent repository पहुँच, shell commands, file edits और test execution नियंत्रित करता है। शुरुआत read-only या सख्ती से सीमित पहुँच से करें, writes और commands के लिए स्वीकृति लें, हर diff देखें और secrets को test repository तथा prompts से दूर रखें। Agent काम से आगे जाए, असंबंधित फ़ाइलें बदले या विफल test न समझा सके तो रुकें।
निजी उपयोग के लिए पुष्टि करें कि inference कहाँ चलता है और agent कैसे configured है। जब अनुरोध स्थानीय endpoint पर रहते हैं, तो स्थानीय model process prompts को आपके कंप्यूटर पर रख सकता है; फिर भी अन्य सुविधाओं के लिए agent बाहरी सेवाएँ बुला सकता है। निजी code या data इस्तेमाल करने से पहले उस application में network access, logs, telemetry और tool permissions जाँचें।
चरण 4: प्रकाशित साक्ष्य क्या दिखाते हैं और क्या नहीं
JetBrains Mellum2.1 को 12B mixture-of-experts मॉडल बताता है, जिसमें 2.5B सक्रिय पैरामीटर, BF16 precision और 131,072-token context है। Model card कहता है कि release Apache 2.0 है और post-training में sandboxed software environments में reinforcement learning शामिल थी। JetBrains benchmark नतीजे भी प्रकाशित करता है, जिनमें agentic coding evaluations शामिल हैं। ये JetBrains के स्वयं बताए scores हैं; BIG CHANGE की measurements नहीं और आपके hardware throughput या project परिणामों का अनुमान नहीं।
प्रकाशन के स्थानों के बीच release का एक विवरण बदला। JetBrains की 8 अक्टूबर की launch post में GGUF builds “जल्द आ रहे हैं” कहा गया था। 9 अक्टूबर को आधिकारिक Hugging Face GGUF repository उपलब्ध है और इसमें llama.cpp, Ollama तथा अन्य quickstarts हैं। यह गाइड अभी प्रकाशित GGUF repository इस्तेमाल करता है। BF16 repository अलग artifact बना रहता है; ये कदम दोहराने से पहले दोनों repositories में बदलाव देखें।
सबसे बड़ा बदलाव
अब आप quantized Mellum2.1 build के लिए प्रकाशित llama.cpp quickstart अपना सकते हैं और उसे स्थानीय OpenAI-compatible endpoint से query कर सकते हैं। इससे BF16 repository के लिए inference-provider deployment पर निर्भर हुए बिना self-hosted inference की पहली जाँच व्यावहारिक होती है। जवाब serving path के काम करने का प्रमाण है; agent गुणवत्ता, उपयुक्तता, पूरे toolchain में privacy या production readiness का नहीं।
स्रोत और आगे पढ़ें
- JetBrains: “Mellum2.1 Gets to Work” (8 अक्टूबर 2026) — launch विवरण और GGUF उपलब्धता पर मूल बयान।
- JetBrains Mellum2.1 BF16 model card — मॉडल विवरण, vLLM और Transformers निर्देश, benchmarks और license।
- JetBrains Mellum2.1 GGUF repository — मौजूदा quantizations, फ़ाइल आकार, llama.cpp commands और स्थानीय API उदाहरण।
- llama.cpp project — रनटाइम स्रोत और release जानकारी।



