AI-translated from English; not yet reviewed by a fluent editor.
# Mellum2.1 को स्थानीय रूप से चलाएँ और उसका पहला जवाब जाँचें
> JetBrains का मौजूदा GGUF repository llama.cpp के जरिए Mellum2.1 को स्थानीय रूप से चलाने का तरीका बताता है। रनटाइम इंस्टॉल करें, completion अनुरोध भेजें और किसी agent को आज़माने से पहले जवाब जाँचें।
By BIG CHANGE Editorial
Published: 2026-10-09T17:10:04.232Z
Updated: 2026-10-09T17:10:04.232Z
Canonical: https://bigchange.ai/blog/run-jetbrains-mellum21-locally-llama-cpp

Conceptual illustration of a computer that can host a local model server; no Mellum2.1 installation or test is depicted. AI-generated illustration by BIG CHANGE.
JetBrains का Mellum2.1 12 अरब पैरामीटर वाला मॉडल है, जिनमें से 2.5 अरब सक्रिय हैं। BF16 repository और अलग GGUF repository, दोनों Hugging Face पर उपलब्ध हैं। पहली स्थानीय शुरुआत के लिए GGUF repository llama.cpp का तरीका बताता है: ज़रूरत पर quantized फ़ाइल डाउनलोड करें, स्थानीय सर्वर शुरू करें, prompt भेजें और किसी भी coding agent को repository की पहुँच देने से पहले जवाब देखें।
यह दस्तावेज़-आधारित सेटअप गाइड है। BIG CHANGE ने Mellum2.1 इंस्टॉल नहीं किया और नीचे दिए आदेश नहीं चलाए। सफलता की जाँच है कि सर्वर स्थानीय completion लौटाए; इससे code की गुणवत्ता, agent की विश्वसनीयता या आपके hardware पर प्रदर्शन सिद्ध नहीं होता।
### आपको क्या चाहिए
- चुने हुए मॉडल और रनटाइम के लिए पर्याप्त मेमोरी और स्टोरेज वाला Windows, macOS या Linux कंप्यूटर। JetBrains के card के अनुसार मूल मॉडल BF16 है और इसका context 131,072 tokens का है। GGUF repository 8.1 GB की Q4\_K\_M फ़ाइल सुझाता है। यह फ़ाइल का आकार है, रनटाइम मेमोरी का पूरा अनुमान नहीं: रनटाइम, context और अन्य प्रक्रियाओं को अतिरिक्त संसाधन चाहिए। JetBrains न्यूनतम मेमोरी आवश्यकता प्रकाशित नहीं करता।
- सॉफ़्टवेयर और मॉडल के शुरुआती डाउनलोड के लिए इंटरनेट कनेक्शन चाहिए। inference अनुरोध स्वयं स्थानीय सर्वर को भेजा जा सकता है।
- llama.cpp और एक terminal। Repository Windows के लिए `winget install llama.cpp` बताता है और स्थानीय serving के लिए `llama serve` command देता है।
मॉडल Apache 2.0 के तहत जारी किया गया है। weights के उपयोग का कोई शुल्क सूचीबद्ध नहीं है; JetBrains hardware, बिजली, स्टोरेज या किराए के infrastructure की लागत नहीं बताता। मौजूदा BF16 model card कहता है कि कोई inference provider उस repository को सेवा नहीं देता। GGUF repository एक अलग quantized artifact है और उसका अपना llama.cpp quickstart है।
### चरण 1: llama.cpp इंस्टॉल करें और स्थानीय सर्वर शुरू करें
Windows में PowerShell से llama.cpp इंस्टॉल करने के लिए [आधिकारिक Mellum2.1 GGUF quickstart](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF):
```powershell
winget install llama.cpp
```
अगर `llama` command अभी PATH में नहीं है तो नया terminal खोलें। सुझाया Q4\_K\_M build शुरू करें और उसे port 8080 पर स्थानीय कंप्यूटर से स्पष्ट रूप से bind करें:
```powershell
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080
```
GGUF repository इस model ID और quantization को `llama serve` के लिए बताता है; Windows install का तरीका भी दर्ज है। [llama.cpp server संदर्भ](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) में `--host` और `--port` का दस्तावेज़ देता है; repository का उदाहरण endpoint `http://localhost:8080/v1` है। macOS और Linux पर वही GGUF repository `curl -LsSf https://llama.app/install.sh | sh` से llama.cpp इंस्टॉल करने और फिर वही serve command चलाने का तरीका बताता है।
पहले जवाब से पहले प्रक्रिया को मॉडल डाउनलोड करना होगा। Q4\_K\_M फ़ाइल 8.1 GB सूचीबद्ध है। इस परीक्षण में सर्वर केवल अपने कंप्यूटर से bind रखें; उसे network पर न खोलें और prompt में credentials न डालें। Repository 7.0 GB की छोटी MXFP4\_MOE फ़ाइल और बड़े Q6\_K, Q8\_0 और BF16 variants भी सूचीबद्ध करता है। Quantization मॉडल artifact बदलता है; केवल फ़ाइल आकार से यह पता नहीं चलता कि कोई खास कंप्यूटर उपयोगी context लंबाई या गति पर उसे चला सकेगा।
अगर command शुरू नहीं होता, तो पहले सटीक model ID, उपलब्ध disk space, llama.cpp version और पूरा error text देखें। Memory allocation failure होने पर रुकें और वर्तमान llama.cpp दस्तावेज़ के अनुसार runtime विकल्प तथा context settings जाँचें; यह मॉडल में दोष का प्रमाण नहीं है। यह न मानें कि प्रकाशित 131,072-token context आपके कंप्यूटर में समा जाएगा।
### चरण 2: smoke-test prompt भेजें
सर्वर चलता रहने दें। दूसरे PowerShell विंडो में उसके स्थानीय API को छोटा अनुरोध भेजें:
```powershell
$body = @{
model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
messages = @(
@{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
)
# Author-selected budget for this short smoke test; not a JetBrains recommendation.
max_tokens = 512
temperature = 0.6
top_p = 0.95
top_k = 20
} | ConvertTo-Json -Depth 5
$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body
$choice = $response.choices[0]
[pscustomobject]@{
finish_reason = $choice.finish_reason
has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
content = $choice.message.content
}
```
Model ID, स्थानीय endpoint और sampling मान repository के API उदाहरण के अनुसार हैं। `max_tokens = 512` इस छोटे परीक्षण के लिए चुना सीमित मान है, model-card की सिफारिश नहीं। Mellum2.1 thinking model है; GGUF card कहता है कि यह reasoning को `<think>...</think>` blocks में निकालता है। Code अलग `reasoning_content` field खाली न होने की सूचना देता है, लेकिन field को प्रिंट नहीं करता। Runtime के reasoning format के आधार पर `content` में अभी भी `<think>` text हो सकता है। Prompt smoke test है, मॉडल-गुणवत्ता benchmark नहीं।
बुनियादी जाँच तभी पास होती है जब अनुरोध connection या server error के बजाय completion लौटाए, `finish_reason` , `length` न हो और अंतिम `content` में `MELLUM21-LOCAL-OK` हो। केवल HTTP सफलता पर्याप्त नहीं: thinking model माँगा गया final text देने से पहले छोटा output budget खर्च कर सकता है। Output खाली हो, marker न हो या `finish_reason` का मान `length` हो, तो जाँच को अनिर्णायक मानें; मॉडल की विफलता बताने के बजाय सीमित output budget बढ़ाकर फिर कोशिश करें। PowerShell connection failure बताए तो पुष्टि करें कि पहले terminal में सर्वर अभी चल रहा है और अनुरोध port 8080 इस्तेमाल करता है। Server error लौटाए तो सटीक संदेश सहेजें और coding agent जाँचने से पहले समस्या हल करें। सफल जवाब केवल यह पुष्टि करता है कि यह स्थानीय inference path एक अनुरोध का जवाब दे सकता है; यह नहीं कि मॉडल code सुरक्षित रूप से बदल सकता है।
### चरण 3: agent जोड़ने से पहले जाँचें
पहला मूल्यांकन live project से अलग रखें। एक ज्ञात छोटे काम वाले अस्थायी repository का उपयोग करें और model artifact तथा quantization, llama.cpp version, operating system, context setting, prompt, output, लगा समय और संसाधन उपयोग दर्ज करें। सीमित बदलाव माँगें, प्रस्तावित diff देखें और repository के मौजूदा tests स्वयं चलाएँ। तुलना के लिए यही काम अपने मौजूदा baseline के साथ दोहराएँ। एक prompt या एक सफल test run benchmark नहीं है।
Model server text लौटाता है और runtime तथा request format के आधार पर structured tool-call workflows का समर्थन कर सकता है। वह स्वयं तय नहीं करता कि agent कौन-से tools इस्तेमाल करे और न उन्हें सुरक्षित रूप से चलाता है। आसपास का agent repository पहुँच, shell commands, file edits और test execution नियंत्रित करता है। शुरुआत read-only या सख्ती से सीमित पहुँच से करें, writes और commands के लिए स्वीकृति लें, हर diff देखें और secrets को test repository तथा prompts से दूर रखें। Agent काम से आगे जाए, असंबंधित फ़ाइलें बदले या विफल test न समझा सके तो रुकें।
निजी उपयोग के लिए पुष्टि करें कि inference कहाँ चलता है और agent कैसे configured है। जब अनुरोध स्थानीय endpoint पर रहते हैं, तो स्थानीय model process prompts को आपके कंप्यूटर पर रख सकता है; फिर भी अन्य सुविधाओं के लिए agent बाहरी सेवाएँ बुला सकता है। निजी code या data इस्तेमाल करने से पहले उस application में network access, logs, telemetry और tool permissions जाँचें।
### चरण 4: प्रकाशित साक्ष्य क्या दिखाते हैं और क्या नहीं
JetBrains Mellum2.1 को 12B mixture-of-experts मॉडल बताता है, जिसमें 2.5B सक्रिय पैरामीटर, BF16 precision और 131,072-token context है। Model card कहता है कि release Apache 2.0 है और post-training में sandboxed software environments में reinforcement learning शामिल थी। JetBrains benchmark नतीजे भी प्रकाशित करता है, जिनमें agentic coding evaluations शामिल हैं। ये JetBrains के स्वयं बताए scores हैं; BIG CHANGE की measurements नहीं और आपके hardware throughput या project परिणामों का अनुमान नहीं।
प्रकाशन के स्थानों के बीच release का एक विवरण बदला। JetBrains की 8 अक्टूबर की launch post में GGUF builds “जल्द आ रहे हैं” कहा गया था। 9 अक्टूबर को आधिकारिक Hugging Face GGUF repository उपलब्ध है और इसमें llama.cpp, Ollama तथा अन्य quickstarts हैं। यह गाइड अभी प्रकाशित GGUF repository इस्तेमाल करता है। BF16 repository अलग artifact बना रहता है; ये कदम दोहराने से पहले दोनों repositories में बदलाव देखें।
### सबसे बड़ा बदलाव
अब आप quantized Mellum2.1 build के लिए प्रकाशित llama.cpp quickstart अपना सकते हैं और उसे स्थानीय OpenAI-compatible endpoint से query कर सकते हैं। इससे BF16 repository के लिए inference-provider deployment पर निर्भर हुए बिना self-hosted inference की पहली जाँच व्यावहारिक होती है। जवाब serving path के काम करने का प्रमाण है; agent गुणवत्ता, उपयुक्तता, पूरे toolchain में privacy या production readiness का नहीं।
### स्रोत और आगे पढ़ें
- [JetBrains: “Mellum2.1 Gets to Work” (8 अक्टूबर 2026)](https://blog.jetbrains.com/ai/2026/10/mellum2-1-gets-to-work-a-fast-open-model-for-coding-agents/) — launch विवरण और GGUF उपलब्धता पर मूल बयान।
- [JetBrains Mellum2.1 BF16 model card](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking) — मॉडल विवरण, vLLM और Transformers निर्देश, benchmarks और license।
- [JetBrains Mellum2.1 GGUF repository](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF) — मौजूदा quantizations, फ़ाइल आकार, llama.cpp commands और स्थानीय API उदाहरण।
- [llama.cpp project](https://github.com/ggml-org/llama.cpp) — रनटाइम स्रोत और release जानकारी।
## Sources
- [Mellum2.1 Gets to Work: A Fast Open Model for Coding Agents](https://blog.jetbrains.com/ai/2026/10/mellum2-1-gets-to-work-a-fast-open-model-for-coding-agents/) — JetBrains की launch post; 8 अक्टूबर की उस समय की घोषणा दिखाती है कि GGUF builds आने वाले थे।
- [JetBrains/Mellum2.1-12B-A2.5B-Thinking model card](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking) — आधिकारिक BF16 artifact विवरण, model-card quickstarts, benchmark तालिका और inference-provider स्थिति; benchmark मान JetBrains के स्वयं बताए हैं।
- [JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF model card और quickstart](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF) — मौजूदा आधिकारिक GGUF artifact, quantization फ़ाइल आकार, Windows llama.cpp quickstart और स्थानीय OpenAI-compatible endpoint।
- [llama.cpp](https://github.com/ggml-org/llama.cpp) — Runtime project संदर्भ; किसी runtime version का दावा नहीं।
BIG CHANGE न्यूज़लेटर
बड़ी तस्वीर। आपकी गति से।
AI और रोबोटिक्स पर ताज़ा लेख, ध्यान देने योग्य बदलाव और उपयोगी विचार। दैनिक ब्रीफ़िंग, साप्ताहिक सारांश या मासिक परिप्रेक्ष्य चुनें।
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
आपकी गोपनीयता, आपकी पसंद।
ज़रूरी स्टोरेज साइट की सुरक्षा में मदद करता है और आपकी पसंद याद रखता है। आपकी अनुमति मिलने तक वैकल्पिक Google Analytics बंद रहता है। आप हर लेख केवल आवश्यक स्टोरेज के साथ पढ़ सकते हैं। गोपनीयता का विवरण