AI-translated from English; not yet reviewed by a fluent editor.
# Mellum2.1 स्थानिक पातळीवर चालवा आणि त्याचा पहिला प्रतिसाद तपासा
> JetBrains चे सध्याचे GGUF भांडार llama.cpp वापरून Mellum2.1 स्थानिकरीत्या कसे उपलब्ध करायचे ते सांगते. रनटाइम स्थापित करा, completion मागवा आणि agent वापरण्यापूर्वी तो तपासा.
By BIG CHANGE Editorial
Published: 2026-10-09T17:10:04.232Z
Updated: 2026-10-09T17:10:04.232Z
Canonical: https://bigchange.ai/blog/run-jetbrains-mellum21-locally-llama-cpp

Conceptual illustration of a computer that can host a local model server; no Mellum2.1 installation or test is depicted. AI-generated illustration by BIG CHANGE.
JetBrains चे Mellum2.1 हे 12 अब्ज पॅरामीटर आणि 2.5 अब्ज सक्रिय पॅरामीटर असलेले मॉडेल म्हणून उपलब्ध आहे. BF16 भांडार आणि स्वतंत्र GGUF भांडार दोन्ही Hugging Face वर उपलब्ध आहेत. पहिल्या स्थानिक वापरासाठी GGUF भांडार llama.cpp मार्ग सांगते: क्वांटाइझ केलेली फाइल गरजेनुसार डाउनलोड करा, स्थानिक सर्व्हर सुरू करा, prompt पाठवा आणि कोणत्याही कोडिंग agent ला भांडाराचा प्रवेश देण्यापूर्वी उत्तर तपासा.
ही कागदपत्रांवर आधारित सेटअप मार्गदर्शिका आहे. BIG CHANGE ने Mellum2.1 स्थापित केले नाही किंवा खालील आदेश चालवले नाहीत. यशाची तपासणी म्हणजे सर्व्हरने परत केलेला स्थानिक completion; यावरून कोडची गुणवत्ता, agent ची विश्वासार्हता किंवा तुमच्या हार्डवेअरवरील कार्यक्षमता सिद्ध होत नाही.
### काय आवश्यक आहे
- निवडलेल्या मॉडेल आणि रनटाइमसाठी पुरेशी मेमरी व स्टोरेज असलेला Windows, macOS किंवा Linux संगणक. JetBrains कार्डनुसार मूळ मॉडेल BF16 असून त्याचा संदर्भ आकार 131,072 token आहे. GGUF भांडार शिफारस केलेली Q4\_K\_M फाइल 8.1 GB असल्याचे सांगते. हा फाइल आकार आहे; रनटाइम मेमरीचा पूर्ण अंदाज नाही: रनटाइम, संदर्भ आणि इतर प्रक्रियांना अतिरिक्त संसाधने लागतात. JetBrains किमान मेमरी आवश्यकता प्रकाशित करत नाही.
- प्रारंभीचे सॉफ्टवेअर/मॉडेल डाउनलोड करण्यासाठी इंटरनेट कनेक्शन. अनुमान विनंती स्थानिक सर्व्हरकडे जाऊ शकते.
- llama.cpp आणि टर्मिनल. भांडार Windows साठी `winget install llama.cpp` आणि स्थानिक सर्व्हिंगसाठी `llama serve` आदेश सांगते.
मॉडेल Apache 2.0 अंतर्गत प्रसिद्ध झाले आहे. वजने वापरण्यासाठी शुल्क नमूद नाही; हार्डवेअर, वीज, स्टोरेज किंवा भाड्याने घेण्याच्या पायाभूत सुविधांचा खर्च JetBrains मोजत नाही. BF16 कार्डनुसार सध्या कोणताही अनुमान प्रदाता त्या भांडाराला सेवा देत नाही. GGUF भांडार हा स्वतंत्र क्वांटाइझ केलेला घटक असून त्यासाठी स्वतंत्र llama.cpp द्रुत प्रारंभ आहे.
### पायरी 1: llama.cpp स्थापित करा आणि स्थानिक सर्व्हर सुरू करा
Windows PowerShell मध्ये [अधिकृत Mellum2.1 GGUF द्रुत प्रारंभ](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF) वापरून llama.cpp स्थापित करा.
```powershell
winget install llama.cpp
```
जर `llama` आदेश अद्याप PATH मध्ये नसेल तर नवीन टर्मिनल उघडा. शिफारस केलेली Q4\_K\_M बिल्ड सुरू करा आणि पोर्ट 8080 वर फक्त स्थानिक संगणकाला स्पष्टपणे बांधा:
```powershell
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080
```
GGUF भांडार हे मॉडेल ID आणि क्वांटायझेशन `llama serve` साठी सांगते; Windows स्थापना मार्गही नोंदवते. [llama.cpp सर्व्हर संदर्भ](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) मध्ये `--host` आणि `--port` यांची नोंद करतो; भांडाराचे उदाहरण endpoint `http://localhost:8080/v1` आहे. macOS व Linux साठी त्याच GGUF भांडारात `curl -LsSf https://llama.app/install.sh | sh` वापरून llama.cpp स्थापित करणे आणि मग तोच serve आदेश वापरणे सांगितले आहे.
पहिल्या प्रतिसादापूर्वी प्रक्रिया मॉडेल डाउनलोड करेल. Q4\_K\_M फाइल 8.1 GB आहे. या चाचणीसाठी सर्व्हर फक्त तुमच्या संगणकावर बांधा; नेटवर्कवर उघडू नका किंवा prompt मध्ये credentials ठेवू नका. भांडार 7.0 GB ची लहान MXFP4\_MOE फाइल तसेच मोठ्या Q6\_K, Q8\_0 आणि BF16 प्रकारही दाखवते. क्वांटायझेशनमुळे मॉडेल घटक बदलतो; फाइल आकारावरून एखादा संगणक उपयुक्त संदर्भ लांबी किंवा वेगाने सेवा देऊ शकेल का हे कळत नाही.
आदेश सुरू न झाल्यास प्रथम अचूक मॉडेल ID, उपलब्ध डिस्क जागा, llama.cpp आवृत्ती आणि संपूर्ण त्रुटी तपासा. मेमरी वाटप अयशस्वी झाल्यास थांबा आणि सध्याच्या llama.cpp कागदपत्रांशी रनटाइम पर्याय व संदर्भ सेटिंग्ज तपासा; हा मॉडेल दोषी असल्याचा पुरावा नाही. प्रकाशित 131,072-token संदर्भ तुमच्या संगणकात मावेल असे गृहित धरू नका.
### पायरी 2: स्मोक-टेस्ट prompt पाठवा
सर्व्हर चालू ठेवा. दुसऱ्या PowerShell विंडोमध्ये त्याच्या स्थानिक API कडे लहान विनंती पाठवा:
```powershell
$body = @{
model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
messages = @(
@{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
)
# Author-selected budget for this short smoke test; not a JetBrains recommendation.
max_tokens = 512
temperature = 0.6
top_p = 0.95
top_k = 20
} | ConvertTo-Json -Depth 5
$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body
$choice = $response.choices[0]
[pscustomobject]@{
finish_reason = $choice.finish_reason
has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
content = $choice.message.content
}
```
मॉडेल ID, स्थानिक endpoint आणि sampling मूल्ये भांडाराच्या API उदाहरणानुसार आहेत. `max_tokens = 512` हे या छोट्या तपासणीसाठी निवडलेले मर्यादित मूल्य आहे, मॉडेल कार्डची शिफारस नाही. Mellum2.1 विचारक्षम मॉडेल आहे; GGUF कार्डनुसार ते reasoning `<think>...</think>` blocks मध्ये देते. कोड स्वतंत्र `reasoning_content` field रिकामा नाही का ते सांगतो, पण तो field छापत नाही. रनटाइमच्या reasoning स्वरूपानुसार `content` मध्ये अजूनही `<think>` मजकूर असू शकतो. हा prompt स्मोक टेस्ट आहे, मॉडेल गुणवत्ता benchmark नाही.
विनंतीने connection किंवा server error ऐवजी completion परत करणे, `finish_reason` हे `length` नसणे आणि अंतिम `content` मध्ये `MELLUM21-LOCAL-OK` असणे आवश्यक आहे. फक्त HTTP यश पुरेसे नाही: विचारक्षम मॉडेल मागितलेला अंतिम मजकूर देण्याआधी छोटा output budget वापरू शकते. आउटपुट रिकामे, marker नसलेला किंवा `finish_reason` हे `length` असल्यास निकाल अनिश्चित माना; मॉडेल अपयशी ठरले असे न म्हणता मर्यादित output budget वाढवून पुन्हा प्रयत्न करा. PowerShell connection failure दाखवत असल्यास पहिल्या टर्मिनलमध्ये सर्व्हर चालू आहे आणि विनंती पोर्ट 8080 वापरते याची खात्री करा. सर्व्हर त्रुटी देत असल्यास अचूक संदेश जतन करा आणि coding agent तपासण्यापूर्वी त्याचे निराकरण करा. यशस्वी प्रतिसाद स्थानिक अनुमान मार्ग एका विनंतीला उत्तर देऊ शकतो हे दाखवतो; मॉडेल सुरक्षितपणे कोड बदलू शकते हे नाही.
### पायरी 3: agent जोडण्यापूर्वी तपासा
पहिले मूल्यमापन चालू प्रकल्पापासून वेगळे ठेवा. माहीत असलेले छोटे काम असलेले तात्पुरते भांडार वापरा आणि मॉडेल घटक/क्वांटायझेशन, llama.cpp आवृत्ती, ऑपरेटिंग सिस्टम, संदर्भ सेटिंग, prompt, आउटपुट, वेळ आणि संसाधन वापर नोंदवा. मर्यादित बदल मागा, प्रस्तावित diff तपासा आणि भांडाराच्या विद्यमान चाचण्या स्वतः चालवा. तुलना हवी असल्यास सध्याच्या baseline सह तेच काम पुन्हा करा. एक prompt किंवा एक यशस्वी चाचणी benchmark नाही.
मॉडेल सर्व्हर मजकूर परत करतो आणि रनटाइम व विनंती स्वरूपानुसार संरचित tool-call workflow समर्थित करू शकतो. agent कोणती साधने वापरू शकतो किंवा ती सुरक्षितपणे चालवतो हे तो स्वतः ठरवत नाही. भोवतालचा agent भांडार प्रवेश, shell आदेश, फाइल बदल आणि चाचणी नियंत्रणात ठेवतो. फक्त-वाचन किंवा काटेकोरपणे मर्यादित प्रवेशाने सुरुवात करा; लिहिणे व आदेशांसाठी मंजुरी घ्या, प्रत्येक diff तपासा आणि test भांडार व prompts मध्ये secrets ठेवू नका. agent कामापलीकडे जात असेल, असंबंधित फाइल बदलत असेल किंवा अयशस्वी चाचणी समजावू शकत नसेल तर थांबा.
खासगी वापरासाठी अनुमान कुठे चालते आणि agent कसा सेट केला आहे ते तपासा. विनंत्या स्थानिक endpoint वरच राहिल्यास स्थानिक मॉडेल प्रक्रिया prompts तुमच्या संगणकावर ठेवू शकते; तरी agent इतर वैशिष्ट्यांसाठी बाह्य सेवा वापरू शकतो. खासगी code/data वापरण्यापूर्वी त्या अनुप्रयोगाचे network access, logging, telemetry आणि tool permissions तपासा.
### पायरी 4: प्रकाशित पुरावे काय दाखवतात आणि काय नाही
JetBrains Mellum2.1 ला 12B mixture-of-experts मॉडेल, 2.5B सक्रिय पॅरामीटर, BF16 अचूकता आणि 131,072-token संदर्भ असलेले वर्णन करते. कार्डनुसार प्रकाशन Apache 2.0 आहे आणि sandboxed software environments मधील reinforcement learning सह post-training झाले. JetBrains agentic coding मूल्यमापनासह benchmark निकालही प्रकाशित करते. हे JetBrains चे स्वतः नोंदवलेले गुण आहेत; BIG CHANGE ची मोजमापे नाहीत आणि तुमच्या हार्डवेअरचा throughput किंवा प्रकल्पाचा परिणाम भाकीत करत नाहीत.
प्रकाशनाच्या वेगवेगळ्या ठिकाणी एक तपशील बदलला. JetBrains च्या 8 ऑक्टोबरच्या launch post मध्ये GGUF builds ‘लवकरच’ येतील असे म्हटले होते. 9 ऑक्टोबरला अधिकृत Hugging Face GGUF भांडार उपलब्ध असून त्यात llama.cpp, Ollama आणि इतर quickstarts आहेत. ही मार्गदर्शिका सध्या प्रकाशित GGUF भांडार वापरते. BF16 भांडार स्वतंत्र घटक आहे; पायऱ्या पुन्हा करण्यापूर्वी दोन्ही भांडारांतील बदल तपासा.
### मोठा बदल
आता प्रकाशित llama.cpp quickstart वापरून quantized Mellum2.1 build करता येतो आणि स्थानिक OpenAI-सुसंगत endpoint वरून प्रश्न विचारता येतात. BF16 भांडारासाठी inference-provider deployment वर अवलंबून न राहता स्वतः होस्ट केलेल्या अनुमानाची पहिली तपासणी शक्य होते. प्रतिसाद serving मार्ग चालतो हे सिद्ध करतो; agent गुणवत्ता, योग्यपणा, संपूर्ण toolchain मधील गोपनीयता किंवा production तयारी सिद्ध करत नाही.
### स्रोत आणि पुढील वाचन
- [JetBrains: ‘Mellum2.1 Gets to Work’ (8 ऑक्टोबर 2026)](https://blog.jetbrains.com/ai/2026/10/mellum2-1-gets-to-work-a-fast-open-model-for-coding-agents/) — लॉन्च वर्णन आणि GGUF उपलब्धतेबद्दलचे मूळ विधान.
- [JetBrains Mellum2.1 BF16 मॉडेल कार्ड](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking) — मॉडेल तपशील, vLLM आणि Transformers सूचना, benchmarks आणि परवाना.
- [JetBrains Mellum2.1 GGUF भांडार](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF) — सध्याची quantization, फाइल आकार, llama.cpp commands आणि स्थानिक API उदाहरण.
- [llama.cpp प्रकल्प](https://github.com/ggml-org/llama.cpp) — रनटाइम स्रोत आणि release माहिती.
## Sources
- [Mellum2.1 Gets to Work: A Fast Open Model for Coding Agents](https://blog.jetbrains.com/ai/2026/10/mellum2-1-gets-to-work-a-fast-open-model-for-coding-agents/) — JetBrains लॉन्च लेख; 8 ऑक्टोबरची घोषणा आणि त्या वेळी GGUF लवकरच येईल हे विधान दर्शवतो.
- [JetBrains/Mellum2.1-12B-A2.5B-Thinking मॉडेल कार्ड](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking) — अधिकृत BF16 घटक तपशील, कार्ड quickstarts, benchmark तक्ता आणि inference-provider स्थिती; benchmark मूल्ये JetBrains ने स्वतः नोंदवली.
- [JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF मॉडेल कार्ड आणि quickstart](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF) — सध्याचा अधिकृत GGUF घटक, quantized फाइल आकार, Windows llama.cpp quickstart आणि स्थानिक OpenAI-सुसंगत endpoint.
- [llama.cpp](https://github.com/ggml-org/llama.cpp) — रनटाइम प्रकल्प संदर्भ; रनटाइम आवृत्तीचा दावा नाही.
BIG CHANGE वृत्तपत्र
मोठे चित्र. तुमच्या गतीने.
AI आणि रोबोटिक्सवरील ताज्या बातम्या, पाहण्यासारखे बदल आणि वापरता येतील अशा व्यावहारिक कल्पना. दैनिक माहिती, साप्ताहिक सारांश किंवा मासिक दृष्टिकोन निवडा.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
तुमची गोपनीयता, तुमची निवड.
आवश्यक स्टोरेज साइट सुरक्षित ठेवण्यास आणि तुमच्या निवडी लक्षात ठेवण्यास मदत करते. तुमची परवानगी मिळेपर्यंत पर्यायी Google Analytics बंद राहते. फक्त आवश्यक स्टोरेज वापरून प्रत्येक लेख वाचता येतो. गोपनीयतेचा तपशील