AI-translated from English; not yet reviewed by a fluent editor.

# Mellum2.1 کو مقامی طور پر چلائیں اور اس کا پہلا جواب جانچیں

> JetBrains کی موجودہ GGUF ریپوزٹری میں llama.cpp کے ذریعے Mellum2.1 کو مقامی طور پر پیش کرنے کا طریقہ درج ہے۔ رن ٹائم انسٹال کریں، completion کی درخواست بھیجیں، اور agent آزمانے سے پہلے جواب دیکھیں۔

By BIG CHANGE Editorial

Published: 2026-10-09T17:10:04.232Z
Updated: 2026-10-09T17:10:04.232Z
Canonical: https://bigchange.ai/blog/run-jetbrains-mellum21-locally-llama-cpp

![An unbranded desktop computer tower with a small orange indicator stands on a warm ivory floor.](https://bigchange.ai/api/media/file/mellum21-local-inference-hero-v1.png)
Conceptual illustration of a computer that can host a local model server; no Mellum2.1 installation or test is depicted. AI-generated illustration by BIG CHANGE.

JetBrains کا Mellum2.1 بارہ ارب پیرامیٹرز کا ماڈل ہے، جن میں سے ڈھائی ارب فعال ہیں۔ BF16 ریپوزٹری اور الگ GGUF ریپوزٹری دونوں Hugging Face پر موجود ہیں۔ پہلی مقامی بار چلانے کے لیے GGUF ریپوزٹری llama.cpp کا طریقہ بتاتی ہے: ضرورت پر quantized فائل ڈاؤن لوڈ کریں، مقامی سرور شروع کریں، prompt بھیجیں، اور کسی coding agent کو ریپوزٹری تک رسائی دینے سے پہلے جواب دیکھیں۔

یہ دستاویزات پر مبنی سیٹ اپ رہنمائی ہے۔ BIG CHANGE نے Mellum2.1 انسٹال نہیں کیا اور نہ ہی نیچے دیے گئے احکامات چلائے۔ کامیابی کی جانچ یہ ہے کہ سرور مقامی completion واپس کرے؛ اس سے code کا معیار، agent کی قابلِ اعتماد کارکردگی یا آپ کے hardware پر رفتار ثابت نہیں ہوتی۔

### آپ کو کیا چاہیے

- Windows، macOS یا Linux کمپیوٹر جس میں منتخب ماڈل اور اس کے رن ٹائم کے لیے کافی میموری اور اسٹوریج ہو۔ JetBrains کارڈ کے مطابق اصل ماڈل BF16 ہے اور اس کا context 131,072 tokens ہے۔ GGUF ریپوزٹری تجویز کردہ Q4\_K\_M فائل 8.1 GB بتاتی ہے۔ یہ فائل کا حجم ہے، رن ٹائم میموری کا مکمل تخمینہ نہیں: رن ٹائم، context اور دوسرے عمل کے لیے اضافی وسائل درکار ہیں۔ JetBrains کم از کم میموری کی ضرورت شائع نہیں کرتا۔
- سافٹ ویئر اور ماڈل پہلی بار ڈاؤن لوڈ کرنے کے لیے انٹرنیٹ کنکشن چاہیے۔ inference کی درخواست خود مقامی سرور کو بھیجی جا سکتی ہے۔
- llama.cpp اور ایک terminal۔ ریپوزٹری Windows کے لیے `winget install llama.cpp` اور مقامی طور پر چلانے کے لیے `llama serve` command درج کرتی ہے۔

ماڈل Apache 2.0 کے تحت جاری کیا گیا ہے۔ weights کے استعمال کی کوئی فیس درج نہیں؛ JetBrains ہارڈویئر، بجلی، اسٹوریج یا کرائے کے infrastructure کے اخراجات نہیں بتاتا۔ موجودہ BF16 ماڈل کارڈ کہتا ہے کہ کوئی inference provider اس ریپوزٹری کو سروس نہیں دیتا۔ GGUF ایک الگ quantized artifact ہے اور اس کی اپنی llama.cpp فوری رہنمائی ہے۔

### مرحلہ 1: llama.cpp انسٹال کریں اور مقامی سرور شروع کریں

Windows میں PowerShell کے ذریعے llama.cpp انسٹال کرنے کے لیے [سرکاری Mellum2.1 GGUF فوری رہنمائی](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF):

```powershell
winget install llama.cpp
```

اگر `llama` command ابھی PATH میں نہیں تو نیا terminal کھولیں۔ تجویز کردہ Q4\_K\_M build شروع کریں اور اسے port 8080 پر مقامی کمپیوٹر سے واضح طور پر bind کریں:

```powershell
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080
```

GGUF ریپوزٹری اس model ID اور quantization کو `llama serve` کے لیے درج کرتی ہے؛ Windows انسٹالیشن کا طریقہ بھی بتاتی ہے۔ [llama.cpp server حوالہ](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) میں `--host` اور `--port` درج ہیں؛ ریپوزٹری کی مثال endpoint `http://localhost:8080/v1` ہے۔ macOS اور Linux پر یہی GGUF ریپوزٹری `curl -LsSf https://llama.app/install.sh | sh` سے llama.cpp انسٹال کرنے اور پھر وہی server command چلانے کی ہدایت دیتی ہے۔

پہلے جواب سے پہلے عمل کو ماڈل ڈاؤن لوڈ کرنا ہوگا۔ Q4\_K\_M فائل کا حجم 8.1 GB درج ہے۔ اس ٹیسٹ کے لیے سرور کو صرف اپنے کمپیوٹر سے bind رکھیں؛ اسے نیٹ ورک پر ظاہر نہ کریں اور prompt میں credentials نہ رکھیں۔ ریپوزٹری ایک چھوٹی 7.0 GB MXFP4\_MOE فائل اور بڑی Q6\_K، Q8\_0 اور BF16 اقسام بھی درج کرتی ہے۔ quantization ماڈل artifact بدلتی ہے؛ صرف فائل کے حجم سے معلوم نہیں ہوتا کہ کوئی خاص کمپیوٹر اسے مفید context length یا رفتار سے چلا سکے گا یا نہیں۔

اگر command شروع نہ ہو تو پہلے درست model ID، دستیاب disk جگہ، llama.cpp کا ورژن اور مکمل error متن دیکھیں۔ میموری مختص کرنے میں ناکامی پر رکیں اور موجودہ llama.cpp دستاویزات کے مطابق رن ٹائم اختیارات اور context ترتیبات دیکھیں؛ یہ ماڈل کے خراب ہونے کا ثبوت نہیں۔ یہ نہ سمجھیں کہ شائع شدہ 131,072-token context آپ کے کمپیوٹر میں سما جائے گا۔

### مرحلہ 2: smoke-test prompt بھیجیں

سرور کو چلتا رہنے دیں۔ دوسرے PowerShell ونڈو میں اس کے مقامی API کو مختصر درخواست بھیجیں:

```powershell
$body = @{
  model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
  messages = @(
    @{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
  )
  # Author-selected budget for this short smoke test; not a JetBrains recommendation.
  max_tokens = 512
  temperature = 0.6
  top_p = 0.95
  top_k = 20
} | ConvertTo-Json -Depth 5

$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body

$choice = $response.choices[0]
[pscustomobject]@{
  finish_reason = $choice.finish_reason
  has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
  content = $choice.message.content
}
```

ماڈل ID، مقامی endpoint اور sampling values ریپوزٹری کی API مثال کے مطابق ہیں۔ `max_tokens = 512` یہ مختصر جانچ کے لیے منتخب محدود قدر ہے، ماڈل کارڈ کی سفارش نہیں۔ Mellum2.1 ایک thinking ماڈل ہے؛ GGUF کارڈ کے مطابق یہ reasoning کو `<think>...</think>` blocks میں نکالتا ہے۔ code الگ `reasoning_content` field کے غیر خالی ہونے کی اطلاع دیتا ہے مگر اسے چھاپتا نہیں۔ رن ٹائم کی reasoning شکل کے مطابق `content` میں اب بھی `<think>` متن ہو سکتا ہے۔ یہ prompt smoke test ہے، ماڈل کے معیار کا benchmark نہیں۔

بنیادی جانچ تبھی کامیاب ہے جب درخواست connection یا server error کے بجائے completion واپس کرے، `finish_reason` ، `length` نہ ہو، اور آخری `content` میں `MELLUM21-LOCAL-OK` موجود ہو۔ صرف HTTP کامیابی کافی نہیں: thinking ماڈل مطلوبہ آخری متن سے پہلے چھوٹا output budget خرچ کر سکتا ہے۔ اگر output خالی ہو، marker غائب ہو یا `finish_reason` کی قدر `length` ہو تو جانچ کو غیر فیصلہ کن سمجھیں؛ ماڈل کی ناکامی قرار دینے کے بجائے محدود output budget بڑھا کر دوبارہ کوشش کریں۔ اگر PowerShell connection failure دکھائے تو تصدیق کریں کہ پہلے terminal میں سرور چل رہا ہے اور درخواست port 8080 استعمال کرتی ہے۔ سرور error واپس کرے تو درست پیغام محفوظ کریں اور coding agent آزمانے سے پہلے مسئلہ حل کریں۔ کامیاب جواب صرف یہ تصدیق کرتا ہے کہ مقامی inference کا یہ راستہ ایک درخواست کا جواب دے سکتا ہے؛ یہ نہیں کہ ماڈل محفوظ طریقے سے code میں ترمیم کرسکتا ہے۔

### مرحلہ 3: agent جوڑنے سے پہلے جانچیں

پہلی جانچ کو فعال منصوبے سے الگ رکھیں۔ معلوم چھوٹے کام والی عارضی ریپوزٹری استعمال کریں اور ماڈل artifact اور quantization، llama.cpp ورژن، آپریٹنگ سسٹم، context ترتیب، prompt، output، وقت اور وسائل کے استعمال کو درج کریں۔ محدود تبدیلی مانگیں، تجویز کردہ diff دیکھیں، اور ریپوزٹری کے موجودہ tests خود چلائیں۔ موازنہ مقصود ہو تو موجودہ baseline کے ساتھ یہی کام دہرائیں۔ ایک prompt یا ایک کامیاب test run benchmark نہیں۔

ماڈل سرور متن واپس کرتا ہے اور رن ٹائم و درخواست کی شکل کے مطابق ساختہ tool-call ورک فلو کی حمایت کرسکتا ہے۔ وہ خود طے نہیں کرتا کہ agent کون سے tools استعمال کرے یا انہیں محفوظ طریقے سے چلاتا ہے۔ اردگرد کا agent ریپوزٹری کی رسائی، shell commands، فائل میں تبدیلی اور tests چلانے کو کنٹرول کرتا ہے۔ ابتدا read-only یا سخت محدود رسائی سے کریں، لکھنے اور احکامات کے لیے منظوری لیں، ہر diff کا جائزہ لیں، اور راز ٹیسٹ ریپوزٹری یا prompts میں نہ رکھیں۔ اگر agent کام سے آگے بڑھے، غیر متعلقہ فائلیں بدلے یا ناکام test کی وضاحت نہ کرسکے تو رک جائیں۔

نجی استعمال کے لیے تصدیق کریں کہ inference کہاں چلتی ہے اور agent کی ترتیب کیا ہے۔ مقامی ماڈل کا عمل prompts کو آپ کے کمپیوٹر پر رکھ سکتا ہے جب درخواستیں مقامی endpoint تک رہیں، لیکن دوسرے فیچرز کے لیے agent بیرونی خدمات بھی بلا سکتا ہے۔ نجی code یا data استعمال کرنے سے پہلے اس application میں network رسائی، logs، telemetry اور tool permissions دیکھیں۔

### مرحلہ 4: شائع شدہ شواہد کیا دکھاتے ہیں اور کیا نہیں

JetBrains Mellum2.1 کو 12B mixture-of-experts ماڈل بتاتا ہے، جس میں 2.5B فعال پیرامیٹرز، BF16 precision اور 131,072-token context ہے۔ ماڈل کارڈ کے مطابق اجرا Apache 2.0 ہے اور post-training میں sandboxed software ماحول میں reinforcement learning شامل تھی۔ JetBrains benchmark نتائج بھی شائع کرتا ہے، جن میں agentic coding جانچ شامل ہے۔ یہ JetBrains کے خود رپورٹ کردہ نتائج ہیں؛ BIG CHANGE کی پیمائش نہیں اور آپ کے hardware throughput یا منصوبے کے نتائج کی پیش گوئی نہیں کرتے۔

اشاعت کے مقامات کے درمیان release کی ایک تفصیل بدلی۔ JetBrains کی 8 اکتوبر کی launch پوسٹ میں GGUF builds کو “جلد آنے والا” کہا گیا تھا۔ 9 اکتوبر کو سرکاری Hugging Face GGUF ریپوزٹری دستیاب ہے اور llama.cpp، Ollama اور دیگر کے quickstart رکھتی ہے۔ یہ رہنمائی موجودہ شائع شدہ GGUF ریپوزٹری استعمال کرتی ہے۔ BF16 ریپوزٹری الگ artifact ہے؛ یہ اقدامات دہرانے سے پہلے دونوں ریپوزٹری میں تبدیلیاں دیکھیں۔

### بڑی تبدیلی

اب آپ quantized Mellum2.1 build کے لیے شائع شدہ llama.cpp quickstart پر عمل کرکے اسے مقامی OpenAI-compatible endpoint کے ذریعے query کرسکتے ہیں۔ اس سے BF16 ریپوزٹری کے لیے inference-provider deployment پر انحصار کیے بغیر self-hosted inference کی پہلی جانچ عملی بنتی ہے۔ جواب ثابت کرتا ہے کہ serving path کام کرتی ہے؛ agent معیار، موزونیت، پورے toolchain کی رازداری یا production کی تیاری نہیں۔

### ذرائع اور مزید مطالعہ

- [JetBrains: “Mellum2.1 Gets to Work” (8 اکتوبر 2026)](https://blog.jetbrains.com/ai/2026/10/mellum2-1-gets-to-work-a-fast-open-model-for-coding-agents/) — launch کی وضاحت اور GGUF کی دستیابی سے متعلق ابتدائی بیان۔
- [JetBrains Mellum2.1 BF16 ماڈل کارڈ](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking) — ماڈل کی تفصیل، vLLM اور Transformers ہدایات، benchmarks اور لائسنس۔
- [JetBrains Mellum2.1 GGUF ریپوزٹری](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF) — موجودہ quantizations، فائل سائز، llama.cpp commands اور مقامی API مثال۔
- [llama.cpp منصوبہ](https://github.com/ggml-org/llama.cpp) — رن ٹائم کا ماخذ اور اجرا کی معلومات۔

## Sources

- [Mellum2.1 Gets to Work: A Fast Open Model for Coding Agents](https://blog.jetbrains.com/ai/2026/10/mellum2-1-gets-to-work-a-fast-open-model-for-coding-agents/) — JetBrains کی launch پوسٹ؛ 8 اکتوبر کے اس وقت کے بیان کی عکاسی کرتی ہے کہ GGUF builds جلد آرہی تھیں۔
- [JetBrains/Mellum2.1-12B-A2.5B-Thinking ماڈل کارڈ](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking) — BF16 artifact کی سرکاری تفصیل، model-card quickstarts، benchmark جدول اور inference-provider حالت؛ benchmark اقدار JetBrains کی خود رپورٹ کردہ ہیں۔
- [JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF ماڈل کارڈ اور quickstart](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF) — موجودہ سرکاری GGUF artifact، quantized فائلوں کے سائز، Windows llama.cpp quickstart اور مقامی OpenAI-compatible endpoint۔
- [llama.cpp](https://github.com/ggml-org/llama.cpp) — رن ٹائم منصوبے کا حوالہ؛ رن ٹائم کا کوئی ورژن بیان نہیں کیا گیا۔
