JetBrains کا Mellum2.1 بارہ ارب پیرامیٹرز کا ماڈل ہے، جن میں سے ڈھائی ارب فعال ہیں۔ BF16 ریپوزٹری اور الگ GGUF ریپوزٹری دونوں Hugging Face پر موجود ہیں۔ پہلی مقامی بار چلانے کے لیے GGUF ریپوزٹری llama.cpp کا طریقہ بتاتی ہے: ضرورت پر quantized فائل ڈاؤن لوڈ کریں، مقامی سرور شروع کریں، prompt بھیجیں، اور کسی coding agent کو ریپوزٹری تک رسائی دینے سے پہلے جواب دیکھیں۔

یہ دستاویزات پر مبنی سیٹ اپ رہنمائی ہے۔ BIG CHANGE نے Mellum2.1 انسٹال نہیں کیا اور نہ ہی نیچے دیے گئے احکامات چلائے۔ کامیابی کی جانچ یہ ہے کہ سرور مقامی completion واپس کرے؛ اس سے code کا معیار، agent کی قابلِ اعتماد کارکردگی یا آپ کے hardware پر رفتار ثابت نہیں ہوتی۔

آپ کو کیا چاہیے

  • Windows، macOS یا Linux کمپیوٹر جس میں منتخب ماڈل اور اس کے رن ٹائم کے لیے کافی میموری اور اسٹوریج ہو۔ JetBrains کارڈ کے مطابق اصل ماڈل BF16 ہے اور اس کا context 131,072 tokens ہے۔ GGUF ریپوزٹری تجویز کردہ Q4_K_M فائل 8.1 GB بتاتی ہے۔ یہ فائل کا حجم ہے، رن ٹائم میموری کا مکمل تخمینہ نہیں: رن ٹائم، context اور دوسرے عمل کے لیے اضافی وسائل درکار ہیں۔ JetBrains کم از کم میموری کی ضرورت شائع نہیں کرتا۔
  • سافٹ ویئر اور ماڈل پہلی بار ڈاؤن لوڈ کرنے کے لیے انٹرنیٹ کنکشن چاہیے۔ inference کی درخواست خود مقامی سرور کو بھیجی جا سکتی ہے۔
  • llama.cpp اور ایک terminal۔ ریپوزٹری Windows کے لیے winget install llama.cpp اور مقامی طور پر چلانے کے لیے llama serve command درج کرتی ہے۔

ماڈل Apache 2.0 کے تحت جاری کیا گیا ہے۔ weights کے استعمال کی کوئی فیس درج نہیں؛ JetBrains ہارڈویئر، بجلی، اسٹوریج یا کرائے کے infrastructure کے اخراجات نہیں بتاتا۔ موجودہ BF16 ماڈل کارڈ کہتا ہے کہ کوئی inference provider اس ریپوزٹری کو سروس نہیں دیتا۔ GGUF ایک الگ quantized artifact ہے اور اس کی اپنی llama.cpp فوری رہنمائی ہے۔

مرحلہ 1: llama.cpp انسٹال کریں اور مقامی سرور شروع کریں

Windows میں PowerShell کے ذریعے llama.cpp انسٹال کرنے کے لیے سرکاری Mellum2.1 GGUF فوری رہنمائی:

PowerShell
winget install llama.cpp

اگر llama command ابھی PATH میں نہیں تو نیا terminal کھولیں۔ تجویز کردہ Q4_K_M build شروع کریں اور اسے port 8080 پر مقامی کمپیوٹر سے واضح طور پر bind کریں:

PowerShell
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080

GGUF ریپوزٹری اس model ID اور quantization کو llama serve کے لیے درج کرتی ہے؛ Windows انسٹالیشن کا طریقہ بھی بتاتی ہے۔ llama.cpp server حوالہ میں --host اور --port درج ہیں؛ ریپوزٹری کی مثال endpoint http://localhost:8080/v1 ہے۔ macOS اور Linux پر یہی GGUF ریپوزٹری curl -LsSf https://llama.app/install.sh | sh سے llama.cpp انسٹال کرنے اور پھر وہی server command چلانے کی ہدایت دیتی ہے۔

پہلے جواب سے پہلے عمل کو ماڈل ڈاؤن لوڈ کرنا ہوگا۔ Q4_K_M فائل کا حجم 8.1 GB درج ہے۔ اس ٹیسٹ کے لیے سرور کو صرف اپنے کمپیوٹر سے bind رکھیں؛ اسے نیٹ ورک پر ظاہر نہ کریں اور prompt میں credentials نہ رکھیں۔ ریپوزٹری ایک چھوٹی 7.0 GB MXFP4_MOE فائل اور بڑی Q6_K، Q8_0 اور BF16 اقسام بھی درج کرتی ہے۔ quantization ماڈل artifact بدلتی ہے؛ صرف فائل کے حجم سے معلوم نہیں ہوتا کہ کوئی خاص کمپیوٹر اسے مفید context length یا رفتار سے چلا سکے گا یا نہیں۔

اگر command شروع نہ ہو تو پہلے درست model ID، دستیاب disk جگہ، llama.cpp کا ورژن اور مکمل error متن دیکھیں۔ میموری مختص کرنے میں ناکامی پر رکیں اور موجودہ llama.cpp دستاویزات کے مطابق رن ٹائم اختیارات اور context ترتیبات دیکھیں؛ یہ ماڈل کے خراب ہونے کا ثبوت نہیں۔ یہ نہ سمجھیں کہ شائع شدہ 131,072-token context آپ کے کمپیوٹر میں سما جائے گا۔

مرحلہ 2: smoke-test prompt بھیجیں

سرور کو چلتا رہنے دیں۔ دوسرے PowerShell ونڈو میں اس کے مقامی API کو مختصر درخواست بھیجیں:

PowerShell
$body = @{
  model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
  messages = @(
    @{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
  )
  # Author-selected budget for this short smoke test; not a JetBrains recommendation.
  max_tokens = 512
  temperature = 0.6
  top_p = 0.95
  top_k = 20
} | ConvertTo-Json -Depth 5

$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body

$choice = $response.choices[0]
[pscustomobject]@{
  finish_reason = $choice.finish_reason
  has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
  content = $choice.message.content
}

ماڈل ID، مقامی endpoint اور sampling values ریپوزٹری کی API مثال کے مطابق ہیں۔ max_tokens = 512 یہ مختصر جانچ کے لیے منتخب محدود قدر ہے، ماڈل کارڈ کی سفارش نہیں۔ Mellum2.1 ایک thinking ماڈل ہے؛ GGUF کارڈ کے مطابق یہ reasoning کو <think>...</think> blocks میں نکالتا ہے۔ code الگ reasoning_content field کے غیر خالی ہونے کی اطلاع دیتا ہے مگر اسے چھاپتا نہیں۔ رن ٹائم کی reasoning شکل کے مطابق content میں اب بھی <think> متن ہو سکتا ہے۔ یہ prompt smoke test ہے، ماڈل کے معیار کا benchmark نہیں۔

بنیادی جانچ تبھی کامیاب ہے جب درخواست connection یا server error کے بجائے completion واپس کرے، finish_reason ، length نہ ہو، اور آخری content میں MELLUM21-LOCAL-OK موجود ہو۔ صرف HTTP کامیابی کافی نہیں: thinking ماڈل مطلوبہ آخری متن سے پہلے چھوٹا output budget خرچ کر سکتا ہے۔ اگر output خالی ہو، marker غائب ہو یا finish_reason کی قدر length ہو تو جانچ کو غیر فیصلہ کن سمجھیں؛ ماڈل کی ناکامی قرار دینے کے بجائے محدود output budget بڑھا کر دوبارہ کوشش کریں۔ اگر PowerShell connection failure دکھائے تو تصدیق کریں کہ پہلے terminal میں سرور چل رہا ہے اور درخواست port 8080 استعمال کرتی ہے۔ سرور error واپس کرے تو درست پیغام محفوظ کریں اور coding agent آزمانے سے پہلے مسئلہ حل کریں۔ کامیاب جواب صرف یہ تصدیق کرتا ہے کہ مقامی inference کا یہ راستہ ایک درخواست کا جواب دے سکتا ہے؛ یہ نہیں کہ ماڈل محفوظ طریقے سے code میں ترمیم کرسکتا ہے۔

مرحلہ 3: agent جوڑنے سے پہلے جانچیں

پہلی جانچ کو فعال منصوبے سے الگ رکھیں۔ معلوم چھوٹے کام والی عارضی ریپوزٹری استعمال کریں اور ماڈل artifact اور quantization، llama.cpp ورژن، آپریٹنگ سسٹم، context ترتیب، prompt، output، وقت اور وسائل کے استعمال کو درج کریں۔ محدود تبدیلی مانگیں، تجویز کردہ diff دیکھیں، اور ریپوزٹری کے موجودہ tests خود چلائیں۔ موازنہ مقصود ہو تو موجودہ baseline کے ساتھ یہی کام دہرائیں۔ ایک prompt یا ایک کامیاب test run benchmark نہیں۔

ماڈل سرور متن واپس کرتا ہے اور رن ٹائم و درخواست کی شکل کے مطابق ساختہ tool-call ورک فلو کی حمایت کرسکتا ہے۔ وہ خود طے نہیں کرتا کہ agent کون سے tools استعمال کرے یا انہیں محفوظ طریقے سے چلاتا ہے۔ اردگرد کا agent ریپوزٹری کی رسائی، shell commands، فائل میں تبدیلی اور tests چلانے کو کنٹرول کرتا ہے۔ ابتدا read-only یا سخت محدود رسائی سے کریں، لکھنے اور احکامات کے لیے منظوری لیں، ہر diff کا جائزہ لیں، اور راز ٹیسٹ ریپوزٹری یا prompts میں نہ رکھیں۔ اگر agent کام سے آگے بڑھے، غیر متعلقہ فائلیں بدلے یا ناکام test کی وضاحت نہ کرسکے تو رک جائیں۔

نجی استعمال کے لیے تصدیق کریں کہ inference کہاں چلتی ہے اور agent کی ترتیب کیا ہے۔ مقامی ماڈل کا عمل prompts کو آپ کے کمپیوٹر پر رکھ سکتا ہے جب درخواستیں مقامی endpoint تک رہیں، لیکن دوسرے فیچرز کے لیے agent بیرونی خدمات بھی بلا سکتا ہے۔ نجی code یا data استعمال کرنے سے پہلے اس application میں network رسائی، logs، telemetry اور tool permissions دیکھیں۔

مرحلہ 4: شائع شدہ شواہد کیا دکھاتے ہیں اور کیا نہیں

JetBrains Mellum2.1 کو 12B mixture-of-experts ماڈل بتاتا ہے، جس میں 2.5B فعال پیرامیٹرز، BF16 precision اور 131,072-token context ہے۔ ماڈل کارڈ کے مطابق اجرا Apache 2.0 ہے اور post-training میں sandboxed software ماحول میں reinforcement learning شامل تھی۔ JetBrains benchmark نتائج بھی شائع کرتا ہے، جن میں agentic coding جانچ شامل ہے۔ یہ JetBrains کے خود رپورٹ کردہ نتائج ہیں؛ BIG CHANGE کی پیمائش نہیں اور آپ کے hardware throughput یا منصوبے کے نتائج کی پیش گوئی نہیں کرتے۔

اشاعت کے مقامات کے درمیان release کی ایک تفصیل بدلی۔ JetBrains کی 8 اکتوبر کی launch پوسٹ میں GGUF builds کو “جلد آنے والا” کہا گیا تھا۔ 9 اکتوبر کو سرکاری Hugging Face GGUF ریپوزٹری دستیاب ہے اور llama.cpp، Ollama اور دیگر کے quickstart رکھتی ہے۔ یہ رہنمائی موجودہ شائع شدہ GGUF ریپوزٹری استعمال کرتی ہے۔ BF16 ریپوزٹری الگ artifact ہے؛ یہ اقدامات دہرانے سے پہلے دونوں ریپوزٹری میں تبدیلیاں دیکھیں۔

بڑی تبدیلی

اب آپ quantized Mellum2.1 build کے لیے شائع شدہ llama.cpp quickstart پر عمل کرکے اسے مقامی OpenAI-compatible endpoint کے ذریعے query کرسکتے ہیں۔ اس سے BF16 ریپوزٹری کے لیے inference-provider deployment پر انحصار کیے بغیر self-hosted inference کی پہلی جانچ عملی بنتی ہے۔ جواب ثابت کرتا ہے کہ serving path کام کرتی ہے؛ agent معیار، موزونیت، پورے toolchain کی رازداری یا production کی تیاری نہیں۔

ذرائع اور مزید مطالعہ