يتوفر Mellum2.1 من JetBrains كنموذج يضم 12 مليار معلَمة، منها 2.5 مليار نشطة. يتوفر مستودع BF16 ومستودع GGUF منفصل على Hugging Face. وللتشغيل المحلي الأول، يشرح مستودع GGUF مسار llama.cpp: نزّل ملفاً مكمّماً عند الحاجة، وشغّل خادماً محلياً، وأرسل prompt، وافحص الإجابة قبل منح أي وكيل برمجي صلاحية الوصول إلى مستودع.

هذا دليل إعداد يستند إلى الوثائق. لم تثبّت BIG CHANGE نموذج Mellum2.1 ولم تنفّذ الأوامر أدناه. معيار النجاح هو أن يعيد الخادم completion محلياً؛ وهذا لا يثبت جودة الشيفرة أو موثوقية الوكيل أو الأداء على أجهزتك.

ما تحتاج إليه

  • حاسوب يعمل بنظام Windows أو macOS أو Linux، بذاكرة ومساحة تخزين كافيتين للنموذج المختار وبيئة تشغيله. تذكر بطاقة JetBrains أن النموذج الأصلي بصيغة BF16 وأن طول السياق 131,072 token. يوصي مستودع GGUF بملف Q4_K_M حجمه 8.1 GB. هذا حجم الملف، وليس تقديراً كاملاً لذاكرة التشغيل: تحتاج بيئة التشغيل والسياق والعمليات الأخرى إلى موارد إضافية. لا تنشر JetBrains حداً أدنى للذاكرة.
  • يلزم اتصال بالإنترنت لتنزيل البرنامج والنموذج أول مرة. ويمكن إرسال طلب الاستدلال نفسه إلى الخادم المحلي.
  • llama.cpp وطرفية. يشرح المستودع الأمر winget install llama.cpp لنظام Windows، وأمر llama serve للتقديم المحلي.

صدر النموذج بموجب ترخيص Apache 2.0. لا تُذكر رسوم لاستخدام الأوزان؛ ولا تحدد JetBrains تكلفة الأجهزة أو الكهرباء أو التخزين أو أي بنية تحتية تستأجرها. تقول بطاقة BF16 الحالية إنه لا يوجد مزود استدلال يقدم خدمة لهذا المستودع. مستودع GGUF أثر منفصل مكمّم وله دليل بدء سريع خاص بـ llama.cpp.

الخطوة 1: ثبّت llama.cpp وشغّل الخادم المحلي

في PowerShell على Windows، ثبّت llama.cpp باتباع دليل البدء السريع الرسمي لـ Mellum2.1 GGUF:

PowerShell
winget install llama.cpp

افتح طرفية جديدة إذا لم يكن الأمر llama موجوداً بعد في PATH. شغّل بناء Q4_K_M الموصى به واربطه صراحةً بالحاسوب المحلي على المنفذ 8080:

PowerShell
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080

يوثّق مستودع GGUF معرّف النموذج هذا والتكميم لاستخدامه مع llama serve؛ كما يوثّق طريقة التثبيت على Windows. يوثّق مرجع خادم llama.cpp كلاً من --host و --port؛ ونقطة النهاية في مثال المستودع هي http://localhost:8080/v1 . وعلى macOS وLinux، يشرح مستودع GGUF نفسه تثبيت llama.cpp باستخدام curl -LsSf https://llama.app/install.sh | sh ثم استخدام أمر التقديم نفسه.

يجب أن تنزّل العملية النموذج قبل أول استجابة. يُذكر أن حجم ملف Q4_K_M هو 8.1 GB. في هذا الاختبار، اربط الخادم بحاسوبك فقط؛ لا تعرضه على شبكة ولا تضع بيانات اعتماد في prompt. يسرد المستودع أيضاً ملف MXFP4_MOE أصغر حجمه 7.0 GB ونسخ Q6_K وQ8_0 وBF16 الأكبر. يغيّر التكميم أثر النموذج؛ ولا يكشف حجم الملف وحده ما إذا كان حاسوب معين يستطيع تقديمه بطول سياق أو سرعة مفيدين.

إذا لم يبدأ الأمر، فتحقق أولاً من معرّف النموذج الدقيق ومساحة القرص المتاحة وإصدار llama.cpp ونص الخطأ كاملاً. فشل تخصيص الذاكرة سبب للتوقف ومراجعة خيارات بيئة التشغيل وإعدادات السياق في وثائق llama.cpp الحالية؛ وليس دليلاً على وجود عيب في النموذج. لا تفترض أن سياق 131,072 token المنشور سيلائم حاسوبك.

الخطوة 2: أرسل prompt للاختبار السريع

اترك الخادم قيد التشغيل. وفي نافذة PowerShell ثانية، أرسل طلباً قصيراً إلى API المحلي:

PowerShell
$body = @{
  model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
  messages = @(
    @{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
  )
  # Author-selected budget for this short smoke test; not a JetBrains recommendation.
  max_tokens = 512
  temperature = 0.6
  top_p = 0.95
  top_k = 20
} | ConvertTo-Json -Depth 5

$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body

$choice = $response.choices[0]
[pscustomobject]@{
  finish_reason = $choice.finish_reason
  has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
  content = $choice.message.content
}

يتبع معرّف النموذج ونقطة النهاية المحلية وقيم أخذ العينات مثال API في المستودع. max_tokens = 512 قيمة محدودة اختيرت لهذا الفحص القصير، وليست توصية من بطاقة النموذج. Mellum2.1 نموذج تفكير؛ وتقول بطاقة GGUF إنه يُصدر reasoning ضمن كتل <think>...</think> . يذكر الكود ما إذا كان الحقل المنفصل reasoning_content غير فارغ من دون طباعته. وبحسب تنسيق reasoning في بيئة التشغيل، قد يظل content يحتوي على نص <think> . هذا prompt اختبار سريع، وليس معياراً لجودة النموذج.

لا ينجح الفحص الأساسي إلا إذا أعاد الطلب completion بدلاً من خطأ اتصال أو خادم، وإذا لم تكن finish_reason هي length، واحتوى content النهائي على MELLUM21-LOCAL-OK . نجاح HTTP وحده لا يكفي: قد يستهلك نموذج التفكير ميزانية إخراج صغيرة قبل إنتاج النص النهائي المطلوب. إذا كان الإخراج فارغاً أو غابت العلامة أو كانت finish_reason تساوي length، فاعتبر الفحص غير حاسم؛ وارفع ميزانية الإخراج المحدودة وأعد المحاولة بدلاً من تشخيص فشل النموذج. إذا أبلغ PowerShell عن فشل اتصال، فتأكد من أن الطرفية الأولى ما زالت تعرض خادماً يعمل وأن الطلب يستخدم المنفذ 8080. وإذا أعاد الخادم خطأً، فاحفظ الرسالة الدقيقة وحل المشكلة قبل اختبار وكيل برمجي. تؤكد الاستجابة الناجحة أن مسار الاستدلال المحلي هذا يستطيع الرد على طلب واحد؛ ولا تؤكد أن النموذج يستطيع تعديل الشيفرة بأمان.

الخطوة 3: افحصه قبل ربط وكيل

أبقِ التقييم الأول منفصلاً عن مشروع حي. استخدم مستودعاً مؤقتاً بمهمة صغيرة معروفة، وسجّل أثر النموذج وتكميمه وإصدار llama.cpp ونظام التشغيل وإعداد السياق وprompt والإخراج والوقت المنقضي واستخدام الموارد. اطلب تغييراً محدوداً، وافحص diff المقترح، وشغّل بنفسك الاختبارات الحالية للمستودع. وللمقارنة، كرر المهمة نفسها مع خط الأساس الحالي لديك. prompt واحد أو تشغيل اختبار ناجح واحد ليس معياراً للأداء.

يعيد خادم النموذج نصاً، وقد يدعم تدفقات منظمة لاستدعاء الأدوات بحسب بيئة التشغيل وتنسيق الطلب. لكنه لا يقرر بنفسه الأدوات التي يستطيع الوكيل استخدامها ولا ينفذها بأمان. يتحكم الوكيل المحيط به في الوصول إلى المستودع وأوامر shell وتعديلات الملفات وتشغيل الاختبارات. ابدأ بوصول للقراءة فقط أو محدود بدقة، واشترط الموافقة على الكتابة والأوامر، وراجع كل diff، وأبعد الأسرار عن مستودع الاختبار وprompts. توقف إذا تجاوز الوكيل المهمة أو عدّل ملفات لا صلة لها أو عجز عن شرح اختبار فاشل.

للاستخدام الخاص، تأكد من موضع تنفيذ الاستدلال وكيفية إعداد وكيلك. قد تُبقي عملية النموذج المحلية prompts على حاسوبك عندما تبقى الطلبات عند نقطة النهاية المحلية، لكن الوكيل قد يستدعي خدمات خارجية لميزات أخرى. قبل استخدام شيفرة أو بيانات خاصة، افحص وصول التطبيق إلى الشبكة والسجلات والقياس عن بُعد وأذونات الأدوات.

الخطوة 4: ما الذي تثبته الأدلة المنشورة وما الذي لا تثبته

تصف JetBrains نموذج Mellum2.1 بأنه نموذج mixture-of-experts بحجم 12B، مع 2.5B معلَمة نشطة ودقة BF16 وسياق من 131,072 token. وتقول بطاقة النموذج إن الإصدار بترخيص Apache 2.0 وتصف تدريباً لاحقاً شمل التعلم المعزز في بيئات برمجية معزولة. كما تنشر JetBrains نتائج معايير أداء، منها تقييمات البرمجة الوكيلة. هذه نتائج أبلغت عنها JetBrains بنفسها؛ وليست قياسات من BIG CHANGE ولا تتنبأ بمعدل معالجة أجهزتك أو نتائج مشروعك.

تغيرت إحدى تفاصيل الإصدار بين منصات النشر. قال منشور إطلاق JetBrains في 8 أكتوبر إن إصدارات GGUF «قريباً». وفي 9 أكتوبر أصبح مستودع GGUF الرسمي على Hugging Face متاحاً ويضم أدلة بدء سريع لـ llama.cpp وOllama وغيرها. يستخدم هذا الدليل مستودع GGUF المنشور حالياً. يظل مستودع BF16 أثراً منفصلاً؛ فتحقق من المستودعين قبل تكرار هذه الخطوات.

التغيير الكبير

يمكنك الآن اتباع دليل llama.cpp المنشور لبناء Mellum2.1 مكمّم والاستعلام عنه عبر نقطة نهاية محلية متوافقة مع OpenAI. وهذا يجعل أول فحص للاستدلال المستضاف ذاتياً عملياً من دون الاعتماد على نشر مزود استدلال لمستودع BF16. تثبت الاستجابة أن مسار التقديم يعمل؛ ولا تثبت جودة الوكيل أو ملاءمته أو خصوصية سلسلة الأدوات بأكملها أو جاهزيته للإنتاج.

المصادر ومزيد من القراءة