JetBrains चे Mellum2.1 हे 12 अब्ज पॅरामीटर आणि 2.5 अब्ज सक्रिय पॅरामीटर असलेले मॉडेल म्हणून उपलब्ध आहे. BF16 भांडार आणि स्वतंत्र GGUF भांडार दोन्ही Hugging Face वर उपलब्ध आहेत. पहिल्या स्थानिक वापरासाठी GGUF भांडार llama.cpp मार्ग सांगते: क्वांटाइझ केलेली फाइल गरजेनुसार डाउनलोड करा, स्थानिक सर्व्हर सुरू करा, prompt पाठवा आणि कोणत्याही कोडिंग agent ला भांडाराचा प्रवेश देण्यापूर्वी उत्तर तपासा.

ही कागदपत्रांवर आधारित सेटअप मार्गदर्शिका आहे. BIG CHANGE ने Mellum2.1 स्थापित केले नाही किंवा खालील आदेश चालवले नाहीत. यशाची तपासणी म्हणजे सर्व्हरने परत केलेला स्थानिक completion; यावरून कोडची गुणवत्ता, agent ची विश्वासार्हता किंवा तुमच्या हार्डवेअरवरील कार्यक्षमता सिद्ध होत नाही.

काय आवश्यक आहे

  • निवडलेल्या मॉडेल आणि रनटाइमसाठी पुरेशी मेमरी व स्टोरेज असलेला Windows, macOS किंवा Linux संगणक. JetBrains कार्डनुसार मूळ मॉडेल BF16 असून त्याचा संदर्भ आकार 131,072 token आहे. GGUF भांडार शिफारस केलेली Q4_K_M फाइल 8.1 GB असल्याचे सांगते. हा फाइल आकार आहे; रनटाइम मेमरीचा पूर्ण अंदाज नाही: रनटाइम, संदर्भ आणि इतर प्रक्रियांना अतिरिक्त संसाधने लागतात. JetBrains किमान मेमरी आवश्यकता प्रकाशित करत नाही.
  • प्रारंभीचे सॉफ्टवेअर/मॉडेल डाउनलोड करण्यासाठी इंटरनेट कनेक्शन. अनुमान विनंती स्थानिक सर्व्हरकडे जाऊ शकते.
  • llama.cpp आणि टर्मिनल. भांडार Windows साठी winget install llama.cpp आणि स्थानिक सर्व्हिंगसाठी llama serve आदेश सांगते.

मॉडेल Apache 2.0 अंतर्गत प्रसिद्ध झाले आहे. वजने वापरण्यासाठी शुल्क नमूद नाही; हार्डवेअर, वीज, स्टोरेज किंवा भाड्याने घेण्याच्या पायाभूत सुविधांचा खर्च JetBrains मोजत नाही. BF16 कार्डनुसार सध्या कोणताही अनुमान प्रदाता त्या भांडाराला सेवा देत नाही. GGUF भांडार हा स्वतंत्र क्वांटाइझ केलेला घटक असून त्यासाठी स्वतंत्र llama.cpp द्रुत प्रारंभ आहे.

पायरी 1: llama.cpp स्थापित करा आणि स्थानिक सर्व्हर सुरू करा

Windows PowerShell मध्ये अधिकृत Mellum2.1 GGUF द्रुत प्रारंभ वापरून llama.cpp स्थापित करा.

PowerShell
winget install llama.cpp

जर llama आदेश अद्याप PATH मध्ये नसेल तर नवीन टर्मिनल उघडा. शिफारस केलेली Q4_K_M बिल्ड सुरू करा आणि पोर्ट 8080 वर फक्त स्थानिक संगणकाला स्पष्टपणे बांधा:

PowerShell
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080

GGUF भांडार हे मॉडेल ID आणि क्वांटायझेशन llama serve साठी सांगते; Windows स्थापना मार्गही नोंदवते. llama.cpp सर्व्हर संदर्भ मध्ये --host आणि --port यांची नोंद करतो; भांडाराचे उदाहरण endpoint http://localhost:8080/v1 आहे. macOS व Linux साठी त्याच GGUF भांडारात curl -LsSf https://llama.app/install.sh | sh वापरून llama.cpp स्थापित करणे आणि मग तोच serve आदेश वापरणे सांगितले आहे.

पहिल्या प्रतिसादापूर्वी प्रक्रिया मॉडेल डाउनलोड करेल. Q4_K_M फाइल 8.1 GB आहे. या चाचणीसाठी सर्व्हर फक्त तुमच्या संगणकावर बांधा; नेटवर्कवर उघडू नका किंवा prompt मध्ये credentials ठेवू नका. भांडार 7.0 GB ची लहान MXFP4_MOE फाइल तसेच मोठ्या Q6_K, Q8_0 आणि BF16 प्रकारही दाखवते. क्वांटायझेशनमुळे मॉडेल घटक बदलतो; फाइल आकारावरून एखादा संगणक उपयुक्त संदर्भ लांबी किंवा वेगाने सेवा देऊ शकेल का हे कळत नाही.

आदेश सुरू न झाल्यास प्रथम अचूक मॉडेल ID, उपलब्ध डिस्क जागा, llama.cpp आवृत्ती आणि संपूर्ण त्रुटी तपासा. मेमरी वाटप अयशस्वी झाल्यास थांबा आणि सध्याच्या llama.cpp कागदपत्रांशी रनटाइम पर्याय व संदर्भ सेटिंग्ज तपासा; हा मॉडेल दोषी असल्याचा पुरावा नाही. प्रकाशित 131,072-token संदर्भ तुमच्या संगणकात मावेल असे गृहित धरू नका.

पायरी 2: स्मोक-टेस्ट prompt पाठवा

सर्व्हर चालू ठेवा. दुसऱ्या PowerShell विंडोमध्ये त्याच्या स्थानिक API कडे लहान विनंती पाठवा:

PowerShell
$body = @{
  model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
  messages = @(
    @{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
  )
  # Author-selected budget for this short smoke test; not a JetBrains recommendation.
  max_tokens = 512
  temperature = 0.6
  top_p = 0.95
  top_k = 20
} | ConvertTo-Json -Depth 5

$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body

$choice = $response.choices[0]
[pscustomobject]@{
  finish_reason = $choice.finish_reason
  has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
  content = $choice.message.content
}

मॉडेल ID, स्थानिक endpoint आणि sampling मूल्ये भांडाराच्या API उदाहरणानुसार आहेत. max_tokens = 512 हे या छोट्या तपासणीसाठी निवडलेले मर्यादित मूल्य आहे, मॉडेल कार्डची शिफारस नाही. Mellum2.1 विचारक्षम मॉडेल आहे; GGUF कार्डनुसार ते reasoning <think>...</think> blocks मध्ये देते. कोड स्वतंत्र reasoning_content field रिकामा नाही का ते सांगतो, पण तो field छापत नाही. रनटाइमच्या reasoning स्वरूपानुसार content मध्ये अजूनही <think> मजकूर असू शकतो. हा prompt स्मोक टेस्ट आहे, मॉडेल गुणवत्ता benchmark नाही.

विनंतीने connection किंवा server error ऐवजी completion परत करणे, finish_reason हे length नसणे आणि अंतिम content मध्ये MELLUM21-LOCAL-OK असणे आवश्यक आहे. फक्त HTTP यश पुरेसे नाही: विचारक्षम मॉडेल मागितलेला अंतिम मजकूर देण्याआधी छोटा output budget वापरू शकते. आउटपुट रिकामे, marker नसलेला किंवा finish_reason हे length असल्यास निकाल अनिश्चित माना; मॉडेल अपयशी ठरले असे न म्हणता मर्यादित output budget वाढवून पुन्हा प्रयत्न करा. PowerShell connection failure दाखवत असल्यास पहिल्या टर्मिनलमध्ये सर्व्हर चालू आहे आणि विनंती पोर्ट 8080 वापरते याची खात्री करा. सर्व्हर त्रुटी देत असल्यास अचूक संदेश जतन करा आणि coding agent तपासण्यापूर्वी त्याचे निराकरण करा. यशस्वी प्रतिसाद स्थानिक अनुमान मार्ग एका विनंतीला उत्तर देऊ शकतो हे दाखवतो; मॉडेल सुरक्षितपणे कोड बदलू शकते हे नाही.

पायरी 3: agent जोडण्यापूर्वी तपासा

पहिले मूल्यमापन चालू प्रकल्पापासून वेगळे ठेवा. माहीत असलेले छोटे काम असलेले तात्पुरते भांडार वापरा आणि मॉडेल घटक/क्वांटायझेशन, llama.cpp आवृत्ती, ऑपरेटिंग सिस्टम, संदर्भ सेटिंग, prompt, आउटपुट, वेळ आणि संसाधन वापर नोंदवा. मर्यादित बदल मागा, प्रस्तावित diff तपासा आणि भांडाराच्या विद्यमान चाचण्या स्वतः चालवा. तुलना हवी असल्यास सध्याच्या baseline सह तेच काम पुन्हा करा. एक prompt किंवा एक यशस्वी चाचणी benchmark नाही.

मॉडेल सर्व्हर मजकूर परत करतो आणि रनटाइम व विनंती स्वरूपानुसार संरचित tool-call workflow समर्थित करू शकतो. agent कोणती साधने वापरू शकतो किंवा ती सुरक्षितपणे चालवतो हे तो स्वतः ठरवत नाही. भोवतालचा agent भांडार प्रवेश, shell आदेश, फाइल बदल आणि चाचणी नियंत्रणात ठेवतो. फक्त-वाचन किंवा काटेकोरपणे मर्यादित प्रवेशाने सुरुवात करा; लिहिणे व आदेशांसाठी मंजुरी घ्या, प्रत्येक diff तपासा आणि test भांडार व prompts मध्ये secrets ठेवू नका. agent कामापलीकडे जात असेल, असंबंधित फाइल बदलत असेल किंवा अयशस्वी चाचणी समजावू शकत नसेल तर थांबा.

खासगी वापरासाठी अनुमान कुठे चालते आणि agent कसा सेट केला आहे ते तपासा. विनंत्या स्थानिक endpoint वरच राहिल्यास स्थानिक मॉडेल प्रक्रिया prompts तुमच्या संगणकावर ठेवू शकते; तरी agent इतर वैशिष्ट्यांसाठी बाह्य सेवा वापरू शकतो. खासगी code/data वापरण्यापूर्वी त्या अनुप्रयोगाचे network access, logging, telemetry आणि tool permissions तपासा.

पायरी 4: प्रकाशित पुरावे काय दाखवतात आणि काय नाही

JetBrains Mellum2.1 ला 12B mixture-of-experts मॉडेल, 2.5B सक्रिय पॅरामीटर, BF16 अचूकता आणि 131,072-token संदर्भ असलेले वर्णन करते. कार्डनुसार प्रकाशन Apache 2.0 आहे आणि sandboxed software environments मधील reinforcement learning सह post-training झाले. JetBrains agentic coding मूल्यमापनासह benchmark निकालही प्रकाशित करते. हे JetBrains चे स्वतः नोंदवलेले गुण आहेत; BIG CHANGE ची मोजमापे नाहीत आणि तुमच्या हार्डवेअरचा throughput किंवा प्रकल्पाचा परिणाम भाकीत करत नाहीत.

प्रकाशनाच्या वेगवेगळ्या ठिकाणी एक तपशील बदलला. JetBrains च्या 8 ऑक्टोबरच्या launch post मध्ये GGUF builds ‘लवकरच’ येतील असे म्हटले होते. 9 ऑक्टोबरला अधिकृत Hugging Face GGUF भांडार उपलब्ध असून त्यात llama.cpp, Ollama आणि इतर quickstarts आहेत. ही मार्गदर्शिका सध्या प्रकाशित GGUF भांडार वापरते. BF16 भांडार स्वतंत्र घटक आहे; पायऱ्या पुन्हा करण्यापूर्वी दोन्ही भांडारांतील बदल तपासा.

मोठा बदल

आता प्रकाशित llama.cpp quickstart वापरून quantized Mellum2.1 build करता येतो आणि स्थानिक OpenAI-सुसंगत endpoint वरून प्रश्न विचारता येतात. BF16 भांडारासाठी inference-provider deployment वर अवलंबून न राहता स्वतः होस्ट केलेल्या अनुमानाची पहिली तपासणी शक्य होते. प्रतिसाद serving मार्ग चालतो हे सिद्ध करतो; agent गुणवत्ता, योग्यपणा, संपूर्ण toolchain मधील गोपनीयता किंवा production तयारी सिद्ध करत नाही.

स्रोत आणि पुढील वाचन