JetBrains-এর Mellum2.1 হলো ১২ বিলিয়ন parameter-এর মডেল, যার মধ্যে ২.৫ বিলিয়ন সক্রিয়। BF16 repository এবং আলাদা GGUF repository—দুটিই Hugging Face-এ আছে। প্রথমবার স্থানীয়ভাবে চালানোর জন্য GGUF repository-তে llama.cpp পদ্ধতি আছে: প্রয়োজনে quantized file ডাউনলোড করুন, স্থানীয় server চালু করুন, prompt পাঠান এবং কোনো coding agent-কে repository-তে প্রবেশাধিকার দেওয়ার আগে উত্তর পরীক্ষা করুন।
এটি নথিভিত্তিক সেটআপ নির্দেশিকা। BIG CHANGE Mellum2.1 ইনস্টল করেনি বা নিচের command চালায়নি। server থেকে স্থানীয় completion পাওয়াই সফলতার পরীক্ষা; এটি code-এর গুণমান, agent-এর নির্ভরযোগ্যতা বা আপনার hardware-এ কর্মক্ষমতা প্রমাণ করে না।
যা লাগবে
- নির্বাচিত মডেল ও runtime-এর জন্য পর্যাপ্ত memory এবং storage-সহ Windows, macOS বা Linux কম্পিউটার। JetBrains-এর card-এ মূল মডেলকে BF16 এবং context-কে 131,072 token বলা হয়েছে। GGUF repository-তে প্রস্তাবিত Q4_K_M file 8.1 GB। এটি file-এর আকার, runtime memory-এর পূর্ণ হিসাব নয়: runtime, context এবং অন্য process-এর জন্য আরও resource লাগে। JetBrains ন্যূনতম memory requirement প্রকাশ করেনি।
- software ও মডেলের প্রথম download-এর জন্য internet সংযোগ দরকার। inference অনুরোধটি স্থানীয় server-এ পাঠানো যেতে পারে।
- llama.cpp এবং একটি terminal। Repository Windows-এর জন্য
winget install llama.cppএবং স্থানীয় serving-এর জন্যllama servecommand বর্ণনা করে।
মডেলটি Apache 2.0 লাইসেন্সে প্রকাশিত। weights ব্যবহারের কোনো ফি তালিকাভুক্ত নেই; hardware, বিদ্যুৎ, storage বা ভাড়া করা infrastructure-এর খরচ JetBrains নির্দিষ্ট করেনি। বর্তমান BF16 model card বলছে, কোনো inference provider ওই repository পরিবেশন করে না। GGUF আলাদা quantized artifact, যার নিজস্ব llama.cpp quickstart আছে।
ধাপ ১: llama.cpp ইনস্টল করে স্থানীয় server চালু করুন
Windows PowerShell-এ llama.cpp ইনস্টল করতে অফিসিয়াল Mellum2.1 GGUF quickstart:
winget install llama.cppযদি llama command এখনও PATH-এ না থাকে, নতুন terminal খুলুন। প্রস্তাবিত Q4_K_M build চালু করে port 8080-এ স্থানীয় কম্পিউটারে স্পষ্টভাবে bind করুন:
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080GGUF repository এই model ID এবং quantization llama serve-এর জন্য নথিভুক্ত করে; Windows install পদ্ধতিও জানায়। llama.cpp server reference নথিভুক্ত করে --host এবং --port; repository-র উদাহরণ endpoint হলো http://localhost:8080/v1 । macOS ও Linux-এ একই GGUF repository curl -LsSf https://llama.app/install.sh | sh দিয়ে llama.cpp ইনস্টল করে একই server command চালানোর পদ্ধতি জানায়।
প্রথম উত্তর দেওয়ার আগে process-কে মডেল ডাউনলোড করতে হবে। Q4_K_M file 8.1 GB বলা হয়েছে। এই পরীক্ষায় server শুধু নিজের কম্পিউটারে bind রাখুন; network-এ প্রকাশ করবেন না বা prompt-এ credential দেবেন না। Repository-তে আরও ছোট 7.0 GB MXFP4_MOE file এবং বড় Q6_K, Q8_0 ও BF16 variant আছে। quantization মডেল artifact বদলায়; শুধু file size থেকে বোঝা যায় না কোনো নির্দিষ্ট কম্পিউটার কার্যকর context length বা গতিতে এটি চালাতে পারবে কি না।
command চালু না হলে প্রথমে সঠিক model ID, ফাঁকা disk space, llama.cpp সংস্করণ এবং সম্পূর্ণ error text পরীক্ষা করুন। memory allocation ব্যর্থ হলে থেমে বর্তমান llama.cpp নথি অনুযায়ী runtime option ও context setting দেখুন; এটি মডেল ত্রুটিপূর্ণ হওয়ার প্রমাণ নয়। প্রকাশিত 131,072-token context আপনার কম্পিউটারে চলবে বলে ধরে নেবেন না।
ধাপ ২: smoke-test prompt পাঠান
server চালু রাখুন। দ্বিতীয় PowerShell window-এ তার স্থানীয় API-তে ছোট অনুরোধ পাঠান:
$body = @{
model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
messages = @(
@{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
)
# Author-selected budget for this short smoke test; not a JetBrains recommendation.
max_tokens = 512
temperature = 0.6
top_p = 0.95
top_k = 20
} | ConvertTo-Json -Depth 5
$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body
$choice = $response.choices[0]
[pscustomobject]@{
finish_reason = $choice.finish_reason
has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
content = $choice.message.content
}model ID, স্থানীয় endpoint এবং sampling value repository-র API উদাহরণ অনুসরণ করে। max_tokens = 512 এই সংক্ষিপ্ত পরীক্ষার জন্য বেছে নেওয়া সীমিত মান, model card-এর সুপারিশ নয়। Mellum2.1 একটি thinking model; GGUF card বলে এটি reasoning <think>...</think> block-এ দেয়। code আলাদা reasoning_content field খালি নয় কি না জানায়, কিন্তু fieldটি প্রিন্ট করে না। runtime-এর reasoning format অনুযায়ী content-এ এখনও <think> text থাকতে পারে। promptটি smoke test, মডেল-গুণমান benchmark নয়।
শুধু তখনই প্রাথমিক পরীক্ষা পাস করে যখন অনুরোধ connection বা server error-এর বদলে completion ফেরায়, finish_reason হয় length নয় এবং শেষের content-এ MELLUM21-LOCAL-OK থাকে। শুধু HTTP সফলতা যথেষ্ট নয়: thinking model চাওয়া final text দেওয়ার আগেই ছোট output budget খরচ করতে পারে। output ফাঁকা হলে, marker না থাকলে বা finish_reason হয় length , পরীক্ষাটিকে অনির্ধারিত ধরুন; মডেল ব্যর্থ হয়েছে বলার বদলে সীমিত output budget বাড়িয়ে আবার চেষ্টা করুন। PowerShell connection failure দেখালে প্রথম terminal-এ server চলছে কি না এবং অনুরোধ port 8080 ব্যবহার করছে কি না নিশ্চিত করুন। server error দিলে সঠিক বার্তাটি সংরক্ষণ করে coding agent পরীক্ষার আগে সমাধান করুন। সফল উত্তর শুধু নিশ্চিত করে যে এই স্থানীয় inference path একটি অনুরোধের উত্তর দিতে পারে; মডেল নিরাপদে code সম্পাদনা করতে পারে তা নয়।
ধাপ ৩: agent যুক্ত করার আগে পরীক্ষা করুন
প্রথম মূল্যায়নকে চলমান project থেকে আলাদা রাখুন। পরিচিত ছোট কাজসহ অস্থায়ী repository ব্যবহার করুন এবং মডেল artifact ও quantization, llama.cpp সংস্করণ, operating system, context setting, prompt, output, সময় এবং resource ব্যবহার লিখে রাখুন। সীমিত পরিবর্তন চাইুন, প্রস্তাবিত diff পরীক্ষা করুন এবং repository-র বর্তমান test নিজে চালান। তুলনা চাইলে বর্তমান baseline-এ একই কাজ করুন। একটি prompt বা একবার সফল test run benchmark নয়।
মডেল server text ফেরায় এবং runtime ও request format অনুযায়ী structured tool-call workflow সমর্থন করতে পারে। এটি নিজে ঠিক করে না agent কোন tool ব্যবহার করবে, কিংবা নিরাপদে সেগুলো চালায় না। চারপাশের agent repository access, shell command, file edit এবং test run নিয়ন্ত্রণ করে। read-only বা কঠোরভাবে সীমিত access দিয়ে শুরু করুন, write ও command-এর অনুমোদন নিন, প্রতিটি diff দেখুন এবং test repository ও prompt-এ গোপন তথ্য রাখবেন না। agent কাজের সীমা ছাড়ালে, সম্পর্কহীন file বদলালে বা ব্যর্থ test ব্যাখ্যা করতে না পারলে থামুন।
ব্যক্তিগত কাজে ব্যবহারের আগে inference কোথায় চলে এবং agent কীভাবে configured তা নিশ্চিত করুন। অনুরোধ স্থানীয় endpoint-এ থাকলে স্থানীয় মডেল process prompt আপনার কম্পিউটারে রাখতে পারে; তবুও অন্য feature-এর জন্য agent বাহ্যিক service ডাকতে পারে। ব্যক্তিগত code বা data ব্যবহারের আগে application-এর network access, log, telemetry এবং tool permission দেখুন।
ধাপ ৪: প্রকাশিত প্রমাণ কী দেখায় আর কী দেখায় না
JetBrains Mellum2.1-কে 12B mixture-of-experts মডেল বলে বর্ণনা করে, যাতে 2.5B সক্রিয় parameter, BF16 precision এবং 131,072-token context আছে। Model card বলে release Apache 2.0 এবং sandboxed software environment-এ reinforcement learning-সহ post-training-এর কথা জানায়। JetBrains agentic coding evaluation-সহ benchmark ফলও প্রকাশ করে। এসব score JetBrains-এর নিজের প্রতিবেদন; BIG CHANGE-এর মাপ নয় এবং আপনার hardware throughput বা project ফল অনুমান করে না।
প্রকাশের স্থানভেদে release-এর একটি তথ্য বদলেছে। JetBrains-এর ৮ অক্টোবরের launch post-এ GGUF build “শিগগিরই আসছে” বলা হয়েছিল। ৯ অক্টোবর, Hugging Face-এর সরকারি GGUF repository দেখা যায় এবং এতে llama.cpp, Ollama ইত্যাদির quickstart আছে। এই নির্দেশিকা বর্তমানে প্রকাশিত GGUF repository ব্যবহার করে। BF16 repository আলাদা artifact; ধাপগুলো পুনরাবৃত্তির আগে দুই repository-ই পরীক্ষা করুন।
বড় পরিবর্তন
এখন quantized Mellum2.1 build-এর প্রকাশিত llama.cpp quickstart অনুসরণ করে স্থানীয় OpenAI-compatible endpoint দিয়ে সেটিকে query করা যায়। এতে BF16 repository-র inference-provider deployment-এর ওপর নির্ভর না করে self-hosted inference প্রথমবার পরীক্ষা করা বাস্তবসম্মত হয়। উত্তর প্রমাণ করে serving path কাজ করে; agent quality, উপযোগিতা, পুরো toolchain-এর privacy বা production প্রস্তুতি নয়।
সূত্র ও আরও পড়ুন
- JetBrains: “Mellum2.1 Gets to Work” (৮ অক্টোবর ২০২৬) — launch বিবরণ এবং GGUF উপলভ্যতা নিয়ে প্রাথমিক বক্তব্য।
- JetBrains Mellum2.1 BF16 model card — মডেলের বিবরণ, vLLM ও Transformers নির্দেশনা, benchmark এবং license।
- JetBrains Mellum2.1 GGUF repository — বর্তমান quantization, file size, llama.cpp command এবং স্থানীয় API উদাহরণ।
- llama.cpp project — runtime source এবং release তথ্য।



