পৃথিবী স্থির নেই।RSS
BIG CHANGE.

Markdown সংস্করণ

AI-translated from English; not yet reviewed by a fluent editor.

# Mellum2.1 স্থানীয়ভাবে চালান এবং প্রথম উত্তরটি পরীক্ষা করুন

> JetBrains-এর বর্তমান GGUF repository-তে llama.cpp দিয়ে স্থানীয়ভাবে Mellum2.1 চালানোর পদ্ধতি বর্ণনা করা হয়েছে। runtime ইনস্টল করুন, completion অনুরোধ পাঠান এবং agent ব্যবহারের আগে উত্তরটি পরীক্ষা করুন।

By BIG CHANGE Editorial

Published: 2026-10-09T17:10:04.232Z
Updated: 2026-10-09T17:10:04.232Z
Canonical: https://bigchange.ai/blog/run-jetbrains-mellum21-locally-llama-cpp

![An unbranded desktop computer tower with a small orange indicator stands on a warm ivory floor.](https://bigchange.ai/api/media/file/mellum21-local-inference-hero-v1.png)
Conceptual illustration of a computer that can host a local model server; no Mellum2.1 installation or test is depicted. AI-generated illustration by BIG CHANGE.

JetBrains-এর Mellum2.1 হলো ১২ বিলিয়ন parameter-এর মডেল, যার মধ্যে ২.৫ বিলিয়ন সক্রিয়। BF16 repository এবং আলাদা GGUF repository—দুটিই Hugging Face-এ আছে। প্রথমবার স্থানীয়ভাবে চালানোর জন্য GGUF repository-তে llama.cpp পদ্ধতি আছে: প্রয়োজনে quantized file ডাউনলোড করুন, স্থানীয় server চালু করুন, prompt পাঠান এবং কোনো coding agent-কে repository-তে প্রবেশাধিকার দেওয়ার আগে উত্তর পরীক্ষা করুন।

এটি নথিভিত্তিক সেটআপ নির্দেশিকা। BIG CHANGE Mellum2.1 ইনস্টল করেনি বা নিচের command চালায়নি। server থেকে স্থানীয় completion পাওয়াই সফলতার পরীক্ষা; এটি code-এর গুণমান, agent-এর নির্ভরযোগ্যতা বা আপনার hardware-এ কর্মক্ষমতা প্রমাণ করে না।

### যা লাগবে

- নির্বাচিত মডেল ও runtime-এর জন্য পর্যাপ্ত memory এবং storage-সহ Windows, macOS বা Linux কম্পিউটার। JetBrains-এর card-এ মূল মডেলকে BF16 এবং context-কে 131,072 token বলা হয়েছে। GGUF repository-তে প্রস্তাবিত Q4\_K\_M file 8.1 GB। এটি file-এর আকার, runtime memory-এর পূর্ণ হিসাব নয়: runtime, context এবং অন্য process-এর জন্য আরও resource লাগে। JetBrains ন্যূনতম memory requirement প্রকাশ করেনি।
- software ও মডেলের প্রথম download-এর জন্য internet সংযোগ দরকার। inference অনুরোধটি স্থানীয় server-এ পাঠানো যেতে পারে।
- llama.cpp এবং একটি terminal। Repository Windows-এর জন্য `winget install llama.cpp` এবং স্থানীয় serving-এর জন্য `llama serve` command বর্ণনা করে।

মডেলটি Apache 2.0 লাইসেন্সে প্রকাশিত। weights ব্যবহারের কোনো ফি তালিকাভুক্ত নেই; hardware, বিদ্যুৎ, storage বা ভাড়া করা infrastructure-এর খরচ JetBrains নির্দিষ্ট করেনি। বর্তমান BF16 model card বলছে, কোনো inference provider ওই repository পরিবেশন করে না। GGUF আলাদা quantized artifact, যার নিজস্ব llama.cpp quickstart আছে।

### ধাপ ১: llama.cpp ইনস্টল করে স্থানীয় server চালু করুন

Windows PowerShell-এ llama.cpp ইনস্টল করতে [অফিসিয়াল Mellum2.1 GGUF quickstart](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF):

```powershell
winget install llama.cpp
```

যদি `llama` command এখনও PATH-এ না থাকে, নতুন terminal খুলুন। প্রস্তাবিত Q4\_K\_M build চালু করে port 8080-এ স্থানীয় কম্পিউটারে স্পষ্টভাবে bind করুন:

```powershell
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080
```

GGUF repository এই model ID এবং quantization `llama serve`-এর জন্য নথিভুক্ত করে; Windows install পদ্ধতিও জানায়। [llama.cpp server reference](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) নথিভুক্ত করে `--host` এবং `--port`; repository-র উদাহরণ endpoint হলো `http://localhost:8080/v1` । macOS ও Linux-এ একই GGUF repository `curl -LsSf https://llama.app/install.sh | sh` দিয়ে llama.cpp ইনস্টল করে একই server command চালানোর পদ্ধতি জানায়।

প্রথম উত্তর দেওয়ার আগে process-কে মডেল ডাউনলোড করতে হবে। Q4\_K\_M file 8.1 GB বলা হয়েছে। এই পরীক্ষায় server শুধু নিজের কম্পিউটারে bind রাখুন; network-এ প্রকাশ করবেন না বা prompt-এ credential দেবেন না। Repository-তে আরও ছোট 7.0 GB MXFP4\_MOE file এবং বড় Q6\_K, Q8\_0 ও BF16 variant আছে। quantization মডেল artifact বদলায়; শুধু file size থেকে বোঝা যায় না কোনো নির্দিষ্ট কম্পিউটার কার্যকর context length বা গতিতে এটি চালাতে পারবে কি না।

command চালু না হলে প্রথমে সঠিক model ID, ফাঁকা disk space, llama.cpp সংস্করণ এবং সম্পূর্ণ error text পরীক্ষা করুন। memory allocation ব্যর্থ হলে থেমে বর্তমান llama.cpp নথি অনুযায়ী runtime option ও context setting দেখুন; এটি মডেল ত্রুটিপূর্ণ হওয়ার প্রমাণ নয়। প্রকাশিত 131,072-token context আপনার কম্পিউটারে চলবে বলে ধরে নেবেন না।

### ধাপ ২: smoke-test prompt পাঠান

server চালু রাখুন। দ্বিতীয় PowerShell window-এ তার স্থানীয় API-তে ছোট অনুরোধ পাঠান:

```powershell
$body = @{
  model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
  messages = @(
    @{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
  )
  # Author-selected budget for this short smoke test; not a JetBrains recommendation.
  max_tokens = 512
  temperature = 0.6
  top_p = 0.95
  top_k = 20
} | ConvertTo-Json -Depth 5

$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body

$choice = $response.choices[0]
[pscustomobject]@{
  finish_reason = $choice.finish_reason
  has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
  content = $choice.message.content
}
```

model ID, স্থানীয় endpoint এবং sampling value repository-র API উদাহরণ অনুসরণ করে। `max_tokens = 512` এই সংক্ষিপ্ত পরীক্ষার জন্য বেছে নেওয়া সীমিত মান, model card-এর সুপারিশ নয়। Mellum2.1 একটি thinking model; GGUF card বলে এটি reasoning `<think>...</think>` block-এ দেয়। code আলাদা `reasoning_content` field খালি নয় কি না জানায়, কিন্তু fieldটি প্রিন্ট করে না। runtime-এর reasoning format অনুযায়ী `content`-এ এখনও `<think>` text থাকতে পারে। promptটি smoke test, মডেল-গুণমান benchmark নয়।

শুধু তখনই প্রাথমিক পরীক্ষা পাস করে যখন অনুরোধ connection বা server error-এর বদলে completion ফেরায়, `finish_reason` হয় `length` নয় এবং শেষের `content`-এ `MELLUM21-LOCAL-OK` থাকে। শুধু HTTP সফলতা যথেষ্ট নয়: thinking model চাওয়া final text দেওয়ার আগেই ছোট output budget খরচ করতে পারে। output ফাঁকা হলে, marker না থাকলে বা `finish_reason` হয় `length` , পরীক্ষাটিকে অনির্ধারিত ধরুন; মডেল ব্যর্থ হয়েছে বলার বদলে সীমিত output budget বাড়িয়ে আবার চেষ্টা করুন। PowerShell connection failure দেখালে প্রথম terminal-এ server চলছে কি না এবং অনুরোধ port 8080 ব্যবহার করছে কি না নিশ্চিত করুন। server error দিলে সঠিক বার্তাটি সংরক্ষণ করে coding agent পরীক্ষার আগে সমাধান করুন। সফল উত্তর শুধু নিশ্চিত করে যে এই স্থানীয় inference path একটি অনুরোধের উত্তর দিতে পারে; মডেল নিরাপদে code সম্পাদনা করতে পারে তা নয়।

### ধাপ ৩: agent যুক্ত করার আগে পরীক্ষা করুন

প্রথম মূল্যায়নকে চলমান project থেকে আলাদা রাখুন। পরিচিত ছোট কাজসহ অস্থায়ী repository ব্যবহার করুন এবং মডেল artifact ও quantization, llama.cpp সংস্করণ, operating system, context setting, prompt, output, সময় এবং resource ব্যবহার লিখে রাখুন। সীমিত পরিবর্তন চাইুন, প্রস্তাবিত diff পরীক্ষা করুন এবং repository-র বর্তমান test নিজে চালান। তুলনা চাইলে বর্তমান baseline-এ একই কাজ করুন। একটি prompt বা একবার সফল test run benchmark নয়।

মডেল server text ফেরায় এবং runtime ও request format অনুযায়ী structured tool-call workflow সমর্থন করতে পারে। এটি নিজে ঠিক করে না agent কোন tool ব্যবহার করবে, কিংবা নিরাপদে সেগুলো চালায় না। চারপাশের agent repository access, shell command, file edit এবং test run নিয়ন্ত্রণ করে। read-only বা কঠোরভাবে সীমিত access দিয়ে শুরু করুন, write ও command-এর অনুমোদন নিন, প্রতিটি diff দেখুন এবং test repository ও prompt-এ গোপন তথ্য রাখবেন না। agent কাজের সীমা ছাড়ালে, সম্পর্কহীন file বদলালে বা ব্যর্থ test ব্যাখ্যা করতে না পারলে থামুন।

ব্যক্তিগত কাজে ব্যবহারের আগে inference কোথায় চলে এবং agent কীভাবে configured তা নিশ্চিত করুন। অনুরোধ স্থানীয় endpoint-এ থাকলে স্থানীয় মডেল process prompt আপনার কম্পিউটারে রাখতে পারে; তবুও অন্য feature-এর জন্য agent বাহ্যিক service ডাকতে পারে। ব্যক্তিগত code বা data ব্যবহারের আগে application-এর network access, log, telemetry এবং tool permission দেখুন।

### ধাপ ৪: প্রকাশিত প্রমাণ কী দেখায় আর কী দেখায় না

JetBrains Mellum2.1-কে 12B mixture-of-experts মডেল বলে বর্ণনা করে, যাতে 2.5B সক্রিয় parameter, BF16 precision এবং 131,072-token context আছে। Model card বলে release Apache 2.0 এবং sandboxed software environment-এ reinforcement learning-সহ post-training-এর কথা জানায়। JetBrains agentic coding evaluation-সহ benchmark ফলও প্রকাশ করে। এসব score JetBrains-এর নিজের প্রতিবেদন; BIG CHANGE-এর মাপ নয় এবং আপনার hardware throughput বা project ফল অনুমান করে না।

প্রকাশের স্থানভেদে release-এর একটি তথ্য বদলেছে। JetBrains-এর ৮ অক্টোবরের launch post-এ GGUF build “শিগগিরই আসছে” বলা হয়েছিল। ৯ অক্টোবর, Hugging Face-এর সরকারি GGUF repository দেখা যায় এবং এতে llama.cpp, Ollama ইত্যাদির quickstart আছে। এই নির্দেশিকা বর্তমানে প্রকাশিত GGUF repository ব্যবহার করে। BF16 repository আলাদা artifact; ধাপগুলো পুনরাবৃত্তির আগে দুই repository-ই পরীক্ষা করুন।

### বড় পরিবর্তন

এখন quantized Mellum2.1 build-এর প্রকাশিত llama.cpp quickstart অনুসরণ করে স্থানীয় OpenAI-compatible endpoint দিয়ে সেটিকে query করা যায়। এতে BF16 repository-র inference-provider deployment-এর ওপর নির্ভর না করে self-hosted inference প্রথমবার পরীক্ষা করা বাস্তবসম্মত হয়। উত্তর প্রমাণ করে serving path কাজ করে; agent quality, উপযোগিতা, পুরো toolchain-এর privacy বা production প্রস্তুতি নয়।

### সূত্র ও আরও পড়ুন

- [JetBrains: “Mellum2.1 Gets to Work” (৮ অক্টোবর ২০২৬)](https://blog.jetbrains.com/ai/2026/10/mellum2-1-gets-to-work-a-fast-open-model-for-coding-agents/) — launch বিবরণ এবং GGUF উপলভ্যতা নিয়ে প্রাথমিক বক্তব্য।
- [JetBrains Mellum2.1 BF16 model card](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking) — মডেলের বিবরণ, vLLM ও Transformers নির্দেশনা, benchmark এবং license।
- [JetBrains Mellum2.1 GGUF repository](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF) — বর্তমান quantization, file size, llama.cpp command এবং স্থানীয় API উদাহরণ।
- [llama.cpp project](https://github.com/ggml-org/llama.cpp) — runtime source এবং release তথ্য।

## Sources

- [Mellum2.1 Gets to Work: A Fast Open Model for Coding Agents](https://blog.jetbrains.com/ai/2026/10/mellum2-1-gets-to-work-a-fast-open-model-for-coding-agents/) — JetBrains-এর launch post; ৮ অক্টোবরের সেই সময়কার GGUF build শিগগির আসার বক্তব্য প্রতিফলিত করে।
- [JetBrains/Mellum2.1-12B-A2.5B-Thinking model card](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking) — সরকারি BF16 artifact বিবরণ, model-card quickstart, benchmark table এবং inference-provider অবস্থা; benchmark মান JetBrains নিজে জানিয়েছে।
- [JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF model card ও quickstart](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF) — বর্তমান সরকারি GGUF artifact, quantized file size, Windows llama.cpp quickstart এবং স্থানীয় OpenAI-compatible endpoint।
- [llama.cpp](https://github.com/ggml-org/llama.cpp) — Runtime project reference; runtime version দাবি করা হয়নি।