AI-translated from English; not yet reviewed by a fluent editor.

# 在本機執行 Mellum2.1，並檢查第一個回應

> JetBrains 目前的 GGUF 儲存庫記載以 llama.cpp 在本機服務 Mellum2.1 的做法。安裝執行環境、送出 completion 請求，並在交給 agent 前檢查結果。

By BIG CHANGE Editorial

Published: 2026-10-09T17:10:04.232Z
Updated: 2026-10-09T17:10:04.232Z
Canonical: https://bigchange.ai/blog/run-jetbrains-mellum21-locally-llama-cpp

![An unbranded desktop computer tower with a small orange indicator stands on a warm ivory floor.](https://bigchange.ai/api/media/file/mellum21-local-inference-hero-v1.png)
Conceptual illustration of a computer that can host a local model server; no Mellum2.1 installation or test is depicted. AI-generated illustration by BIG CHANGE.

JetBrains 的 Mellum2.1 提供 120 億參數、25 億啟用參數的模型。BF16 儲存庫與獨立 GGUF 儲存庫目前都在 Hugging Face 上。首次本機執行時，GGUF 儲存庫記載了 llama.cpp 路徑：按需下載量化檔案、啟動本機伺服器、傳送提示，並在讓任何程式碼 agent 存取儲存庫前檢查答案。

這是依文件編寫的設定指南。BIG CHANGE 未安裝 Mellum2.1，也未執行下列命令。成功檢查是伺服器傳回本機 completion；這不能證明程式碼品質、agent 可靠性或在你的硬體上的效能。

### 所需項目

- 一台 Windows、macOS 或 Linux 電腦，並有足夠記憶體與儲存空間供所選模型及執行環境使用。JetBrains 模型卡列出原始模型為 BF16，脈絡長度 131,072 token。GGUF 儲存庫建議的 Q4\_K\_M 檔案為 8.1 GB。這只是檔案大小，不是執行時記憶體的完整估算；執行環境、脈絡及其他程序還需要額外資源。JetBrains 未公布最低記憶體需求。
- 初次下載軟體與模型時需要網際網路連線。推論請求本身可傳給本機伺服器。
- llama.cpp 與終端機。儲存庫記載 `winget install llama.cpp`，適用於 Windows，以及 `llama serve` 命令供本機服務使用。

模型採 Apache 2.0 授權。權重未列使用費；硬體、電力、儲存空間及租用基礎設施的費用則未由 JetBrains 量化。BF16 模型卡目前表示沒有推論服務商提供該儲存庫的服務。GGUF 儲存庫是另一個量化成品，並有自己的 llama.cpp 快速入門。

### 步驟 1：安裝 llama.cpp 並啟動本機伺服器

在 Windows PowerShell 中，使用 [官方 Mellum2.1 GGUF 快速入門](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF)：

```powershell
winget install llama.cpp
```

若 `llama` 命令尚未加入 PATH，請開啟新的終端機。啟動建議的 Q4\_K\_M 建置，並明確綁定本機電腦的 8080 埠：

```powershell
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080
```

GGUF 儲存庫記載此模型 ID 與量化方式供 `llama serve` 使用；也記載 Windows 安裝路徑。[llama.cpp 伺服器參考文件](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) 記載 `--host` 與 `--port`；儲存庫範例端點為 `http://localhost:8080/v1`。macOS 與 Linux 上，同一 GGUF 儲存庫記載使用 `curl -LsSf https://llama.app/install.sh | sh` 安裝 llama.cpp，接著使用相同的服務命令。

程序必須先下載模型，才能產生首次回應。Q4\_K\_M 檔案標示為 8.1 GB。此測試請讓伺服器只綁定自己的電腦；不要暴露於網路，也不要把憑證放進提示。儲存庫另列出較小的 7.0 GB MXFP4\_MOE 檔案，以及較大的 Q6\_K、Q8\_0 與 BF16 版本。量化會改變模型成品；僅憑檔案大小，無法判斷特定電腦能否以實用的脈絡長度或速度提供服務。

若命令無法啟動，先檢查確切模型 ID、可用磁碟空間、llama.cpp 版本及完整錯誤訊息。記憶體配置失敗時，應停止並依目前 llama.cpp 文件檢查執行選項與脈絡設定；這不代表模型有缺陷。不要假設公布的 131,072 token 脈絡能在你的電腦上容納。

### 步驟 2：傳送冒煙測試提示

讓伺服器繼續執行。在第二個 PowerShell 視窗中，向本機 API 傳送簡短請求：

```powershell
$body = @{
  model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
  messages = @(
    @{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
  )
  # Author-selected budget for this short smoke test; not a JetBrains recommendation.
  max_tokens = 512
  temperature = 0.6
  top_p = 0.95
  top_k = 20
} | ConvertTo-Json -Depth 5

$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body

$choice = $response.choices[0]
[pscustomobject]@{
  finish_reason = $choice.finish_reason
  has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
  content = $choice.message.content
}
```

模型 ID、本機端點與取樣值依據儲存庫的 API 範例。`max_tokens = 512` 是此處為簡短檢查選用的有限值，並非模型卡建議值。Mellum2.1 是思考型模型；GGUF 模型卡指出它會在 `<think>...</think>` 區塊輸出推理內容。此程式會回報獨立的 `reasoning_content` 欄位是否非空，但不會列印該欄位。依執行環境的推理格式而定，`content` 仍可能包含 `<think>` 文字。此提示是冒煙測試，不是模型品質基準。

只有在請求傳回 completion，而非連線或伺服器錯誤、`finish_reason` 不是 `length`，且最後的 `content` 包含 `MELLUM21-LOCAL-OK` 時，基本檢查才算通過。僅有 HTTP 成功並不足夠：思考型模型可能在產生要求的最後文字前就用完少量輸出預算。若輸出為空、缺少標記，或 `finish_reason` 是 `length`，應視為結果不確定；提高有限的輸出預算再試一次，不要診斷為模型故障。若 PowerShell 回報連線失敗，確認第一個終端仍顯示伺服器正在執行，且請求使用 8080 埠。若伺服器傳回錯誤，先保存確切訊息並解決，再測試程式碼 agent。成功回應只確認此本機推論路徑能回答一個請求；不代表模型能安全編輯程式碼。

### 步驟 3：連接 agent 前先檢查

首次評估請與實際專案隔離。使用有已知小型任務的拋棄式儲存庫，並記錄模型成品與量化方式、llama.cpp 版本、作業系統、脈絡設定、提示、輸出、耗時與資源使用量。要求一項範圍明確的變更，檢查建議差異，並自行執行儲存庫既有測試。若要比較，可用目前基準重做同一任務。一次提示或一次成功測試都不是基準測試。

模型伺服器會傳回文字；依執行環境與請求格式，可能也支援結構化工具呼叫流程。但它不會自行決定 agent 可用哪些工具，也不會安全地執行工具。外圍 agent 控制儲存庫存取、shell 命令、檔案編輯與測試執行。先採唯讀或嚴格限縮的存取；寫入與命令須經核准；檢查每個差異；測試儲存庫與提示中不得放秘密。若 agent 嘗試超出任務、修改無關檔案，或無法解釋失敗測試，請停止。

若用於私人程式碼，請確認推論在哪裡執行及 agent 如何設定。若請求留在本機端點，本機模型程序可讓提示留在你的電腦上；但 agent 仍可能為其他功能呼叫外部服務。使用私人程式碼或資料前，請檢查該應用程式的網路存取、記錄、遙測與工具權限。

### 步驟 4：已公布的證據能與不能說明什麼

JetBrains 將 Mellum2.1 描述為 12B 混合專家模型，啟用參數 2.5B、BF16 精度、脈絡長度 131,072 token。模型卡表示此版本採 Apache 2.0，並說明後訓練包含在沙箱軟體環境中的強化學習。JetBrains 也公布基準結果，包括 agent 程式碼評估。這些分數由 JetBrains 自行報告，並非 BIG CHANGE 的測量，也不能預測你的硬體吞吐量或專案成果。

不同發布頁面的其中一項細節有所變化。JetBrains 10 月 8 日的發布文章稱 GGUF 建置「即將推出」。10 月 9 日，官方 Hugging Face GGUF 儲存庫已可存取，並包含 llama.cpp、Ollama 等快速入門。本指南使用目前已發布的 GGUF 儲存庫。BF16 儲存庫仍是獨立成品；重做步驟前請檢查兩個儲存庫是否有變更。

### 重大改變

現在可依已發布的 llama.cpp 快速入門量化建置 Mellum2.1，並透過本機 OpenAI 相容端點查詢。這讓首次自架推論檢查變得可行，不必依賴 BF16 儲存庫的推論服務商部署。回應證明服務路徑可運作；不證明 agent 品質、適配度、整套工具鏈的隱私或正式環境就緒度。

### 來源與延伸閱讀

- [JetBrains：「Mellum2.1 開始工作」（2026 年 10 月 8 日）](https://blog.jetbrains.com/ai/2026/10/mellum2-1-gets-to-work-a-fast-open-model-for-coding-agents/) — 發布說明與最初 GGUF 可用狀態的說明。
- [JetBrains Mellum2.1 BF16 模型卡](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking) — 模型細節、vLLM 與 Transformers 指示、基準及授權。
- [JetBrains Mellum2.1 GGUF 儲存庫](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF) — 目前量化版本、檔案大小、llama.cpp 命令及本機 API 範例。
- [llama.cpp 專案](https://github.com/ggml-org/llama.cpp) — 執行環境原始碼與版本資訊。

## Sources

- [Mellum2.1 Gets to Work: A Fast Open Model for Coding Agents](https://blog.jetbrains.com/ai/2026/10/mellum2-1-gets-to-work-a-fast-open-model-for-coding-agents/) — JetBrains 發布文章；反映 10 月 8 日公告及當時 GGUF 建置即將推出的說法。
- [JetBrains/Mellum2.1-12B-A2.5B-Thinking 模型卡](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking) — 官方 BF16 成品細節、模型卡快速入門、基準表與推論服務商狀態；基準值由 JetBrains 自行報告。
- [JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF 模型卡與快速入門](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF) — 目前官方 GGUF 成品、量化檔案大小、Windows llama.cpp 快速入門及本機 OpenAI 相容端點。
- [llama.cpp](https://github.com/ggml-org/llama.cpp) — 執行環境專案參考；未宣稱執行環境版本。
