世界從未停止變化。RSS
BIG CHANGE.

Markdown 版本

AI-translated from English; not yet reviewed by a fluent editor.

# 在本機執行 Mellum2.1,並檢查第一個回應

> JetBrains 目前的 GGUF 儲存庫記載以 llama.cpp 在本機服務 Mellum2.1 的做法。安裝執行環境、送出 completion 請求,並在交給 agent 前檢查結果。

By BIG CHANGE Editorial

Published: 2026-10-09T17:10:04.232Z
Updated: 2026-10-09T17:10:04.232Z
Canonical: https://bigchange.ai/blog/run-jetbrains-mellum21-locally-llama-cpp

![An unbranded desktop computer tower with a small orange indicator stands on a warm ivory floor.](https://bigchange.ai/api/media/file/mellum21-local-inference-hero-v1.png)
Conceptual illustration of a computer that can host a local model server; no Mellum2.1 installation or test is depicted. AI-generated illustration by BIG CHANGE.

JetBrains 的 Mellum2.1 提供 120 億參數、25 億啟用參數的模型。BF16 儲存庫與獨立 GGUF 儲存庫目前都在 Hugging Face 上。首次本機執行時,GGUF 儲存庫記載了 llama.cpp 路徑:按需下載量化檔案、啟動本機伺服器、傳送提示,並在讓任何程式碼 agent 存取儲存庫前檢查答案。

這是依文件編寫的設定指南。BIG CHANGE 未安裝 Mellum2.1,也未執行下列命令。成功檢查是伺服器傳回本機 completion;這不能證明程式碼品質、agent 可靠性或在你的硬體上的效能。

### 所需項目

- 一台 Windows、macOS 或 Linux 電腦,並有足夠記憶體與儲存空間供所選模型及執行環境使用。JetBrains 模型卡列出原始模型為 BF16,脈絡長度 131,072 token。GGUF 儲存庫建議的 Q4\_K\_M 檔案為 8.1 GB。這只是檔案大小,不是執行時記憶體的完整估算;執行環境、脈絡及其他程序還需要額外資源。JetBrains 未公布最低記憶體需求。
- 初次下載軟體與模型時需要網際網路連線。推論請求本身可傳給本機伺服器。
- llama.cpp 與終端機。儲存庫記載 `winget install llama.cpp`,適用於 Windows,以及 `llama serve` 命令供本機服務使用。

模型採 Apache 2.0 授權。權重未列使用費;硬體、電力、儲存空間及租用基礎設施的費用則未由 JetBrains 量化。BF16 模型卡目前表示沒有推論服務商提供該儲存庫的服務。GGUF 儲存庫是另一個量化成品,並有自己的 llama.cpp 快速入門。

### 步驟 1:安裝 llama.cpp 並啟動本機伺服器

在 Windows PowerShell 中,使用 [官方 Mellum2.1 GGUF 快速入門](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF):

```powershell
winget install llama.cpp
```

若 `llama` 命令尚未加入 PATH,請開啟新的終端機。啟動建議的 Q4\_K\_M 建置,並明確綁定本機電腦的 8080 埠:

```powershell
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080
```

GGUF 儲存庫記載此模型 ID 與量化方式供 `llama serve` 使用;也記載 Windows 安裝路徑。[llama.cpp 伺服器參考文件](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md) 記載 `--host` 與 `--port`;儲存庫範例端點為 `http://localhost:8080/v1`。macOS 與 Linux 上,同一 GGUF 儲存庫記載使用 `curl -LsSf https://llama.app/install.sh | sh` 安裝 llama.cpp,接著使用相同的服務命令。

程序必須先下載模型,才能產生首次回應。Q4\_K\_M 檔案標示為 8.1 GB。此測試請讓伺服器只綁定自己的電腦;不要暴露於網路,也不要把憑證放進提示。儲存庫另列出較小的 7.0 GB MXFP4\_MOE 檔案,以及較大的 Q6\_K、Q8\_0 與 BF16 版本。量化會改變模型成品;僅憑檔案大小,無法判斷特定電腦能否以實用的脈絡長度或速度提供服務。

若命令無法啟動,先檢查確切模型 ID、可用磁碟空間、llama.cpp 版本及完整錯誤訊息。記憶體配置失敗時,應停止並依目前 llama.cpp 文件檢查執行選項與脈絡設定;這不代表模型有缺陷。不要假設公布的 131,072 token 脈絡能在你的電腦上容納。

### 步驟 2:傳送冒煙測試提示

讓伺服器繼續執行。在第二個 PowerShell 視窗中,向本機 API 傳送簡短請求:

```powershell
$body = @{
  model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
  messages = @(
    @{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
  )
  # Author-selected budget for this short smoke test; not a JetBrains recommendation.
  max_tokens = 512
  temperature = 0.6
  top_p = 0.95
  top_k = 20
} | ConvertTo-Json -Depth 5

$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body

$choice = $response.choices[0]
[pscustomobject]@{
  finish_reason = $choice.finish_reason
  has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
  content = $choice.message.content
}
```

模型 ID、本機端點與取樣值依據儲存庫的 API 範例。`max_tokens = 512` 是此處為簡短檢查選用的有限值,並非模型卡建議值。Mellum2.1 是思考型模型;GGUF 模型卡指出它會在 `<think>...</think>` 區塊輸出推理內容。此程式會回報獨立的 `reasoning_content` 欄位是否非空,但不會列印該欄位。依執行環境的推理格式而定,`content` 仍可能包含 `<think>` 文字。此提示是冒煙測試,不是模型品質基準。

只有在請求傳回 completion,而非連線或伺服器錯誤、`finish_reason` 不是 `length`,且最後的 `content` 包含 `MELLUM21-LOCAL-OK` 時,基本檢查才算通過。僅有 HTTP 成功並不足夠:思考型模型可能在產生要求的最後文字前就用完少量輸出預算。若輸出為空、缺少標記,或 `finish_reason` 是 `length`,應視為結果不確定;提高有限的輸出預算再試一次,不要診斷為模型故障。若 PowerShell 回報連線失敗,確認第一個終端仍顯示伺服器正在執行,且請求使用 8080 埠。若伺服器傳回錯誤,先保存確切訊息並解決,再測試程式碼 agent。成功回應只確認此本機推論路徑能回答一個請求;不代表模型能安全編輯程式碼。

### 步驟 3:連接 agent 前先檢查

首次評估請與實際專案隔離。使用有已知小型任務的拋棄式儲存庫,並記錄模型成品與量化方式、llama.cpp 版本、作業系統、脈絡設定、提示、輸出、耗時與資源使用量。要求一項範圍明確的變更,檢查建議差異,並自行執行儲存庫既有測試。若要比較,可用目前基準重做同一任務。一次提示或一次成功測試都不是基準測試。

模型伺服器會傳回文字;依執行環境與請求格式,可能也支援結構化工具呼叫流程。但它不會自行決定 agent 可用哪些工具,也不會安全地執行工具。外圍 agent 控制儲存庫存取、shell 命令、檔案編輯與測試執行。先採唯讀或嚴格限縮的存取;寫入與命令須經核准;檢查每個差異;測試儲存庫與提示中不得放秘密。若 agent 嘗試超出任務、修改無關檔案,或無法解釋失敗測試,請停止。

若用於私人程式碼,請確認推論在哪裡執行及 agent 如何設定。若請求留在本機端點,本機模型程序可讓提示留在你的電腦上;但 agent 仍可能為其他功能呼叫外部服務。使用私人程式碼或資料前,請檢查該應用程式的網路存取、記錄、遙測與工具權限。

### 步驟 4:已公布的證據能與不能說明什麼

JetBrains 將 Mellum2.1 描述為 12B 混合專家模型,啟用參數 2.5B、BF16 精度、脈絡長度 131,072 token。模型卡表示此版本採 Apache 2.0,並說明後訓練包含在沙箱軟體環境中的強化學習。JetBrains 也公布基準結果,包括 agent 程式碼評估。這些分數由 JetBrains 自行報告,並非 BIG CHANGE 的測量,也不能預測你的硬體吞吐量或專案成果。

不同發布頁面的其中一項細節有所變化。JetBrains 10 月 8 日的發布文章稱 GGUF 建置「即將推出」。10 月 9 日,官方 Hugging Face GGUF 儲存庫已可存取,並包含 llama.cpp、Ollama 等快速入門。本指南使用目前已發布的 GGUF 儲存庫。BF16 儲存庫仍是獨立成品;重做步驟前請檢查兩個儲存庫是否有變更。

### 重大改變

現在可依已發布的 llama.cpp 快速入門量化建置 Mellum2.1,並透過本機 OpenAI 相容端點查詢。這讓首次自架推論檢查變得可行,不必依賴 BF16 儲存庫的推論服務商部署。回應證明服務路徑可運作;不證明 agent 品質、適配度、整套工具鏈的隱私或正式環境就緒度。

### 來源與延伸閱讀

- [JetBrains:「Mellum2.1 開始工作」(2026 年 10 月 8 日)](https://blog.jetbrains.com/ai/2026/10/mellum2-1-gets-to-work-a-fast-open-model-for-coding-agents/) — 發布說明與最初 GGUF 可用狀態的說明。
- [JetBrains Mellum2.1 BF16 模型卡](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking) — 模型細節、vLLM 與 Transformers 指示、基準及授權。
- [JetBrains Mellum2.1 GGUF 儲存庫](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF) — 目前量化版本、檔案大小、llama.cpp 命令及本機 API 範例。
- [llama.cpp 專案](https://github.com/ggml-org/llama.cpp) — 執行環境原始碼與版本資訊。

## Sources

- [Mellum2.1 Gets to Work: A Fast Open Model for Coding Agents](https://blog.jetbrains.com/ai/2026/10/mellum2-1-gets-to-work-a-fast-open-model-for-coding-agents/) — JetBrains 發布文章;反映 10 月 8 日公告及當時 GGUF 建置即將推出的說法。
- [JetBrains/Mellum2.1-12B-A2.5B-Thinking 模型卡](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking) — 官方 BF16 成品細節、模型卡快速入門、基準表與推論服務商狀態;基準值由 JetBrains 自行報告。
- [JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF 模型卡與快速入門](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF) — 目前官方 GGUF 成品、量化檔案大小、Windows llama.cpp 快速入門及本機 OpenAI 相容端點。
- [llama.cpp](https://github.com/ggml-org/llama.cpp) — 執行環境專案參考;未宣稱執行環境版本。