JetBrains 的 Mellum2.1 提供 120 億參數、25 億啟用參數的模型。BF16 儲存庫與獨立 GGUF 儲存庫目前都在 Hugging Face 上。首次本機執行時,GGUF 儲存庫記載了 llama.cpp 路徑:按需下載量化檔案、啟動本機伺服器、傳送提示,並在讓任何程式碼 agent 存取儲存庫前檢查答案。

這是依文件編寫的設定指南。BIG CHANGE 未安裝 Mellum2.1,也未執行下列命令。成功檢查是伺服器傳回本機 completion;這不能證明程式碼品質、agent 可靠性或在你的硬體上的效能。

所需項目

  • 一台 Windows、macOS 或 Linux 電腦,並有足夠記憶體與儲存空間供所選模型及執行環境使用。JetBrains 模型卡列出原始模型為 BF16,脈絡長度 131,072 token。GGUF 儲存庫建議的 Q4_K_M 檔案為 8.1 GB。這只是檔案大小,不是執行時記憶體的完整估算;執行環境、脈絡及其他程序還需要額外資源。JetBrains 未公布最低記憶體需求。
  • 初次下載軟體與模型時需要網際網路連線。推論請求本身可傳給本機伺服器。
  • llama.cpp 與終端機。儲存庫記載 winget install llama.cpp,適用於 Windows,以及 llama serve 命令供本機服務使用。

模型採 Apache 2.0 授權。權重未列使用費;硬體、電力、儲存空間及租用基礎設施的費用則未由 JetBrains 量化。BF16 模型卡目前表示沒有推論服務商提供該儲存庫的服務。GGUF 儲存庫是另一個量化成品,並有自己的 llama.cpp 快速入門。

步驟 1:安裝 llama.cpp 並啟動本機伺服器

在 Windows PowerShell 中,使用 官方 Mellum2.1 GGUF 快速入門:

PowerShell
winget install llama.cpp

若 llama 命令尚未加入 PATH,請開啟新的終端機。啟動建議的 Q4_K_M 建置,並明確綁定本機電腦的 8080 埠:

PowerShell
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080

GGUF 儲存庫記載此模型 ID 與量化方式供 llama serve 使用;也記載 Windows 安裝路徑。llama.cpp 伺服器參考文件 記載 --host 與 --port;儲存庫範例端點為 http://localhost:8080/v1。macOS 與 Linux 上,同一 GGUF 儲存庫記載使用 curl -LsSf https://llama.app/install.sh | sh 安裝 llama.cpp,接著使用相同的服務命令。

程序必須先下載模型,才能產生首次回應。Q4_K_M 檔案標示為 8.1 GB。此測試請讓伺服器只綁定自己的電腦;不要暴露於網路,也不要把憑證放進提示。儲存庫另列出較小的 7.0 GB MXFP4_MOE 檔案,以及較大的 Q6_K、Q8_0 與 BF16 版本。量化會改變模型成品;僅憑檔案大小,無法判斷特定電腦能否以實用的脈絡長度或速度提供服務。

若命令無法啟動,先檢查確切模型 ID、可用磁碟空間、llama.cpp 版本及完整錯誤訊息。記憶體配置失敗時,應停止並依目前 llama.cpp 文件檢查執行選項與脈絡設定;這不代表模型有缺陷。不要假設公布的 131,072 token 脈絡能在你的電腦上容納。

步驟 2:傳送冒煙測試提示

讓伺服器繼續執行。在第二個 PowerShell 視窗中,向本機 API 傳送簡短請求:

PowerShell
$body = @{
  model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
  messages = @(
    @{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
  )
  # Author-selected budget for this short smoke test; not a JetBrains recommendation.
  max_tokens = 512
  temperature = 0.6
  top_p = 0.95
  top_k = 20
} | ConvertTo-Json -Depth 5

$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body

$choice = $response.choices[0]
[pscustomobject]@{
  finish_reason = $choice.finish_reason
  has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
  content = $choice.message.content
}

模型 ID、本機端點與取樣值依據儲存庫的 API 範例。max_tokens = 512 是此處為簡短檢查選用的有限值,並非模型卡建議值。Mellum2.1 是思考型模型;GGUF 模型卡指出它會在 <think>...</think> 區塊輸出推理內容。此程式會回報獨立的 reasoning_content 欄位是否非空,但不會列印該欄位。依執行環境的推理格式而定,content 仍可能包含 <think> 文字。此提示是冒煙測試,不是模型品質基準。

只有在請求傳回 completion,而非連線或伺服器錯誤、finish_reason 不是 length,且最後的 content 包含 MELLUM21-LOCAL-OK 時,基本檢查才算通過。僅有 HTTP 成功並不足夠:思考型模型可能在產生要求的最後文字前就用完少量輸出預算。若輸出為空、缺少標記,或 finish_reason 是 length,應視為結果不確定;提高有限的輸出預算再試一次,不要診斷為模型故障。若 PowerShell 回報連線失敗,確認第一個終端仍顯示伺服器正在執行,且請求使用 8080 埠。若伺服器傳回錯誤,先保存確切訊息並解決,再測試程式碼 agent。成功回應只確認此本機推論路徑能回答一個請求;不代表模型能安全編輯程式碼。

步驟 3:連接 agent 前先檢查

首次評估請與實際專案隔離。使用有已知小型任務的拋棄式儲存庫,並記錄模型成品與量化方式、llama.cpp 版本、作業系統、脈絡設定、提示、輸出、耗時與資源使用量。要求一項範圍明確的變更,檢查建議差異,並自行執行儲存庫既有測試。若要比較,可用目前基準重做同一任務。一次提示或一次成功測試都不是基準測試。

模型伺服器會傳回文字;依執行環境與請求格式,可能也支援結構化工具呼叫流程。但它不會自行決定 agent 可用哪些工具,也不會安全地執行工具。外圍 agent 控制儲存庫存取、shell 命令、檔案編輯與測試執行。先採唯讀或嚴格限縮的存取;寫入與命令須經核准;檢查每個差異;測試儲存庫與提示中不得放秘密。若 agent 嘗試超出任務、修改無關檔案,或無法解釋失敗測試,請停止。

若用於私人程式碼,請確認推論在哪裡執行及 agent 如何設定。若請求留在本機端點,本機模型程序可讓提示留在你的電腦上;但 agent 仍可能為其他功能呼叫外部服務。使用私人程式碼或資料前,請檢查該應用程式的網路存取、記錄、遙測與工具權限。

步驟 4:已公布的證據能與不能說明什麼

JetBrains 將 Mellum2.1 描述為 12B 混合專家模型,啟用參數 2.5B、BF16 精度、脈絡長度 131,072 token。模型卡表示此版本採 Apache 2.0,並說明後訓練包含在沙箱軟體環境中的強化學習。JetBrains 也公布基準結果,包括 agent 程式碼評估。這些分數由 JetBrains 自行報告,並非 BIG CHANGE 的測量,也不能預測你的硬體吞吐量或專案成果。

不同發布頁面的其中一項細節有所變化。JetBrains 10 月 8 日的發布文章稱 GGUF 建置「即將推出」。10 月 9 日,官方 Hugging Face GGUF 儲存庫已可存取,並包含 llama.cpp、Ollama 等快速入門。本指南使用目前已發布的 GGUF 儲存庫。BF16 儲存庫仍是獨立成品;重做步驟前請檢查兩個儲存庫是否有變更。

重大改變

現在可依已發布的 llama.cpp 快速入門量化建置 Mellum2.1,並透過本機 OpenAI 相容端點查詢。這讓首次自架推論檢查變得可行,不必依賴 BF16 儲存庫的推論服務商部署。回應證明服務路徑可運作;不證明 agent 品質、適配度、整套工具鏈的隱私或正式環境就緒度。

來源與延伸閱讀