AI-translated from English; not yet reviewed by a fluent editor.

# 在本地运行 Mellum2.1 并检查它的第一个回答

> JetBrains 当前的 GGUF 仓库介绍了通过 llama.cpp 在本地提供 Mellum2.1 服务的方法。安装运行环境，发送 completion 请求，并在尝试使用 agent 之前检查回答。

By BIG CHANGE Editorial

Published: 2026-10-09T17:10:04.232Z
Updated: 2026-10-09T17:10:04.232Z
Canonical: https://bigchange.ai/blog/run-jetbrains-mellum21-locally-llama-cpp

![An unbranded desktop computer tower with a small orange indicator stands on a warm ivory floor.](https://bigchange.ai/api/media/file/mellum21-local-inference-hero-v1.png)
Conceptual illustration of a computer that can host a local model server; no Mellum2.1 installation or test is depicted. AI-generated illustration by BIG CHANGE.

JetBrains 的 Mellum2.1 是一款拥有 120 亿参数、其中 25 亿参数处于激活状态的模型。BF16 仓库和单独的 GGUF 仓库目前都在 Hugging Face 上。首次在本地运行时，GGUF 仓库介绍了 llama.cpp 路径：按需下载量化文件，启动本地服务器，发送 prompt，并在向任何编程 agent 开放仓库访问权限前检查回答。

这是一份依据文档编写的设置指南。BIG CHANGE 没有安装 Mellum2.1，也没有运行以下命令。成功检查的标准是服务器返回本地 completion；这并不能证明代码质量、agent 可靠性或模型在你的硬件上的表现。

### 所需条件

- 一台 Windows、macOS 或 Linux 电脑，并有足够的内存和存储空间供所选模型及运行环境使用。JetBrains 的模型卡称原始模型为 BF16，支持 131,072-token 上下文。GGUF 仓库推荐的 Q4\_K\_M 文件大小为 8.1 GB。这只是文件大小，并非运行时内存的完整估算：运行环境、上下文和其他进程还需要额外资源。JetBrains 没有公布最低内存要求。
- 首次下载软件和模型时需要互联网连接。推理请求本身可以发送给本地服务器。
- llama.cpp 和一个终端。仓库为 Windows 介绍了 `winget install llama.cpp`，并提供用于本地服务的 `llama serve` 命令。

该模型采用 Apache 2.0 许可发布。权重没有列出使用费；JetBrains 未量化硬件、电力、存储或租用基础设施的成本。目前的 BF16 模型卡称没有推理服务商提供该仓库的服务。GGUF 仓库是单独的量化产物，并有自己的 llama.cpp 快速入门。

### 步骤 1：安装 llama.cpp 并启动本地服务器

在 Windows PowerShell 中，按[官方 Mellum2.1 GGUF 快速入门](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF)安装 llama.cpp：

```powershell
winget install llama.cpp
```

如果 `llama` 命令还不在 PATH 中，请打开一个新终端。启动推荐的 Q4\_K\_M 构建，并明确将其绑定到本地电脑的 8080 端口：

```powershell
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080
```

GGUF 仓库介绍了此模型 ID 和量化方式用于 `llama serve`；也介绍了 Windows 安装路径。[llama.cpp 服务器参考文档](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md)介绍了 `--host` 和 `--port`；仓库的示例 endpoint 是 `http://localhost:8080/v1`。在 macOS 和 Linux 上，同一 GGUF 仓库介绍了使用 `curl -LsSf https://llama.app/install.sh | sh` 安装 llama.cpp，然后使用同一服务命令。

首次响应前，进程必须先下载模型。Q4\_K\_M 文件标注为 8.1 GB。此测试中，请将服务器只绑定到自己的电脑；不要将其暴露到网络，也不要把凭据放进 prompt。仓库还列出了较小的 7.0 GB MXFP4\_MOE 文件，以及较大的 Q6\_K、Q8\_0 和 BF16 变体。量化会改变模型产物；仅凭文件大小无法判断特定电脑能否以实用的上下文长度或速度运行它。

如果命令无法启动，先检查准确的模型 ID、可用磁盘空间、llama.cpp 版本和完整错误文本。内存分配失败时应停止，并根据当前 llama.cpp 文档检查运行选项和上下文设置；这并不代表模型有缺陷。不要假设公布的 131,072-token 上下文能在你的电脑上运行。

### 步骤 2：发送冒烟测试 prompt

让服务器保持运行。在第二个 PowerShell 窗口中，向它的本地 API 发送一个简短请求：

```powershell
$body = @{
  model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
  messages = @(
    @{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
  )
  # Author-selected budget for this short smoke test; not a JetBrains recommendation.
  max_tokens = 512
  temperature = 0.6
  top_p = 0.95
  top_k = 20
} | ConvertTo-Json -Depth 5

$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body

$choice = $response.choices[0]
[pscustomobject]@{
  finish_reason = $choice.finish_reason
  has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
  content = $choice.message.content
}
```

模型 ID、本地 endpoint 和采样值遵循仓库的 API 示例。`max_tokens = 512` 是为本次简短检查选取的有限值，并非模型卡建议。Mellum2.1 是思考型模型；GGUF 模型卡称它会在 `<think>...</think>` 区块中输出推理内容。代码会报告单独的 `reasoning_content` 字段是否非空，但不会打印该字段。根据运行环境的推理格式，`content` 仍可能包含 `<think>` 文本。这个 prompt 是冒烟测试，不是模型质量基准。

只有当请求返回 completion 而不是连接或服务器错误，`finish_reason` 不等于 `length`，且最终 `content` 包含 `MELLUM21-LOCAL-OK` 时，基本检查才算通过。仅 HTTP 成功还不够：思考型模型可能在生成所需的最终文本前耗尽较小的输出预算。如果输出为空、缺少标记，或 `finish_reason` 等于 `length`，应将检查视为结果不确定；提高有限的输出预算并重试，而不是诊断为模型故障。如果 PowerShell 报告连接失败，请确认第一个终端仍显示服务器正在运行，并且请求使用 8080 端口。如果服务器返回错误，保存准确的错误消息并在测试编程 agent 前解决。成功响应只证明该本地推理路径可以回答一个请求；不能证明模型能够安全地编辑代码。

### 步骤 3：连接 agent 前先检查

首次评估要与实际项目分开。使用一个包含已知小任务的一次性仓库，并记录模型产物与量化方式、llama.cpp 版本、操作系统、上下文设置、prompt、输出、耗时和资源使用情况。要求进行范围明确的修改，检查建议的 diff，并自行运行仓库现有测试。若要对比，可使用当前基线重复同一任务。一个 prompt 或一次成功的测试运行不是基准测试。

模型服务器返回文本，并可能根据运行环境和请求格式支持结构化工具调用工作流。它不会自行决定 agent 能使用什么工具，也不会安全地执行这些工具。外围 agent 控制仓库访问、shell 命令、文件修改和测试运行。先采用只读或严格受限的访问；写入和命令需要审批；检查每个 diff；不要将机密放进测试仓库或 prompt。如果 agent 超出任务范围、修改无关文件或无法解释失败的测试，请停止。

若用于私人场景，请确认推理在哪里运行以及 agent 如何配置。如果请求留在本地 endpoint，本地模型进程可以让 prompt 留在你的电脑上；但 agent 仍可能为其他功能调用外部服务。在使用私人代码或数据前，检查该应用的网络访问、日志、遥测和工具权限。

### 步骤 4：已发布证据能说明什么、不能说明什么

JetBrains 将 Mellum2.1 描述为 12B 混合专家模型，其中 2.5B 参数激活，采用 BF16 精度并支持 131,072-token 上下文。模型卡称该版本采用 Apache 2.0 许可，并介绍了在隔离软件环境中进行的强化学习后训练。JetBrains 还公布了基准结果，包括 agent 编程评估。这些分数由 JetBrains 自行报告；它们不是 BIG CHANGE 的测量，也不能预测你的硬件吞吐量或项目结果。

不同发布页面上的一个发行细节发生了变化。JetBrains 10 月 8 日的发布文章称 GGUF 构建“即将推出”。到了 10 月 9 日，官方 Hugging Face GGUF 仓库已经可以访问，并提供 llama.cpp、Ollama 等快速入门。本指南使用目前发布的 GGUF 仓库。BF16 仓库仍是单独产物；重复这些步骤前请检查两个仓库是否有变动。

### 重大变化

现在，你可以按照已发布的 llama.cpp 快速入门运行量化版 Mellum2.1，并通过兼容 OpenAI 的本地 endpoint 查询它。无需依赖 BF16 仓库的推理服务商部署，即可实际进行首次自托管推理检查。响应证明服务路径有效；它不能证明 agent 质量、适用性、整个工具链的隐私或生产就绪程度。

### 来源与延伸阅读

- [JetBrains：《Mellum2.1 Gets to Work》（2026 年 10 月 8 日）](https://blog.jetbrains.com/ai/2026/10/mellum2-1-gets-to-work-a-fast-open-model-for-coding-agents/) — 发布介绍及最初关于 GGUF 可用性的说法。
- [JetBrains Mellum2.1 BF16 模型卡](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking) — 模型详情、vLLM 和 Transformers 说明、基准及许可。
- [JetBrains Mellum2.1 GGUF 仓库](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF) — 当前量化版本、文件大小、llama.cpp 命令和本地 API 示例。
- [llama.cpp 项目](https://github.com/ggml-org/llama.cpp) — 运行环境源码和发布信息。

## Sources

- [Mellum2.1 Gets to Work: A Fast Open Model for Coding Agents](https://blog.jetbrains.com/ai/2026/10/mellum2-1-gets-to-work-a-fast-open-model-for-coding-agents/) — JetBrains 的发布文章；反映 10 月 8 日关于 GGUF 构建即将推出的当时说法。
- [JetBrains/Mellum2.1-12B-A2.5B-Thinking 模型卡](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking) — BF16 产物的官方详情、模型卡快速入门、基准表和推理服务状态；基准值为 JetBrains 自行报告。
- [JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF 模型卡和快速入门](https://huggingface.co/JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF) — 当前官方 GGUF 产物、量化文件大小、Windows llama.cpp 快速入门及兼容 OpenAI 的本地 endpoint。
- [llama.cpp](https://github.com/ggml-org/llama.cpp) — 运行环境项目参考；未说明具体运行环境版本。
