Mellum2.1 от JetBrains доступен как модель с 12 миллиардами параметров, из которых активны 2,5 миллиарда. Репозитории BF16 и отдельный репозиторий GGUF доступны на Hugging Face. Для первого локального запуска репозиторий GGUF описывает путь с llama.cpp: при необходимости скачайте квантованный файл, запустите локальный сервер, отправьте prompt и изучите ответ, прежде чем открывать любому агенту для программирования доступ к репозиторию.
Это руководство по настройке основано на документации. BIG CHANGE не устанавливала Mellum2.1 и не выполняла приведённые ниже команды. Успешная проверка означает, что сервер вернул локальный completion; это не доказывает качество кода, надёжность агента или производительность на вашем оборудовании.
Что понадобится
- Компьютер под Windows, macOS или Linux с достаточным объёмом памяти и хранилища для выбранной модели и среды выполнения. На карточке JetBrains указано, что исходная модель представлена в BF16 и поддерживает контекст в 131 072 токена. В репозитории GGUF рекомендуется файл Q4_K_M размером 8,1 ГБ. Это размер файла, а не полная оценка требуемой памяти во время работы: дополнительные ресурсы нужны среде выполнения, контексту и другим процессам. JetBrains не публикует минимальные требования к памяти.
- Для первоначальной загрузки программного обеспечения и модели нужно подключение к интернету. Сам запрос на инференс может отправляться локальному серверу.
- llama.cpp и терминал. В репозитории описана команда
winget install llama.cppдля Windows и командаllama serveдля локального запуска сервера.
Модель выпущена по лицензии Apache 2.0. Плата за использование весов не указана; JetBrains не оценивает затраты на оборудование, электричество, хранилище и арендуемую инфраструктуру. В текущей карточке BF16 указано, что ни один провайдер инференса не обслуживает этот репозиторий. GGUF — отдельный квантованный артефакт с собственным кратким руководством по llama.cpp.
Шаг 1. Установите llama.cpp и запустите локальный сервер
В Windows откройте PowerShell и установите llama.cpp по официальному краткому руководству Mellum2.1 GGUF:
winget install llama.cppОткройте новый терминал, если команда llama ещё не добавлена в PATH. Запустите рекомендуемую сборку Q4_K_M и явно привяжите её к локальному компьютеру на порту 8080:
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080В репозитории GGUF описаны этот ID модели и квантование для llama serve; там же приведён способ установки в Windows. В справочнике сервера llama.cpp описаны --host и --port; пример endpoint в репозитории — http://localhost:8080/v1 . Для macOS и Linux тот же репозиторий GGUF описывает установку llama.cpp с помощью curl -LsSf https://llama.app/install.sh | sh и последующий запуск той же командой сервера.
Перед первым ответом процесс должен скачать модель. Размер файла Q4_K_M указан как 8,1 ГБ. Для этого теста привяжите сервер только к своему компьютеру; не открывайте его для сети и не помещайте учётные данные в prompt. В репозитории также перечислены меньший файл MXFP4_MOE размером 7,0 ГБ и более крупные варианты Q6_K, Q8_0 и BF16. Квантование меняет артефакт модели; по одному размеру файла нельзя понять, сможет ли конкретный компьютер обслуживать её с полезной длиной контекста или скоростью.
Если команда не запускается, сначала проверьте точный ID модели, свободное место на диске, версию llama.cpp и полный текст ошибки. Сбой выделения памяти — повод остановиться и сверить параметры среды выполнения и контекста с текущей документацией llama.cpp; это не свидетельствует о дефекте модели. Не рассчитывайте, что опубликованный контекст в 131 072 токена поместится на вашем компьютере.
Шаг 2. Отправьте тестовый prompt
Оставьте сервер запущенным. Во втором окне PowerShell отправьте короткий запрос к его локальному API:
$body = @{
model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
messages = @(
@{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
)
# Author-selected budget for this short smoke test; not a JetBrains recommendation.
max_tokens = 512
temperature = 0.6
top_p = 0.95
top_k = 20
} | ConvertTo-Json -Depth 5
$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body
$choice = $response.choices[0]
[pscustomobject]@{
finish_reason = $choice.finish_reason
has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
content = $choice.message.content
}ID модели, локальный endpoint и параметры sampling соответствуют примеру API из репозитория. max_tokens = 512 — ограниченное значение, выбранное здесь для короткой проверки, а не рекомендация из карточки модели. Mellum2.1 — модель с рассуждениями; согласно карточке GGUF, она выводит reasoning в блоках <think>...</think> . Код сообщает, заполнено ли отдельное поле reasoning_content , не выводя его содержимое. В зависимости от формата reasoning в среде выполнения поле content всё ещё может содержать текст <think> . Этот prompt — тест, а не бенчмарк качества модели.
Базовая проверка пройдена, только если запрос вернул completion, а не ошибку подключения или сервера, если finish_reason не равно length и если итоговый content содержит MELLUM21-LOCAL-OK . Успешного HTTP-ответа недостаточно: модель с рассуждениями может потратить небольшой бюджет вывода, не успев сформировать запрошенный итоговый текст. Если ответ пуст, маркера нет или finish_reason равно length , считайте проверку неопределённой; увеличьте ограниченный бюджет вывода и повторите попытку, а не диагностируйте сбой модели. Если PowerShell сообщает об ошибке подключения, убедитесь, что в первом терминале сервер всё ещё работает и запрос использует порт 8080. Если сервер вернул ошибку, сохраните точное сообщение и устраните её до проверки агента для программирования. Успешный ответ подтверждает, что этот локальный путь инференса способен обработать один запрос; он не подтверждает, что модель может безопасно редактировать код.
Шаг 3. Проверьте модель до подключения агента
Проводите первую оценку отдельно от рабочего проекта. Используйте временный репозиторий с известной небольшой задачей и зафиксируйте артефакт модели и квантование, версию llama.cpp, операционную систему, настройку контекста, prompt, ответ, затраченное время и использование ресурсов. Попросите внести ограниченное изменение, проверьте предложенный diff и самостоятельно запустите существующие тесты репозитория. Для сравнения можно повторить ту же задачу с текущей базовой моделью. Один prompt или один успешный запуск теста — не бенчмарк.
Сервер модели возвращает текст и, в зависимости от формата среды и запроса, может поддерживать структурированные вызовы инструментов. Сам по себе он не определяет, какими инструментами может пользоваться агент, и не запускает их безопасно. Окружающий агент контролирует доступ к репозиторию, команды shell, правки файлов и запуск тестов. Начните с доступа только для чтения или строго ограниченного доступа, требуйте разрешения на запись и команды, проверяйте каждый diff и не помещайте секреты в тестовый репозиторий или prompt. Остановитесь, если агент выходит за рамки задачи, меняет несвязанные файлы или не может объяснить проваленный тест.
Для частного использования уточните, где выполняется инференс и как настроен агент. Локальный процесс модели может оставить prompt на вашем компьютере, если запросы остаются на локальном endpoint, но агент всё равно может обращаться к внешним сервисам для других функций. Перед использованием частного кода или данных проверьте сетевой доступ, журналы, телеметрию и разрешения инструментов в приложении.
Шаг 4. Что показывают и чего не доказывают опубликованные материалы
JetBrains описывает Mellum2.1 как модель mixture-of-experts с 12B параметров, 2,5B активных параметров, точностью BF16 и контекстом в 131 072 токена. В карточке указано, что модель выпущена по Apache 2.0, а постобучение включало обучение с подкреплением в изолированных программных средах. JetBrains также публикует результаты бенчмарков, в том числе оценки агентного программирования. Эти результаты заявлены самой JetBrains; это не измерения BIG CHANGE и не прогноз пропускной способности вашего оборудования или результатов проекта.
Одна деталь релиза изменилась между площадками публикации. В анонсе от 8 октября JetBrains сообщала, что сборки GGUF «скоро появятся». 9 октября официальный репозиторий GGUF на Hugging Face уже доступен и содержит краткие руководства для llama.cpp, Ollama и других инструментов. В этом руководстве используется опубликованный сейчас репозиторий GGUF. Репозиторий BF16 остаётся отдельным артефактом; перед повторением этих действий проверьте изменения в обоих репозиториях.
Главное изменение
Теперь можно следовать опубликованному краткому руководству llama.cpp для квантованной сборки Mellum2.1 и обращаться к ней через локальный endpoint, совместимый с OpenAI. Это делает практичной первую проверку инференса на собственной инфраструктуре без зависимости от развертывания провайдера инференса для репозитория BF16. Ответ доказывает, что путь обслуживания работает; он не доказывает качество агента, пригодность, конфиденциальность всей цепочки инструментов или готовность к эксплуатации.
Источники и дополнительная литература
- JetBrains: «Mellum2.1 Gets to Work» (8 октября 2026 года) — описание запуска и первоначальное заявление о доступности GGUF.
- Карточка модели JetBrains Mellum2.1 BF16 — сведения о модели, инструкции для vLLM и Transformers, бенчмарки и лицензия.
- Репозиторий JetBrains Mellum2.1 GGUF — текущие варианты квантования, размеры файлов, команды llama.cpp и пример локального API.
- Проект llama.cpp — исходный код среды выполнения и сведения о релизах.



