Mellum2.1 de JetBrains está disponible como un modelo de 12.000 millones de parámetros, con 2.500 millones activos. Tanto el repositorio BF16 como un repositorio GGUF independiente están activos en Hugging Face. Para la primera ejecución local, el repositorio GGUF documenta una ruta con llama.cpp: descarga bajo demanda un archivo cuantizado, inicia un servidor local, envíale una solicitud y revisa la respuesta antes de dar acceso a un repositorio a cualquier agente de programación.
Esta guía de configuración se basa en documentación. BIG CHANGE no instaló Mellum2.1 ni ejecutó los comandos siguientes. La comprobación de éxito es una completion local devuelta por el servidor; no demuestra calidad de código, fiabilidad del agente ni rendimiento en tu hardware.
Qué necesitas
- Un ordenador Windows, macOS o Linux con memoria y almacenamiento suficientes para el modelo elegido y su runtime. La ficha de JetBrains indica que el modelo original es BF16 con un contexto de 131.072 tokens. El repositorio GGUF recomienda el archivo Q4_K_M de 8,1 GB. Ese es el tamaño del archivo, no una estimación completa de la memoria de ejecución: el runtime, el contexto y otros procesos requieren recursos adicionales. JetBrains no publica un requisito mínimo de memoria.
- Conexión a Internet para descargar inicialmente el software y el modelo. La solicitud de inferencia puede dirigirse al servidor local.
- llama.cpp y un terminal. El repositorio documenta
winget install llama.cpppara Windows y un comandollama servepara servirlo localmente.
El modelo se publica bajo Apache 2.0. No se indica una tarifa de uso para los pesos; JetBrains no cuantifica los costes de hardware, electricidad, almacenamiento ni de la infraestructura que decidas alquilar. La ficha BF16 indica actualmente que ningún proveedor de inferencia sirve ese repositorio. El repositorio GGUF es otro artefacto cuantizado con su propio inicio rápido para llama.cpp.
Paso 1: instala llama.cpp e inicia el servidor local
En PowerShell en Windows, instala llama.cpp con la guía oficial de inicio rápido GGUF de Mellum2.1.
winget install llama.cppAbre otro terminal si el comando llama aún no está en tu PATH. Inicia la compilación Q4_K_M recomendada y enlázala explícitamente a tu equipo local en el puerto 8080:
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080El repositorio GGUF documenta este ID de modelo y esta cuantización para llama serve; también documenta la instalación en Windows. La referencia del servidor de llama.cpp documenta --host y --port; el endpoint de ejemplo del repositorio es http://localhost:8080/v1. En macOS y Linux, el mismo repositorio GGUF documenta instalar llama.cpp con curl -LsSf https://llama.app/install.sh | sh y luego usar el mismo comando para servirlo.
El proceso debe descargar el modelo antes de la primera respuesta. El archivo Q4_K_M figura con 8,1 GB. Para esta prueba, mantén el servidor enlazado solo a tu propio equipo; no lo expongas a una red ni incluyas credenciales en la solicitud. El repositorio también enumera el archivo MXFP4_MOE, menor, de 7,0 GB, y las variantes mayores Q6_K, Q8_0 y BF16. La cuantización cambia el artefacto del modelo; el tamaño del archivo por sí solo no indica si un ordenador concreto podrá servirlo con una longitud de contexto o una velocidad útil.
Si el comando no arranca, comprueba primero el ID exacto del modelo, el espacio disponible, la versión de llama.cpp y el mensaje de error completo. Un fallo de asignación de memoria es motivo para detenerse y revisar las opciones del runtime y la configuración del contexto frente a la documentación actual de llama.cpp; no demuestra que el modelo esté defectuoso. No des por hecho que el contexto publicado de 131.072 tokens cabrá en tu equipo.
Paso 2: envía una solicitud de prueba
Deja el servidor en ejecución. En otra ventana de PowerShell, envía una solicitud breve a su API local:
$body = @{
model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
messages = @(
@{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
)
# Author-selected budget for this short smoke test; not a JetBrains recommendation.
max_tokens = 512
temperature = 0.6
top_p = 0.95
top_k = 20
} | ConvertTo-Json -Depth 5
$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body
$choice = $response.choices[0]
[pscustomobject]@{
finish_reason = $choice.finish_reason
has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
content = $choice.message.content
}El ID del modelo, el endpoint local y los valores de muestreo siguen el ejemplo de API del repositorio. max_tokens = 512 es un valor acotado elegido aquí para esta comprobación breve, no una recomendación de la ficha del modelo. Mellum2.1 es un modelo de razonamiento; la ficha GGUF indica que emite razonamiento en bloques <think>...</think>. El código informa si el campo independiente reasoning_content no está vacío, sin imprimirlo. Según el formato de razonamiento del runtime, content todavía puede incluir texto de <think>. Esta solicitud es una prueba básica, no una evaluación de calidad del modelo.
La comprobación básica solo se supera si la solicitud devuelve una completion, no un error de conexión o del servidor; finish_reason no es length; y el content final contiene MELLUM21-LOCAL-OK. Un HTTP correcto por sí solo no basta: un modelo de razonamiento puede consumir un presupuesto de salida pequeño antes de producir el texto final solicitado. Si la salida está vacía, falta el marcador o finish_reason es length, considera que la prueba no es concluyente; aumenta el presupuesto acotado de salida y vuelve a intentarlo en lugar de diagnosticar un fallo del modelo. Si PowerShell informa de un fallo de conexión, confirma que el primer terminal aún muestra el servidor activo y que la solicitud usa el puerto 8080. Si el servidor devuelve un error, guarda el mensaje exacto y resuélvelo antes de probar un agente de programación. Una respuesta correcta confirma que esta ruta de inferencia local puede responder a una solicitud; no confirma que el modelo pueda editar código de forma segura.
Paso 3: compruébalo antes de conectar un agente
Mantén la primera evaluación separada de un proyecto real. Usa un repositorio desechable con una tarea pequeña y conocida, y registra el artefacto y la cuantización del modelo, la versión de llama.cpp, el sistema operativo, la configuración del contexto, la solicitud, la salida, el tiempo transcurrido y el uso de recursos. Pide un cambio acotado, inspecciona el diff propuesto y ejecuta por tu cuenta las pruebas existentes del repositorio. Para comparar, repite la misma tarea con tu referencia actual. Una solicitud o una ejecución de prueba correcta no son un benchmark.
Un servidor de modelos devuelve texto y, según el runtime y el formato de solicitud, puede admitir flujos estructurados de llamadas a herramientas. Por sí mismo no decide qué herramientas puede usar un agente ni las ejecuta de forma segura. El agente que lo rodea controla el acceso al repositorio, los comandos de shell, la edición de archivos y las pruebas. Empieza con acceso de solo lectura o estrictamente limitado, exige aprobación para escrituras y comandos, revisa cada diff y mantén los secretos fuera del repositorio y de las solicitudes de prueba. Detente si el agente intenta exceder la tarea, modifica archivos ajenos o no puede explicar una prueba fallida.
Para uso privado, confirma dónde se ejecuta la inferencia y cómo está configurado el agente. Un proceso de modelo local puede mantener las solicitudes en tu equipo si se quedan en el endpoint local, pero el agente aún podría llamar a servicios externos para otras funciones. Antes de usar código o datos privados, comprueba el acceso a la red, los registros, la telemetría y los permisos de herramientas de esa aplicación.
Paso 4: qué muestran y qué no muestran las pruebas publicadas
JetBrains describe Mellum2.1 como un modelo de mezcla de expertos 12B con 2,5B parámetros activos, precisión BF16 y contexto de 131.072 tokens. Su ficha indica que la versión usa Apache 2.0 y describe un postentrenamiento que incluyó aprendizaje por refuerzo en entornos de software aislados. JetBrains también publica resultados de benchmarks, incluidas evaluaciones de programación agéntica. Son resultados declarados por JetBrains, no mediciones de BIG CHANGE, y no predicen el rendimiento de tu hardware ni los resultados de tu proyecto.
Un detalle de publicación cambió entre superficies. La nota de lanzamiento de JetBrains del 8 de octubre decía que las compilaciones GGUF llegarían «pronto». El 9 de octubre, el repositorio oficial GGUF de Hugging Face es accesible e incluye guías rápidas para llama.cpp, Ollama y otros. Esta guía usa ese repositorio GGUF publicado actualmente. El repositorio BF16 sigue siendo un artefacto distinto; comprueba ambos repositorios por si hay cambios antes de repetir los pasos.
El gran cambio
Ahora puedes seguir un inicio rápido publicado de llama.cpp para una compilación cuantizada de Mellum2.1 y consultarla mediante un endpoint local compatible con OpenAI. Esto hace práctica una primera comprobación de inferencia autoalojada sin depender del despliegue de un proveedor de inferencia para el repositorio BF16. Una respuesta demuestra que funciona la vía de servicio; no demuestra calidad del agente, adecuación, privacidad de toda la cadena de herramientas ni preparación para producción.
Fuentes y lecturas adicionales
- JetBrains: «Mellum2.1 se pone manos a la obra» (8 de octubre de 2026) — descripción del lanzamiento y declaración original sobre la disponibilidad de GGUF.
- Ficha del modelo BF16 JetBrains Mellum2.1 — detalles del modelo, instrucciones para vLLM y Transformers, benchmarks y licencia.
- Repositorio GGUF de JetBrains Mellum2.1 — cuantizaciones actuales, tamaños de archivos, comandos llama.cpp y ejemplo de API local.
- Proyecto llama.cpp — código fuente del runtime e información de versiones.



