Mellum2.1 de JetBrains est disponible sous la forme d’un modèle de 12 milliards de paramètres, dont 2,5 milliards sont actifs. Le dépôt BF16 et un dépôt GGUF distinct sont tous deux disponibles sur Hugging Face. Pour une première exécution locale, le dépôt GGUF décrit une méthode avec llama.cpp : téléchargez un fichier quantifié au besoin, démarrez un serveur local, envoyez un prompt et examinez la réponse avant d’accorder à un agent de programmation l’accès à un dépôt.
Ce guide de configuration s’appuie sur la documentation. BIG CHANGE n’a pas installé Mellum2.1 ni exécuté les commandes ci-dessous. Le test de réussite consiste à recevoir une completion locale du serveur ; cela ne démontre ni la qualité du code, ni la fiabilité de l’agent, ni les performances sur votre matériel.
Ce qu’il vous faut
- Un ordinateur Windows, macOS ou Linux avec suffisamment de mémoire et de stockage pour le modèle choisi et son environnement d’exécution. La fiche de JetBrains indique que le modèle d’origine est en BF16 et utilise un contexte de 131 072 tokens. Le dépôt GGUF recommande le fichier Q4_K_M de 8,1 Go. Il s’agit de la taille du fichier, pas d’une estimation complète de la mémoire nécessaire à l’exécution : l’environnement, le contexte et les autres processus demandent des ressources supplémentaires. JetBrains ne publie pas de mémoire minimale requise.
- Une connexion Internet est nécessaire pour télécharger le logiciel et le modèle la première fois. La requête d’inférence elle-même peut être envoyée au serveur local.
- llama.cpp et un terminal. Le dépôt décrit
winget install llama.cpppour Windows et une commandellama servepour l’exécution locale du serveur.
Le modèle est publié sous licence Apache 2.0. Aucun coût d’utilisation des poids n’est indiqué ; JetBrains ne chiffre pas le matériel, l’électricité, le stockage ni les éventuelles infrastructures louées. La fiche BF16 actuelle indique qu’aucun fournisseur d’inférence ne sert ce dépôt. Le dépôt GGUF est un artefact quantifié distinct, avec son propre guide rapide llama.cpp.
Étape 1 : installer llama.cpp et démarrer le serveur local
Dans PowerShell sous Windows, installez llama.cpp en suivant le guide rapide GGUF officiel de Mellum2.1:
winget install llama.cppOuvrez un nouveau terminal si la commande llama ne figure pas encore dans votre PATH. Démarrez la version Q4_K_M recommandée et liez-la explicitement à l’ordinateur local sur le port 8080 :
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080Le dépôt GGUF décrit cet ID de modèle et cette quantification pour llama serve ; il documente aussi l’installation sous Windows. La référence du serveur llama.cpp documente --host et --port ; l’endpoint d’exemple du dépôt est http://localhost:8080/v1 . Sous macOS et Linux, le même dépôt GGUF décrit l’installation de llama.cpp avec curl -LsSf https://llama.app/install.sh | sh , puis l’utilisation de la même commande de serveur.
Le processus doit télécharger le modèle avant de produire sa première réponse. Le fichier Q4_K_M est indiqué à 8,1 Go. Pour ce test, liez le serveur uniquement à votre propre ordinateur ; ne l’exposez pas au réseau et ne placez pas d’identifiants dans le prompt. Le dépôt répertorie aussi un fichier MXFP4_MOE plus petit de 7,0 Go et des variantes Q6_K, Q8_0 et BF16 plus grandes. La quantification modifie l’artefact du modèle ; la taille du fichier seule ne permet pas de savoir si un ordinateur donné peut le servir avec une longueur de contexte ou une vitesse utiles.
Si la commande ne démarre pas, vérifiez d’abord l’ID exact du modèle, l’espace disque disponible, la version de llama.cpp et le texte intégral de l’erreur. Un échec d’allocation mémoire justifie de s’arrêter et de consulter la documentation llama.cpp actuelle sur les options d’exécution et les paramètres de contexte ; il ne prouve pas que le modèle est défectueux. Ne supposez pas que le contexte publié de 131 072 tokens tient sur votre machine.
Étape 2 : envoyer un prompt de test
Laissez le serveur actif. Dans une deuxième fenêtre PowerShell, envoyez une courte requête à son API locale :
$body = @{
model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
messages = @(
@{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
)
# Author-selected budget for this short smoke test; not a JetBrains recommendation.
max_tokens = 512
temperature = 0.6
top_p = 0.95
top_k = 20
} | ConvertTo-Json -Depth 5
$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body
$choice = $response.choices[0]
[pscustomobject]@{
finish_reason = $choice.finish_reason
has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
content = $choice.message.content
}L’ID du modèle, l’endpoint local et les valeurs d’échantillonnage suivent l’exemple d’API du dépôt. max_tokens = 512 est une valeur limitée choisie ici pour ce test court, pas une recommandation de la fiche du modèle. Mellum2.1 est un modèle de raisonnement ; la fiche GGUF indique qu’il émet le raisonnement dans des blocs <think>...</think> . Le code signale si le champ distinct reasoning_content n’est pas vide sans afficher son contenu. Selon le format de raisonnement de l’environnement, content peut encore contenir du texte <think> . Ce prompt est un test rapide, pas un benchmark de qualité du modèle.
Le test de base réussit uniquement si la requête renvoie une completion plutôt qu’une erreur de connexion ou de serveur, si finish_reason n’est pas length et si le content final contient MELLUM21-LOCAL-OK . Une réponse HTTP réussie ne suffit pas : un modèle de raisonnement peut épuiser un petit budget de sortie avant de produire le texte final demandé. Si la sortie est vide, si le marqueur manque ou si finish_reason vaut length , considérez le test comme non concluant ; augmentez le budget de sortie limité et réessayez au lieu de conclure à une défaillance du modèle. Si PowerShell signale une erreur de connexion, vérifiez que le premier terminal affiche toujours un serveur actif et que la requête utilise le port 8080. Si le serveur renvoie une erreur, conservez le message exact et résolvez-la avant de tester un agent de programmation. Une réponse réussie confirme que cette voie d’inférence locale peut répondre à une requête ; elle ne confirme pas que le modèle peut modifier du code sans risque.
Étape 3 : vérifier le modèle avant de connecter un agent
Séparez la première évaluation d’un projet actif. Utilisez un dépôt jetable avec une petite tâche connue et consignez l’artefact et la quantification du modèle, la version de llama.cpp, le système d’exploitation, le paramètre de contexte, le prompt, la sortie, le temps écoulé et les ressources utilisées. Demandez une modification bien délimitée, examinez le diff proposé et lancez vous-même les tests existants du dépôt. Pour comparer, répétez la même tâche avec votre référence actuelle. Un prompt ou une exécution de test réussie ne constitue pas un benchmark.
Un serveur de modèle renvoie du texte et peut, selon l’environnement et le format de requête, prendre en charge des workflows structurés d’appels d’outils. Il ne décide pas à lui seul des outils qu’un agent peut utiliser et ne les exécute pas de manière sûre. L’agent qui l’entoure contrôle l’accès au dépôt, les commandes shell, les modifications de fichiers et l’exécution des tests. Commencez avec un accès en lecture seule ou strictement limité, exigez une approbation pour les écritures et les commandes, examinez chaque diff et gardez les secrets hors du dépôt de test et des prompts. Arrêtez-vous si l’agent dépasse la tâche, modifie des fichiers sans rapport ou ne peut pas expliquer un test en échec.
Pour un usage privé, confirmez où l’inférence s’exécute et comment votre agent est configuré. Un processus de modèle local peut garder les prompts sur votre ordinateur lorsque les requêtes restent sur l’endpoint local, mais l’agent peut encore appeler des services externes pour d’autres fonctions. Avant d’utiliser du code ou des données privés, vérifiez l’accès réseau, les journaux, la télémétrie et les autorisations des outils de l’application.
Étape 4 : ce que les éléments publiés montrent et ne montrent pas
JetBrains décrit Mellum2.1 comme un modèle mixture-of-experts de 12B paramètres, dont 2,5B actifs, avec une précision BF16 et un contexte de 131 072 tokens. Sa fiche indique une publication sous Apache 2.0 et décrit un post-entraînement comprenant de l’apprentissage par renforcement dans des environnements logiciels isolés. JetBrains publie aussi des résultats de benchmark, notamment des évaluations de programmation agentique. Ces scores sont déclarés par JetBrains ; ils ne proviennent pas de mesures de BIG CHANGE et ne prédisent ni le débit de votre matériel ni les résultats de votre projet.
Un détail du lancement a changé selon la plateforme de publication. Le billet de lancement de JetBrains du 8 octobre disait que les versions GGUF arriveraient « bientôt ». Le 9 octobre, le dépôt GGUF officiel sur Hugging Face est accessible et propose des guides rapides pour llama.cpp, Ollama et d’autres outils. Ce guide utilise le dépôt GGUF actuellement publié. Le dépôt BF16 reste un artefact distinct ; vérifiez les deux dépôts avant de répéter ces étapes.
Le grand changement
Vous pouvez désormais suivre le guide rapide llama.cpp publié pour une version quantifiée de Mellum2.1 et l’interroger via un endpoint local compatible avec OpenAI. Cela rend praticable un premier test d’inférence auto-hébergée sans dépendre du déploiement d’un fournisseur d’inférence pour le dépôt BF16. Une réponse prouve que la voie de service fonctionne ; elle ne prouve ni la qualité de l’agent, ni son adéquation, ni la confidentialité de toute la chaîne d’outils, ni son aptitude à la production.
Sources et lectures complémentaires
- JetBrains : « Mellum2.1 Gets to Work » (8 octobre 2026) — présentation du lancement et déclaration initiale sur la disponibilité de GGUF.
- Fiche du modèle JetBrains Mellum2.1 BF16 — détails du modèle, instructions vLLM et Transformers, benchmarks et licence.
- Dépôt JetBrains Mellum2.1 GGUF — quantifications actuelles, tailles des fichiers, commandes llama.cpp et exemple d’API locale.
- Projet llama.cpp — code source de l’environnement et informations de publication.



