Mellum2.1 von JetBrains ist als Modell mit 12 Milliarden Parametern verfügbar, davon 2,5 Milliarden aktiv. Sowohl das BF16-Repository als auch ein separates GGUF-Repository sind auf Hugging Face verfügbar. Für den ersten lokalen Lauf beschreibt das GGUF-Repository einen Weg mit llama.cpp: eine quantisierte Datei bei Bedarf herunterladen, einen lokalen Server starten, einen Prompt senden und die Antwort prüfen, bevor irgendein Coding-Agent Zugriff auf ein Repository erhält.

Dies ist eine dokumentationsbasierte Einrichtungsanleitung. BIG CHANGE hat Mellum2.1 nicht installiert und die folgenden Befehle nicht ausgeführt. Als Erfolg gilt eine vom Server zurückgegebene lokale Completion; sie belegt weder Codequalität noch Zuverlässigkeit des Agenten oder Leistung auf Ihrer Hardware.

Was Sie benötigen

  • Einen Windows-, macOS- oder Linux-Computer mit genügend Arbeitsspeicher und Speicherplatz für das ausgewählte Modell und seine Laufzeitumgebung. Laut JetBrains-Karte liegt das ursprüngliche Modell in BF16 vor und hat einen Kontext von 131.072 Token. Das GGUF-Repository empfiehlt eine Q4_K_M-Datei mit 8,1 GB. Das ist die Dateigröße, keine vollständige Schätzung des Laufzeitspeichers: Laufzeitumgebung, Kontext und andere Prozesse benötigen zusätzlichen Speicher. JetBrains veröffentlicht keinen Mindestbedarf an Arbeitsspeicher.
  • Für den ersten Download von Software und Modell benötigen Sie eine Internetverbindung. Die Inferenzanfrage selbst kann an den lokalen Server gehen.
  • llama.cpp und ein Terminal. Das Repository beschreibt winget install llama.cpp für Windows und einen llama serve-Befehl für den lokalen Serverbetrieb.

Das Modell steht unter Apache 2.0. Für die Gewichte ist keine Nutzungsgebühr angegeben; Kosten für Hardware, Strom, Speicher und gemietete Infrastruktur beziffert JetBrains nicht. Die aktuelle BF16-Modellkarte sagt, dass kein Inferenzanbieter dieses Repository bereitstellt. Das GGUF-Repository ist ein separates quantisiertes Artefakt mit eigenem llama.cpp-Schnellstart.

Schritt 1: llama.cpp installieren und den lokalen Server starten

Installieren Sie llama.cpp unter Windows in PowerShell mithilfe des offiziellen Mellum2.1-GGUF-Schnellstarts:

PowerShell
winget install llama.cpp

Öffnen Sie ein neues Terminal, falls der Befehl llama noch nicht in Ihrem PATH liegt. Starten Sie den empfohlenen Q4_K_M-Build und binden Sie ihn ausdrücklich an den lokalen Rechner auf Port 8080:

PowerShell
llama serve -hf JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF:Q4_K_M --host 127.0.0.1 --port 8080

Das GGUF-Repository beschreibt diese Modell-ID und Quantisierung für llama serve; außerdem dokumentiert es den Installationsweg für Windows. Die Referenz zum llama.cpp-Server dokumentiert --host und --port; der Beispiel-Endpunkt des Repositorys lautet http://localhost:8080/v1 . Unter macOS und Linux beschreibt dasselbe GGUF-Repository die Installation von llama.cpp mit curl -LsSf https://llama.app/install.sh | sh und anschließend denselben Serverbefehl.

Vor der ersten Antwort muss der Prozess das Modell herunterladen. Für die Q4_K_M-Datei werden 8,1 GB angegeben. Binden Sie den Server für diesen Test nur an Ihren eigenen Rechner; machen Sie ihn nicht im Netzwerk erreichbar und geben Sie keine Zugangsdaten in den Prompt ein. Das Repository nennt außerdem eine kleinere MXFP4_MOE-Datei mit 7,0 GB sowie größere Q6_K-, Q8_0- und BF16-Varianten. Die Quantisierung verändert das Modellartefakt; allein aus der Dateigröße lässt sich nicht ableiten, ob ein bestimmter Computer es mit brauchbarer Kontextlänge oder Geschwindigkeit bereitstellen kann.

Wenn der Befehl nicht startet, prüfen Sie zuerst die genaue Modell-ID, den verfügbaren Speicherplatz, die llama.cpp-Version und den vollständigen Fehlertext. Ein Fehler bei der Speicherzuweisung ist ein Grund, anzuhalten und Laufzeitoptionen sowie Kontexteinstellungen anhand der aktuellen llama.cpp-Dokumentation zu prüfen; er ist kein Beleg für einen Modelldefekt. Nehmen Sie nicht an, dass der veröffentlichte Kontext von 131.072 Token auf Ihren Rechner passt.

Schritt 2: Einen Smoke-Test-Prompt senden

Lassen Sie den Server laufen. Senden Sie in einem zweiten PowerShell-Fenster eine kurze Anfrage an seine lokale API:

PowerShell
$body = @{
  model = "JetBrains/Mellum2.1-12B-A2.5B-Thinking-GGUF"
  messages = @(
    @{ role = "user"; content = "Reply with exactly: MELLUM21-LOCAL-OK" }
  )
  # Author-selected budget for this short smoke test; not a JetBrains recommendation.
  max_tokens = 512
  temperature = 0.6
  top_p = 0.95
  top_k = 20
} | ConvertTo-Json -Depth 5

$response = Invoke-RestMethod -Uri "http://localhost:8080/v1/chat/completions" -Method Post -ContentType "application/json" -Body $body

$choice = $response.choices[0]
[pscustomobject]@{
  finish_reason = $choice.finish_reason
  has_reasoning_content = -not [string]::IsNullOrWhiteSpace($choice.message.reasoning_content)
  content = $choice.message.content
}

Modell-ID, lokaler Endpunkt und Sampling-Werte folgen dem API-Beispiel des Repositorys. max_tokens = 512 ist ein hier für diesen kurzen Test gewählter begrenzter Wert, keine Empfehlung der Modellkarte. Mellum2.1 ist ein Thinking-Modell; laut GGUF-Karte gibt es Reasoning in <think>...</think>-Blöcken aus. Der Code meldet, ob das separate Feld reasoning_content nicht leer ist, ohne es auszugeben. Je nach Reasoning-Format der Laufzeitumgebung kann content weiterhin Text aus <think> enthalten. Der Prompt ist ein Smoke-Test, kein Benchmark für die Modellqualität.

Der Basistest ist nur bestanden, wenn die Anfrage eine Completion statt eines Verbindungs- oder Serverfehlers zurückgibt, finish_reason nicht length ist und das abschließende content enthält MELLUM21-LOCAL-OK enthält. Ein erfolgreicher HTTP-Aufruf allein genügt nicht: Ein Thinking-Modell kann ein kleines Ausgabebudget aufbrauchen, bevor es den angeforderten Abschlusstext erzeugt. Wenn die Ausgabe leer ist, die Markierung fehlt oder finish_reason den Wert length hat, ist der Test nicht aussagekräftig; erhöhen Sie das begrenzte Ausgabebudget und versuchen Sie es erneut, statt einen Modellfehler zu diagnostizieren. Meldet PowerShell einen Verbindungsfehler, prüfen Sie, ob das erste Terminal weiterhin einen laufenden Server zeigt und die Anfrage Port 8080 verwendet. Gibt der Server einen Fehler zurück, sichern Sie die genaue Meldung und beheben Sie ihn, bevor Sie einen Coding-Agenten testen. Eine erfolgreiche Antwort bestätigt, dass dieser lokale Inferenzweg eine Anfrage beantworten kann; sie bestätigt nicht, dass das Modell Code sicher bearbeiten kann.

Schritt 3: Vor dem Verbinden eines Agenten prüfen

Halten Sie die erste Bewertung von einem laufenden Projekt getrennt. Verwenden Sie ein Wegwerf-Repository mit einer bekannten, kleinen Aufgabe und notieren Sie Modellartefakt und Quantisierung, llama.cpp-Version, Betriebssystem, Kontexteinstellung, Prompt, Ausgabe, Laufzeit und Ressourcenverbrauch. Verlangen Sie eine klar begrenzte Änderung, prüfen Sie den vorgeschlagenen Diff und führen Sie die vorhandenen Repository-Tests selbst aus. Für einen Vergleich können Sie dieselbe Aufgabe mit Ihrer aktuellen Basisversion wiederholen. Ein Prompt oder ein erfolgreicher Testlauf ist kein Benchmark.

Ein Modellserver gibt Text zurück und kann je nach Laufzeit- und Anfrageformat strukturierte Tool-Aufruf-Abläufe unterstützen. Er bestimmt nicht selbst, welche Tools ein Agent verwenden darf, und führt sie nicht sicher aus. Der umgebende Agent steuert Repository-Zugriff, Shell-Befehle, Dateiänderungen und Testausführung. Beginnen Sie mit Lesezugriff oder eng begrenztem Zugriff, verlangen Sie eine Genehmigung für Schreibvorgänge und Befehle, prüfen Sie jeden Diff und halten Sie Geheimnisse aus Test-Repository und Prompts heraus. Stoppen Sie, wenn der Agent die Aufgabe überschreitet, nicht zugehörige Dateien ändert oder einen fehlgeschlagenen Test nicht erklären kann.

Prüfen Sie für die private Nutzung, wo die Inferenz läuft und wie Ihr Agent konfiguriert ist. Ein lokaler Modellprozess kann Prompts auf Ihrem Rechner belassen, wenn Anfragen am lokalen Endpunkt bleiben; der Agent kann für andere Funktionen dennoch externe Dienste aufrufen. Prüfen Sie Netzwerkzugriff, Protokollierung, Telemetrie und Tool-Berechtigungen der Anwendung, bevor Sie privaten Code oder Daten verwenden.

Schritt 4: Was die veröffentlichten Belege zeigen und was nicht

JetBrains beschreibt Mellum2.1 als Mixture-of-Experts-Modell mit 12B Parametern, davon 2,5B aktiv, BF16-Präzision und einem Kontext von 131.072 Token. Laut Modellkarte steht die Veröffentlichung unter Apache 2.0; außerdem beschreibt sie ein Post-Training mit bestärkendem Lernen in abgeschirmten Softwareumgebungen. JetBrains veröffentlicht auch Benchmark-Ergebnisse, darunter Bewertungen für agentisches Programmieren. Diese Werte stammen von JetBrains selbst; sie sind keine Messungen von BIG CHANGE und sagen weder den Durchsatz Ihrer Hardware noch die Ergebnisse Ihres Projekts voraus.

Ein Detail der Veröffentlichung änderte sich zwischen den Veröffentlichungsorten. Im Launch-Beitrag vom 8. Oktober schrieb JetBrains, GGUF-Builds kämen „bald“. Am 9. Oktober ist das offizielle Hugging-Face-GGUF-Repository zugänglich und enthält Schnellstarts für llama.cpp, Ollama und weitere Tools. Diese Anleitung nutzt das derzeit veröffentlichte GGUF-Repository. Das BF16-Repository bleibt ein separates Artefakt; prüfen Sie beide Repositorys auf Änderungen, bevor Sie diese Schritte wiederholen.

Die große Veränderung

Sie können jetzt einem veröffentlichten llama.cpp-Schnellstart für einen quantisierten Mellum2.1-Build folgen und ihn über einen lokalen OpenAI-kompatiblen Endpunkt abfragen. Damit wird ein erster selbst gehosteter Inferenztest praktikabel, ohne auf eine Bereitstellung durch einen Inferenzanbieter für das BF16-Repository angewiesen zu sein. Eine Antwort belegt, dass der Bereitstellungsweg funktioniert; sie belegt weder Agentenqualität noch Eignung, Datenschutz über die gesamte Toolchain oder Produktionsreife.

Quellen und weiterführende Informationen