Google hat Gemini 4 Argon am 30. September vorgestellt und dabei starke Ergebnisse bei Wissensarbeit und Programmierung, ein behauptetes Limit von einer Million Ausgabetoken sowie Preise für eine künftige API-Version genannt. Zunächst stellt Google das Modell einer kleinen Gruppe vertrauenswürdiger Cyberabwehrkräfte und Tester bereit. Eine öffentliche Modell-ID für Entwickler oder einen Termin für zahlende API-Kunden und Google-AI-Ultra-Abonnenten hat das Unternehmen nicht genannt. die Google-Ankündigung und der Gemini-API-Modellkatalog zeigen die Lücke zwischen der Vorstellung und dem Zugang für die meisten Leser.

Die große Veränderung

  • Was sich geändert hat: Google hat ein neues Spitzenmodell ausgewählten Cyberabwehrkräften anvertraut, während die meisten Entwickler und Abonnenten weiter keinen Zugang haben. Die wichtigsten Leistungs- und Preisangaben sind öffentlich, eine öffentliche API gibt es aber noch nicht.
  • Warum das wichtig ist: Unabhängige Tests von Vals AI setzen Argon bei allgemeiner Wissensarbeit und einem Finanzagenten-Test auf Platz eins. Teams, die Modelle vergleichen, haben damit einen ernst zu nehmenden neuen Kandidaten. Die uneinheitlichen Ergebnisse und der begrenzte Rollout lassen Leistung und Kosten in den eigenen Arbeitsabläufen jedoch offen.
  • Worauf es jetzt ankommt: Google nennt zahlende API-Kunden und AI-Ultra-Abonnenten als nächste Gruppen, aber ohne Termin. Eine dokumentierte Modell-ID und klare Dienstgrenzen würden Entwicklern Tests ihrer relevanten Aufgaben ermöglichen – auch dazu, ob sich die behauptete Ausgabe von einer Million Token praktisch nutzen lässt.

Wer Gemini 4 jetzt nutzen kann

Google zufolge gehören vertrauenswürdige Cyberabwehrkräfte und Tester aus dem Fairwind-Programmzu den ersten Nutzern. Fairwind ist ein Programm mit begrenztem Zugang für ausgewählte Google-Cloud-Kunden, Behörden und Sicherheitspartner. Google sagt, vertrauenswürdige Verteidiger erhielten Argon ohne die üblichen Cyber-Schutzvorkehrungen, um seine Abwehrfunktionen einzusetzen. Der erste Rollout ist ein kontrollierter Test für einen besonders sensiblen Anwendungsfall.

Google plant, den Zugang auf Entwickler, Unternehmen und Verbraucher auszuweiten, beginnend mit zahlenden API-Kunden und Google-AI-Ultra-Abonnenten. Einen Termin dafür gibt es nicht. Am 1. Oktober führte das Gemini-API-Modellverzeichnis von Google Gemini-3-Modelle, aber keine Kennung für Gemini 4 Argon. Auch auf der API-Preisseite gab es keinen Argon-Eintrag. Eine Anleitung für API-Aufrufe müsste daher einen Modellnamen und Zugangsweg erfinden, die Google nicht dokumentiert hat.

Trotzdem nannte Google im Ankündigungsbeitrag künftige Tokenpreise. Der Einführungspreis beträgt 2 US-Dollar je Million Eingabetoken und 10 US-Dollar je Million Ausgabetoken; zwischengespeicherte Eingaben kosten 95 Prozent weniger als der Eingabetarif. Nach der Einführungsphase sollen die Preise laut Google auf 4 und 20 US-Dollarsteigen. Wann die Einführungsphase endet, sagte das Unternehmen nicht. Das sind angekündigte Tarife, keine Preise einer heute verfügbaren Self-Service-API. Der Tokenpreis allein sagt zudem wenig über die Kosten einer langen Agentenaufgabe aus, solange Umfang von Schlussfolgerungen, Werkzeugnutzung und Ausgabe nicht feststeht.

Starke Ergebnisse mit erkennbaren Schwächen

Die unabhängige Argon-Auswertung von Vals AI weist 68.90% ± 0.97 im Vals Index aus; damit liegt Argon in der Tabelle unter 41 Modellen auf Platz eins. Auch bei Finance Agent v2 liegt es unter 73 Modellen vorn, mit 65.40% ± 0.32. Beim Vibe Code Bench belegt es mit 91.91% ± 1.90Platz zwei unter 106 Modellen, bei Code Migration mit 68.17% ± 4.35Platz zwei unter 71 und bei CyberBench v1.1 mit 77.86% ± 5.30Platz zwei unter 43 Modellen. Das ist ein starker Auftakt bei mehreren Aufgaben, macht Argon aber nicht zum besten Modell für jede einzelne.

Derselbe Evaluator setzt Argon bei Terminal-Bench 4.0 mit 57.58% ± 2.31auf Platz fünf unter 42 Modellen, bei MedScribe auf Platz 15 unter 106 und beim Computerbedienungs-Test CUA-bench mit 4.83%auf Platz sieben unter acht. Auch die gemessenen Kosten je Test unterscheiden sich stark: $15.68 für einen Vals-Index-Test und $193.78 für CUA-bench. Das sind Kosten der Evaluationsaufgaben, getrennt von Googles angekündigten Preisen je Million Token. Vals zufolge nutzen einige Agententests ein festes Harness, andere den nativen Agenten eines Modells; die gemeldeten Standardfehler erfassen keine Unterschiede bei Prompts, Seeds oder Einsatzkonfigurationen. Kleine Punktabstände sind vor diesem Hintergrund zu lesen.

Auch die Vergleichstabelle von Google DeepMind liefert Gegenbeispiele zu einem durchgängigen Vorsprung. Bei DeepSWE v1.1 liegt Argon vor GPT-6 Astra, 77.9% to 74.1%, bei FrontierSWE v2 aber dahinter, 55.0% to 65.5%ebenso bei Terminal-Bench Science, 57.6% to 68.1%. Claude Opus 5.5 liegt bei Terminal-Bench 4.0 vor Argon, 66.4% to 57.4%und auch bei PostTrainBench, 49.3% to 45.3%. Im Offline-Teilbereich OSWorld-2.0 der Tabelle erreicht Astra 72.6% gegenüber 69.2%bei Argon. Die Vergleiche beruhen auf der Auswahl und den Testaufbauten von Google; sie ersetzen keine Kundentests in einem dokumentierten öffentlichen Dienst.

Google zufolge kann Argon in einem Durchlauf bis zu eine Million Ausgabetokenerzeugen, nach zuvor höchstens 64.000 Token. Vals nennt ein Kontextfenster von einer Million Token , begrenzte die Ausgabe in der Argon-Bewertung aber auf höchstens 262.144 Token. Diese Einstellung legt keine feste Grenze für ein künftiges Google-Produkt fest. Sie bedeutet jedoch, dass die öffentlichen Vals-Ergebnisse keine vollständige Ausgabe von einer Million Token zeigen und Google noch keinen öffentlichen API-Eintrag mit dem Ausgabelimit für gewöhnliche Entwickler veröffentlicht hat.

Interne Anwendungen und Sicherheitsversprechen brauchen eigene Belege

Google beschreibt, wie Argon-Agenten bei der Migration von C/C++ zu Rust, einer Subroutine für Quantencomputing und der Speicheroptimierung in Rechenzentren halfen. Ein Satz von Speicheränderungen habe nach der Einführung mehr als 300 TiB freigemacht. Außerdem habe der Partner Wiz mit Argon eine kritische Schwachstelle in Gesundheitssoftware gefunden. Das sind Darstellungen von Google zu internen oder Partnerarbeiten; die Startunterlagen enthalten nicht genug unabhängige Details, um diese Ergebnisse zu prüfen oder zu reproduzieren. Große Rust-Umschreibungen würden vor dem Produktiveinsatz weiterhin automatisiert und manuell geprüft, so Google.

Zur Sicherheit nennt Google ein Training zur Ablehnung schädlicher Anfragen, Schutz gegen indirekte Prompt-Injection, die Überwachung von Schlussfolgerungen und Handlungen des Modells auf Verhalten außerhalb der Nutzerabsicht sowie eine stärkere Isolation von Testumgebungen. Die Behauptung, Argon sei Googles widerstandsfähigstes Modell gegen indirekte Prompt-Injection, stammt vom Anbieter. Laut Google erhält die erste Cybergruppe Zugang ohne die üblichen Cyber-Schutzvorkehrungen. Damit werden Umfang und Überwachung des Zugangs bei einer Ausweitung besonders wichtig.

Die ersten Hinweise zum Nutzen im Alltag widersprechen sich. Axios berichtete , Bloomberg habe sich auf anonyme Quellen berufen und berichtet, einige Google-Beschäftigte hätten Argons interne Leistung als schwach eingeschätzt. Axios berichtete auch, Google habe Bloomberg gesagt, die Darstellung sei unzutreffend. Google erklärte Axios, Beschäftigte hätten das Modell für anspruchsvolle Programmier- und Rechercheaufgaben genutzt. Keine der Darstellungen klärt die Leistung einer öffentlichen Version. Nützlich wären nun Zugang mit dokumentierten Einstellungen sowie überprüfbare Aufgabenergebnisse und Kosten.