AI-translated from English; not yet reviewed by a fluent editor.
# Gemini 4 Argon startet für Cybersecurity-Tester; API-Zugang weiter ohne Termin
> Google hat Gemini 4 Argon für vertrauenswürdige Cybersecurity-Tester angekündigt. Für den geplanten Zugang über die kostenpflichtige API und AI Ultra gibt es noch keinen Termin. Erste unabhängige Bewertungen von Vals AI sehen Argon bei einigen Aufgaben vorn, bei anderen hinten; der öffentliche API-Katalog enthält keinen Argon-Endpunkt.
By BIG CHANGE Editorial
Published: 2026-09-30T23:56:07.213Z
Updated: 2026-10-01T02:16:11.971Z
Canonical: https://bigchange.ai/blog/gemini-4-argon-restricted-access-independent-benchmarks

AI-generated editorial illustration by BIG CHANGE.
Google hat **Gemini 4 Argon** am 30. September vorgestellt und dabei starke Ergebnisse bei Wissensarbeit und Programmierung, ein behauptetes Limit von einer Million Ausgabetoken sowie Preise für eine künftige API-Version genannt. Zunächst stellt Google das Modell einer kleinen Gruppe vertrauenswürdiger Cyberabwehrkräfte und Tester bereit. Eine öffentliche Modell-ID für Entwickler oder einen Termin für zahlende API-Kunden und Google-AI-Ultra-Abonnenten hat das Unternehmen nicht genannt. [die Google-Ankündigung](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/) und der [Gemini-API-Modellkatalog](https://ai.google.dev/gemini-api/docs/models) zeigen die Lücke zwischen der Vorstellung und dem Zugang für die meisten Leser.
## Die große Veränderung
- **Was sich geändert hat:** Google hat ein neues Spitzenmodell ausgewählten Cyberabwehrkräften anvertraut, während die meisten Entwickler und Abonnenten weiter keinen Zugang haben. Die wichtigsten Leistungs- und Preisangaben sind öffentlich, eine öffentliche API gibt es aber noch nicht.
- **Warum das wichtig ist:** Unabhängige Tests von Vals AI setzen Argon bei allgemeiner Wissensarbeit und einem Finanzagenten-Test auf Platz eins. Teams, die Modelle vergleichen, haben damit einen ernst zu nehmenden neuen Kandidaten. Die uneinheitlichen Ergebnisse und der begrenzte Rollout lassen Leistung und Kosten in den eigenen Arbeitsabläufen jedoch offen.
- **Worauf es jetzt ankommt:** Google nennt zahlende API-Kunden und AI-Ultra-Abonnenten als nächste Gruppen, aber ohne Termin. Eine dokumentierte Modell-ID und klare Dienstgrenzen würden Entwicklern Tests ihrer relevanten Aufgaben ermöglichen – auch dazu, ob sich die behauptete Ausgabe von einer Million Token praktisch nutzen lässt.
## Wer Gemini 4 jetzt nutzen kann
Google zufolge gehören vertrauenswürdige Cyberabwehrkräfte und Tester aus dem [Fairwind-Programm](https://blog.google/innovation-and-ai/technology/safety-security/fairwind-program/)zu den ersten Nutzern. Fairwind ist ein Programm mit begrenztem Zugang für ausgewählte Google-Cloud-Kunden, Behörden und Sicherheitspartner. Google sagt, vertrauenswürdige Verteidiger erhielten Argon ohne die üblichen Cyber-Schutzvorkehrungen, um seine Abwehrfunktionen einzusetzen. Der erste Rollout ist ein kontrollierter Test für einen besonders sensiblen Anwendungsfall.
Google plant, den Zugang auf Entwickler, Unternehmen und Verbraucher auszuweiten, beginnend mit zahlenden API-Kunden und Google-AI-Ultra-Abonnenten. Einen Termin dafür gibt es nicht. Am 1. Oktober führte das [Gemini-API-Modellverzeichnis](https://ai.google.dev/gemini-api/docs/models) von Google Gemini-3-Modelle, aber keine Kennung für Gemini 4 Argon. Auch auf der [API-Preisseite](https://ai.google.dev/gemini-api/docs/pricing) gab es keinen Argon-Eintrag. Eine Anleitung für API-Aufrufe müsste daher einen Modellnamen und Zugangsweg erfinden, die Google nicht dokumentiert hat.
Trotzdem nannte Google im Ankündigungsbeitrag künftige Tokenpreise. Der Einführungspreis beträgt **2 US-Dollar je Million Eingabetoken und 10 US-Dollar je Million Ausgabetoken**; zwischengespeicherte Eingaben kosten 95 Prozent weniger als der Eingabetarif. Nach der Einführungsphase sollen die Preise laut Google auf **4 und 20 US-Dollar**steigen. Wann die Einführungsphase endet, sagte das Unternehmen nicht. Das sind angekündigte Tarife, keine Preise einer heute verfügbaren Self-Service-API. Der Tokenpreis allein sagt zudem wenig über die Kosten einer langen Agentenaufgabe aus, solange Umfang von Schlussfolgerungen, Werkzeugnutzung und Ausgabe nicht feststeht.
## Starke Ergebnisse mit erkennbaren Schwächen
[Die unabhängige Argon-Auswertung von Vals AI](https://www.vals.ai/models/google_gemini-4-argon) weist **68.90% ± 0.97** im Vals Index aus; damit liegt Argon in der Tabelle unter 41 Modellen auf Platz eins. Auch bei Finance Agent v2 liegt es unter 73 Modellen vorn, mit **65.40% ± 0.32**. Beim Vibe Code Bench belegt es mit **91.91% ± 1.90**Platz zwei unter 106 Modellen, bei Code Migration mit **68.17% ± 4.35**Platz zwei unter 71 und bei CyberBench v1.1 mit **77.86% ± 5.30**Platz zwei unter 43 Modellen. Das ist ein starker Auftakt bei mehreren Aufgaben, macht Argon aber nicht zum besten Modell für jede einzelne.
Derselbe Evaluator setzt Argon bei Terminal-Bench 4.0 mit **57.58% ± 2.31**auf Platz fünf unter 42 Modellen, bei MedScribe auf Platz 15 unter 106 und beim Computerbedienungs-Test CUA-bench mit **4.83%**auf Platz sieben unter acht. Auch die gemessenen Kosten je Test unterscheiden sich stark: **$15.68** für einen Vals-Index-Test und **$193.78** für CUA-bench. Das sind Kosten der Evaluationsaufgaben, getrennt von Googles angekündigten Preisen je Million Token. Vals zufolge nutzen einige Agententests ein festes Harness, andere den nativen Agenten eines Modells; die gemeldeten Standardfehler erfassen keine Unterschiede bei Prompts, Seeds oder Einsatzkonfigurationen. Kleine Punktabstände sind vor diesem Hintergrund zu lesen.
[Auch die Vergleichstabelle von Google DeepMind](https://deepmind.google/models/gemini/) liefert Gegenbeispiele zu einem durchgängigen Vorsprung. Bei DeepSWE v1.1 liegt Argon vor GPT-6 Astra, **77.9% to 74.1%**, bei FrontierSWE v2 aber dahinter, **55.0% to 65.5%**ebenso bei Terminal-Bench Science, **57.6% to 68.1%**. Claude Opus 5.5 liegt bei Terminal-Bench 4.0 vor Argon, **66.4% to 57.4%**und auch bei PostTrainBench, **49.3% to 45.3%**. Im Offline-Teilbereich OSWorld-2.0 der Tabelle erreicht Astra **72.6%** gegenüber **69.2%**bei Argon. Die Vergleiche beruhen auf der Auswahl und den Testaufbauten von Google; sie ersetzen keine Kundentests in einem dokumentierten öffentlichen Dienst.
Google zufolge kann Argon in einem Durchlauf bis zu **eine Million Ausgabetoken**erzeugen, nach zuvor höchstens 64.000 Token. Vals nennt ein Kontextfenster von einer Million *Token* , begrenzte die Ausgabe in der Argon-Bewertung aber auf höchstens **262.144 Token**. Diese Einstellung legt keine feste Grenze für ein künftiges Google-Produkt fest. Sie bedeutet jedoch, dass die öffentlichen Vals-Ergebnisse keine vollständige Ausgabe von einer Million Token zeigen und Google noch keinen öffentlichen API-Eintrag mit dem Ausgabelimit für gewöhnliche Entwickler veröffentlicht hat.
## Interne Anwendungen und Sicherheitsversprechen brauchen eigene Belege
Google beschreibt, wie Argon-Agenten bei der Migration von C/C++ zu Rust, einer Subroutine für Quantencomputing und der Speicheroptimierung in Rechenzentren halfen. Ein Satz von Speicheränderungen habe nach der Einführung mehr als 300 TiB freigemacht. Außerdem habe der Partner Wiz mit Argon eine kritische Schwachstelle in Gesundheitssoftware gefunden. Das sind Darstellungen von Google zu internen oder Partnerarbeiten; die Startunterlagen enthalten nicht genug unabhängige Details, um diese Ergebnisse zu prüfen oder zu reproduzieren. Große Rust-Umschreibungen würden vor dem Produktiveinsatz weiterhin automatisiert und manuell geprüft, so Google.
Zur Sicherheit nennt Google ein Training zur Ablehnung schädlicher Anfragen, Schutz gegen indirekte Prompt-Injection, die Überwachung von Schlussfolgerungen und Handlungen des Modells auf Verhalten außerhalb der Nutzerabsicht sowie eine stärkere Isolation von Testumgebungen. Die Behauptung, Argon sei Googles widerstandsfähigstes Modell gegen indirekte Prompt-Injection, stammt vom Anbieter. Laut Google erhält die erste Cybergruppe Zugang ohne die üblichen Cyber-Schutzvorkehrungen. Damit werden Umfang und Überwachung des Zugangs bei einer Ausweitung besonders wichtig.
Die ersten Hinweise zum Nutzen im Alltag widersprechen sich. [Axios berichtete](https://www.axios.com/2026/09/30/google-gemini-4) , Bloomberg habe sich auf anonyme Quellen berufen und berichtet, einige Google-Beschäftigte hätten Argons interne Leistung als schwach eingeschätzt. Axios berichtete auch, Google habe Bloomberg gesagt, die Darstellung sei unzutreffend. Google erklärte Axios, Beschäftigte hätten das Modell für anspruchsvolle Programmier- und Rechercheaufgaben genutzt. Keine der Darstellungen klärt die Leistung einer öffentlichen Version. Nützlich wären nun Zugang mit dokumentierten Einstellungen sowie überprüfbare Aufgabenergebnisse und Kosten.
## Sources
- [Googles Ankündigung zu Gemini 4 Argon](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/) — Offizielle Vorstellung, Zugangsplan, künftige Preise, behauptetes Ausgabelimit, interne Projekte und Sicherheitsangaben. Interne Ergebnisse und Sicherheitsvergleiche sind Anbieterangaben.
- [Gemini-Modellseite von Google DeepMind](https://deepmind.google/models/gemini/) — Von Google ausgewählte direkte Vergleichstabelle mit Argons Stärken und Schwächen; geprüft am 1. Oktober.
- [Gemini-API-Modellkatalog](https://ai.google.dev/gemini-api/docs/models) — Öffentlicher Modellkatalog für Entwickler; bei der Prüfung ohne Gemini-4-Argon-ID. Das schließt privaten Zugang nicht aus.
- [Preise der Gemini API](https://ai.google.dev/gemini-api/docs/pricing) — Öffentliche Preisseite für Entwickler; bei der Prüfung ohne Argon-Eintrag. Der Ankündigungsbeitrag nennt künftige Tarife.
- [Vals-AI-Bewertung von Gemini 4 Argon](https://www.vals.ai/models/google_gemini-4-argon) — Benchmarkscores, Platzierungen, Aufgabenkosten und Testkonfiguration des unabhängigen Evaluators, einschließlich maximal 262.144 Ausgabetoken.
- [Methodik der Vals-AI-Auswertung](https://www.vals.ai/methodology) — Erläutert Aufgabendesign, Unterschiede bei Agenten-Harnesses und was die Standardfehler erfassen und auslassen.
- [Googles Fairwind-Programm](https://blog.google/innovation-and-ai/technology/safety-security/fairwind-program/) — Googles Hintergrund zum begrenzten Cyberabwehrprogramm und den vorgesehenen Partnern.
- [Axios-Bericht zum Start](https://www.axios.com/2026/09/30/google-gemini-4) — Unabhängiger Kontext zu Zugang und Googles Stellungnahme; mit der von Bloomberg berichteten Skepsis anonymer Beschäftigter und Googles Dementi.
- [Ars-Technica-Bericht zum Start](https://arstechnica.com/google/2026/09/google-announces-gemini-4-argon-ai-model-but-you-cant-use-it-yet/) — Unabhängiger Startkontext; interne Anwendungen bleiben Angaben von Google.
Der Newsletter von BIG CHANGE
Das große Ganze. In Ihrem Tempo.
Aktuelle Storys über KI und Robotik, beobachtenswerte Veränderungen und praktische Ideen zur Anwendung. Wählen Sie ein tägliches Briefing, eine wöchentliche Zusammenfassung oder eine monatliche Perspektive.
Versand um 09:00 Uhr Belgrader Zeit: täglich, montags oder am ersten Tag des Monats. Ihre erste Ausgabe kommt nach Ihrer Bestätigung zum nächsten planmäßigen Versandzeitpunkt.
Ihr Datenschutz, Ihre Entscheidung.
Notwendiger Speicher schützt die Website und merkt sich Ihre Einstellungen. Optionales Google Analytics bleibt deaktiviert, bis Sie es erlauben. Sie können alle Geschichten auch nur mit notwendigem Speicher lesen. Datenschutzdetails