Google a annoncé Gemini 4 Argon le 30 septembre, avec de bons scores en travail de connaissance et en programmation, une limite annoncée d’un million de jetons en sortie et les tarifs d’une future version de l’API. Google déploie d’abord le modèle auprès d’un groupe restreint de défenseurs et testeurs en cybersécurité de confiance. L’entreprise n’a communiqué ni identifiant de modèle public pour les développeurs ni date d’accès pour les clients de l’API payante ou les abonnés à Google AI Ultra. l’annonce de Google et le catalogue des modèles de l’API Gemini illustrent l’écart entre le lancement et l’accès pour la plupart des lecteurs.
Le changement majeur
- Ce qui change : Google a confié un nouveau modèle de pointe à certains défenseurs en cybersécurité, alors que la plupart des développeurs et abonnés ne peuvent toujours pas y accéder. Ses principales promesses de capacités et de tarifs sont publiques, mais l’API ne l’est pas encore.
- Pourquoi c’est important : Les évaluations indépendantes de Vals AI placent Argon premier en connaissances générales et dans un test d’agent financier : les équipes qui comparent les modèles disposent donc d’un nouveau candidat sérieux. Les résultats varient selon les tâches et le déploiement reste restreint ; les performances et les coûts dans leurs propres processus restent donc à établir.
- Les points à suivre : Google a désigné les clients de l’API payante et les abonnés AI Ultra comme prochains groupes, sans préciser de date. Un identifiant de modèle documenté et les limites du service permettront aux développeurs de tester les tâches qui comptent pour eux, notamment de vérifier si le million de jetons de sortie annoncé est utilisable en pratique.
Qui peut utiliser Gemini 4 aujourd’hui
Selon Google, les premiers utilisateurs sont des défenseurs et testeurs en cybersécurité de confiance participant au programme Fairwind. Fairwind est un programme à accès limité destiné à certains clients de Google Cloud, organismes publics et partenaires de sécurité. Google indique que les défenseurs de confiance peuvent utiliser Argon sans les protections habituelles en cybersécurité afin d’exploiter ses capacités défensives. Ce lancement initial est un test contrôlé d’un cas d’usage particulièrement sensible.
Google prévoit d’élargir l’accès aux développeurs, entreprises et consommateurs, en commençant par les clients de l’API payante et les abonnés à Google AI Ultra. Aucune date n’a été annoncée. Au 1er octobre, l’ annuaire des modèles de l’API Gemini de Google répertoriait des modèles Gemini 3, mais aucun identifiant Gemini 4 Argon. Sa page de tarifs de l’API ne mentionnait pas non plus Argon. Un guide d’appel à l’API devrait donc inventer un nom de modèle et un mode d’accès que Google n’a pas documentés.
L’entreprise a pourtant indiqué les futurs tarifs par jeton dans son annonce de lancement. Le tarif de lancement est de 2 $ par million de jetons d’entrée et 10 $ par million de jetons de sortie, avec une remise de 95 % sur le tarif d’entrée pour les entrées mises en cache. Après la période de lancement, Google indique que les tarifs passeront à 4 $ et 20 $. La durée de cette période n’a pas été précisée. Ce sont des tarifs annoncés, et non le prix d’une API en libre-service disponible aujourd’hui. Le tarif par jeton ne suffit pas non plus à estimer le coût d’une longue tâche d’agent sans connaître le raisonnement, les outils et le volume de sortie qu’elle implique.
De bons scores, avec des faiblesses visibles
L’évaluation indépendante d’Argon par Vals AI indique 68.90% ± 0.97 sur le Vals Index, à la première place des 41 modèles du tableau. Argon arrive aussi premier sur 73 modèles au Finance Agent v2, avec 65.40% ± 0.32. Il se classe deuxième sur 106 au Vibe Code Bench, avec 91.91% ± 1.90; deuxième sur 71 en Code Migration, avec 68.17% ± 4.35; et deuxième sur 43 au CyberBench v1.1, avec 77.86% ± 5.30. Ces résultats témoignent d’un bon démarrage sur plusieurs tâches, sans faire d’Argon le meilleur modèle pour chacune.
Le même évaluateur classe Argon cinquième sur 42 au Terminal-Bench 4.0, avec 57.58% ± 2.31, quinzième sur 106 à MedScribe et septième sur huit à son test d’utilisation d’ordinateur CUA-bench, avec 4.83%. Le coût mesuré par test varie lui aussi fortement : $15.68 pour un test Vals Index et $193.78 pour CUA-bench. Ce sont les coûts des tâches évaluées, distincts des tarifs annoncés par Google par million de jetons. Vals précise que certaines évaluations d’agents utilisent un environnement fixe, tandis que d’autres utilisent l’agent natif du modèle ; les erreurs-types publiées ne couvrent pas les variations entre les prompts, les graines aléatoires ou les paramètres de déploiement. Un faible écart de score doit être interprété dans ce contexte.
Le tableau comparatif de Google DeepMind apporte d’autres contre-exemples à toute affirmation de domination générale. Argon y devance GPT-6 Astra sur DeepSWE v1.1, 77.9% to 74.1%, mais se classe derrière Astra sur FrontierSWE v2, 55.0% to 65.5%et Terminal-Bench Science, 57.6% to 68.1%. Claude Opus 5.5 devance Argon sur Terminal-Bench 4.0, 66.4% to 57.4%et PostTrainBench, 49.3% to 45.3%. Dans le sous-ensemble hors ligne OSWorld-2.0 du tableau, Astra obtient 72.6% contre 69.2%pour Argon. Ces comparaisons reposent sur la sélection de Google et ses protocoles de test déclarés ; elles ne remplacent pas les essais des clients sur un service public documenté.
Google affirme qu’Argon peut générer jusqu’à un million de jetons de sortie en une seule trajectoire, contre une limite antérieure de 64 000 jetons. Vals indique une fenêtre de contexte d’un million de jetons, mais a limité la sortie de son évaluation d’Argon à 262 144 jetons. Ce paramètre ne fixe pas une limite définitive pour un futur produit Google. Il signifie toutefois que les résultats publics de Vals ne démontrent pas une génération complète d’un million de jetons et que Google n’a pas encore publié de fiche d’API précisant la limite de sortie proposée aux développeurs ordinaires.
Les usages internes et les promesses de sécurité exigent des preuves distinctes
Google décrit des agents Argon ayant contribué à des migrations de code C/C++ vers Rust, à un sous-programme d’informatique quantique et à l’optimisation de la mémoire de centres de données. L’entreprise affirme qu’un ensemble de changements mémoire a libéré plus de 300 TiB après son déploiement. Elle indique aussi que son partenaire Wiz a découvert avec Argon une vulnérabilité critique touchant un logiciel de santé. Ce sont des récits de Google sur des travaux internes ou partenaires ; les documents de lancement ne donnent pas assez de détails indépendants pour vérifier ou reproduire ces résultats. Google affirme que les grandes réécritures en Rust font toujours l’objet de contrôles automatisés et manuels avant leur mise en production.
En matière de sécurité, Google décrit un entraînement au refus des demandes malveillantes, des protections contre l’injection indirecte de prompt, la surveillance du raisonnement et des actions du modèle pour détecter les écarts par rapport à l’intention de l’utilisateur, ainsi qu’un cloisonnement renforcé des environnements d’évaluation. L’affirmation selon laquelle Argon serait son modèle le plus résistant à l’injection indirecte de prompt est une déclaration du fournisseur. Selon Google, le premier groupe cyber reçoit aussi l’accès sans les protections habituelles, ce qui rend particulièrement importants le périmètre d’accès et la surveillance à mesure de l’élargissement.
Les premiers éléments sur l’utilité au quotidien sont contradictoires. Axios a rapporté que Bloomberg, citant des sources anonymes, avait écrit que certains employés de Google jugeaient les performances internes d’Argon insuffisantes ; Axios a également rapporté que Google avait dit à Bloomberg que cette information était inexacte. Google a déclaré à Axios que ses employés avaient utilisé le modèle pour des tâches difficiles de programmation et de recherche. Aucun de ces récits ne tranche sur les performances d’une version publique. Les prochaines preuves utiles porteront sur un accès aux paramètres documentés, avec des résultats de tâches et des coûts que d’autres pourront examiner.



