Google anunció Gemini 4 Argon el 30 de septiembre, con puntuaciones sólidas en trabajo de conocimiento y programación, un límite declarado de un millón de tokens de salida y precios para una futura versión de la API. Google está desplegando el modelo primero a un grupo de defensores y probadores de ciberseguridad de confianza. No ha publicado un identificador de modelo para el público ni una fecha para que los clientes de API de pago o los suscriptores de Google AI Ultra puedan usarlo. el anuncio de Google y el catálogo de modelos de Gemini API muestran la brecha entre el lanzamiento y el acceso para la mayoría de los lectores.
El gran cambio
- Qué cambió: Google ha puesto un nuevo modelo de vanguardia en manos de algunos defensores de la ciberseguridad, mientras que la mayoría de los desarrolladores y suscriptores aún no pueden acceder a él. Sus principales afirmaciones sobre capacidad y precio ya son públicas, aunque la API todavía no se ha lanzado.
- Por qué importa: Las evaluaciones independientes de Vals AI sitúan a Argon en primer lugar en conocimiento general y en una prueba de agentes financieros, por lo que los equipos que comparan modelos tienen un nuevo candidato serio. Los resultados dispares entre tareas y el despliegue restringido dejan sin resolver su rendimiento y costo en los flujos de trabajo de cada equipo.
- Qué conviene seguir: Google ha señalado a los clientes de API de pago y a los suscriptores de AI Ultra como los próximos grupos, pero no ha dado una fecha. Un identificador de modelo documentado y límites del servicio permitirán a los desarrolladores probar las tareas que les importan, incluida la posibilidad de usar en la práctica el millón de tokens de salida anunciado.
Quién puede usar Gemini 4 ahora
Google dice que los primeros usuarios son defensores y probadores de ciberseguridad de confianza que participan en su programa Fairwind. Fairwind es un programa de acceso limitado para determinados clientes de Google Cloud, organismos públicos y socios de seguridad. Google afirma que ofrece Argon a defensores de confianza sin las protecciones de ciberseguridad habituales, para que aprovechen sus capacidades defensivas. Este lanzamiento inicial es una prueba controlada de un caso de uso especialmente delicado.
Google planea ampliar el acceso a desarrolladores, empresas y consumidores, empezando por los clientes de API de pago y los suscriptores de Google AI Ultra. No ha publicado una fecha para ese paso. Al 1 de octubre, el directorio de modelos de Gemini API de Google incluía modelos Gemini 3, pero ningún identificador de Gemini 4 Argon. La página de precios de la API tampoco mostraba una fila para Argon. Por eso, una guía para hacer llamadas a la API tendría que inventar un nombre de modelo y una vía de acceso que Google no ha documentado.
Aun así, la empresa indicó tarifas futuras por token en su publicación de lanzamiento. El precio inicial es de 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida por millón de tokens de entrada almacenados en caché, con una tarifa un 95 % inferior a la de entrada. Tras el período inicial, Google afirma que las tarifas subirán a 4 y 20 dólares. No indicó cuándo terminará el período inicial. Son tarifas anunciadas, no precios de una API de autoservicio disponible hoy. El precio por token tampoco dice mucho sobre el costo de una tarea larga de agente hasta que se conozcan el razonamiento, el uso de herramientas y la cantidad de salida que requiere.
Puntuaciones sólidas, con puntos débiles visibles
Evaluación independiente de Argon por Vals AI informa un 68.90% ± 0.97 en el índice Vals, donde ocupa el primer puesto entre 41 modelos de su tabla. Vals lo sitúa primero entre 73 modelos en Finance Agent v2, con un resultado de 65.40% ± 0.32. En Vibe Code Bench ocupa el segundo lugar entre 106, con 91.91% ± 1.90; en Code Migration, el segundo entre 71, con 68.17% ± 4.35; y en CyberBench v1.1, el segundo entre 43, con 77.86% ± 5.30. Los resultados muestran un comienzo sólido en varias tareas, pero no convierten a Argon en el mejor modelo para todas.
El mismo evaluador sitúa a Argon en quinto lugar entre 42 modelos en Terminal-Bench 4.0, con 57.58% ± 2.31, en el puesto 15 de 106 en MedScribe y en el séptimo de ocho en la prueba de uso del ordenador CUA-bench, con 4.83%. El costo medido por prueba también varía mucho: $15.68 por una prueba de Vals Index y $193.78 por CUA-bench. Son costos de las tareas del evaluador, distintos de los precios anunciados por Google por millón de tokens. Vals explica que algunas evaluaciones de agentes usan un entorno de prueba fijo y otras el agente nativo del modelo; los errores estándar publicados no reflejan las variaciones entre instrucciones, semillas o configuraciones de despliegue. Una diferencia pequeña en la puntuación debe interpretarse teniendo eso en cuenta.
La propia tabla comparativa de Google DeepMind ofrece más contraejemplos a cualquier afirmación de que Argon lidera en todos los ámbitos. Muestra que Argon supera a GPT-6 Astra en DeepSWE v1.1, 77.9% to 74.1%, pero queda por detrás de Astra en FrontierSWE v2, 55.0% to 65.5% y Terminal-Bench Science, 57.6% to 68.1%. Claude Opus 5.5 supera a Argon en Terminal-Bench 4.0, 66.4% to 57.4% y PostTrainBench, 49.3% to 45.3%. En el subconjunto sin conexión OSWorld-2.0 de la tabla, Astra obtiene 72.6% frente al 69.2%. Estas comparaciones se basan en la selección y las configuraciones de pruebas publicadas por Google; no sustituyen las pruebas de clientes en un servicio público documentado.
Google afirma que Argon puede generar hasta un millón de tokens de salida en una sola trayectoria, frente al límite anterior de 64.000 tokens. Vals indica una ventana de contexto de un millón de tokens, pero configuró su evaluación de Argon con una salida máxima de 262.144 tokens. Esa configuración no establece un límite estricto para el producto futuro de Google. Sí significa que los resultados públicos de Vals no demuestran una generación completa de un millón de tokens y que Google aún no ha publicado una ficha de API que aclare el límite de salida disponible para los desarrolladores en general.
Los usos internos y las afirmaciones de seguridad necesitan pruebas propias
Google describe a agentes de Argon que ayudaron a migrar código de C/C++ a Rust, crear una subrutina de computación cuántica y optimizar la memoria de centros de datos. Afirma que, tras desplegar un conjunto de cambios de memoria, liberó más de 300 TiB. También dice que su socio Wiz encontró con Argon una vulnerabilidad crítica en software sanitario. Son relatos de Google sobre trabajos internos o de sus socios; los materiales de lanzamiento no aportan suficiente detalle independiente para verificar o reproducir esos resultados. Google afirma que las grandes reescrituras en Rust siguen pasando por revisiones automáticas y manuales antes de llegar a producción.
En materia de seguridad, Google describe entrenamiento para rechazar solicitudes dañinas, defensas contra la inyección indirecta de instrucciones, supervisión del razonamiento y las acciones del modelo para detectar conductas ajenas a la intención del usuario, y un mayor aislamiento de los entornos de evaluación. La afirmación de que Argon es su modelo más resistente a la inyección indirecta es una declaración del proveedor. Según Google, el grupo inicial de ciberseguridad también accede al modelo sin las protecciones habituales, lo que vuelve especialmente importantes el alcance del acceso y su supervisión a medida que se amplíe.
Las primeras pruebas ofrecen indicios contradictorios sobre su utilidad cotidiana. Axios informó que Bloomberg, citando fuentes anónimas, dijo que algunos empleados de Google consideraban deficiente el rendimiento interno de Argon; Axios también informó que Google dijo a Bloomberg que esa versión era inexacta. Google declaró a Axios que sus empleados habían utilizado el modelo para tareas difíciles de programación e investigación. Ninguna de las dos versiones aclara cómo rendirá una versión pública. Lo útil ahora será contar con acceso bajo condiciones documentadas, junto con resultados de tareas y costos que otros puedan examinar.



