EL MUNDO NO SE DETIENE.RSS
BIG CHANGE.

Edición en Markdown

AI-translated from English; not yet reviewed by a fluent editor.

# Gemini 4 Argon llega a los probadores de ciberseguridad; la API sigue sin fecha

> Google anunció Gemini 4 Argon para un grupo de confianza de especialistas en ciberseguridad. El acceso previsto a la API de pago y a AI Ultra aún no tiene fecha. Las primeras evaluaciones independientes de Vals AI lo sitúan a la cabeza en algunas tareas y por detrás en otras; el catálogo público de API no incluye un punto de acceso para Argon.

By BIG CHANGE Editorial

Published: 2026-09-30T23:56:07.213Z
Updated: 2026-10-01T02:16:11.971Z
Canonical: https://bigchange.ai/blog/gemini-4-argon-restricted-access-independent-benchmarks

![Charcoal illustration of a sculptural numeral 4 on warm ivory, with a restrained orange edge detail.](https://bigchange.ai/api/media/file/gemini-4-argon-number-4-hero-v2.png)
AI-generated editorial illustration by BIG CHANGE.

Google anunció **Gemini 4 Argon** el 30 de septiembre, con puntuaciones sólidas en trabajo de conocimiento y programación, un límite declarado de un millón de tokens de salida y precios para una futura versión de la API. Google está desplegando el modelo primero a un grupo de defensores y probadores de ciberseguridad de confianza. No ha publicado un identificador de modelo para el público ni una fecha para que los clientes de API de pago o los suscriptores de Google AI Ultra puedan usarlo. [el anuncio de Google](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/) y el [catálogo de modelos de Gemini API](https://ai.google.dev/gemini-api/docs/models) muestran la brecha entre el lanzamiento y el acceso para la mayoría de los lectores.

## El gran cambio

- **Qué cambió:** Google ha puesto un nuevo modelo de vanguardia en manos de algunos defensores de la ciberseguridad, mientras que la mayoría de los desarrolladores y suscriptores aún no pueden acceder a él. Sus principales afirmaciones sobre capacidad y precio ya son públicas, aunque la API todavía no se ha lanzado.
- **Por qué importa:** Las evaluaciones independientes de Vals AI sitúan a Argon en primer lugar en conocimiento general y en una prueba de agentes financieros, por lo que los equipos que comparan modelos tienen un nuevo candidato serio. Los resultados dispares entre tareas y el despliegue restringido dejan sin resolver su rendimiento y costo en los flujos de trabajo de cada equipo.
- **Qué conviene seguir:** Google ha señalado a los clientes de API de pago y a los suscriptores de AI Ultra como los próximos grupos, pero no ha dado una fecha. Un identificador de modelo documentado y límites del servicio permitirán a los desarrolladores probar las tareas que les importan, incluida la posibilidad de usar en la práctica el millón de tokens de salida anunciado.

## Quién puede usar Gemini 4 ahora

Google dice que los primeros usuarios son defensores y probadores de ciberseguridad de confianza que participan en su [programa Fairwind](https://blog.google/innovation-and-ai/technology/safety-security/fairwind-program/). Fairwind es un programa de acceso limitado para determinados clientes de Google Cloud, organismos públicos y socios de seguridad. Google afirma que ofrece Argon a defensores de confianza sin las protecciones de ciberseguridad habituales, para que aprovechen sus capacidades defensivas. Este lanzamiento inicial es una prueba controlada de un caso de uso especialmente delicado.

Google planea ampliar el acceso a desarrolladores, empresas y consumidores, empezando por los clientes de API de pago y los suscriptores de Google AI Ultra. No ha publicado una fecha para ese paso. Al 1 de octubre, el [directorio de modelos de Gemini API](https://ai.google.dev/gemini-api/docs/models) de Google incluía modelos Gemini 3, pero ningún identificador de Gemini 4 Argon. La [página de precios de la API](https://ai.google.dev/gemini-api/docs/pricing) tampoco mostraba una fila para Argon. Por eso, una guía para hacer llamadas a la API tendría que inventar un nombre de modelo y una vía de acceso que Google no ha documentado.

Aun así, la empresa indicó tarifas futuras por token en su publicación de lanzamiento. El precio inicial es de **2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida** por millón de tokens de entrada almacenados en caché, con una tarifa un 95 % inferior a la de entrada. Tras el período inicial, Google afirma que las tarifas subirán a **4 y 20 dólares**. No indicó cuándo terminará el período inicial. Son tarifas anunciadas, no precios de una API de autoservicio disponible hoy. El precio por token tampoco dice mucho sobre el costo de una tarea larga de agente hasta que se conozcan el razonamiento, el uso de herramientas y la cantidad de salida que requiere.

## Puntuaciones sólidas, con puntos débiles visibles

[Evaluación independiente de Argon por Vals AI](https://www.vals.ai/models/google_gemini-4-argon) informa un **68.90% ± 0.97** en el índice Vals, donde ocupa el primer puesto entre 41 modelos de su tabla. Vals lo sitúa primero entre 73 modelos en Finance Agent v2, con un resultado de **65.40% ± 0.32**. En Vibe Code Bench ocupa el segundo lugar entre 106, con **91.91% ± 1.90**; en Code Migration, el segundo entre 71, con **68.17% ± 4.35**; y en CyberBench v1.1, el segundo entre 43, con **77.86% ± 5.30**. Los resultados muestran un comienzo sólido en varias tareas, pero no convierten a Argon en el mejor modelo para todas.

El mismo evaluador sitúa a Argon en quinto lugar entre 42 modelos en Terminal-Bench 4.0, con **57.58% ± 2.31**, en el puesto 15 de 106 en MedScribe y en el séptimo de ocho en la prueba de uso del ordenador CUA-bench, con **4.83%**. El costo medido por prueba también varía mucho: **$15.68** por una prueba de Vals Index y **$193.78** por CUA-bench. Son costos de las tareas del evaluador, distintos de los precios anunciados por Google por millón de tokens. Vals explica que algunas evaluaciones de agentes usan un entorno de prueba fijo y otras el agente nativo del modelo; los errores estándar publicados no reflejan las variaciones entre instrucciones, semillas o configuraciones de despliegue. Una diferencia pequeña en la puntuación debe interpretarse teniendo eso en cuenta.

[La propia tabla comparativa de Google DeepMind](https://deepmind.google/models/gemini/) ofrece más contraejemplos a cualquier afirmación de que Argon lidera en todos los ámbitos. Muestra que Argon supera a GPT-6 Astra en DeepSWE v1.1, **77.9% to 74.1%**, pero queda por detrás de Astra en FrontierSWE v2, **55.0% to 65.5%** y Terminal-Bench Science, **57.6% to 68.1%**. Claude Opus 5.5 supera a Argon en Terminal-Bench 4.0, **66.4% to 57.4%** y PostTrainBench, **49.3% to 45.3%**. En el subconjunto sin conexión OSWorld-2.0 de la tabla, Astra obtiene **72.6%** frente al **69.2%**. Estas comparaciones se basan en la selección y las configuraciones de pruebas publicadas por Google; no sustituyen las pruebas de clientes en un servicio público documentado.

Google afirma que Argon puede generar hasta **un millón de tokens de salida en una sola trayectoria**, frente al límite anterior de 64.000 tokens. Vals indica una ventana de *contexto* de un millón de tokens, pero configuró su evaluación de Argon con una salida máxima de **262.144 tokens**. Esa configuración no establece un límite estricto para el producto futuro de Google. Sí significa que los resultados públicos de Vals no demuestran una generación completa de un millón de tokens y que Google aún no ha publicado una ficha de API que aclare el límite de salida disponible para los desarrolladores en general.

## Los usos internos y las afirmaciones de seguridad necesitan pruebas propias

Google describe a agentes de Argon que ayudaron a migrar código de C/C++ a Rust, crear una subrutina de computación cuántica y optimizar la memoria de centros de datos. Afirma que, tras desplegar un conjunto de cambios de memoria, liberó más de 300 TiB. También dice que su socio Wiz encontró con Argon una vulnerabilidad crítica en software sanitario. Son relatos de Google sobre trabajos internos o de sus socios; los materiales de lanzamiento no aportan suficiente detalle independiente para verificar o reproducir esos resultados. Google afirma que las grandes reescrituras en Rust siguen pasando por revisiones automáticas y manuales antes de llegar a producción.

En materia de seguridad, Google describe entrenamiento para rechazar solicitudes dañinas, defensas contra la inyección indirecta de instrucciones, supervisión del razonamiento y las acciones del modelo para detectar conductas ajenas a la intención del usuario, y un mayor aislamiento de los entornos de evaluación. La afirmación de que Argon es su modelo más resistente a la inyección indirecta es una declaración del proveedor. Según Google, el grupo inicial de ciberseguridad también accede al modelo sin las protecciones habituales, lo que vuelve especialmente importantes el alcance del acceso y su supervisión a medida que se amplíe.

Las primeras pruebas ofrecen indicios contradictorios sobre su utilidad cotidiana. [Axios informó](https://www.axios.com/2026/09/30/google-gemini-4) que Bloomberg, citando fuentes anónimas, dijo que algunos empleados de Google consideraban deficiente el rendimiento interno de Argon; Axios también informó que Google dijo a Bloomberg que esa versión era inexacta. Google declaró a Axios que sus empleados habían utilizado el modelo para tareas difíciles de programación e investigación. Ninguna de las dos versiones aclara cómo rendirá una versión pública. Lo útil ahora será contar con acceso bajo condiciones documentadas, junto con resultados de tareas y costos que otros puedan examinar.

## Sources

- [Anuncio de Gemini 4 Argon de Google](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/) — Lanzamiento oficial, plan de acceso, precios futuros, límite de salida declarado, proyectos internos y afirmaciones de seguridad. Los resultados internos y las comparaciones de seguridad son afirmaciones del proveedor.
- [Página de modelos Gemini de Google DeepMind](https://deepmind.google/models/gemini/) — Tabla de comparación directa seleccionada por Google, con ventajas y desventajas de Argon; consultada el 1 de octubre.
- [Catálogo de modelos de Gemini API](https://ai.google.dev/gemini-api/docs/models) — Catálogo público para desarrolladores; no incluía un identificador de Gemini 4 Argon al consultarlo. Esto no descarta el acceso privado.
- [Precios de Gemini API](https://ai.google.dev/gemini-api/docs/pricing) — Página pública de precios para desarrolladores; no incluía una tarifa para Argon al consultarla. La publicación de lanzamiento anunció tarifas futuras.
- [Evaluación de Gemini 4 Argon de Vals AI](https://www.vals.ai/models/google_gemini-4-argon) — Puntuaciones, puestos, costos por tarea y configuración de las pruebas del evaluador independiente, incluido el máximo de 262.144 tokens de salida.
- [Metodología de evaluación de Vals AI](https://www.vals.ai/methodology) — Explica el diseño de las pruebas, las variaciones del entorno de agentes y qué reflejan —o no— sus errores estándar.
- [Programa Fairwind de Google](https://blog.google/innovation-and-ai/technology/safety-security/fairwind-program/) — Información de Google sobre el programa limitado de defensa cibernética y sus socios previstos.
- [Cobertura del lanzamiento por Axios](https://www.axios.com/2026/09/30/google-gemini-4) — Contexto independiente sobre el acceso y la respuesta de Google; recoge las dudas de empleados anónimos mencionadas por Bloomberg y la negativa de Google.
- [Cobertura del lanzamiento por Ars Technica](https://arstechnica.com/google/2026/09/google-announces-gemini-4-argon-ai-model-but-you-cant-use-it-yet/) — Contexto independiente del lanzamiento; los usos internos siguen siendo afirmaciones atribuidas a Google.
El boletín de BIG CHANGE

La visión global, a tu ritmo.

Historias recientes sobre IA y robótica, cambios que vale la pena observar e ideas prácticas para usar. Elige un informe diario, un resumen semanal o una perspectiva mensual.