O Google anunciou Gemini 4 Argon em 30 de setembro, com bons resultados em trabalho de conhecimento e programação, um limite declarado de um milhão de tokens de saída e preços para uma futura versão da API. O modelo está sendo liberado primeiro para um grupo inicial de defensores e testadores de segurança cibernética de confiança. O Google não divulgou um ID público do modelo nem uma data para que clientes da API paga ou assinantes do Google AI Ultra possam usá-lo. o anúncio do Google e o catálogo de modelos da Gemini API mostram a distância entre o lançamento e o acesso para a maioria dos leitores.

A grande mudança

  • O que mudou: O Google colocou um novo modelo de ponta nas mãos de alguns defensores de segurança cibernética, enquanto a maioria dos desenvolvedores e assinantes ainda não pode acessá-lo. As principais alegações de capacidade e preço já são públicas, mas a API pública ainda não foi lançada.
  • Por que isso importa: As avaliações independentes da Vals AI colocam o Argon em primeiro lugar em tarefas amplas de conhecimento e em um teste de agente financeiro. Assim, equipes que comparam modelos têm um novo candidato sério. Os resultados variam entre tarefas e a liberação é restrita, então o desempenho e o custo nos fluxos de trabalho de cada equipe continuam indefinidos.
  • O que observar: O Google apontou clientes da API paga e assinantes do AI Ultra como os próximos grupos, mas não informou uma data. Um ID de modelo documentado e limites do serviço permitirão que desenvolvedores testem o que importa para eles, inclusive se o milhão de tokens de saída anunciado pode ser usado na prática.

Quem pode usar o Gemini 4 agora

Segundo o Google, os primeiros usuários são defensores e testadores de segurança cibernética de confiança do programa Fairwind. O Fairwind é um programa de acesso limitado para alguns clientes do Google Cloud, órgãos governamentais e parceiros de segurança. O Google diz que está oferecendo o Argon a defensores de confiança sem as proteções cibernéticas habituais, para que usem seus recursos defensivos. Essa liberação inicial é um teste controlado de um caso de uso particularmente sensível.

O Google planeja ampliar o acesso a desenvolvedores, empresas e consumidores, começando por clientes da API paga e assinantes do Google AI Ultra. Não há data para essa etapa. Em 1º de outubro, o diretório de modelos da Gemini API do Google listava modelos Gemini 3, mas nenhum identificador do Gemini 4 Argon. A página de preços da API também não tinha uma linha para o Argon. Portanto, um tutorial de chamadas à API teria de inventar um nome de modelo e um caminho de acesso que o Google não documentou.

Ainda assim, a empresa informou preços futuros por token na publicação de lançamento. O preço inicial é de US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída, com entrada em cache custando 95% menos que a tarifa de entrada. Depois do período inicial, o Google diz que os preços subirão para US$ 4 e US$ 20. A empresa não informou quando o período inicial termina. São preços anunciados, não o custo de uma API de autoatendimento disponível hoje. O preço por token também não basta para estimar uma tarefa longa de agente sem saber quanto raciocínio, uso de ferramentas e saída ela exige.

Bons resultados, com pontos fracos visíveis

O registro independente da Vals AI sobre o Argon aponta 68.90% ± 0.97 no Vals Index, em primeiro lugar entre 41 modelos da tabela. No Finance Agent v2, fica em primeiro entre 73 modelos, com 65.40% ± 0.32. No Vibe Code Bench, ocupa o segundo lugar entre 106, com 91.91% ± 1.90; em Code Migration, o segundo entre 71, com 68.17% ± 4.35; e em CyberBench v1.1, o segundo entre 43, com 77.86% ± 5.30. Os resultados mostram um início forte em várias tarefas, mas não fazem do Argon o melhor modelo em todas.

O mesmo avaliador coloca o Argon em quinto entre 42 modelos no Terminal-Bench 4.0, com 57.58% ± 2.31, em décimo quinto entre 106 no MedScribe e em sétimo entre oito no teste de uso de computador CUA-bench, com 4.83%. O custo medido por teste também varia bastante: $15.68 por teste do Vals Index e $193.78 no CUA-bench. São custos das tarefas avaliadas, separados dos preços anunciados pelo Google por milhão de tokens. A Vals diz que algumas avaliações de agentes usam uma estrutura fixa e outras usam o agente nativo do modelo; os erros-padrão informados não incluem variações de prompts, sementes aleatórias ou configurações de implantação. Uma pequena diferença de pontuação deve ser lida nesse contexto.

A própria tabela comparativa do Google DeepMind traz mais exemplos que contrariam uma alegação de liderança geral. O Argon supera o GPT-6 Astra no DeepSWE v1.1, 77.9% to 74.1%, mas fica atrás do Astra no FrontierSWE v2, 55.0% to 65.5%e no Terminal-Bench Science, 57.6% to 68.1%. O Claude Opus 5.5 supera o Argon no Terminal-Bench 4.0, 66.4% to 57.4%e no PostTrainBench, 49.3% to 45.3%. No subconjunto offline OSWorld-2.0 da tabela, o Astra marca 72.6% contra 69.2%do Argon. Essas comparações usam a seleção do Google e as configurações de benchmark informadas; não substituem testes de clientes em um serviço público documentado.

O Google diz que o Argon pode gerar até um milhão de tokens de saída em uma única trajetória, acima do limite anterior de 64 mil tokens. A Vals lista uma janela de contexto de um milhão de tokens, mas configurou a avaliação do Argon com saída máxima de 262.144 tokens. Essa configuração não estabelece um limite rígido para um futuro produto do Google. Ela mostra, porém, que os resultados públicos da Vals não demonstram uma geração completa de um milhão de tokens, e o Google ainda não publicou uma entrada da API que esclareça o limite de saída disponível para desenvolvedores em geral.

Usos internos e alegações de segurança precisam de evidências próprias

O Google descreve agentes do Argon ajudando em migrações de código de C/C++ para Rust, em uma sub-rotina de computação quântica e na otimização de memória de centros de dados. Diz que um conjunto de mudanças de memória liberou mais de 300 TiB após a implantação. Também afirma que seu parceiro Wiz encontrou, com o Argon, uma vulnerabilidade crítica que afetava software de saúde. São relatos do Google sobre trabalhos internos ou de parceiros; o material de lançamento não traz detalhes independentes suficientes para verificar ou reproduzir os resultados. O Google diz que grandes reescritas em Rust ainda passam por revisão automatizada e manual antes da produção.

Em segurança, o Google descreve treinamento para recusar pedidos nocivos, defesas contra injeção indireta de prompt, monitoramento do raciocínio e das ações do modelo para detectar comportamentos fora da intenção do usuário e maior isolamento dos ambientes de avaliação. A afirmação de que o Argon é seu modelo mais resistente à injeção indireta de prompt é uma alegação do fornecedor. Segundo o Google, o grupo cibernético inicial também recebe acesso sem as proteções habituais, o que torna especialmente importantes o escopo do acesso e o monitoramento à medida que a disponibilidade cresce.

As primeiras evidências sobre a utilidade no dia a dia são conflitantes. A Axios noticiou que a Bloomberg, citando fontes anônimas, disse que alguns funcionários do Google consideraram fraco o desempenho interno do Argon; a Axios também noticiou que o Google disse à Bloomberg que essa informação era imprecisa. O Google disse à Axios que funcionários usaram o modelo em tarefas difíceis de programação e pesquisa. Nenhum dos relatos define como será o desempenho de uma versão pública. As próximas evidências úteis são o acesso com configurações documentadas e resultados de tarefas e custos que outras pessoas possam examinar.