A OpenAI e a Anthropic lançaram novos modelos a 22 de setembro, mas as respetivas gamas estão a evoluir a ritmos diferentes. O GPT-6 Sol e o Luna juntam-se ao Astra, enquanto o Terra continua na geração GPT-5.6. O Opus da Claude avança para a versão 5.5, ao lado do Fable 5.1, do Sonnet 5 e do Haiku 4.5, com quase um ano.

As comparações mais relevantes são Astra com Fable, Sol com Opus, Terra com Sonnet e Luna com Haiku. Analisar os quatro pares revela uma disputa mais interessante do que qualquer lançamento isolado: o Opus desafia o nível de topo, o Luna pressiona a oferta económica da Anthropic e o meio das duas gamas continua incompleto.

A grande mudança

  • O que mudou: Os clientes podem agora obter modelos mais recentes a preços muito diferentes dentro da gama do mesmo fornecedor. A OpenAI renovou o seu nível económico, enquanto a Anthropic concentrou este lançamento no Opus e deixou o Haiku quase um ano atrás no calendário de lançamentos.
  • Porque é importante: As equipas de produto têm mais margem para reduzir o custo da utilização rotineira de IA e pagar por melhores resultados quando os erros são dispendiosos. A dificuldade está em escolher com base no desempenho demonstrado: a posição de um modelo na gama do produto não permite prever com fiabilidade os resultados dos benchmarks.
  • O que acompanhar: A Anthropic afirma que o Sonnet 5.5 e o Haiku 5.5 chegarão nas próximas semanas. Os preços e resultados desses modelos determinarão quanto da oportunidade atual para a OpenAI se mantém, sobretudo nos produtos que fazem um grande número de chamadas económicas.

Os preços, nível a nível

Todos os valores abaixo são preços Standard diretos da API, em dólares dos EUA por milhão de tokens, consultados a 22 de setembro. Entrada em cache significa que houve um acerto na cache. As tarifas indicadas pela OpenAI aplicam-se até 272 000 tokens de entrada; acima desse valor, a tarifa de entrada do pedido completo duplica e a de saída aumenta 50%. As escritas na cache, o processamento em lote e as ferramentas têm condições de faturação próprias. Fontes: OpenAI e Anthropic.

Modelo

Entrada

Entrada em cache

Saída

GPT-6 Astra

10 $

1 $

50 $

Claude Fable 5.1

10 $

0,25 $

50 $

GPT-6 Sol

2 $

0,20 $

10 $

Claude Opus 5.5

4 $

0,20 $

20 $

GPT-5.6 Terra

2 $

0,20 $

12 $

Claude Sonnet 5

2 $

0,20 $

10 $

GPT-6 Luna

0,10 $

0,01 $

0,50 $

Claude Haiku 4.5

1 $

0,10 $

5 $

Índice de inteligência e custos medidos em testes

Artificial Analysis Intelligence Index v4.3.2, consultado a 22 de setembro. Os custos correspondem à despesa média ponderada do operador por tarefa do índice.

Modelo

Definição testada

Índice de inteligência

Custo por tarefa do índice

GPT-6 Astra

Máximo

52,7

3,26 $

Claude Fable 5.1

Máximo com contingência

53,4

7,63 $

GPT-6 Sol

Máximo

47,5

Não indicado

Claude Opus 5.5

Máximo com contingência

57,6

5,98 $

GPT-5.6 Terra

Máximo

42,1

1,40 $

Claude Sonnet 5

Máximo

38,2

5,09 $

GPT-6 Luna

Máximo

37,3

Não indicado

Claude Haiku 4.5

Raciocínio ativado

16,9

0,21 $

Fonte: Artificial Analysis; os resultados de cada modelo estão ligados nas comparações abaixo.

Astra e Fable: o par de topo

Os preços Standard de entrada e saída são iguais. O preço da leitura em cache do Fable é um quarto do valor do Astra, uma diferença relevante quando as aplicações reutilizam repetidamente conteúdo elegível do pedido.

No índice atual da Artificial Analysis, o Astra no nível máximo obtém 52,7 e o Fable 5.1 no nível máximo com contingência obtém 53,4. É um resultado renhido. A Artificial Analysis comunica uma despesa ponderada de 3,26 dólares por tarefa do índice para o Astra, contra 7,63 dólares para o Fable. O Astra obtém uma pontuação próxima com cerca de 57% menos despesa medida, apesar de as tarifas de entrada e saída serem iguais. Resultados do Astra, resultados do Fable.

Sol e Opus: preços mais baixos e pontuações superiores

As tarifas normais de entrada e saída do Sol são metade das do Opus; as tarifas de leitura em cache são iguais. A OpenAI também reduziu para metade os preços de lançamento de entrada e saída do Sol face aos do GPT-5.6 Sol. A Anthropic reduziu as tarifas correspondentes do Opus em 20% face ao Opus 5. Lançamento da OpenAI, lançamento do Opus.

A Artificial Analysis atribui ao Sol no nível máximo 47,5, contra 57,6 para o Opus 5.5 no nível máximo com contingência. O Opus supera o Sol em 10,1 pontos, cobrando o dobro pela entrada e saída normais. Também supera o Astra e o Fable, com tarifas de entrada e saída 60% inferiores. A despesa efetiva nos testes altera esta comparação: o Opus custa, em média, 5,98 dólares por tarefa do índice, cerca de 84% acima do Astra. Quando a consulta foi feita, a tabela de custos publicada pela Artificial Analysis ainda não apresentava o valor do Sol. Resultados do Sol, resultados do Opus.

Terra e Sonnet: falta um modelo GPT-6

O catálogo atual de lançamentos e modelos da OpenAI não inclui um GPT-6 Terra. A comparação disponível é com o GPT-5.6 Terra, cuja documentação atual da API confirma as tarifas acima. O guia da OpenAI sobre Work e Codex também indica que os modelos 5.6 mais antigos continuam disponíveis durante o lançamento gradual.

No nível máximo de esforço, o Terra obtém 42,1 no índice da Artificial Analysis e o Sonnet 5 obtém 38,2. O custo médio do Terra por tarefa do índice é 1,40 dólares, contra 5,09 dólares para o Sonnet: uma pontuação superior com cerca de 73% menos despesa medida. A tarifa de saída por token do Terra é 20% superior, mostrando como o consumo de tokens e a utilização da cache podem pesar mais do que o preço anunciado. Resultados do Terra, resultados do Sonnet.

O Sonnet 5 chegou a 30 de junho. A Anthropic anunciou agora o Sonnet 5.5 para as próximas semanas. A promessa de um sucessor mantém atual a comparação com o Sonnet 5 até que a nova versão esteja disponível para teste e tenha preços publicados.

Luna e Haiku: a maior diferença de idade entre lançamentos

O Luna custa um décimo em cada categoria de tokens indicada. O Haiku 4.5 foi lançado a 15 de outubro de 2025, 342 dias antes do Luna. Continua a ser a versão Haiku mais recente da Anthropic; o Haiku 5.5 foi anunciado para as próximas semanas.

A diferença de desempenho também surge em testes independentes. A Artificial Analysis atribui ao Luna no nível máximo 37,3, contra 16,9 para o Haiku 4.5 com raciocínio ativado. São pontuações do mesmo conjunto atual de testes, juntamente com um preço por token 90% inferior para o Luna. O custo médio por tarefa do índice do Haiku com raciocínio é de 0,21 dólares; o custo correspondente do Luna ainda não constava da tabela publicada pelo operador. Resultados do Luna, resultados do Haiku com raciocínio.

Para a Anthropic, esta é uma vulnerabilidade exposta na gama: o seu modelo mais económico enfrenta um concorrente recém-lançado com preços por token inferiores e um resultado muito superior nessa avaliação. A atualização anunciada do Haiku é, por isso, um dos próximos lançamentos com consequências para os programadores que compram em grande volume.

Os valores da Artificial Analysis acima utilizam o Intelligence Index v4.3.2, um agregado de dez avaliações, consultado a 22 de setembro. As definições são indicadas juntamente com as pontuações; os resultados do Fable e do Opus incluem a configuração de contingência do operador. Índice e metodologia.

O que acontece quando os agentes têm de concluir o trabalho?

O AutomationBench v1.0.6 da Zapier testa tarefas de ponta a ponta em aplicações empresariais simuladas. Para ser aprovada, cada ação avaliada tem de estar correta. A tabela classificativa de 22 de setembro apresenta:

Modelo

Definição testada

Taxa de aprovação

Custo por tarefa

GPT-6 Astra

Máximo

41,4%

1,73 $

Claude Fable 5.1

Máximo, sem contingência

22,37%

2,45 $

GPT-6 Sol

Xhigh

33,2%

0,27 $

GPT-6 Sol

Máximo

32,0%

0,34 $

Claude Opus 5.5

Máximo

40,0%

1,28 $

GPT-5.6 Terra

Máximo

23,59%

0,51 $

Claude Sonnet 5

Máximo

10,65%

0,88 $

GPT-6 Luna

Máximo

20,7%

0,04 $

Claude Haiku 4.5

Não especificado

0,46%

0,07 $

A configuração separada com Fable e Opus 5 obtém 31,4%. O Opus trata cerca de 40% das tarefas; os 2,45 dólares indicados não incluem os tokens utilizados na contingência.

No nível xhigh, o Sol gasta cerca de 79% menos por tentativa do que o Opus no nível máximo, com uma taxa de aprovação 6,8 pontos percentuais inferior. O Luna supera o Haiku com um custo por tarefa 43% inferior. O Astra lidera este grupo; todas as taxas de aprovação ficam abaixo de metade. Resultados e método de pontuação da Zapier.

O calendário de lançamentos é intenso e irregular

Os registos de lançamentos da API das duas empresas fornecem duas séries selecionadas. A série da OpenAI acompanha as versões numeradas do GPT até ao GPT-6 Astra. Exclui as variantes especializadas Instant e Codex e as expansões posteriores por nível, como o GPT-5.4 mini e nano, a 17 de março, e o GPT-6 Sol e Luna, a 22 de setembro. A série da Anthropic acompanha as versões públicas da API Opus. O «intervalo» corresponde ao número de dias desde a entrada anterior na série selecionada de cada empresa.

  • Família GPT-5 — 7 de agosto de 2025: lançamento da família; não se aplica intervalo à primeira entrada.
  • GPT-5.1 — 13 de novembro de 2025: atualização de versão; intervalo de 98 dias.
  • GPT-5.2 — 11 de dezembro de 2025: atualização de versão; intervalo de 28 dias.
  • GPT-5.4 — 5 de março de 2026: atualização de versão; intervalo de 84 dias.
  • GPT-5.5 — 24 de abril de 2026: atualização de versão; intervalo de 50 dias.
  • GPT-5.6 — 9 de julho de 2026: atualização da família com novos níveis; intervalo de 76 dias.
  • GPT-6 Astra — 3 de setembro de 2026: lançamento de uma nova família; intervalo de 56 dias.

Fonte: registo de alterações da API da OpenAI. Em separado, o GPT-6 Sol e o Luna chegaram a 22 de setembro, 19 dias depois do Astra. Esse intervalo mede a expansão dos níveis dentro da mesma família e não faz parte da série de versões numeradas acima.

  • Opus 4 — 22 de maio de 2025: versão principal; não se aplica intervalo à primeira entrada.
  • Opus 4.1 — 5 de agosto de 2025: atualização pontual; intervalo de 75 dias.
  • Opus 4.5 — 24 de novembro de 2025: atualização de versão; intervalo de 111 dias.
  • Opus 4.6 — 5 de fevereiro de 2026: atualização de versão; intervalo de 73 dias.
  • Opus 4.7 — 16 de abril de 2026: atualização de versão; intervalo de 70 dias.
  • Opus 4.8 — 28 de maio de 2026: atualização de versão; intervalo de 42 dias.
  • Opus 5 — 24 de julho de 2026: versão principal; intervalo de 57 dias.
  • Opus 5.5 — 22 de setembro de 2026: atualização de versão e redução de preços; intervalo de 60 dias.

Fonte: notas de lançamento da API Anthropic. Os lançamentos Fable e Mythos com acesso restrito são ramos separados, pelo que não são incluídos na sequência Opus.

Os intervalos entre versões identificadas da OpenAI variam entre 28 e 98 dias; os intervalos entre versões Opus da Anthropic variam entre 42 e 111 dias. Se «lançamento principal» significar uma alteração do número da família, decorreram 392 dias entre o GPT-5 e o GPT-6 e 428 dias entre o Opus 4 e o Opus 5. Os intervalos menores correspondem a atualizações pontuais e expansões por nível. Ambas as séries oscilam: intervalos curtos são seguidos por outros mais longos.

A pressão prática é atualizar seletivamente

O calendário de lançamentos cria constantemente motivos para reconsiderar a escolha de um modelo. Os quatro pares atuais mostram por que razão uma conclusão única sobre cada fornecedor não revelaria diferenças úteis: a Anthropic tem um novo Opus competitivo, a OpenAI lançou um nível económico que agora concorre de forma mais forte e ambas as empresas ainda mantêm modelos mais antigos em partes das respetivas gamas.

Mudar de versão também exige trabalho de engenharia. O guia de migração do Opus 5.5 da Anthropic indica que o raciocínio está sempre ativo, que a seleção forçada de ferramentas gera um erro e que o tipo anterior de ferramenta de utilização do computador é rejeitado na API Claude e no Google Cloud. As integrações existentes que utilizam estas opções têm de ser alteradas.

A próxima evolução anunciada é a renovação do Sonnet e do Haiku pela Anthropic. Isso dá aos compradores um motivo concreto para reavaliar em breve os níveis inferiores. Por agora, as listas de preços e os resultados independentes já mostram onde a concorrência mudou e onde um modelo mais antigo continua a merecer consideração.