A Anthropic lançou o Claude Sonnet 5.5 em 28 de setembro, mantendo os mesmos preços de tokens da API do Sonnet 5. A empresa afirma que o modelo gera respostas mais de 30% mais rápido e pode custar até 30% menos por tarefa por usar menos tokens. São alegações distintas: o preço publicado não caiu, e o custo de uma tarefa ainda depende do prompt, da resposta, das ferramentas e do nível de esforço.

Para desenvolvedores, o lançamento combina um possível ganho de eficiência com mudanças que podem quebrar integrações com o Sonnet 5. A documentação da Anthropic lista o modelo como claude-sonnet-5-5 na Claude API, no Google Cloud e no Microsoft Foundry, e anthropic.claude-sonnet-5-5 na Amazon Bedrock. A página do modelo informa uma janela de contexto de um milhão de tokens e uma saída máxima de 128.000 tokens. O acesso também está listado por meio da Claude Platform na AWS. A cobrança e as configurações regionais dos provedores de nuvem podem diferir dos preços publicados para a Claude API.

O que mostram as avaliações

Na avaliação do Terminal-Bench 4.0 da Anthropic, o Sonnet 5.5 concluiu 70,6% de 66 tarefas de terminal, contra 10,3% do Sonnet 5 na tabela de lançamento. O cartão de sistema descreve um conjunto exigente de tarefas de ciência e engenharia em ambientes de linha de comando conteinerizados. A Anthropic executou o Claude Code no modo bare, com o esforço de raciocínio no máximo, bloqueou o acesso à internet e armazenou em cache os recursos necessários às tarefas. As salvaguardas encaminharam 1,2% das solicitações do Sonnet 5.5 a um modelo alternativo, afetando 1,5% dos testes. A Anthropic informa um erro padrão de 2,5 pontos percentuais para o resultado do Sonnet 5.5. A pontuação mede esse arranjo; não estabelece que a mesma melhora ocorra nos repositórios dos desenvolvedores.

Segundo o cartão de sistema da Anthropic, a Cognition executou o FrontierCode no Claude Code em 150 tarefas de repositório e informou 52,1% para o Sonnet 5.5 no conjunto Main, com esforço xhigh. A pontuação caiu para 46,2% no esforço máximo, em parte porque, nos casos examinados pela Cognition, as etapas adicionais de revisão e edição do agente ultrapassaram o escopo ou o limite de tempo do benchmark. A Cursor executou o CursorBench 4.0 em seu ambiente de agente de produção, com tarefas provenientes de sessões do Cursor. O resultado de 55,5% do Sonnet 5.5 no esforço máximo aparece em uma tabela enviada à Anthropic; a Anthropic estimou o custo por tarefa desse modelo com base na contagem de tokens da Cursor. Essas avaliações externas usaram tarefas e ambientes diferentes, e os números do Sonnet 5.5 apresentados aqui vêm do cartão de sistema da Anthropic.

A Artificial Analysis também testou o modelo pré-lançamento no GDPval-AA, que compara produtos de trabalho em 220 tarefas de 44 ocupações, e no AA-Briefcase, um conjunto de projetos interligados de trabalho intelectual. O cartão informa pontuações Elo de 1844 e 1811, respectivamente, no esforço máximo, próximas às do Opus 5.5 nesses testes. A Anthropic diz que a versão pré-lançamento tinha um erro na saída estruturada que poderia ter afetado os resultados e que já foi corrigido. A comparação avalia as respostas do benchmark nessas condições; não demonstra que o Sonnet 5.5 igualará o Opus em tarefas abertas dos leitores. A própria Anthropic diz que o Opus continua mais forte em trabalhos complexos que exigem julgamento sustentado.

Depoimentos de clientes iniciais citados no lançamento da Anthropic descrevem fluxos de trabalho mais rápidos e menor consumo de tokens em seus próprios testes. Esses clientes usaram tarefas e métodos próprios, portanto seus relatos não estabelecem uma medida comum de produtividade. A BIG CHANGE não testou o Sonnet 5.5 nem verificou as alegações do fornecedor sobre velocidade e custo por tarefa em um fluxo de trabalho real.

Preço e migração

O preço de tabela da Claude API permanece igual ao do Sonnet 5: US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída. Uma gravação em cache por cinco minutos custa US$ 2,50 por milhão de tokens, e a leitura do cache custa US$ 0,20. Os gráficos da Anthropic sobre custo por tarefa combinam os preços de tabela com os tokens consumidos nos níveis de esforço especificados. Eles não comprovam uma economia universal de 30%. Uma equipe que compare modelos deve executar tarefas representativas próprias no nível de qualidade necessário, registrando o consumo de tokens e o tempo decorrido, além do sucesso.

Alterar apenas o ID do modelo pode fazer o código existente da Messages API falhar. O valor thinking: {"type": "disabled"} gera um erro no Sonnet 5.5; a alternativa documentada para evitar o raciocínio prévio é thinking: {"type": "between_tools"}, aceita nos níveis de esforço baixo, médio e alto. O raciocínio adaptativo fica ativado quando o campo é omitido, e a Claude API usa esforço alto por padrão. Os valores forçados de tool_choice do tipo any e tool também geram erros; a Anthropic direciona os desenvolvedores para auto e, quando houver suporte, esquemas estritos de ferramentas. No Sonnet 5.5 pela Amazon Bedrock, o uso estrito de ferramentas não está disponível: use auto sem strict e valide as entradas das ferramentas no código da aplicação. Código que exibe texto entre chamadas a ferramentas talvez precise tratar atualizações de progresso retornadas em blocos de raciocínio. Integrações de uso do computador na Claude API e no Google Cloud precisam do conjunto mais recente de ferramentas computer_toolset_20260801; na Bedrock, permanece a versão anterior computer_20251124. O guia de migração detalha outras mudanças de compatibilidade.

A grande mudança

O Sonnet 5.5 oferece às equipes sensíveis a custos um novo modelo com os preços por token do Sonnet 5, resultados superiores em várias avaliações específicas e a alegação da Anthropic de respostas mais rápidas. Seu valor prático depende da combinação de tarefas e do nível de esforço. As integrações existentes também precisam de uma revisão das configurações. A comparação mais útil agora é medir a própria carga de trabalho da organização em resultados corretos, consumo de tokens e tempo decorrido.

Fontes e leituras complementares

  • Anúncio do Sonnet 5.5 pela Anthropic apresenta a data de lançamento, as alegações da empresa sobre velocidade e custo por tarefa, o resumo dos benchmarks e relatos de clientes iniciais. O desempenho alegado precisa ser verificado para cada carga de trabalho.
  • Cartão de sistema do Sonnet 5.5 da Anthropic documenta as tarefas e os ambientes dos benchmarks, os níveis de esforço, o uso de modelos alternativos e a procedência das avaliações externas. É uma divulgação primária do fornecedor do modelo, que inclui resultados de avaliações externas fornecidos à empresa.
  • Página do modelo na Claude Platform lista IDs da API, acesso, limites e preços por token. Página completa de preços confirma que as tarifas básicas do Sonnet 5 e do 5.5 são iguais e explica as diferenças de preços na nuvem.
  • Guia de migração do Sonnet 5.5 registra as configurações de solicitação que mudam ou geram erros. Consulte-o para ver a lista completa de verificações de uma integração existente.