A Anthropic lançou o Claude Sonnet 5.5 a 28 de setembro, com os mesmos preços da API por token do Sonnet 5. A empresa afirma que o modelo gera respostas mais de 30% mais depressa e pode custar até 30% menos por tarefa por utilizar menos tokens. São afirmações distintas: o preço publicado não baixou, e o custo de cada tarefa continua a depender do prompt, da resposta, das ferramentas e da definição do nível de esforço.

Para os programadores, o lançamento combina um possível ganho de eficiência com alterações que podem interromper integrações existentes com o Sonnet 5. A documentação da Anthropic identifica o modelo como claude-sonnet-5-5 na Claude API, no Google Cloud e no Microsoft Foundry, e anthropic.claude-sonnet-5-5 na Amazon Bedrock. A página do modelo indica uma janela de contexto de um milhão de tokens e um limite máximo de saída de 128 000 tokens. O acesso também está disponível através da Claude Platform na AWS. A faturação e as definições regionais dos fornecedores de cloud podem diferir dos preços publicados para a Claude API.

O que mostram as avaliações

Na avaliação Terminal-Bench 4.0 da Anthropic, o Sonnet 5.5 concluiu 70,6% de 66 tarefas de terminal, contra 10,3% do Sonnet 5 na tabela de lançamento. O cartão de sistema descreve um conjunto exigente de tarefas de ciência e engenharia em ambientes de linha de comandos conteinerizados. A Anthropic executou o Claude Code no modo bare, com o esforço de raciocínio no máximo, bloqueou o acesso à Internet e guardou em cache os recursos necessários às tarefas. As salvaguardas encaminharam 1,2% dos pedidos do Sonnet 5.5 para um modelo alternativo, afetando 1,5% dos ensaios. A Anthropic indica um erro-padrão de 2,5 pontos percentuais para o resultado do Sonnet 5.5. A pontuação mede esta configuração; não demonstra que se verifique a mesma melhoria nos repositórios dos programadores.

Segundo o cartão de sistema da Anthropic, a Cognition executou o FrontierCode no Claude Code em 150 tarefas de repositório e obteve 52,1% para o Sonnet 5.5 no conjunto Main, com o nível de esforço xhigh. A pontuação caiu para 46,2% no nível máximo, em parte porque, nos casos analisados pela Cognition, as operações adicionais de revisão e edição do agente ultrapassaram o âmbito ou o limite de tempo do benchmark. A Cursor executou o CursorBench 4.0 na sua configuração de agentes em produção, com tarefas recolhidas de sessões do Cursor. O resultado de 55,5% do Sonnet 5.5 no nível máximo aparece numa tabela enviada à Anthropic; esta estimou o custo por tarefa do modelo a partir da contagem de tokens fornecida pela Cursor. Estas avaliações externas utilizaram tarefas e definições diferentes, e os resultados do Sonnet 5.5 apresentados aqui foram obtidos através do cartão de sistema da Anthropic.

A Artificial Analysis também avaliou o modelo de pré-lançamento no GDPval-AA, que compara resultados de trabalho em 220 tarefas de 44 profissões, e no AA-Briefcase, um conjunto de projetos interligados de trabalho intelectual. O cartão apresenta pontuações Elo de 1844 e 1811, respetivamente, no nível máximo de esforço, próximas das do Opus 5.5 nesses testes. A Anthropic diz que a versão de pré-lançamento tinha um erro na saída estruturada que poderia ter afetado os resultados e que já foi corrigido. A comparação avalia os resultados nos benchmarks e nas condições indicadas; não demonstra que o Sonnet 5.5 iguale o Opus em tarefas abertas dos leitores. A própria Anthropic afirma que o Opus continua a ser mais forte em trabalhos complexos que exigem julgamento sustentado.

Os testemunhos de clientes iniciais citados no lançamento da Anthropic descrevem fluxos de trabalho mais rápidos e menor utilização de tokens nos seus próprios testes. Esses clientes utilizaram tarefas e métodos próprios, pelo que os seus relatos não estabelecem uma medida comum de produtividade. A BIG CHANGE não testou o Sonnet 5.5 nem verificou as alegações do fornecedor sobre velocidade e custo por tarefa num fluxo de trabalho real.

Preço e migração

O preço de tabela da Claude API mantém-se igual ao do Sonnet 5: 2 USD por milhão de tokens de entrada e 10 USD por milhão de tokens de saída. Uma gravação em cache durante cinco minutos custa 2,50 USD por milhão de tokens; a leitura do cache custa 0,20 USD. Os gráficos da Anthropic sobre o custo por tarefa combinam os preços de tabela com os tokens utilizados nos níveis de esforço especificados. Não demonstram uma poupança universal de 30%. Uma equipa que compare modelos deve testar tarefas representativas próprias com o nível de qualidade de que precisa, registando a utilização de tokens, o tempo de execução e a taxa de sucesso.

Alterar apenas o ID do modelo pode fazer o código existente da Messages API falhar. O valor thinking: {"type": "disabled"} gera um erro no Sonnet 5.5; a alternativa documentada para evitar o raciocínio prévio é thinking: {"type": "between_tools"}, aceita nos níveis de esforço baixo, médio e alto. O raciocínio adaptativo fica ativado quando o campo é omitido, e a Claude API usa esforço alto por padrão. Os valores forçados de tool_choice do tipo any e tool também geram erros; a Anthropic direciona os programadores para auto e, quando houver suporte, esquemas estritos de ferramentas. No Sonnet 5.5 pela Amazon Bedrock, o uso estrito de ferramentas não está disponível: use auto sem strict e valide as entradas das ferramentas no código da aplicação. Código que exibe texto entre chamadas a ferramentas talvez precise tratar atualizações de progresso retornadas em blocos de raciocínio. Integrações de uso do computador na Claude API e no Google Cloud precisam do conjunto mais recente de ferramentas computer_toolset_20260801; na Bedrock, permanece a versão anterior computer_20251124. O guia de migração detalha outras mudanças de compatibilidade.

A grande mudança

O Sonnet 5.5 oferece às equipas sensíveis aos custos um novo modelo com os preços por token do Sonnet 5, resultados superiores em várias avaliações especificadas e a alegação da Anthropic de que gera respostas mais depressa. O valor prático depende da combinação de tarefas e da definição do nível de esforço. As integrações existentes também exigem uma revisão das definições. A comparação mais esclarecedora é testar a carga de trabalho da própria organização, medindo a correção dos resultados, a utilização de tokens e o tempo de execução.

Fontes e leituras complementares

  • Anúncio do Sonnet 5.5 pela Anthropic apresenta a data de lançamento, as alegações da empresa sobre velocidade e custo por tarefa, o resumo dos benchmarks e relatos de clientes iniciais. O desempenho alegado precisa ser verificado para cada carga de trabalho.
  • Cartão de sistema do Sonnet 5.5 da Anthropic documenta as tarefas e definições dos benchmarks, os níveis de esforço, o encaminhamento para modelos alternativos e a origem das avaliações externas. É uma divulgação primária do fornecedor do modelo e inclui resultados de avaliações externas que lhe foram comunicados.
  • Página do modelo na Claude Platform lista IDs da API, acesso, limites e preços por token. Página completa de preços confirma que as tarifas de base do Sonnet 5 e do 5.5 são iguais e explica as diferenças de preços entre fornecedores de cloud.
  • Guia de migração do Sonnet 5.5 registra as definições de solicitação que mudam ou geram erros. Consulte-o para ver a lista completa de verificações de uma integração existente.