A Anthropic lançou o Claude Haiku 5.5 a 7 de outubro para tarefas curtas e frequentes que podem representar uma grande parte das chamadas num sistema de agentes. As tarifas de tabela da Claude API começam nos 0,10 dólares por milhão de tokens de entrada e 0,50 dólares por milhão de tokens de saída, um décimo das tarifas do Haiku 4.5. Ainda assim, a Anthropic afirma que o mesmo texto utiliza cerca de 30% mais tokens no novo modelo e que os prompts com mais de 100.000 tokens passam para um escalão de preços superior. As equipas que usam o Haiku 4.5 devem voltar a contar os seus próprios pedidos antes de estimar a fatura ou transferir tráfego de produção.

O lançamento também altera o percurso da Messages API. Os orçamentos manuais de thinking não funcionam no Haiku 5.5, o adaptive thinking está ativo por predefinição e o primeiro bloco da resposta pode ser thinking em vez de texto. São verificações concretas de compatibilidade para serviços que chamam repetidamente um modelo pequeno para classificar, extrair, encaminhar ou resumir trabalho.

A grande mudança

  • O que mudou: A Anthropic trouxe a sua nova janela de contexto de um milhão de tokens e o adaptive thinking para o escalão Claude mais barato. O Haiku 5.5 reduz a tarifa para prompts curtos, mas altera a forma como o texto é contado e como uma resposta pode começar.
  • Porque é importante: Uma equipa pode agora considerar o Claude para mais etapas frequentes e bem delimitadas de um agente, a uma tarifa publicada mais baixa. O benefício depende da combinação de comprimentos de prompt, tokens de saída e thinking, utilização da cache e de o novo modelo atingir o objetivo de qualidade dessa etapa.
  • O que deve acompanhar: As integrações do Haiku 4.5 precisam de uma migração medida. Depois de recontados, os pedidos perto do limite de 100.000 tokens podem passar para o escalão superior; o código que assume que o primeiro bloco de conteúdo é texto pode tratar incorretamente uma resposta que, de resto, foi bem-sucedida.

O preço depende do comprimento do prompt

Na Claude API, o Haiku 5.5 custa 0,10 dólares por milhão de tokens de entrada e 0,50 dólares por milhão de tokens de saída para prompts até 100.000 tokens. Acima desse limite, as tarifas correspondentes são 0,50 e 2,50 dólares. O Haiku 4.5 está listado a 1 e 5 dólares em toda a sua janela de contexto de 200.000 tokens. O Haiku 5.5 tem uma janela de contexto de um milhão de tokens e uma saída máxima de 128.000, face a 200.000 e 64.000 no Haiku 4.5. A Anthropic indica disponibilidade através da Claude API, Amazon Bedrock, Claude Platform na AWS, Google Cloud e Microsoft Foundry. O ID do modelo na Amazon Bedrock é anthropic.claude-haiku-5-5; a Claude API utiliza claude-haiku-5-5. As páginas de modelos da Anthropic apresentam os IDs, limites e tarifas atuais de cada plataforma.

A Anthropic afirma que o custo médio de utilização do Haiku 5.5 é cerca de 75% inferior ao do Haiku 4.5 em média. A nota de rodapé combina a tarifa de tabela 90% mais baixa para prompts até 100.000 tokens, a tarifa 50% mais baixa acima desse limite, a observação de que 90% dos pedidos do Haiku 4.5 pertenciam à categoria mais curta e a contagem superior de tokens do novo tokenizer para o mesmo trabalho. Esse cálculo descreve a combinação de pedidos da Anthropic, não um desconto uniforme em todos os pedidos. O aumento de cerca de 30% nos tokens também é uma estimativa do fornecedor para o mesmo texto de entrada; a diferença exata depende do conteúdo. O anúncio de lançamento da Anthropic apresenta a alegação e o respetivo método.

Para um pedido da Claude API sem cache, obtenha as contagens de tokens de entrada e saída do Haiku 5.5, multiplique cada uma pela tarifa do escalão de comprimento do prompt desse pedido e divida por um milhão. Como exemplo de cálculo, 80.000 tokens de entrada e 10.000 de saída custam 0,013 dólares às tarifas de prompts curtos. Com 120.000 de entrada e 10.000 de saída, as tarifas de prompts longos dão 0,085 dólares. São cálculos de preços, não tarefas observadas nem previsões. A leitura e escrita da cache têm tarifas próprias, e o processamento em lote indica um desconto de 50% na entrada e na saída. Uma estimativa útil deve, por isso, agrupar as chamadas reais segundo o comprimento do prompt e o comportamento da cache antes de as somar. Estas categorias estão listadas na página do modelo Haiku 5.5 .

Volte a contar prompts representativos guardados com o endpoint de contagem de tokens da Message, especificando claude-haiku-5-5. Os totais de tokens do modelo antigo não permitem determinar em que escalão do 5.5 se enquadra um prompt. Para uma amostra real, registe a resposta usage, o comprimento da saída, os campos da cache, o effort e o custo efetivo, juntamente com os resultados da tarefa. Inclua pedidos curtos, as conversas repetidas mais longas e casos perto dos 100.000 tokens. A BIG CHANGE analisou a documentação; não executou o Haiku 5.5 nem mediu uma carga de produção.

As definições que exigem uma revisão da migração

O guia de migração do Haiku 5.5 da Anthropic apresenta uma lista de verificação invulgarmente específica para clientes que mudem do Haiku 4.5:

  1. Altere o ID do modelo da plataforma e volte a contar os prompts. claude-haiku-5-5é um ID fixo da Claude API, sem sufixo de data nem alias separado. Reveja max_tokens, porque o thinking consome esse limite e o mesmo texto pode exigir mais tokens.
  2. Substitua thinking: {"type":"enabled","budget_tokens":N} por adaptive thinking ou deixe thinking por definir. Defina output_config.effort para calibrar a profundidade; o valor predefinido documentado é medium. Um valor baixo de max_tokens pode terminar a resposta depois de um bloco de thinking e antes de surgir qualquer texto.
  3. Leia os blocos de conteúdo pelo respetivo type, e não pela posição. Devolva os blocos de thinking sem alterações, juntamente com os resultados das ferramentas. Teste qualquer arquivo de conversas que reproduza um bloco através de outra conta ou altere mensagens anteriores, instruções do sistema ou ferramentas.
  4. Remova as definições personalizadas de temperature, top_p e top_k. Substitua um prefill final do assistant por um turno do user e, nos formatos condicionados, utilize a abordagem de saída estruturada ou de ferramentas documentada pela Anthropic. Trate no cliente um stop_reason com o valor refusal.
  5. Se a integração utilizar computer use na Claude API ou na Google Cloud, substitua a ferramenta antiga computer_20250124 por computer_toolset_20260801 e atualize o ciclo das ferramentas conforme indicado no guia. As organizações que usam capacidade Priority Tier no Haiku 4.5 também precisam de um plano separado: o guia indica que o Priority Tier não está disponível no Haiku 5.5.

Estas alterações não determinam uma única definição de effort para todas as tarefas. Uma comparação deve manter constante a tarefa da aplicação e os critérios de aceitação e, depois, registar a qualidade das respostas, recusas, truncamentos, latência e tokens faturados nas definições consideradas. A Anthropic relata resultados melhores do Haiku 5.5 do que do 4.5 em vários benchmarks, incluindo 39,2% contra 0,0% na sua tabela do Terminal-Bench 4.0. São resultados comunicados pela Anthropic nas condições da sua avaliação, não uma medição do agente de um leitor. A Anthropic também considera Sonnet 5.5 e Opus 5.5 mais adequados para programação agêntica complexa nesse benchmark. A decisão imediata para quem usa o Haiku 4.5 é saber se o modelo mais pequeno cumpre os requisitos de cada etapa específica depois de contabilizadas as alterações à API e a nova contagem de tokens.

Fontes e leituras adicionais