Inilabas ng Anthropic ang Claude Haiku 5.5 noong Oktubre 7 para sa maiikli at madalas na trabahong maaaring bumuo sa malaking bahagi ng dami ng tawag sa isang agent system. Nagsisimula ang listahang rate ng Claude API sa $0.10 bawat isang milyong input token at $0.50 bawat isang milyong output token, ikasampu ng mga rate ng Haiku 4.5. Gayunman, ayon sa Anthropic, humigit-kumulang 30% pang token ang kailangan para sa parehong teksto sa bagong model, at pumapasok sa mas mataas na antas ng presyo ang mga prompt na lampas 100,000 token. Kailangang muling bilangin ng team na gumagamit ng Haiku 4.5 ang sarili nitong mga request bago tantiyahin ang bayarin o ilipat ang production traffic.

Binabago rin ng release ang landas ng Messages API. Hindi gumagana sa Haiku 5.5 ang mga manual na thinking budget, naka-on bilang default ang adaptive thinking, at maaaring thinking ang unang response block sa halip na teksto. Mga kongkretong compatibility check ito para sa mga serbisyong paulit-ulit tumatawag sa maliit na model upang mag-uri, kumuha ng impormasyon, magruta o magbuod ng trabaho.

Ang malaking pagbabago

  • Ano ang nagbago: Dinala ng Anthropic ang bago nitong isang-milyong-token na context window at adaptive thinking sa pinakamurang Claude tier. Pinabababa ng Haiku 5.5 ang rate para sa maiikling prompt, habang binabago kung paano binibilang ang teksto at kung paano maaaring magsimula ang isang response.
  • Bakit mahalaga: Maaari nang isaalang-alang ng team ang Claude para sa mas maraming madalas at limitadong hakbang ng agent sa mas mababang nakalistang rate. Nakadepende ang pakinabang sa halo ng haba ng prompt, output at thinking token, paggamit ng cache, at kung naaabot ng bagong model ang target na kalidad ng hakbang na iyon.
  • Ano ang dapat bantayan: Kailangan ng maingat na migration ang mga integration ng Haiku 4.5. Maaaring mapunta sa mas mataas na tier kapag muling binilang ang mga request na malapit sa 100,000-token na hangganan; maaari ring hindi maayos na mapangasiwaan ng code na nag-aakalang teksto ang unang content block ang isang matagumpay na reply.

Nakadepende ang presyo sa haba ng prompt

Sa Claude API, nagkakahalaga ang Haiku 5.5 ng $0.10 bawat isang milyong input token at $0.50 bawat isang milyong output token para sa mga prompt na hanggang 100,000 token. Lampas sa hangganang iyon, $0.50 at $2.50 ang katumbas na mga rate. Nakalista ang Haiku 4.5 sa $1 at $5 sa buong 200,000-token nitong context window. May isang milyong token na context window ang Haiku 5.5 at 128,000 token ang pinakamataas nitong output, kumpara sa 200,000 at 64,000 sa Haiku 4.5. Nakalista ng Anthropic ang availability sa Claude API, Amazon Bedrock, Claude Platform sa AWS, Google Cloud at Microsoft Foundry. Ang model ID sa Amazon Bedrock ay anthropic.claude-haiku-5-5; ginagamit naman ng Claude API ang claude-haiku-5-5. Inililista ng mga pahina ng model ng Anthropic ang kasalukuyang platform ID, limitasyon at rate.

Sinasabi ng Anthropic na humigit-kumulang 75% na mas mababa ang karaniwang gastos sa pagpapatakbo ng Haiku 5.5 kaysa sa Haiku 4.5 sa average. Pinagsasama ng footnote nito ang 90% na mas mababang list rate para sa mga prompt na hanggang 100,000 token, 50% na mas mababang rate sa lampas ng hangganang iyon, obserbasyon nitong 90% ng mga request ng Haiku 4.5 ay nasa mas maikling kategorya, at mas mataas na bilang ng token ng bagong tokenizer para sa parehong trabaho. Inilalarawan ng kalkulasyong iyon ang halo ng request ng Anthropic, hindi pantay-pantay na diskuwento sa bawat request. Tantiya rin ng vendor ang humigit-kumulang 30% pagtaas ng token para sa parehong input text; nakadepende sa nilalaman ang eksaktong pagbabago. Ipinapaliwanag ng anunsyo ng paglulunsad ng Anthropic kapwa ang pahayag at paraan ng pagkalkula nito.

Para sa Claude API request na walang cache, kunin ang bilang ng input at output token ng Haiku 5.5, imultiply ang bawat isa sa rate para sa antas ng presyo ayon sa haba ng prompt ng request at hatiin sa isang milyon. Halimbawa sa pagkalkula: nagkakahalaga ng $0.013 ang 80,000 input token at 10,000 output token sa maiikling-prompt na rate. Sa 120,000 input at 10,000 output token, $0.085 naman ang kalalabasan sa mahahabang-prompt na rate. Mga kalkulasyon ito ng presyo, hindi mga trabahong naobserbahan o forecast. May sarili nitong rate ang pagbasa at pagsulat sa cache, at may nakalistang 50% diskuwento sa input at output para sa batch processing. Kaya mas kapaki-pakinabang na pagpangkatin muna ang totoong mga tawag ayon sa haba ng prompt at asal ng cache bago pagsamahin ang mga ito. Nakalista ang mga kategoryang ito sa pahina ng model na Haiku 5.5 .

Muling bilangin ang mga nakaimbak na kinatawang prompt gamit ang endpoint ng pagbibilang ng token sa Message, at tukuyin ang claude-haiku-5-5. Hindi matutukoy ng kabuuang token ng lumang model kung saang tier mapupunta ang prompt sa 5.5. Para sa live sample, itala kasama ng resulta ng gawain ang usage, haba ng output, mga field ng cache, effort at aktuwal na singil. Isama ang maiikling request, pinakamahabang paulit-ulit na usapan, at mga kasong malapit sa 100,000 token. Sinuri ng BIG CHANGE ang dokumentasyon; hindi nito pinatakbo ang Haiku 5.5 o sinukat ang production workload.

Mga setting na kailangang suriin sa migration

Nagbibigay ang gabay sa migration ng Haiku 5.5 ng Anthropic ng di-pangkaraniwang tiyak na checklist para sa mga client na lilipat mula sa Haiku 4.5:

  1. Palitan ang model ID para sa platform at muling bilangin ang mga prompt. claude-haiku-5-5ang nakapirming Claude API ID na walang date suffix o hiwalay na alias. Suriin ang max_tokens, dahil ginagamit ng thinking ang limitasyong iyon at maaaring mangailangan ng mas maraming token ang katumbas na teksto.
  2. Palitan ang thinking: {"type":"enabled","budget_tokens":N} ng adaptive thinking o iwanang hindi nakatakda ang thinking. Itakda ang output_config.effort upang i-calibrate ang lalim; medium ang dokumentadong default. Maaaring matapos ang reply pagkatapos ng thinking block at bago ang anumang teksto kapag mababa ang max_tokens.
  3. Basahin ang mga content block ayon sa type, hindi sa posisyon. Ibalik nang hindi binabago ang mga thinking block kasama ng mga resulta ng tool. Subukan ang anumang conversation store na nagre-replay ng block sa ibang account o nagbabago ng mga naunang mensahe, system instruction o tool.
  4. Alisin ang mga custom na setting na temperature, top_p at top_k. Palitan ng user turn ang huling assistant prefill at, para sa mga limitadong format, gamitin ang structured-output o tool approach na idinodokumento ng Anthropic. Pangasiwaan sa client ang stop_reason na may halagang refusal.
  5. Kung gumagamit ang integration ng computer use sa Claude API o Google Cloud, palitan ang lumang tool na computer_20250124 ng computer_toolset_20260801 at i-update ang tool loop gaya ng nasa gabay. Kailangan din ng hiwalay na plano ng mga organisasyong gumagamit ng Priority Tier capacity para sa Haiku 4.5: ayon sa gabay, walang Priority Tier sa Haiku 5.5.

Hindi nagtatakda ang mga pagbabagong ito ng iisang effort setting para sa lahat ng gawain. Dapat panatilihing pareho sa paghahambing ang gawain ng application at pamantayan ng pagtanggap, saka itala ang kalidad ng sagot, mga pagtanggi, pagkaputol, latency at siningil na token sa mga setting na sinusuri. Iniulat ng Anthropic na mas maganda ang resulta ng Haiku 5.5 kaysa 4.5 sa ilang benchmark, kabilang ang 39.2% kumpara sa 0.0% sa talahanayan nito para sa Terminal-Bench 4.0. Mga resultang iniulat ng Anthropic sa sarili nitong mga kundisyon ng pagsusuri ang mga iyon, hindi sukat ng agent ng mambabasa. Inilalarawan din ng Anthropic ang Sonnet 5.5 at Opus 5.5 bilang mas angkop sa masalimuot na agentic coding sa benchmark na iyon. Para sa kasalukuyang gumagamit ng Haiku 4.5, ang agarang pasya ay kung natutugunan pa rin ng mas maliit na model ang mga kailangan ng bawat makitid na hakbang matapos isama ang pagbabago sa API at bagong bilang ng token.

Mga sanggunian at karagdagang babasahin