Anthropic 在 10 月 7 日推出 Claude Haiku 5.5,目標是處理短而頻繁的工作;這類工作可能占據代理系統的大量呼叫量。Claude API 的公開費率從每百萬輸入 token 0.10 美元、每百萬輸出 token 0.50 美元起,只有 Haiku 4.5 費率的十分之一。然而 Anthropic 表示,同一段文字在新模型上約會使用多 30% 的 token,且超過 100,000 個 token 的提示會進入較高費率級距。使用 Haiku 4.5 的團隊在估算帳單或轉移正式環境流量前,需要重新計算自己的請求。
這次發布也改變了 Messages API 的使用方式。Haiku 5.5 不接受手動設定的 thinking 預算,預設啟用自適應 thinking,而且第一個回應區塊可能是 thinking 而非文字。對於反覆呼叫小型模型來分類、擷取、路由或摘要工作的服務而言,這些都是具體的相容性檢查項目。
重大變化
- 變更內容: Anthropic 將全新的一百萬 token context window 和自適應 thinking 帶進 Claude 價格最低的級別。Haiku 5.5 降低了短提示的費率,同時改變文字的計算方式及回應可能開始的形式。
- 重要性: 團隊現在可以用較低的標價,考慮在更多頻繁且範圍明確的代理步驟中使用 Claude。實際效益取決於提示長度、輸出 token 與 thinking token 的組合、快取使用情況,以及新模型是否達到該步驟的品質目標。
- 觀察重點: Haiku 4.5 的整合需要經過衡量後再遷移。重新計算後,接近 100,000 token 門檻的請求可能跨入較高級距;假設第一個內容區塊一定是文字的程式碼,也可能錯誤處理原本成功的回覆。
價格取決於提示長度
在 Claude API 中,提示最多 100,000 個 token 時,Haiku 5.5 每百萬輸入 token 收費 0.10 美元,每百萬輸出 token 收費 0.50 美元。超過該門檻後,對應費率為 0.50 美元與 2.50 美元。Haiku 4.5 在其 200,000-token context window 中,費率列為 1 美元與 5 美元。Haiku 5.5 的 context window 為一百萬 token,最大輸出為 128,000 token;Haiku 4.5 則分別為 200,000 和 64,000。Anthropic 列出可透過 Claude API、Amazon Bedrock、AWS 上的 Claude Platform、Google Cloud 和 Microsoft Foundry 使用。Amazon Bedrock 的模型 ID 是 anthropic.claude-haiku-5-5;Claude API 使用 claude-haiku-5-5。Anthropic 的模型頁面 提供目前的平台 ID、限制與費率。
Anthropic 表示,Haiku 5.5 的平均執行成本比 Haiku 4.5 低約 75% 平均而言。其註腳合併了幾項條件:提示不超過 100,000 token 時,標價低 90%;超過門檻時低 50%;Anthropic 觀察到 Haiku 4.5 有 90% 的請求屬於較短類別;以及新 tokenizer 對相同工作會計入較多 token。這項計算反映 Anthropic 自身的請求組合,不代表每個請求都會有固定折扣。同樣文字增加約 30% token 也是供應商對相同輸入文字的估算;實際變化取決於內容。Anthropic 的發布公告 同時說明了這項主張及其計算方法。
對於未使用快取的 Claude API 請求,先取得 Haiku 5.5 的輸入與輸出 token 數,分別乘上該請求所屬提示長度級距的費率,再除以一百萬。以算術計算為例:短提示費率下,80,000 個輸入 token 加上 10,000 個輸出 token,費用為 0.013 美元;若是 120,000 個輸入 token 和 10,000 個輸出 token,長提示費率下則為 0.085 美元。這些是價格計算,不是實際觀察到的工作或預測。快取讀取和寫入各有費率,批次處理的輸入和輸出則標示有 50% 折扣。因此,實用的估算方式是先依提示長度和快取情況分類實際呼叫,再加總費用。 Haiku 5.5 模型頁面列出了這些類別。
使用Message token-count endpoint,並指定 claude-haiku-5-5。舊模型的 token 總數無法判斷提示在 5.5 上會落在哪個級距。若要取得實際樣本,請連同工作結果記錄回應中的 usage、輸出長度、快取欄位、effort 和實際費用。樣本應涵蓋短請求、最長的重複對話,以及接近 100,000 token 的案例。BIG CHANGE 已審閱相關文件,但尚未執行 Haiku 5.5,也未測量正式環境工作負載。
需要逐項遷移的設定
Anthropic 的 Haiku 5.5 遷移指南為從 Haiku 4.5 遷移的用戶端提供了相當具體的檢查清單:
- 變更平台所用的模型 ID,並重新計算提示。
claude-haiku-5-5是固定的 Claude API ID,沒有日期後綴或獨立別名。檢查max_tokens,因為 thinking 會占用該限制,而且相同文字可能需要更多 token。 - 將
thinking: {"type":"enabled","budget_tokens":N}改為自適應 thinking,或讓thinking維持未設定。設定output_config.effort以調整深度;文件所列預設值是medium。若max_tokens設定過低,回覆可能在 thinking 區塊後、尚未輸出任何文字前就結束。 - 依
type判斷內容區塊,而非依位置。將 thinking 區塊與工具結果一併原樣傳回。請測試任何會重播對話區塊的儲存系統,確認它不會改用另一個帳戶,或變更先前訊息、系統指令或工具。 - 移除自訂的
temperature、top_p和top_k設定。將最後一則 assistant 預填改成 user 回合;對於受限制的格式,採用 Anthropic 文件所述的結構化輸出或工具方式。在用戶端處理stop_reason為refusal的情況。 - 若整合在 Claude API 或 Google Cloud 上使用 computer use,請將舊的
computer_20250124工具換成computer_toolset_20260801,並依指南更新工具迴圈。使用 Haiku 4.5 Priority Tier 容量的組織也需要另訂方案:指南指出 Haiku 5.5 不提供 Priority Tier。
這些變更並未規定所有任務都要使用同一個 effort 設定。比較時應固定應用任務和驗收標準,再記錄不同設定下的回答品質、拒答、截斷、延遲和計費 token。Anthropic 表示,Haiku 5.5 在多項基準測試中優於 4.5,包括其 Terminal-Bench 4.0 表格中的 39.2% 對 0.0%。這些是 Anthropic 在自身評估條件下公布的結果,並非讀者代理系統的實測。Anthropic 也表示,在該基準中,Sonnet 5.5 和 Opus 5.5 更適合複雜的代理式程式設計。Haiku 4.5 使用者近期需要判斷的是:納入 API 變更和新的 token 數後,較小型模型是否仍符合每個狹窄步驟的要求。
來源與延伸閱讀
- Anthropic 的 Haiku 5.5 公告標示發布日期、預期工作類型與可用平台,並說明公司平均任務成本的計算方式。其基準測試表呈現 Anthropic 的評估結果。
- Claude Platform 的 Haiku 5.5 模型頁面列出 ID、context 和輸出限制、提示長度級距、快取價格與平台支援。Haiku 4.5 頁面提供前代模型的費率與限制。
- Haiku 5.5 遷移指南列出切換既有整合前應檢查的 Messages API 變更與錯誤。token 計數 API 參考文件說明如何使用指定模型計算請求的 token 數。
- Reuters 的 10 月 7 日發布報導獨立佐證發布日期。以上技術設定與費率取自 Anthropic 目前的文件。



