Anthropic 在 10 月 7 日推出 Claude Haiku 5.5,目標是處理短而頻繁的工作;這類工作可能占據代理系統的大量呼叫量。Claude API 的公開費率從每百萬輸入 token 0.10 美元、每百萬輸出 token 0.50 美元起,只有 Haiku 4.5 費率的十分之一。然而 Anthropic 表示,同一段文字在新模型上約會使用多 30% 的 token,且超過 100,000 個 token 的提示會進入較高費率級距。使用 Haiku 4.5 的團隊在估算帳單或轉移正式環境流量前,需要重新計算自己的請求。

這次發布也改變了 Messages API 的使用方式。Haiku 5.5 不接受手動設定的 thinking 預算,預設啟用自適應 thinking,而且第一個回應區塊可能是 thinking 而非文字。對於反覆呼叫小型模型來分類、擷取、路由或摘要工作的服務而言,這些都是具體的相容性檢查項目。

重大變化

  • 變更內容: Anthropic 將全新的一百萬 token context window 和自適應 thinking 帶進 Claude 價格最低的級別。Haiku 5.5 降低了短提示的費率,同時改變文字的計算方式及回應可能開始的形式。
  • 重要性: 團隊現在可以用較低的標價,考慮在更多頻繁且範圍明確的代理步驟中使用 Claude。實際效益取決於提示長度、輸出 token 與 thinking token 的組合、快取使用情況,以及新模型是否達到該步驟的品質目標。
  • 觀察重點: Haiku 4.5 的整合需要經過衡量後再遷移。重新計算後,接近 100,000 token 門檻的請求可能跨入較高級距;假設第一個內容區塊一定是文字的程式碼,也可能錯誤處理原本成功的回覆。

價格取決於提示長度

在 Claude API 中,提示最多 100,000 個 token 時,Haiku 5.5 每百萬輸入 token 收費 0.10 美元,每百萬輸出 token 收費 0.50 美元。超過該門檻後,對應費率為 0.50 美元與 2.50 美元。Haiku 4.5 在其 200,000-token context window 中,費率列為 1 美元與 5 美元。Haiku 5.5 的 context window 為一百萬 token,最大輸出為 128,000 token;Haiku 4.5 則分別為 200,000 和 64,000。Anthropic 列出可透過 Claude API、Amazon Bedrock、AWS 上的 Claude Platform、Google Cloud 和 Microsoft Foundry 使用。Amazon Bedrock 的模型 ID 是 anthropic.claude-haiku-5-5;Claude API 使用 claude-haiku-5-5。Anthropic 的模型頁面 提供目前的平台 ID、限制與費率。

Anthropic 表示,Haiku 5.5 的平均執行成本比 Haiku 4.5 低約 75% 平均而言。其註腳合併了幾項條件:提示不超過 100,000 token 時,標價低 90%;超過門檻時低 50%;Anthropic 觀察到 Haiku 4.5 有 90% 的請求屬於較短類別;以及新 tokenizer 對相同工作會計入較多 token。這項計算反映 Anthropic 自身的請求組合,不代表每個請求都會有固定折扣。同樣文字增加約 30% token 也是供應商對相同輸入文字的估算;實際變化取決於內容。Anthropic 的發布公告 同時說明了這項主張及其計算方法。

對於未使用快取的 Claude API 請求,先取得 Haiku 5.5 的輸入與輸出 token 數,分別乘上該請求所屬提示長度級距的費率,再除以一百萬。以算術計算為例:短提示費率下,80,000 個輸入 token 加上 10,000 個輸出 token,費用為 0.013 美元;若是 120,000 個輸入 token 和 10,000 個輸出 token,長提示費率下則為 0.085 美元。這些是價格計算,不是實際觀察到的工作或預測。快取讀取和寫入各有費率,批次處理的輸入和輸出則標示有 50% 折扣。因此,實用的估算方式是先依提示長度和快取情況分類實際呼叫,再加總費用。 Haiku 5.5 模型頁面列出了這些類別。

使用Message token-count endpoint,並指定 claude-haiku-5-5。舊模型的 token 總數無法判斷提示在 5.5 上會落在哪個級距。若要取得實際樣本,請連同工作結果記錄回應中的 usage、輸出長度、快取欄位、effort 和實際費用。樣本應涵蓋短請求、最長的重複對話,以及接近 100,000 token 的案例。BIG CHANGE 已審閱相關文件,但尚未執行 Haiku 5.5,也未測量正式環境工作負載。

需要逐項遷移的設定

Anthropic 的 Haiku 5.5 遷移指南為從 Haiku 4.5 遷移的用戶端提供了相當具體的檢查清單:

  1. 變更平台所用的模型 ID,並重新計算提示。claude-haiku-5-5是固定的 Claude API ID,沒有日期後綴或獨立別名。檢查 max_tokens,因為 thinking 會占用該限制,而且相同文字可能需要更多 token。
  2. 將 thinking: {"type":"enabled","budget_tokens":N}改為自適應 thinking,或讓 thinking維持未設定。設定 output_config.effort以調整深度;文件所列預設值是 medium。若 max_tokens設定過低,回覆可能在 thinking 區塊後、尚未輸出任何文字前就結束。
  3. 依type判斷內容區塊,而非依位置。將 thinking 區塊與工具結果一併原樣傳回。請測試任何會重播對話區塊的儲存系統,確認它不會改用另一個帳戶,或變更先前訊息、系統指令或工具。
  4. 移除自訂的 temperature、top_p和 top_k設定。將最後一則 assistant 預填改成 user 回合;對於受限制的格式,採用 Anthropic 文件所述的結構化輸出或工具方式。在用戶端處理 stop_reason為 refusal的情況。
  5. 若整合在 Claude API 或 Google Cloud 上使用 computer use,請將舊的 computer_20250124工具換成 computer_toolset_20260801,並依指南更新工具迴圈。使用 Haiku 4.5 Priority Tier 容量的組織也需要另訂方案:指南指出 Haiku 5.5 不提供 Priority Tier。

這些變更並未規定所有任務都要使用同一個 effort 設定。比較時應固定應用任務和驗收標準,再記錄不同設定下的回答品質、拒答、截斷、延遲和計費 token。Anthropic 表示,Haiku 5.5 在多項基準測試中優於 4.5,包括其 Terminal-Bench 4.0 表格中的 39.2% 對 0.0%。這些是 Anthropic 在自身評估條件下公布的結果,並非讀者代理系統的實測。Anthropic 也表示,在該基準中,Sonnet 5.5 和 Opus 5.5 更適合複雜的代理式程式設計。Haiku 4.5 使用者近期需要判斷的是:納入 API 變更和新的 token 數後,較小型模型是否仍符合每個狹窄步驟的要求。

來源與延伸閱讀