Anthropic 於 9 月 28 日推出 Claude Sonnet 5.5,API token 單價與 Sonnet 5 相同。公司表示,該模型生成速度提高逾 30%,且因使用 token 較少,每項任務成本最多可降低 30%。這是兩項不同主張:公開單價沒有調降,而實際任務費用仍取決於提示詞、輸出、工具和思考強度設定。
對開發者而言,此次發布在帶來可能有用的效率提升之際,也調整了可能使 Sonnet 5 整合程式無法運作的設定。Anthropic 文件列出模型 ID 為 claude-sonnet-5-5,可通過 Claude API、Google Cloud 和 Microsoft Foundry 使用;另一個 ID 可在anthropic.claude-sonnet-5-5上通過 Amazon Bedrock 使用。模型頁面列出的上下文窗口為 100 萬 token,最大輸出為 128,000 token。頁面也列出可通過 AWS 上的 Claude Platform 訪問。雲服務商的賬單和區域設置可能與 Claude API 公布的價格不同。
評測結果呈現什麼
Anthropic 的 Terminal-Bench 4.0 測試中,Sonnet 5.5 完成 66 項終端任務中的 70.6%,而發布結果表中的 Sonnet 5 為 10.3%。系統卡將其描述為在容器化命令列環境進行的一組高難度科學與工程任務。Anthropic 以最高思考強度在精簡模式下執行 Claude Code,封鎖網際網路存取,並快取任務所需資源。安全機制將 Sonnet 5.5 的 1.2% 請求轉交備援模型,影響 1.5% 的試驗。Anthropic 報告 Sonnet 5.5 結果的標準誤差為 2.5 個百分點。這個分數反映的是上述設定,不能證明開發者在自己的程式碼儲存庫中也會得到相同幅度的改善。
Anthropic 系統卡指出,Cognition 在 Claude Code 中以 FrontierCode 測試 150 項程式碼儲存庫任務,Sonnet 5.5 在 Main 集合、xhigh 強度下得分 52.1%。調至 max 強度後分數降為 46.2%;部分原因是 Cognition 檢視的案例中,代理額外進行的審查和修改超出基準測試範圍或時限。Cursor 則在其正式環境的代理框架中,以取自 Cursor 工作階段的任務執行 CursorBench 4.0。傳給 Anthropic 的結果表顯示,Sonnet 5.5 在 max 強度下得分 55.5%;Anthropic 依 Cursor 提供的 token 數估算每項任務的成本。這些外部評測使用不同任務與測試框架,本文所列 Sonnet 5.5 數據均來自 Anthropic 系統卡。
Artificial Analysis 也以 GDPval-AA 測試發布前模型,該基準比較 44 種職業、共 220 項任務的工作成果;另測試由相關知識工作專案組成的 AA-Briefcase。系統卡報告指出,在 max 強度下,兩者 Elo 分數分別為 1844 與 1811,接近 Opus 5.5 在這些測試中的結果。Anthropic 表示,發布前版本有一項結構化輸出錯誤可能影響結果,目前已修正。這些比較是在指定條件下評估基準輸出,不能證明 Sonnet 5.5 在讀者自己的開放式任務中會達到 Opus 水準。Anthropic 也表示,Opus 在需要持續判斷力的複雜工作上仍較強。
Anthropic 發布公告引用的早期客戶表示,在各自的測試中工作流程更快、token 用量更少。客戶使用自選任務和方法,因此這些說法無法構成一致的生產力衡量標準。BIG CHANGE 未執行 Sonnet 5.5,也未在實際工作流程中核驗供應商所稱的速度與任務成本數字。
價格與遷移
Claude API 公開單價為每百萬輸入 token 2 美元、每百萬輸出 token 10 美元,與 Sonnet 5 相同。五分鐘快取寫入每百萬 token 收費 2.50 美元,讀取快取每百萬 token 收費 0.20 美元。Anthropic 的每任務成本圖表,是以標價乘上特定思考強度下的 token 用量計算,不能證明所有任務都能省下 30%。團隊比較模型時,應以具代表性的自有任務,在所需品質門檻下實測,同時記錄 token 用量、耗時與成功率。
對於現有的 Messages API 代碼,僅更改模型 ID 可能還不夠。Sonnet 5 原有的thinking: {"type": "disabled"}在 5.5 上會報錯;若要避免預先進行思考,文檔建議改用thinking: {"type": "between_tools"},可接受 low、medium 和 high 三種思考強度。省略該字段時會啟用自適應思考,而 Claude API 默認使用 high 思考強度。強制指定tool_choice時,any和tool也會報錯;Anthropic 建議開發者使用auto,並在支持的情況下使用嚴格工具架構。Sonnet 5.5 在 Amazon Bedrock 上不支持嚴格工具調用:應使用auto而不加strict,並在應用代碼中驗證工具輸入。在工具調用之間顯示文本的代碼,可能還需要處理思考區塊中返回的進度更新。Claude API 和 Google Cloud 上的計算機操作集成需要更新的computer_toolset_20260801工具集,而 Bedrock 仍使用較早的computer_20251124版本。遷移指南還列出了其他兼容性變化。
主要變化
Sonnet 5.5 讓重視成本的團隊能以 Sonnet 5 的 token 單價使用新模型;在數項指定評測中成績較高,Anthropic 也稱輸出速度有所提升。實際效益取決於任務組合與思考強度設定。既有整合也須重新檢查設定。接下來最有參考價值的比較,是以組織自己的工作負載測量正確性、token 用量和耗時。
來源與延伸閱讀
- Anthropic 的 Sonnet 5.5 發布公告介紹了發布日期、公司關於速度和任務成本的說法、基準測試摘要及早期客戶反饋。相關性能說法需要結合具體工作負載核驗。
- Anthropic 的 Sonnet 5.5 系統卡記錄了基準測試任務、測試框架、思考強度設置、備用模型行為和外部評測來源。這是模型供應商的一手披露,其中也包括供應商收到的外部測試結果。
- Claude Platform 模型頁面列出了 API ID、訪問方式、限制和 token 價格。完整價格頁面確認 Sonnet 5 和 5.5 的基礎價格相同,並說明雲服務價格差異。
- Sonnet 5.5 遷移指南記錄了會發生變化或報錯的請求設置。現有集成可參考該指南中的完整檢查清單。



