Anthropic 于 9 月 28 日发布 Claude Sonnet 5.5,其 API token 价格与 Sonnet 5 相同。公司称,该模型生成内容的速度提升超过 30%,并且由于使用的 token 更少,每项任务的成本最高可降低 30%。这是两项不同的说法:标价并未下降,而且任务账单仍取决于提示词、输出、工具和努力程度设置。

对开发者来说,此次发布带来了可能有用的效率提升,同时也包含可能导致 Sonnet 5 集成无法正常工作的变更。Anthropic 的文档将该模型的 ID 列为claude-sonnet-5-5,可通过 Claude API、Google Cloud 和 Microsoft Foundry 使用;另一个 ID 可在anthropic.claude-sonnet-5-5上通过 Amazon Bedrock 使用。模型页面列出的上下文窗口为 100 万 token,最大输出为 128,000 token。页面也列出可通过 AWS 上的 Claude Platform 访问。云服务商的账单和区域设置可能与 Claude API 公布的价格不同。

评测结果显示了什么

在 Anthropic 的 Terminal-Bench 4.0 测试中,Sonnet 5.5 完成了 66 项终端任务中的 70.6%,而发布结果表中 Sonnet 5 的比例为 10.3%。系统卡将测试描述为一组高难度科学和工程任务,在容器化命令行环境中进行。Anthropic 以最高思考努力程度,在精简模式下运行 Claude Code,阻断互联网访问,并缓存任务所需资源。安全机制将 Sonnet 5.5 的 1.2% 请求转交给备用模型,影响了 1.5% 的试验。Anthropic 报告称,Sonnet 5.5 结果的标准误差为 2.5 个百分点。该分数衡量的是这套测试配置,不能证明开发者在自己的代码仓库中也会获得同等提升。

据 Anthropic 的系统卡所述,Cognition 在 Claude Code 中对 150 项代码仓库任务运行 FrontierCode,并报告 Sonnet 5.5 在其 Main 集合、xhigh 努力程度下得分为 52.1%。努力程度调至 max 后,得分降至 46.2%;部分原因是 Cognition 检查的案例中,智能体增加的审查和编辑超出了基准测试的范围或时限。Cursor 在其生产级智能体框架中,对取自 Cursor 会话的任务运行 CursorBench 4.0。Anthropic 收到的一张结果表显示,Sonnet 5.5 在 max 努力程度下得分为 55.5%;Anthropic 根据 Cursor 的 token 数估算了该模型每项任务的成本。这些外部评测使用了不同的任务和框架,本文列出的 Sonnet 5.5 数字来自 Anthropic 的系统卡。

Artificial Analysis 还使用 GDPval-AA 测试了发布前模型。该测试涵盖 44 种职业的 220 项任务,以比较工作成果;此外还测试了 AA-Briefcase,这是一组相互关联的知识工作项目。系统卡报告称,在最高努力程度下,这两个测试的 Elo 分数分别为 1844 和 1811,接近 Opus 5.5 在相应测试中的成绩。Anthropic 表示,发布前版本存在一个可能影响结果的结构化输出错误,目前已修复。这些比较评估的是模型在相应条件下的基准测试输出,不能说明 Sonnet 5.5 在读者开放式任务中的表现会达到 Opus 水平。Anthropic 自己也表示,Opus 在需要持续判断力的复杂工作中仍然更强。

Anthropic 发布公告引用的早期客户称,在各自测试中工作流程更快、使用的 token 更少。这些客户使用了自己的任务和方法,其说法无法构成统一的生产力衡量指标。BIG CHANGE 没有运行 Sonnet 5.5,也未在实际工作流中核验供应商关于速度和任务成本的数字。

价格与迁移

Claude API 的公开标价为每百万输入 token 2 美元、每百万输出 token 10 美元,与 Sonnet 5 相同。五分钟缓存写入的价格为每百万 token 2.50 美元,缓存读取为 0.20 美元。Anthropic 的每任务成本图表将标价与特定努力程度下消耗的 token 数结合计算,无法证明所有任务都能统一节省 30%。团队比较模型时,应使用具有代表性的自有任务,在所需质量门槛下进行测试,同时记录 token 用量、完成耗时和成功情况。

对于现有的 Messages API 代码,仅更改模型 ID 可能还不够。Sonnet 5 原有的thinking: {"type": "disabled"}在 5.5 上会报错;若要避免预先进行思考,文档建议改用thinking: {"type": "between_tools"},可接受 low、medium 和 high 三种努力程度。省略该字段时会启用自适应思考,而 Claude API 默认使用 high 努力程度。强制指定tool_choice时,any和tool也会报错;Anthropic 建议开发者使用auto,并在支持的情况下使用严格工具架构。Sonnet 5.5 在 Amazon Bedrock 上不支持严格工具调用:应使用auto而不加strict,并在应用代码中验证工具输入。在工具调用之间显示文本的代码,可能还需要处理思考区块中返回的进度更新。Claude API 和 Google Cloud 上的计算机操作集成需要更新的computer_toolset_20260801工具集,而 Bedrock 仍使用较早的computer_20251124版本。迁移指南还列出了其他兼容性变化。

主要变化

Sonnet 5.5 为注重成本的团队提供了新模型,token 价格与 Sonnet 5 相同;在若干指定评测中得分更高,Anthropic 也称生成速度有所提升。实际价值取决于任务组合和努力程度设置。现有集成还需要检查设置。最清楚的下一步是用组织自己的工作负载进行比较,并衡量结果是否正确、token 用量和耗时。

来源与延伸阅读

  • Anthropic 的 Sonnet 5.5 发布公告介绍了发布日期、公司关于速度和任务成本的说法、基准测试摘要及早期客户反馈。相关性能说法需要结合具体工作负载核验。
  • Anthropic 的 Sonnet 5.5 系统卡记录了基准测试任务、测试框架、努力程度设置、备用模型行为和外部评测来源。这是模型供应商的一手披露,其中也包括供应商收到的外部测试结果。
  • Claude Platform 模型页面列出了 API ID、访问方式、限制和 token 价格。完整价格页面确认 Sonnet 5 和 5.5 的基础价格相同,并说明云服务价格差异。
  • Sonnet 5.5 迁移指南记录了会发生变化或报错的请求设置。现有集成可参考该指南中的完整检查清单。