Anthropic 于 10 月 7 日发布 Claude Haiku 5.5,面向短小、频繁的任务;这类任务可能占据代理系统大量调用量。Claude API 的公开费率起价为每百万输入 token 0.10 美元、每百万输出 token 0.50 美元,是 Haiku 4.5 费率的十分之一。不过,Anthropic 表示,同一段文本在新模型上约需多 30% 的 token,超过 100,000 token 的 prompt 则进入更高价格档。使用 Haiku 4.5 的团队应在估算账单或迁移生产流量前重新计算自己的请求。
此次发布也改变了 Messages API 的使用方式。手动设置的 thinking 预算在 Haiku 5.5 上无效,adaptive thinking 默认开启,而且第一个响应块可能是 thinking 而不是文本。对于反复调用小模型来分类、提取、路由或总结内容的服务来说,这些都是明确的兼容性检查项。
重大变化
- 变化内容: Anthropic 将全新的百万 token 上下文窗口和 adaptive thinking 带入价格最低的 Claude 档位。Haiku 5.5 降低了短 prompt 的费率,同时改变了文本计数方式和响应可能的开头形式。
- 重要性: 团队现在可以考虑以更低的公开费率,在更多频繁且范围明确的代理步骤中使用 Claude。实际收益取决于 prompt 长度分布、输出和 thinking token、缓存使用情况,以及新模型能否达到该步骤的质量目标。
- 需要关注: Haiku 4.5 集成需要经过测量后再迁移。重新计数后,接近 100,000 token 门槛的请求可能进入更高档位;假设第一个内容块必定是文本的代码,也可能错误处理原本成功的回复。
价格取决于 prompt 长度
在 Claude API 中,Haiku 5.5 对不超过 100,000 token 的 prompt 收费为每百万输入 token 0.10 美元、每百万输出 token 0.50 美元。超过该门槛后,对应费率为 0.50 美元和 2.50 美元。Haiku 4.5 在其 200,000-token 上下文窗口内的标价为 1 美元和 5 美元。Haiku 5.5 的上下文窗口为百万 token,最大输出为 128,000 token;Haiku 4.5 则分别为 200,000 和 64,000。Anthropic 列出 Claude API、Amazon Bedrock、AWS 上的 Claude Platform、Google Cloud 和 Microsoft Foundry 等可用渠道。Amazon Bedrock 的模型 ID 是 anthropic.claude-haiku-5-5;Claude API 使用 claude-haiku-5-5。Anthropic 的模型页面列出了各平台当前的 ID、限制和费率。
Anthropic 表示,Haiku 5.5 的平均运行成本比 Haiku 4.5 低约 75% 平均而言。其脚注综合了几项因素:不超过 100,000 token 的 prompt 标价低 90%;超过门槛后低 50%;Anthropic 观察到 Haiku 4.5 的请求中有 90% 属于较短类别;新 tokenizer 对同一任务会计算出更多 token。这一计算反映的是 Anthropic 自身的请求组合,并不意味着每个请求都能享受统一折扣。同一输入文本增加约 30% token 也是供应商的估算,实际变化取决于内容。Anthropic 的发布公告 同时说明了这一说法及其计算方法。
对于未使用缓存的 Claude API 请求,取 Haiku 5.5 的输入和输出 token 数,分别乘以该请求对应的 prompt 长度价格档费率,再除以一百万。举例来说,按短 prompt 费率计算,80,000 个输入 token 和 10,000 个输出 token 的费用是 0.013 美元;若输入为 120,000、输出为 10,000,按长 prompt 费率计算则为 0.085 美元。这些是价格计算示例,不是实际观察到的任务或预测。缓存读取和写入各有费率,批处理的输入和输出则标有 50% 折扣。因此,实用的估算方法是先按 prompt 长度和缓存行为对真实调用分组,再汇总费用。 Haiku 5.5 模型页面 列出了这些类别。
使用 Message token 计数端点重新计算已保存的代表性 prompt,并指定 claude-haiku-5-5。旧模型的 token 总数无法判断某个 prompt 在 5.5 上会落入哪个档位。若要进行实际抽样,应连同任务结果记录响应中的 usage、输出长度、缓存字段、effort 和实际费用。样本应涵盖短请求、最长的重复对话,以及接近 100,000 token 的情况。BIG CHANGE 已审阅相关文档,但没有运行 Haiku 5.5,也没有测量生产工作负载。
迁移时需要重新检查的设置
Anthropic 的 Haiku 5.5 迁移指南 为从 Haiku 4.5 迁移的客户端提供了相当具体的检查清单:
- 更改平台对应的模型 ID,并重新计算 prompts。
claude-haiku-5-5是固定的 Claude API ID,没有日期后缀或单独别名。检查max_tokens,因为 thinking 会占用该上限,而且相同文本可能需要更多 token。 - 将
thinking: {"type":"enabled","budget_tokens":N}替换为 adaptive thinking,或让thinking保持未设置。通过output_config.effort调整深度;文档中的默认值为medium。较低的max_tokens可能会让响应在 thinking 块之后、任何文本出现之前就结束。 - 按
type读取内容块,而不是按位置读取。将 thinking 块与工具结果一起原样传回。测试会通过另一个账户重放内容块,或更改先前消息、系统指令或工具的对话存储系统。 - 移除自定义的
temperature、top_p和top_k设置。将最后一条 assistant 预填改为 user 回合;对于受限格式,采用 Anthropic 文档说明的结构化输出或工具方案。在客户端处理值为stop_reason的refusal。 - 如果集成在 Claude API 或 Google Cloud 上使用 computer use,请将旧的
computer_20250124工具替换为computer_toolset_20260801,并按指南更新工具循环。使用 Haiku 4.5 Priority Tier 容量的组织还需要单独规划:指南称 Haiku 5.5 不提供 Priority Tier。
这些变化没有规定所有任务都使用同一个 effort 设置。进行比较时,应固定应用任务和验收标准,再记录各候选设置下的回答质量、拒绝、截断、延迟和计费 token。Anthropic 报告称,Haiku 5.5 在多项基准测试中优于 4.5,包括其 Terminal-Bench 4.0 表格中的 39.2% 对 0.0%。这些是在 Anthropic 自身评估条件下报告的结果,并非读者代理系统的实测值。Anthropic 还表示,在该基准上,Sonnet 5.5 和 Opus 5.5 更适合复杂的代理式编程。Haiku 4.5 用户近期需要判断的是:纳入 API 变化和新的 token 数之后,小模型能否满足每个范围较窄步骤的要求。
来源与延伸阅读
- Anthropic 的 Haiku 5.5 发布公告列出发布日期、目标任务和可用性,并解释公司平均任务成本的计算方式。其基准测试表报告了 Anthropic 的评估结果。
- Claude Platform 的 Haiku 5.5 模型页面列出 ID、上下文与输出限制、按 prompt 长度划分的价格档、缓存价格和平台支持。Haiku 4.5 页面提供前代模型的费率和限制。
- Haiku 5.5 迁移指南说明迁移现有集成前应检查的 Messages API 变化和错误。token 计数 API 参考说明如何使用指定模型计算请求的 token 数。
- Reuters 的 10 月 7 日发布报道独立佐证了发布日期。以上技术设置与费率来自 Anthropic 当前文档。



