OpenAI 和 Anthropic 都在 9 月 22 日发布了新模型,但两家的产品线更新速度不同。GPT-6 Sol 和 Luna 与 Astra 同台推出,而 Terra 仍属于 GPT-5.6。Claude Opus 升级至 5.5,同时还有 Fable 5.1、Sonnet 5,以及已发布近一年的 Haiku 4.5。
最有意义的比较是 Astra 对 Fable、Sol 对 Opus、Terra 对 Sonnet,以及 Luna 对 Haiku。横向观察四组,能看到比单独看任一发布更有意思的竞争格局:Opus 正挑战旗舰层级,Luna 给 Anthropic 的低价产品带来压力,而两家产品线的中间档仍不完整。
重大变化
- 变化内容:同一家服务商现在能以差异显著的价格提供新旧模型。OpenAI 更新了低价档,而 Anthropic 此次主要推出 Opus,Haiku 在发布日历上已落后近一年。
- 为何重要:产品团队可以更灵活地降低日常 AI 使用成本,同时在错误代价高昂的场景投入更强的模型。难点在于依据实际表现来选择:模型在产品线中的档位,并不能可靠地预示其基准测试成绩。
- 关注事项:Anthropic 表示 Sonnet 5.5 和 Haiku 5.5 将在未来几周内推出。它们的价格与成绩将决定 OpenAI 目前获得的竞争空间能保留多少,尤其是在大量调用低价模型的产品中。
各档价格
以下所有数据均为直接 API 的 Standard 美元费率,单位为每百万 token,查阅时间为 9 月 22 日。“缓存输入”指命中缓存的输入。OpenAI 公布的费率适用于最多 272,000 个输入 token 的请求;超出该长度后,完整请求的输入费率翻倍,输出费率提高 50%。缓存写入、批处理和工具另有计费条件。来源:OpenAI和Anthropic。
模型 | 输入 | 缓存输入 | 输出 |
|---|---|---|---|
GPT-6 Astra | $10 | $1 | $50 |
Claude Fable 5.1 | $10 | $0.25 | $50 |
GPT-6 Sol | $2 | $0.20 | $10 |
Claude Opus 5.5 | $4 | $0.20 | $20 |
GPT-5.6 Terra | $2 | $0.20 | $12 |
Claude Sonnet 5 | $2 | $0.20 | $10 |
GPT-6 Luna | $0.10 | $0.01 | $0.50 |
Claude Haiku 4.5 | $1 | $0.10 | $5 |
智能指数与实测测试支出
Artificial Analysis Intelligence Index v4.3.2,查阅时间为 9 月 22 日。成本是运营方按指数任务加权计算的平均支出。
模型 | 测试设置 | 智能指数 | 每项指数任务成本 |
|---|---|---|---|
GPT-6 Astra | Max | 52.7 | $3.26 |
Claude Fable 5.1 | Max(含回退) | 53.4 | $7.63 |
GPT-6 Sol | Max | 47.5 | 未列出 |
Claude Opus 5.5 | Max(含回退) | 57.6 | $5.98 |
GPT-5.6 Terra | Max | 42.1 | $1.40 |
Claude Sonnet 5 | Max | 38.2 | $5.09 |
GPT-6 Luna | Max | 37.3 | 未列出 |
Claude Haiku 4.5 | 启用推理 | 16.9 | $0.21 |
来源:Artificial Analysis;以下各组对比链接至单个模型结果。
Astra 对 Fable:旗舰之争
两者的普通输入和输出价格相同。Fable 的缓存命中费率只有 Astra 的四分之一;如果应用反复复用符合条件的提示内容,这一区别就很重要。
在 Artificial Analysis 当前的智能指数中,Astra 在 Max 设置下得分为52.7;Fable 5.1 在 Max(含回退)设置下得分为53.4。两者分数接近。Artificial Analysis 报告,Astra 每项指数任务加权支出为Astra 每项指数任务 3.26 美元,而Fable 为 7.63 美元。尽管输入和输出价格相同,Astra 的成绩接近,实测支出却低约 57%。Astra 的结果、Fable 的结果。
Sol 对 Opus:低价遇上更高分数
Sol 的普通输入和输出费率是 Opus 的一半,两者的缓存命中费率相同。OpenAI 还将 Sol 的输入和输出价格较 GPT-5.6 Sol 发布时下调了一半。Anthropic 则将 Opus 相应费率较 Opus 5 下调了 20%。OpenAI 发布时的价格、Opus 发布时的价格。
Artificial Analysis 给 Sol 在 Max 设置下的评分为47.5,对比之下,Opus 5.5 在 Max(含回退)设置下的评分为 57.6。Opus 领先 Sol 10.1 分,普通输入和输出价格则是其两倍。它的得分也高于 Astra,而输入和输出费率低 60%。实测支出呈现出另一种情况:Opus 每项指数任务平均花费5.98 美元,比 Astra 高约 84%。查阅时,Artificial Analysis 公布的成本图表尚未列出 Sol 的数字。Sol 的结果、Opus 的结果。
Terra 对 Sonnet:缺少 GPT-6 型号
OpenAI 当前发布信息和模型目录中没有 GPT-6 Terra。可供比较的是GPT-5.6 Terra,其当前API 文档确认了上方费率。OpenAI 的Work 与 Codex 指南也表示,在 GPT-6 Sol 和 Luna 推出期间,旧款 5.6 模型仍然可用。
在 Max 推理力度下,Terra 在 Artificial Analysis 指数中的得分为42.1;Sonnet 5 得分为38.2。Terra 每项指数任务平均花费1.40 美元,而Sonnet 为 5.09 美元:Terra 的得分更高,实测支出低约 73%。其输出 token 费率反而高 20%,说明 token 消耗和缓存可能比标价更能影响成本。Terra 的结果、Sonnet 的结果。
Sonnet 5 于 6 月 30 日推出。Anthropic 现已宣布 Sonnet 5.5 将在未来几周内到来。在新版本可供测试和定价之前,对今天 Sonnet 5 的比较仍然成立。
Luna 对 Haiku:发布年份差距最大
Luna 在列出的每种 token 类别中,价格都只有 Haiku 的十分之一。Haiku 4.5 于 2025 年 10 月 15 日推出,比 Luna 早342 天。它仍是 Anthropic 当前已发布的 Haiku;公司称 5.5 版将在未来几周推出。
独立测试也显示出性能差距。在 Artificial Analysis 指数中,Luna 在 Max 设置下得分为37.3,而 Haiku 4.5 在启用推理后得分为16.9。两者是在同一套当前测试中的指数分数,Luna 的 token 价格还低 90%。Haiku 启用推理后,每项指数任务平均花费0.21 美元;运营方公布的图表当时尚未列出 Luna 对应的成本。Luna 的结果、Haiku 推理结果。
这暴露了 Anthropic 产品线的一处短板:其当前最便宜的模型正面对一款新发布的竞品,而竞品不仅 token 费率更低,在这项评测中的结果也强得多。因此,对于大量购买模型服务的开发者来说,已经预告的 Haiku 更新将是接下来值得关注的重要发布。
以上 Artificial Analysis 数据使用Intelligence Index v4.3.2,这是一个由 10 项评估构成的综合指标,查阅时间为 9 月 22 日。分数旁均列出测试设置;Fable 和 Opus 项目包括运营方的回退配置。指数与方法说明。
智能体必须完成工作的情况如何?
Zapier 的AutomationBench v1.0.6会在模拟的业务应用中测试端到端工作。只有所有计分结果都正确,才算通过。其 9 月 22 日排行榜报告:
模型 | 测试设置 | 通过率 | 每项任务成本 |
|---|---|---|---|
GPT-6 Astra | Max | 41.4% | $1.73 |
Claude Fable 5.1 | Max,单独运行 | 22.37% | $2.45 |
GPT-6 Sol | Xhigh | 33.2% | $0.27 |
GPT-6 Sol | Max | 32.0% | $0.34 |
Claude Opus 5.5 | Max | 40.0% | $1.28 |
GPT-5.6 Terra | Max | 23.59% | $0.51 |
Claude Sonnet 5 | Max | 10.65% | $0.88 |
GPT-6 Luna | Max | 20.7% | $0.04 |
Claude Haiku 4.5 | 未注明 | 0.46% | $0.07 |
单独运行 Fable 与 Opus 5 的组合得分为 31.4%。Opus 处理了约 40% 的任务;页面显示的 2.45 美元成本不包括这些回退 token。
Sol 在 Xhigh 设置下,每次尝试的支出约低 79%于 Max 设置下的 Opus,低 6.8 个百分点。Luna 的通过率高于 Haiku,且任务成本低 43%。Astra 在这一组中领先;所有模型的通过率都不到一半。Zapier 的结果与评分方法。
发布节奏忙碌且不均衡
两家公司的 API 发布记录各自提供了一条经过筛选的版本序列。OpenAI 序列按编号列出 GPT 系列,至 GPT-6 Astra 为止;它不包括 Instant 和 Codex 等专用分支,也不包括随后扩展的层级,例如 3 月 17 日推出的 GPT-5.4 mini 和 nano,以及 9 月 22 日推出的 GPT-6 Sol 和 Luna。Anthropic 序列则跟踪公开的 Opus API 版本。“间隔”指同一家公司所选序列中与前一项之间的日历天数。
- GPT-5 系列 — 2025 年 8 月 7 日:系列发布;首项不适用间隔。
- GPT-5.1 — 2025 年 11 月 13 日:版本更新;间隔 98 天。
- GPT-5.2 — 2025 年 12 月 11 日:版本更新;间隔 28 天。
- GPT-5.4 — 2026 年 3 月 5 日:版本更新;间隔 84 天。
- GPT-5.5 — 2026 年 4 月 24 日:版本更新;间隔 50 天。
- GPT-5.6 — 2026 年 7 月 9 日:系列更新并扩展档位;间隔 76 天。
- GPT-6 Astra — 2026 年 9 月 3 日:新系列发布;间隔 56 天。
来源:OpenAI API 更新日志。另外,GPT-6 Sol 和 Luna 于 9 月 22 日推出,比 Astra 晚 19 天。该间隔衡量的是同一系列的档位扩展,不属于上方的编号版本序列。
- Opus 4 — 2025 年 5 月 22 日:大版本;首项不适用间隔。
- Opus 4.1 — 2025 年 8 月 5 日:小版本更新;间隔 75 天。
- Opus 4.5 — 2025 年 11 月 24 日:版本更新;间隔 111 天。
- Opus 4.6 — 2026 年 2 月 5 日:版本更新;间隔 73 天。
- Opus 4.7 — 2026 年 4 月 16 日:版本更新;间隔 70 天。
- Opus 4.8 — 2026 年 5 月 28 日:版本更新;间隔 42 天。
- Opus 5 — 2026 年 7 月 24 日:大版本;间隔 57 天。
- Opus 5.5 — 2026 年 9 月 22 日:版本更新并降价;间隔 60 天。
来源:Anthropic API 发布说明。Fable 和受限发布的 Mythos 属于独立分支,因此未纳入 Opus 序列。
OpenAI 编号版本之间的间隔在 28 至 98 天之间;Anthropic 的 Opus 版本间隔为 42 至 111 天。如果将“大版本”定义为系列编号变化,那么 GPT-5 到 GPT-6 相隔 392 天,Opus 4 到 Opus 5 相隔 428 天。较短的间隔属于小版本更新和档位扩展。两条序列都不均衡:较短的间隔之后也可能跟着较长间隔。
实际压力在于有选择地升级
发布日历不断带来重新评估模型选择的理由。今天这四组配对说明,笼统评价某家服务商会错过重要差异:Anthropic 新推出的 Opus 实力强劲;OpenAI 则推出了更具竞争力的低价档;两家公司仍都在产品线上保留旧款模型。
切换版本也需要工程投入。Anthropic 的Opus 5.5 迁移指南称,推理功能始终开启;强制选择工具会报错;Claude API 和 Google Cloud 不再接受早期的电脑操作工具类型。使用这些选项的现有集成需要修改。
下一项已公布的更新是 Anthropic 对 Sonnet 和 Haiku 的刷新,这为近期重新评估低价档提供了明确理由。目前,价格表和独立结果已经显示竞争格局在哪里发生了变化,以及为何仍值得考虑某些旧款模型。



