OpenAI 和 Anthropic 都在 9 月 22 日发布了新模型,但两家的产品线更新速度不同。GPT-6 Sol 和 Luna 与 Astra 同台推出,而 Terra 仍属于 GPT-5.6。Claude Opus 升级至 5.5,同时还有 Fable 5.1、Sonnet 5,以及已发布近一年的 Haiku 4.5。

最有意义的比较是 Astra 对 Fable、Sol 对 Opus、Terra 对 Sonnet,以及 Luna 对 Haiku。横向观察四组,能看到比单独看任一发布更有意思的竞争格局:Opus 正挑战旗舰层级,Luna 给 Anthropic 的低价产品带来压力,而两家产品线的中间档仍不完整。

重大变化

  • 变化内容:同一家服务商现在能以差异显著的价格提供新旧模型。OpenAI 更新了低价档,而 Anthropic 此次主要推出 Opus,Haiku 在发布日历上已落后近一年。
  • 为何重要:产品团队可以更灵活地降低日常 AI 使用成本,同时在错误代价高昂的场景投入更强的模型。难点在于依据实际表现来选择:模型在产品线中的档位,并不能可靠地预示其基准测试成绩。
  • 关注事项:Anthropic 表示 Sonnet 5.5 和 Haiku 5.5 将在未来几周内推出。它们的价格与成绩将决定 OpenAI 目前获得的竞争空间能保留多少,尤其是在大量调用低价模型的产品中。

各档价格

以下所有数据均为直接 API 的 Standard 美元费率,单位为每百万 token,查阅时间为 9 月 22 日。“缓存输入”指命中缓存的输入。OpenAI 公布的费率适用于最多 272,000 个输入 token 的请求;超出该长度后,完整请求的输入费率翻倍,输出费率提高 50%。缓存写入、批处理和工具另有计费条件。来源:OpenAI和Anthropic。

模型

输入

缓存输入

输出

GPT-6 Astra

$10

$1

$50

Claude Fable 5.1

$10

$0.25

$50

GPT-6 Sol

$2

$0.20

$10

Claude Opus 5.5

$4

$0.20

$20

GPT-5.6 Terra

$2

$0.20

$12

Claude Sonnet 5

$2

$0.20

$10

GPT-6 Luna

$0.10

$0.01

$0.50

Claude Haiku 4.5

$1

$0.10

$5

智能指数与实测测试支出

Artificial Analysis Intelligence Index v4.3.2,查阅时间为 9 月 22 日。成本是运营方按指数任务加权计算的平均支出。

模型

测试设置

智能指数

每项指数任务成本

GPT-6 Astra

Max

52.7

$3.26

Claude Fable 5.1

Max(含回退)

53.4

$7.63

GPT-6 Sol

Max

47.5

未列出

Claude Opus 5.5

Max(含回退)

57.6

$5.98

GPT-5.6 Terra

Max

42.1

$1.40

Claude Sonnet 5

Max

38.2

$5.09

GPT-6 Luna

Max

37.3

未列出

Claude Haiku 4.5

启用推理

16.9

$0.21

来源:Artificial Analysis;以下各组对比链接至单个模型结果。

Astra 对 Fable:旗舰之争

两者的普通输入和输出价格相同。Fable 的缓存命中费率只有 Astra 的四分之一;如果应用反复复用符合条件的提示内容,这一区别就很重要。

在 Artificial Analysis 当前的智能指数中,Astra 在 Max 设置下得分为52.7;Fable 5.1 在 Max(含回退)设置下得分为53.4。两者分数接近。Artificial Analysis 报告,Astra 每项指数任务加权支出为Astra 每项指数任务 3.26 美元,而Fable 为 7.63 美元。尽管输入和输出价格相同,Astra 的成绩接近,实测支出却低约 57%。Astra 的结果、Fable 的结果。

Sol 对 Opus:低价遇上更高分数

Sol 的普通输入和输出费率是 Opus 的一半,两者的缓存命中费率相同。OpenAI 还将 Sol 的输入和输出价格较 GPT-5.6 Sol 发布时下调了一半。Anthropic 则将 Opus 相应费率较 Opus 5 下调了 20%。OpenAI 发布时的价格、Opus 发布时的价格。

Artificial Analysis 给 Sol 在 Max 设置下的评分为47.5,对比之下,Opus 5.5 在 Max(含回退)设置下的评分为 57.6。Opus 领先 Sol 10.1 分,普通输入和输出价格则是其两倍。它的得分也高于 Astra,而输入和输出费率低 60%。实测支出呈现出另一种情况:Opus 每项指数任务平均花费5.98 美元,比 Astra 高约 84%。查阅时,Artificial Analysis 公布的成本图表尚未列出 Sol 的数字。Sol 的结果、Opus 的结果。

Terra 对 Sonnet:缺少 GPT-6 型号

OpenAI 当前发布信息和模型目录中没有 GPT-6 Terra。可供比较的是GPT-5.6 Terra,其当前API 文档确认了上方费率。OpenAI 的Work 与 Codex 指南也表示,在 GPT-6 Sol 和 Luna 推出期间,旧款 5.6 模型仍然可用。

在 Max 推理力度下,Terra 在 Artificial Analysis 指数中的得分为42.1;Sonnet 5 得分为38.2。Terra 每项指数任务平均花费1.40 美元,而Sonnet 为 5.09 美元:Terra 的得分更高,实测支出低约 73%。其输出 token 费率反而高 20%,说明 token 消耗和缓存可能比标价更能影响成本。Terra 的结果、Sonnet 的结果。

Sonnet 5 于 6 月 30 日推出。Anthropic 现已宣布 Sonnet 5.5 将在未来几周内到来。在新版本可供测试和定价之前,对今天 Sonnet 5 的比较仍然成立。

Luna 对 Haiku:发布年份差距最大

Luna 在列出的每种 token 类别中,价格都只有 Haiku 的十分之一。Haiku 4.5 于 2025 年 10 月 15 日推出,比 Luna 早342 天。它仍是 Anthropic 当前已发布的 Haiku;公司称 5.5 版将在未来几周推出。

独立测试也显示出性能差距。在 Artificial Analysis 指数中,Luna 在 Max 设置下得分为37.3,而 Haiku 4.5 在启用推理后得分为16.9。两者是在同一套当前测试中的指数分数,Luna 的 token 价格还低 90%。Haiku 启用推理后,每项指数任务平均花费0.21 美元;运营方公布的图表当时尚未列出 Luna 对应的成本。Luna 的结果、Haiku 推理结果。

这暴露了 Anthropic 产品线的一处短板:其当前最便宜的模型正面对一款新发布的竞品,而竞品不仅 token 费率更低,在这项评测中的结果也强得多。因此,对于大量购买模型服务的开发者来说,已经预告的 Haiku 更新将是接下来值得关注的重要发布。

以上 Artificial Analysis 数据使用Intelligence Index v4.3.2,这是一个由 10 项评估构成的综合指标,查阅时间为 9 月 22 日。分数旁均列出测试设置;Fable 和 Opus 项目包括运营方的回退配置。指数与方法说明。

智能体必须完成工作的情况如何?

Zapier 的AutomationBench v1.0.6会在模拟的业务应用中测试端到端工作。只有所有计分结果都正确,才算通过。其 9 月 22 日排行榜报告:

模型

测试设置

通过率

每项任务成本

GPT-6 Astra

Max

41.4%

$1.73

Claude Fable 5.1

Max,单独运行

22.37%

$2.45

GPT-6 Sol

Xhigh

33.2%

$0.27

GPT-6 Sol

Max

32.0%

$0.34

Claude Opus 5.5

Max

40.0%

$1.28

GPT-5.6 Terra

Max

23.59%

$0.51

Claude Sonnet 5

Max

10.65%

$0.88

GPT-6 Luna

Max

20.7%

$0.04

Claude Haiku 4.5

未注明

0.46%

$0.07

单独运行 Fable 与 Opus 5 的组合得分为 31.4%。Opus 处理了约 40% 的任务;页面显示的 2.45 美元成本不包括这些回退 token。

Sol 在 Xhigh 设置下,每次尝试的支出约低 79%于 Max 设置下的 Opus,低 6.8 个百分点。Luna 的通过率高于 Haiku,且任务成本低 43%。Astra 在这一组中领先;所有模型的通过率都不到一半。Zapier 的结果与评分方法。

发布节奏忙碌且不均衡

两家公司的 API 发布记录各自提供了一条经过筛选的版本序列。OpenAI 序列按编号列出 GPT 系列,至 GPT-6 Astra 为止;它不包括 Instant 和 Codex 等专用分支,也不包括随后扩展的层级,例如 3 月 17 日推出的 GPT-5.4 mini 和 nano,以及 9 月 22 日推出的 GPT-6 Sol 和 Luna。Anthropic 序列则跟踪公开的 Opus API 版本。“间隔”指同一家公司所选序列中与前一项之间的日历天数。

  • GPT-5 系列 — 2025 年 8 月 7 日:系列发布;首项不适用间隔。
  • GPT-5.1 — 2025 年 11 月 13 日:版本更新;间隔 98 天。
  • GPT-5.2 — 2025 年 12 月 11 日:版本更新;间隔 28 天。
  • GPT-5.4 — 2026 年 3 月 5 日:版本更新;间隔 84 天。
  • GPT-5.5 — 2026 年 4 月 24 日:版本更新;间隔 50 天。
  • GPT-5.6 — 2026 年 7 月 9 日:系列更新并扩展档位;间隔 76 天。
  • GPT-6 Astra — 2026 年 9 月 3 日:新系列发布;间隔 56 天。

来源:OpenAI API 更新日志。另外,GPT-6 Sol 和 Luna 于 9 月 22 日推出,比 Astra 晚 19 天。该间隔衡量的是同一系列的档位扩展,不属于上方的编号版本序列。

  • Opus 4 — 2025 年 5 月 22 日:大版本;首项不适用间隔。
  • Opus 4.1 — 2025 年 8 月 5 日:小版本更新;间隔 75 天。
  • Opus 4.5 — 2025 年 11 月 24 日:版本更新;间隔 111 天。
  • Opus 4.6 — 2026 年 2 月 5 日:版本更新;间隔 73 天。
  • Opus 4.7 — 2026 年 4 月 16 日:版本更新;间隔 70 天。
  • Opus 4.8 — 2026 年 5 月 28 日:版本更新;间隔 42 天。
  • Opus 5 — 2026 年 7 月 24 日:大版本;间隔 57 天。
  • Opus 5.5 — 2026 年 9 月 22 日:版本更新并降价;间隔 60 天。

来源:Anthropic API 发布说明。Fable 和受限发布的 Mythos 属于独立分支,因此未纳入 Opus 序列。

OpenAI 编号版本之间的间隔在 28 至 98 天之间;Anthropic 的 Opus 版本间隔为 42 至 111 天。如果将“大版本”定义为系列编号变化,那么 GPT-5 到 GPT-6 相隔 392 天,Opus 4 到 Opus 5 相隔 428 天。较短的间隔属于小版本更新和档位扩展。两条序列都不均衡:较短的间隔之后也可能跟着较长间隔。

实际压力在于有选择地升级

发布日历不断带来重新评估模型选择的理由。今天这四组配对说明,笼统评价某家服务商会错过重要差异:Anthropic 新推出的 Opus 实力强劲;OpenAI 则推出了更具竞争力的低价档;两家公司仍都在产品线上保留旧款模型。

切换版本也需要工程投入。Anthropic 的Opus 5.5 迁移指南称,推理功能始终开启;强制选择工具会报错;Claude API 和 Google Cloud 不再接受早期的电脑操作工具类型。使用这些选项的现有集成需要修改。

下一项已公布的更新是 Anthropic 对 Sonnet 和 Haiku 的刷新,这为近期重新评估低价档提供了明确理由。目前,价格表和独立结果已经显示竞争格局在哪里发生了变化,以及为何仍值得考虑某些旧款模型。