一则Reddit 帖文声称,GPT-6 Sol 上线后,OpenAI 将 Codex Pro 订阅的价值削减了一半。帖子中的表格估算,每消耗每周配额的 1%,GPT-5.6 Sol 可折算约 25 美元 API 用量,而 GPT-6 Sol 约为 13 美元。

作者承认 API 价格下降,并描述了用量几乎没有变化的情况。当单价减半时,即使 token 配额不变,折算出的 API 价值也会减半。若要确定订阅用户获得的 token 或完成的任务是否变少,还需要另一种测量。帖中数据没有回答这个问题。

重大变化

  • 变化内容:本地 Codex 日志记录 token 用量。第三方工具将其换算成 API 美元金额,而 OpenAI 的订阅用量计量器则使用单独的配额。
  • 为何重要:订阅用户需要比较每月费用所换来的已完成工作量。API 美元估值下降可能让订阅看起来没那么划算,但没有说明每月费用实际能换来的工作是否减少。
  • 关注事项:服务提供商是否会提供记录,将模型、速度、token 类型和缓存使用情况与配额扣减关联起来。此类记录有助于团队跨版本比较订阅价值,并调查对额度消耗的争议。

在假设配额数量之前,50% 的结果已经成立

OpenAI 当前的标准短上下文 API 单价中,GPT-5.6 Sol 的每百万输入 token 收费 4 美元、每百万输出 token 收费 20 美元。GPT-6 Sol 的对应价格分别为 2 美元和 10 美元。以下使用的是已公布的 API 单价;GPT-6 Sol 的模型页面还列出了输入 token 超过 272,000 后适用的长上下文价格。

对于一个固定工作负载:总计使用一百万个未缓存输入 token 和一百万个输出 token,并分摊到每次请求均处于短上下文计价范围内的多条请求中:

模型

输入成本计算

输出成本计算

API 等值总额

GPT-5.6 Sol

100 万 × 4 美元

100 万 × 20 美元

24 美元

GPT-6 Sol

100 万 × 2 美元

100 万 × 10 美元

12 美元

按标准速度档,OpenAI 的Codex 额度表对相同的未缓存输入和输出用量分别计为 600 和 300 个额度。页面指出,仅凭额度价格无法确定订阅中包含的使用量。

仅仅调整价格就会产生这种结果。若要重现该用户的结果,需要知道其 token 类型组合和具体设置,而帖子没有提供匹配的前后对比数据。

ccusage 测量的是什么

该ccusage Codex 文档将 Codex 支持标为实验性功能。该工具会从本地会话文件中读取token_count事件,按turn_context中的模型归类,然后根据一个定价数据集套用模型价格。其报告给出的是 API 等值估算;文档明确将此结果与 ChatGPT 额度余额区分开来。

成本公式区分普通输入、缓存输入和输出。推理 token 按输出计费。记录到的 Standard 或 Fast 服务档也可能改变估算。因此,每个百分点配额所对应的美元总额较低,实际组合了两种不同记录:按单价估值的本地 token,以及 OpenAI 订阅限额的变动。

有关缓存命中和上下文长度如何改变 token 成本的更多细节,请参阅 BIG CHANGE 的GPT-6 提示词缓存指南。我们的GPT-6 与 Claude 价格比较将 API 价格变化放在更广泛的模型市场中考察。这两篇文章都没有提供有关订阅配额的证据。

OpenAI 公布的订阅包含用量信息

OpenAI 估计,Pro 20x 计划每五小时可发送 300 至 3,000 条 GPT-6 Sol 本地消息,而 GPT-5.6 Sol 为 200 至 2,000 条;还可能适用每周上限。页面没有列出每周 token 上限。这些浮动估算取决于模型、上下文、推理、工具、检索和缓存情况。它们无法证实 Reddit 帖文作者实际获得的配额在前后发生了什么变化。

9 月 22 日的Codex 更新日志宣布在 Codex 和 ChatGPT Work 中推出 GPT-6 Sol 和 Luna,并降低了 token 价格。日志没有宣布削减订阅包含的使用量。

哪些证据才能验证这一说法

三种测量回答的是不同问题:

问题

最低限度的有效记录

API 等值价值是否下降?

对相同的 token 数量分别乘以各模型公布的单价。答案已经是肯定的。

GPT-6 Sol 是否以不同方式消耗额度?

使用同一账户和计划、匹配的任务、固定的推理和速度设置,并记录输入、缓存和输出 token,以及多次运行前后的仪表板百分比。

计划配额本身是否被削减?

在据称发生变化的前后,使用相同模型、设置和工作负载,并在可比较的额度重置周期内进行测量。

必须记录工具调用、检索、上下文增长和缓存状态,因为这些都会改变用量。重复测试也很重要,因为两个智能体运行即便执行同一任务,也可能采取不同路径。

报告中 API 等值价值下降的情况与价格调整相符。订阅实际能完成的工作是否减少,仍无定论。若有一份匹配记录,能够把 token 用量、任务结果和额度变化关联起来,就能回答这个问题;单凭计算无法确认配额被削减,也无法排除计量故障。