Vercel 9 月发布的 AI Gateway 报告称,8 月经由其网关路由的词元中,开放权重模型处理了 56%,但按估算支出计算仅占 14%。这一差距显示,使用量和模型预算可能反映不同情况。这是单个网关流量的一个快照,既不代表整个 AI 市场,也不反映客户的实际账单。

在第 290 集《All-In》播客20:03 处,嘉宾讨论了开放权重和高端模型的发布速度,并认为更多能力更强的可下载模型能够扩大使用机会。这是嘉宾的解读。另一个范围更窄的数据点来自 Vercel 的9 月 AI Gateway 生产指数,该指数报告的数据截至 8 月。

主要变化

  • 发生了什么变化:在 Vercel AI Gateway 上,开放权重模型的词元占比从 12 月的少数上升至 8 月的 56%;与此同时,它们在 8 月按标价估算的支出中占 14%。
  • 为何重要:团队选择模型时,需要将词元需求与支出分开,再针对实际任务比较质量和完整运营成本。该指数没有提供特定任务的结果,也没有说明某个团队能够节省多少费用。
  • 接下来关注什么:实际问题在于,所选模型能否以完整成本满足团队对质量、延迟、隐私和运营的要求。单看词元占比无法回答这些问题;许可条款、硬件和工程时间也很重要。

56% 和 14% 的数字衡量什么

Vercel 表示,8 月开放权重模型处理了 AI Gateway 路由词元的 56%;这是这类模型首次占据该网关流量的多数。它们占估算支出的 14%。公司图表显示,占比从 4 月的 13% 升至 8 月的 56%。报告日期为 9 月 17 日,使用截至 8 月的数据。

这项差距并不意味着运行这些模型不花钱。可下载的模型权重仍需要算力、电力和运维。根据四舍五入后的占比估算,这组开放权重模型的每词元估算支出约为其他模型的八分之一。计算方式使用 Vercel 的数据:开放权重组支出的 14% 除以词元的 56%,再与其他模型支出的 86% 除以词元的 44% 相比较。它描述的是不同模型和词元类型的平均值,并非某个具体模型的价格或能力。

该指数统计输入、输出、推理、缓存输入和缓存创建词元。这些词元类型的价格可能不同,因此各组平均值也会反映用户发送和生成的内容。Vercel 按实验室公布的标价估算支出,并称实际账单可能不同。这种方法让公司能够比较使用自带服务商密钥的团队流量,但并非对账单的审计,也没有测量自托管模型的算力成本。

报告还称,8 月网关平均每词元估算价格下降了 23.2%。在 7 月和 8 月分别都运行了超过 1,000 万个词元的团队中,估算每词元价格的团队中位数下降了 7.6%。Vercel 将部分降幅归因于开放权重模型使用量增长。报告没有区分其中有多少变化来自这一转变、有多少来自不同的词元组合,或团队调整模型与工作负载。

单个网关不代表整个市场

该指数统计的是经 Vercel AI Gateway 路由的匿名汇总流量。它展现了通过该服务的真实生产请求,比模型排行榜或发布公告更具体。但报告并未证明其客户能够代表所有 AI 用户,没有披露针对更广泛市场的抽样框,也没有展示不使用该网关的工作负载中的采用情况。因此,这些百分比应理解为 Vercel 网关自身的模型组合。

Vercel 还指出,其开放权重分类依据 AI Gateway 当前的模型清单,比早期报告使用的定义更宽。随着 Vercel 修订方法并获得更完整的数据,过去的数字也可能变化。月度趋势具有参考意义,但报告本身也提示分类边界发生了变化。

“开放权重”也不等同于“开源”。模型权重是可以发布并供下载的学习所得数值参数。开源促进会的《开源 AI 定义 1.0》设定了更广泛的标准:该定义要求具备使用、研究、修改和分享 AI 系统的自由,并将训练数据信息、代码和模型参数列为便于修改的优选形式。可下载的检查点仍可能附带许可限制,或缺少训练代码和数据细节。团队需要核查每个模型的实际许可和发布材料。

这一差距对 AI 买方意味着什么

Vercel 的数据支持一个有限结论:在这个网关上,开放权重模型承载了更多词元流量,但按标价估算的支出占比较低。这些数据不能说明同一工作负载在本地服务器上运行会更便宜,也不能说明低成本模型无需影响质量、速度或可靠性就能取代高端模型。

对产品团队而言,相关比较应当衡量以相同验收标准完成同一任务的成本。这意味着要计入输入和输出量、重试、工具、路由、延迟和任何人工审核,再将服务商账单与直接运行模型权重所需的硬件和运维进行比较。9 月指数没有提供这类逐任务对比。它的价值在于显示:开放权重模型已在一个生产网关上占据相当大的使用量,而支出组合仍集中在其他模型。

《All-In》嘉宾关于模型可用性正在扩大的总体说法,可以用这类使用数据来审视;但 Vercel 指数既不能核实讨论中每项具体模型主张,也不能预测未来的采用趋势。目前值得区分的是:某一类别处理了多少词元、估算的服务商收费是多少,以及团队获得可靠结果的实际成本。

来源与延伸阅读