在9 月 23 日的 Fellows Forum上,OpenAI 应用研究负责人 Boris Power 估计,该公司 80% 至 90% 的研究聚焦于“GPT-7、GPT-8 及更后续的世代”。他在解释 OpenAI 如何平衡当前产品工作与更强大模型的研究时给出了这一数字。这是他在公开对话中的估计;OpenAI 并未发布研究资源分配明细,供外界核对。
主要变化
- 发生了什么变化:Power 描述了两条相互关联的工作线:改进人们当前使用的模型,以及面向后续世代开展研究。他估计,后者占 OpenAI 研究的大多数。
- 为何重要:更强大的大型模型可以针对特定任务提供训练示例,帮助训练更小、成本更低的模型。即使开发者在产品中依赖较小模型,这也让他们有理由关注前沿研究。
- 接下来关注什么:未来的模型发布和技术披露,可以显示大型模型的进展是否传递给了较小模型。这次访谈没有提供 GPT-7 或 GPT-8 的发布时间、规格或结果。
这一估计背后的背景
Power 在回答 Zachary Lipton 关于客户需求如何反馈到研究中的提问时表示,OpenAI 可以通过专门训练数据和应用研究改进某种具体能力,例如工具使用。据他介绍,同一模型世代内的增量更新通常会满足这类需求。他认为,新一代更大型模型可能改变哪些专项修复仍有必要。他将部分当前投入描述为帮助团队今天学得更快、改进更快的方式,即使这些投入并非长期战略。
正是这种区别,引出了他在Fellows Forum 录像 1:32:52 处的发言。Power 所指的是OpenAI 的研究,而不仅是他自己团队的研究。录像和 OpenAI 已发布的材料都没有说明统计的研究具体如何定义、涵盖哪个时间段、预算或员工人数,也没有交代得出这一估计的方法。因此,应将这个数字理解为 Power 对优先事项的描述,而不是经过审计的公司支出或人员配置指标。
Power 以 GPT-7 和 GPT-8 为后续世代的例子。他没有宣布这两款模型,没有披露开发里程碑,也没有给出发布时间表。OpenAI 当前的模型目录列出 GPT-6 Astra、Sol 和 Luna;它为 Power 使用的名称提供公开背景,但不能证明后续世代的研发进展。
他为何谈到蒸馏
在给出估计后,Power 随即描述了一个大型 GPT-6 Astra 模型教导较小 GPT Luna 模型的例子。他想说明的是,强大的大型模型可以提供训练较小模型所需的示例。他解释的是一种研究方法,并未证实某款已发布的 Luna 模型确实由 Astra 训练而成。
OpenAI 的监督微调指南介绍了这一机制:开发者先检验较大型模型在某项明确任务上的表现,保留合适的输出,将其用作训练较小模型的示例,再评估小模型在该任务上的表现。OpenAI 表示,这样可以让较小模型在特定任务上的表现接近较大模型。这并不意味着较小模型会继承教师模型的所有能力。OpenAI 的模型蒸馏公告同样将评估、保存的输出和微调描述为一个迭代过程。
这一想法有更长的历史。在一篇2015 年的研究论文中,Geoffrey Hinton、Oriol Vinyals 和 Jeff Dean 研究了如何将知识从较大型系统迁移到更易部署的模型中。这项工作解释了教师模型与学生模型的概念,但没有涉及 OpenAI 当前的研究资源分配。
这说明了 Power 所描绘的前沿研究与实用模型之间的联系:能力更强的教师模型可以为专用、低成本系统生成有用的训练材料。效果如何取决于任务、所选示例和评估方式。Power 没有为 Astra–Luna 这一例子提供蒸馏结果或对比测量。
Power 的估计之所以值得关注,是因为它表明了他认为 OpenAI 最大的研究价值所在。公开证据能够确认他确实发表了这番言论,也能说明他提到的一般技术。但这些证据无法证明 OpenAI 实际如何分配资源,也无法预知未来 GPT 世代会带来什么。



