OpenAI 于 GPT-6 系列指南 于 2026 年 10 月 2 日发布。该指南将模型选择、指令、长时间运行的任务和部署检查整合在一起。软件团队仍需找到合适的组合,使其通过自身的任务检查,同时满足成本和响应时间限制。
该指南当前列出的系列模型包括 GPT-6 Astra、GPT-6.1 Sol 和 GPT-6 Luna。我们于 10 月 3 日核对了 OpenAI 的 API 文档和价格。下文的选择方法和工作表是建议方案;我们没有运行这些模型,也没有测量生产工作负载。
重大变化
- 变化: OpenAI 现在将 GPT-6 系列定位为面向不同工作负载的一组选项,并提供可调节的推理强度和支持多步骤工作的工具。团队可以为工作流中的各个环节分别配置,而不必让同一个模型设置承担所有任务。
- 意义: 开发者可以测量:需要专注提取任务时是否用 Luna,编程或研究任务是否值得使用 Sol,以及 Astra 的额外能力是否物有所值。答案取决于已完成的任务、延迟和整个工作流的成本,包括工具使用和失败的尝试。
- 关注点: 长时间运行需要明确的交接和检查。运行过程中可以通过 Steering 更新指令,但在接受最终答案之前,仍需核对异步工具结果和委派任务。
按任务选择,再衡量整个工作流
从一组有代表性的真实任务开始,并为每项任务制定验收规则。OpenAI 建议使用 Responses API 来获取当前模型行为、工具调用和有状态工作的支持。前提是具备 API 项目、凭据、账单访问权限,以及该项目可用的模型。模型页面未列出免费层支持;速率限制取决于使用层级。确定部署规模前,请核实账户的实际访问权限和限制。
分配给模型的工作 | 初始候选模型 | 初始推理强度 | 何时升级或调整 |
|---|---|---|---|
重复的信息提取、分类,或答案明确的结构化摘要 | | 常规任务从 Low 开始;与默认的 Medium 对比 | 错误率或审核时间超过团队设定的阈值 |
编程、研究、工具使用或需要专业判断的环节 | | 使用默认的 Medium;针对困难案例测试 High | 即使输入和指令可靠,有代表性的任务仍然失败 |
需要最高强度推理或质量至关重要的审核环节 | | 在相同案例上比较 Medium 和 High | 只有在实测收益足以抵消额外成本和时间时才保留 |
这张表将 OpenAI 的 模型指南 与 模型页面 转化为评估起点。请核对 API 模型 ID 和支持的推理强度设置:Astra 和 GPT-6.1 Sol 支持 Low 到 Max;Luna 还支持 None。GPT-6.1 Sol 不支持 None 和 Minimal。OpenAI 建议在 High 表现不足时,尝试受支持的 Extra High 或 Max。请在同一组任务上比较不同推理强度,因为质量、耗时和 token 使用量可能同时变化。
对于 Standard 模式且输入不超过 272,000 个 token 的提示,当前每百万 token 的文本费率如下:
模型 | 输入 | 缓存输入 | 缓存写入 | 输出 |
|---|---|---|---|---|
GPT-6 Luna | $0.10 | $0.01 | $0.125 | $0.50 |
GPT-6.1 Sol | $2.00 | $0.10 | $2.50 | $10.00 |
GPT-6 Astra | $10.00 | $1.00 | $12.50 | $50.00 |
来源:Luna,GPT-6.1 Sol和Astra模型页面。输入 token 超过 272,000 的请求,整个请求都会适用更高费率。其他处理模式、可用地区的区域处理以及部分工具也会改变账单。三款模型的页面都列出 1,050,000-token 上下文窗口和最多 128,000 个输出 token;大窗口是容量上限,并不意味着应该发送所有可用文档。
估算完整任务路径的成本:输入、缓存输入、缓存写入、输出、工具费用、重试,以及长上下文附加费用。将总成本除以按照同一审核规则验收的任务数。然后分别比较面向用户步骤的延迟和整个工作流的延迟。仅凭单位价格,团队无法判断哪条路径的每项成功结果成本最低。
添加工具前,先明确任务和输出要求
为每个步骤明确输入、目标读者或下游使用者、允许使用的来源和工具、约束条件以及完成标准。OpenAI 的指南还要求团队说明模型可以自行决定哪些事项,哪些事项需要人工批准。确保项目指令、技能和提示对这些边界的要求一致。
对于机器可读输出,请预先定义字段和有效值;如果任务适合使用 schema,请参考 Structured Outputs 指南。将格式有效性视为一项检查;字段符合 schema,事实仍可能错误。如果输出用于交接给人,请要求提供结果、所用证据、已执行的检查和未解决事项。按照原始输入和团队的验收规则审核结果。
评估 提示缓存 时,应先放置稳定指令和共享参考资料,再修改任务细节。复用可以降低重复输入成本,但估算时仍需计入缓存写入及后续上下文。BIG CHANGE 的 较早发布的提示缓存指南详细介绍了缓存诊断。
保持长时间运行的任务可检查
10 月 2 日的指南介绍了运行中途 Steering、异步工具调用和针对独立任务的并行子代理。通过 Responses WebSocket API 发送的更正会排队等待;它不会撤销已完成的操作,也不会停止正在运行的工具。异步工具可以让无关工作继续进行,但有依赖关系的工作必须等待工具返回结果。GPT-6.1 Sol 在 Responses API 中的多智能体支持目前处于 beta 阶段。对于多步骤运行,应保存任务 ID、所选模型和推理强度、当前阶段、工具调用及结果 ID、审批记录,以及最终答案背后的证据。预先决定遇到超时、工具调用失败、指令变更或重复结果时如何处理。上下文增长时,
压缩可以减少后续步骤保留的内容;请检查续接任务实际保留了什么。OpenAI 的 后台模式也是适用于超出单次请求时长的任务的一种文档化选项。应根据工作时长和恢复需求选择这些控制方式。OpenAI 的指南建议,在某一步可以由直接 API 或连接的工具完成时优先使用它;确有需要时再采用屏幕交互。BIG CHANGE 的
Agents API 浏览器任务指南介绍了计算机使用接口及其监督流程。可复现团队决策的工作表
所有候选模型都使用相同案例和审核规则。这份工作表是建议的评估方法;BIG CHANGE 尚未填写或测试任何结果。
每个案例和候选模型都应记录
应保留的内容 | 任务和预期结果 |
|---|---|
真实输入 ID、输出要求、允许使用的工具、验收规则 | 配置 |
API 模型 ID、推理强度、处理模式、提示版本、schema 或输出约定 | 结果 |
已验收、已拒绝或需审核;失败原因;审核者 | 时间 |
端到端耗时以及面向用户步骤的耗时 | 用量和费用 |
输入、缓存输入、缓存写入和输出 token;工具费用;重试;长上下文或区域处理附加费用 | 决策 |
已验收任务数除以尝试任务数;总费用除以已验收任务数;尚未解决的失败类型 | 纳入实际工作流中会遇到的简单和困难案例、格式错误的输入及中断的工具步骤。在比较模型时固定案例;更改提示或工具权限后再重复评估。按类型检查失败:缺少证据、字段错误、工具出错、遗漏指令,或需要人工纠正的答案。只有相同验收规则显示出实际收益后,才将某个步骤切换到其他模型。返工更多的低价模型可能导致每项验收任务的成本更高;较慢的模型或许适合后台阶段,却不适合交互式环节。 |
发布前,请根据 OpenAI 的
部署检查清单核对项目的实际费率和支出限额、数据控制、超时、重试行为、监控和人工审批边界。发布后保留抽样审核流程,并在模型别名、提示、工具或工作负载变化时重新运行工作表。使用收集到的任务数据来决定如何路由。来源与延伸阅读
OpenAI 于 10 月 2 日发布的 GPT-6 系列指南
- 介绍了供应商对模型、推理强度、指令和长时间运行工作流的建议。该指南不包含 BIG CHANGE 的测试结果,也没有说明哪种模型最适合某个团队的工作负载。 涵盖供应商对模型、推理强度、指令和长时间运行工作流的建议。该指南没有报告 BIG CHANGE 的测试结果,也没有针对任何单个团队的工作负载推荐最佳模型。
- GPT-6 Luna,GPT-6.1 Sol和GPT-6 Astra介绍了本文所用的 API ID、支持的推理强度、上下文、价格和分级限制。仍需核实当前账户的访问权限和账单设置。
- OpenAI 的 API 部署检查清单支持评估有代表性的任务、配置 Responses API 并规划生产控制的建议。上文的工作表是 BIG CHANGE 提出的评估方法,不是供应商基准测试。
- Structured Outputs,压缩和后台模式介绍了工作流中提到的具体接口。



