OpenAI 發布了 GPT-6 系列指南 ,日期為 2026 年 10 月 2 日。指南整合了模型選擇、指示、長時間執行任務與部署檢查。軟體團隊仍須找出符合自身任務檢查、成本上限及回應時間限制的組合。

該指南列出的目前系列選項為 GPT-6 Astra、GPT-6.1 Sol 與 GPT-6 Luna。我們於 10 月 3 日查閱了 OpenAI API 文件與價格。以下的選擇方法與工作表皆為建議;我們沒有執行這些模型,也沒有測量正式環境的工作負載。

重大變化

  • 有哪些改變: OpenAI 現在將 GPT-6 系列定位為一組工作負載選項,提供可調整的推理強度,以及處理多步驟工作的工具。團隊可以為工作流程中的每個環節設定不同組合,不必讓單一模型設定負責所有任務。
  • 為何重要: 建置者可以測量:精簡的擷取步驟是否適合使用 Luna、程式撰寫或研究步驟是否值得使用 Sol,以及 Astra 額外的能力是否值得其價格。答案取決於任務完成情況、延遲與整體流程成本,其中也包括工具使用和失敗的嘗試。
  • 接下來要觀察什麼: 長時間執行需要明確的交接與檢查。執行期間可以透過 Steering 更新指示;但仍須在接受最終答案前,整合非同步工具結果與委派工作。

先依任務選擇,再測量整體工作流程

先準備一組具代表性的真實任務,並為每項任務訂定驗收規則。OpenAI 建議使用 Responses API 處理目前的模型行為、工具呼叫與有狀態工作。必要條件包括 API 專案、憑證、帳單存取權,以及該專案可使用的模型。模型頁面並未列出免費方案支援;速率限制取決於使用層級。規劃部署規模前,請先確認帳戶實際可用的模型與限制。

指派給模型的工作

初始候選模型

初始推理強度

符合以下情況時升級或更換

重複擷取、分類或依明確答案格式產生摘要

gpt-6-luna

例行工作使用 Low;並與預設的 Medium 比較

錯誤率或審查時間超出團隊門檻

程式撰寫、研究、工具使用或專業判斷步驟

gpt-6.1-sol

採用預設 Medium;針對困難案例測試 High

即使輸入與指示完善,具代表性的任務仍失敗

品質至關重要的高難度推理或審查步驟

gpt-6-astra

使用相同案例比較 Medium 與 High

只有在測得的效益足以抵銷額外成本與時間時才保留

此表將 OpenAI 的 模型指南 與 模型頁面 轉化為評估起點。請確認 API 模型 ID 與支援的推理強度:Astra 和 GPT-6.1 Sol 支援 Low 到 Max;Luna 也支援 None。GPT-6.1 Sol 不支援 None 和 Minimal。OpenAI 建議在 High 效果不足時,於支援的情況下嘗試 Extra High 或 Max。請在相同任務集上比較不同推理強度,因為品質、耗時與 Token 用量可能同時變動。

使用 Standard 處理模式且輸入提示不超過 272,000 個 Token 時,目前每百萬 Token 的文字費率如下:

模型

輸入

快取輸入

快取寫入

輸出

GPT-6 Luna

$0.10

$0.01

$0.125

$0.50

GPT-6.1 Sol

$2.00

$0.10

$2.50

$10.00

GPT-6 Astra

$10.00

$1.00

$12.50

$50.00

來源: Luna、 GPT-6.1 Sol 與 Astra 模型頁面。輸入 Token 超過 272,000 的請求,整筆請求都適用較高費率。其他處理模式、可用地區的區域處理,以及部分工具都會改變帳單。三個模型頁面均列出 1,050,000 Token 的上下文視窗和 128,000 Token 的最大輸出量;大型視窗是容量上限,不代表應傳送所有可用文件。

估算完整任務流程的成本:輸入、快取輸入、快取寫入、輸出、工具費用、重試,以及長上下文加價。再以總成本除以依相同審查規則驗收的任務數量。接著比較面向使用者的步驟延遲與整體流程延遲。單位價格本身無法告訴團隊哪條路徑每項成功結果的成本最低。

新增工具前,先說明工作內容與輸出要求

為每個步驟明確定義輸入、目標讀者或下游使用者、允許的來源與工具、限制條件,以及完成標準。OpenAI 的指南也要求團隊說明模型可以做哪些決策、哪些決策需要人員核准。專案指示、技能與提示詞都應一致反映這些界線。

若需要機器可讀的輸出,請事先定義欄位與有效值,並在符合任務需求時使用 Structured Outputs 指南 。將輸出格式有效視為其中一項檢查;欄位即使符合結構描述,事實內容仍可能錯誤。若輸出是交接給人員的資料,應要求列出結果、使用的證據、已執行的檢查與尚未解決的事項。請依原始輸入與團隊驗收規則審查結果。

評估 提示詞快取時,應先放入穩定指示與共用參考資料,再調整任務細節。重複使用可降低持續性的輸入成本,但估算仍須納入快取寫入與後續上下文。BIG CHANGE 的 提示詞快取深入指南 詳述快取診斷。

讓長時間執行的工作可供檢視

根據10 月 2 日指南 說明執行期間的引導、非同步工具呼叫,以及適用於獨立工作的平行子代理。透過 Responses WebSocket API 傳送的更正會排入佇列,不會撤銷已完成的動作,也不會停止正在執行的工具。非同步工具可讓不相關的工作繼續進行,但相依工作必須等候其結果。目前,Responses API 中 GPT-6.1 Sol 的多代理支援仍為 Beta 版。

對於多步驟執行,請保存任務 ID、所選模型與推理強度、目前階段、工具呼叫和結果 ID、核准紀錄,以及最終答案的證據。事先決定遇到逾時、工具呼叫失敗、指示變更或重複結果時要如何處理。上下文增加時, 壓縮 可能會減少延續執行時保留的內容;請檢查實際保留下來的狀態。OpenAI 的 背景模式 是另一種適用於超過單次請求時間的任務選項。應依照工作的執行時間與復原需求選擇這些控制機制。

OpenAI 的指南建議:若直接 API 或連結工具能完成步驟,就優先使用;只有必要時才透過畫面操作。BIG CHANGE 的 Agents API 瀏覽器任務指南 說明電腦操作介面及其監督流程。

可重複執行的決策評估工作表

所有候選模型都使用相同案例和審查規則。此工作表是建議的評估方法;BIG CHANGE 尚未填入或測試任何結果。

每個案例與候選模型要記錄的項目

應保留的資料

任務與預期結果

真實輸入 ID、輸出要求、允許的工具、驗收規則

設定

API 模型 ID、推理強度、處理模式、提示詞版本、結構描述或輸出規格

結果

已驗收、已退回或需審查;失敗原因;審查者

時間

端到端耗時及面向使用者步驟的耗時

用量與費用

輸入、快取輸入、快取寫入與輸出 Token;工具費用;重試;長上下文或區域處理加價

決策

驗收任務數除以嘗試任務數;總費用除以驗收任務數;尚未解決的失敗類型

納入容易與困難案例、格式錯誤的輸入,以及真實工作流程可能遇到的工具中斷。比較模型時維持案例不變;更改提示詞或工具權限後再重做一次。依類型檢視失敗:缺少證據、欄位錯誤、工具錯誤、漏掉指示,或答案需要人工修正。只有在相同驗收規則顯示出實際效益後,才將步驟改用其他模型。較便宜的模型若需要更多返工,每項驗收任務的成本可能更高;較慢的模型適合背景階段,卻未必適合互動階段。

發布前,請依 OpenAI 的 部署檢查清單確認專案實際的費率與支出限制、資料控制、逾時、重試行為、監控及人工核准界線。發布後仍應抽樣審查;模型別名、提示詞、工具或工作負載變更時,請重新執行工作表。使用最新任務資料決定路由方式。

來源與延伸閱讀

  • OpenAI 於 10 月 2 日發布的 GPT-6 系列指南 說明供應商對模型、推理強度、指示與長時間工作流程的建議。該文件沒有提供 BIG CHANGE 的測試結果,也沒有指出任何團隊工作負載的最佳模型。
  • GPT-6 Luna、 GPT-6.1 Sol 與 GPT-6 Astra 的文件列出本文使用的 API ID、支援的推理強度、上下文、價格與分級限制。仍須確認目前帳戶可使用的項目與帳單設定。
  • OpenAI API 部署檢查清單 支持以具代表性的任務進行評估、設定 Responses API 並規劃正式環境控制措施的建議。本文工作表是 BIG CHANGE 提出的方法,不是供應商的基準測試。
  • Structured Outputs、 壓縮 與 背景模式 說明工作流程中提到的特定介面。