OpenAIはGPT-6ファミリーのガイドを2026年10月2日に公開しました。モデルの選択、指示、長時間実行されるタスク、デプロイ前の確認事項をまとめています。それでもソフトウェアチームは、自分たちのタスク検証を通過し、コストと応答時間の制約も満たす組み合わせを見つける必要があります。

このガイドに記載された現行のファミリーはGPT-6 Astra、GPT-6.1 Sol、GPT-6 Lunaです。OpenAIのAPIドキュメントと料金を10月3日に確認しました。以下の選択方法とワークシートは提案であり、私たちはモデルを実行したり、本番ワークロードを測定したりしていません。

大きな変化

  • 変更点:OpenAIはGPT-6ファミリーを、推論の強度を調整でき、複数ステップにわたる作業向けのツールも備えた、ワークロード別の選択肢として提示しています。タスクごとに1つのモデル設定を使い回すのではなく、ワークフローの各部分を個別に構成できます。
  • 重要な理由:開発者は、焦点を絞った抽出処理にLunaで十分か、コーディングや調査の工程にSolが必要か、Astraの追加機能が価格に見合うのはどこかを測定できます。判断は完了したタスク、遅延、ツール使用や失敗した試行も含むワークフロー全体のコストによって変わります。
  • 注目点:長時間の実行には、明示的な引き継ぎと確認が必要です。実行中にステアリングで指示を更新できますが、非同期ツールの結果や委任した作業は、最終回答を受け入れる前に照合する必要があります。

タスクごとに選び、ワークフロー全体を測定する

まず、実際のタスクを代表するセットと、それぞれの合格基準を用意します。OpenAIは、現在のモデルの挙動、ツール呼び出し、状態を保持する処理にはResponses APIを推奨しています。APIプロジェクト、認証情報、課金へのアクセス、プロジェクトで利用可能なモデルが前提条件です。モデルのページでは無料枠に対応していないと記載されています。レート制限は利用ティアによって異なります。展開規模を決める前に、アカウントでの実際のアクセス権と上限を確認してください。

モデルに割り当てる作業

最初に試すモデル

最初に試す推論レベル

昇格または変更する条件

明確な回答がある、繰り返しの抽出、分類、構造化要約

gpt-6-luna

定型処理にはLow。デフォルトのMediumとも比較する

エラー率または確認時間がチームの基準を超えた場合

コーディング、調査、ツール使用、専門的判断の工程

gpt-6.1-sol

デフォルトのMedium。難しいケースではHighも試す

妥当な入力と指示でも、代表的なタスクに失敗する場合

品質が決定的に重要となる、最も難しい推論やレビュー工程

gpt-6-astra

同一ケースでMediumとHighを比較する

測定した改善が追加コストと時間に見合う場合のみ維持する

この表は、OpenAIのモデルの指針と各モデルのページを評価の出発点として整理したものです。APIのモデルIDと対応する推論レベルを確認してください。AstraとGPT-6.1 SolはLowからMaxまで、LunaはNoneにも対応しています。GPT-6.1 SolはNoneとMinimalに対応していません。OpenAIは、Highで不十分な場合、対応モデルではExtra HighまたはMaxを試すよう推奨しています。品質、処理時間、トークン使用量は同時に変わり得るため、同じタスクセットで推論レベルを比較してください。

Standard処理で入力が272,000トークン以下の場合、100万トークンあたりの現在のテキスト料金は次のとおりです。

モデル

入力

キャッシュ入力

キャッシュ書き込み

出力

GPT-6 Luna

$0.10

$0.01

$0.125

$0.50

GPT-6.1 Sol

$2.00

$0.10

$2.50

$10.00

GPT-6 Astra

$10.00

$1.00

$12.50

$50.00

出典:Luna、GPT-6.1 Sol、Astraの各モデルページ。入力が272,000トークンを超えるリクエストには、リクエスト全体に高い料金が適用されます。ほかの処理モード、利用可能な場合のリージョン処理、一部のツールによっても請求額が変わります。3つのモデルページには、コンテキストウィンドウが1,050,000トークン、最大出力が128,000トークンと記載されています。大きなウィンドウは容量上限であり、入手可能な文書をすべて送る理由にはなりません。

タスクの全工程にかかるコストを見積もります。入力、キャッシュ入力、キャッシュ書き込み、出力、ツール料金、再試行、長いコンテキストによる追加料金です。同じレビュー基準で受け入れられたタスク数で総額を割ります。そのうえで、ユーザーに見える工程とワークフロー全体の遅延を比較してください。単価だけでは、成功した結果1件あたりの最安ルートは分かりません。

ツールを追加する前に、作業内容と出力を明確にする

各工程には、明確な入力、想定する読者または後続の利用者、使用可能な情報源とツール、制約、完了条件を設定します。OpenAIのガイドは、モデルが単独で決められることと、人の承認が必要な判断も明記するよう求めています。プロジェクト指示、スキル、プロンプト間で、こうした境界を一貫させてください。

機械可読な出力の場合は、事前にフィールドと有効な値を定義し、タスクにスキーマが適していればStructured Outputsのガイドを使います。形式が有効であることは確認項目の1つにすぎません。スキーマに適合したフィールドでも、事実としては誤っている場合があります。人への引き継ぎでは、結果、使用した根拠、実施した確認、未解決事項を含めてください。元の入力とチームの合格基準に照らして結果を確認します。

評価では、タスクの詳細を変える前に、安定した指示と共有参照資料を先に配置してください。プロンプトキャッシュを使う場合は、タスクの詳細を変える前に、変わらない指示と共有参照資料を置いてください。再利用すれば、繰り返し発生する入力コストを抑えられる可能性がありますが、キャッシュへの書き込みと後続のコンテキストも見積もりに含める必要があります。BIG CHANGEのプロンプトキャッシュに関する以前のガイドでは、キャッシュ診断を詳しく扱っています。

長時間の処理を追跡できるようにする

同ガイドのでは、ターン途中のステアリング、非同期ツール呼び出し、独立した作業向けの並列サブエージェントについて説明しています。では、ターン途中のステアリング、非同期ツール呼び出し、独立した作業向けの並列サブエージェントについて説明しています。Responses WebSocket APIを介して送った修正指示はキューに入り、完了済みの操作を元に戻したり、実行中のツールを停止したりはしません。非同期ツールを使えば無関係な作業を続けられますが、依存する作業は結果が出るまで待つ必要があります。Responses APIにおけるGPT-6.1 Solのマルチエージェント機能は現在ベータ版です。

複数ステップの実行では、タスクID、選択したモデルと推論レベル、現在の段階、ツール呼び出しと結果のID、承認、最終回答の根拠を保存します。タイムアウト、ツール呼び出しの失敗、指示の変更、重複した結果への対処を事前に決めてください。コンテキストが大きくなった場合は、コンパクションによって引き継ぐ情報を減らせます。処理を続けた後、実際に何が保持されているか確認してください。OpenAIのバックグラウンドモードも、1回のリクエストを超えるタスク向けにドキュメント化された選択肢です。ジョブの所要時間と復旧要件に合わせて、これらの制御を選んでください。

手順を実行できる場合は、直接APIまたは接続済みツールを使い、必要な場合に画面操作を使うようOpenAIのガイドは推奨しています。BIG CHANGEのAgents APIを使ったブラウザータスクのガイドでは、コンピューター操作インターフェースと監督方法を解説しています。

チームが再現できる判断のためのワークシート

候補ごとに、同じケースとレビュー基準を使います。このワークシートは評価方法の提案です。BIG CHANGEは結果を入力もテストもしていません。

各ケースと候補で記録する項目

記録内容

タスクと期待する結果

実際の入力ID、出力要件、利用可能なツール、合格基準

設定

APIモデルID、推論レベル、処理モード、プロンプトのバージョン、スキーマまたは出力契約

結果

受け入れ、却下、要レビューの別、失敗理由、レビュー担当者

時間

エンドツーエンドの所要時間と、ユーザーに見える工程の所要時間

使用量と料金

入力、キャッシュ入力、キャッシュ書き込み、出力の各トークン数、ツール料金、再試行、長いコンテキストやリージョンによる追加料金

判断

受け入れたタスク数÷試行したタスク数、受け入れたタスクあたりの総費用、未解決の失敗タイプ

実際のワークフローで遭遇する、簡単なケースと難しいケース、不正な形式の入力、途中で中断されたツール処理を含めます。モデルを比較する間はケースを固定し、プロンプトやツールの権限を変更した後に再度評価してください。証拠の欠落、フィールドの誤り、ツールエラー、指示の見落とし、人による修正が必要な回答など、種類ごとに失敗を確認します。同じ合格基準で有用な改善が示された後に限り、工程を別のモデルに切り替えます。安価なモデルでも手戻りが増えれば、受け入れられたタスク1件あたりの費用は高くなることがあります。遅いモデルでもバックグラウンド工程なら許容できる一方、対話型の工程には向かない場合があります。

リリース前に、OpenAIのデプロイチェックリストに照らして、プロジェクトの実際の料金と利用上限、データ管理、タイムアウト、再試行の挙動、監視、人による承認の境界を確認してください。リリース後もサンプルをレビューする経路を保ち、モデルエイリアス、プロンプト、ツール、ワークロードが変わったらワークシートを再実行します。そのタスクデータに基づいて振り分けを決めてください。

出典・参考資料

  • OpenAIの10月2日付GPT-6ファミリーガイドモデル、推論レベル、指示、長時間ワークフローに関するベンダーの推奨事項をまとめています。BIG CHANGEのテスト結果や、各チームのワークロードに最適なモデルは示していません。
  • GPT-6 Luna、GPT-6.1 Sol、GPT-6 Astraは、ここで用いたAPI ID、対応する推論レベル、コンテキスト長、料金、ティア別の上限を説明しています。現在のアカウントで利用できるか、課金条件も確認してください。
  • OpenAIのAPIデプロイチェックリストは、代表的なタスクの評価、Responses APIの設定、本番向け制御の計画に関する推奨事項を示しています。上のワークシートはBIG CHANGEの提案手法であり、ベンダーのベンチマークではありません。
  • Structured Outputs、コンパクション、バックグラウンドモードは、ワークフローで参照する個別のインターフェースを説明しています。