OpenAIとAnthropicは9月22日に新モデルを公開したが、各ラインアップの更新ペースは異なる。GPT-6 SolとLunaが加わる一方、TerraはGPT-5.6のままだ。ClaudeではOpusが5.5に進み、Fable 5.1、Sonnet 5、そして公開からまもなく1年となるHaiku 4.5が並ぶ。

比較すべき組み合わせは、Astra対Fable、Sol対Opus、Terra対Sonnet、Luna対Haikuだ。4組を横断すると、どちらか一方の発表だけでは見えない競争が浮かぶ。Opusは最上位階層に挑み、LunaはAnthropicの低価格モデルに圧力をかける一方、両社の中間階層は更新が追いついていない。

大きな変化

  • 何が変わったか:同じプロバイダーのラインアップ内でも、購入者は価格が大きく異なる新モデルを選べるようになった。OpenAIは低価格階層を更新した一方、Anthropicは今回Opusを中心に刷新し、Haikuはリリース時期でほぼ1年遅れている。
  • なぜ重要か:製品チームは、日常的なAI利用の費用を抑えつつ、誤りの影響が大きい場面では高い性能に投資しやすくなる。難しいのは、実証された性能に基づいて選ぶことだ。製品ラインアップ上の位置だけでは、ベンチマーク結果の優劣を正確に判断できない。
  • 今後の注目点:AnthropicはSonnet 5.5とHaiku 5.5を数週間以内に投入するとしている。特に低価格モデルを大量に呼び出す製品では、その料金と結果によって、現在OpenAIが得ている優位がどれだけ続くかが決まる。

階層別の価格

以下は9月22日に確認した、直接APIを使う場合の標準的な100万トークン当たりの米ドル料金。キャッシュ入力はキャッシュヒット時の料金を指す。OpenAIの掲載料金は入力272,000トークンまで適用され、それを超えるとリクエスト全体の入力料金は2倍、出力料金は50%増となる。キャッシュ書き込み、バッチ処理、ツールには別の請求条件がある。出典:OpenAIとAnthropic。

モデル

入力

キャッシュ入力

出力

GPT-6 Astra

10ドル

1ドル

50ドル

Claude Fable 5.1

10ドル

0.25ドル

50ドル

GPT-6 Sol

2ドル

0.20ドル

10ドル

Claude Opus 5.5

4ドル

0.20ドル

20ドル

GPT-5.6 Terra

2ドル

0.20ドル

12ドル

Claude Sonnet 5

2ドル

0.20ドル

10ドル

GPT-6 Luna

0.10ドル

0.01ドル

0.50ドル

Claude Haiku 4.5

1ドル

0.10ドル

5ドル

知能指数とタスク実測費用

Artificial Analysis Intelligence Index v4.3.2。9月22日に確認。費用は、同指数の各タスクについて運営元が公表した加重平均の支出額。

モデル

テスト設定

知能指数

指数1タスク当たりの費用

GPT-6 Astra

Max

52.7

3.26ドル

Claude Fable 5.1

フォールバック併用のMax

53.4

7.63ドル

GPT-6 Sol

Max

47.5

記載なし

Claude Opus 5.5

フォールバック併用のMax

57.6

5.98ドル

GPT-5.6 Terra

Max

42.1

1.40ドル

Claude Sonnet 5

Max

38.2

5.09ドル

GPT-6 Luna

Max

37.3

記載なし

Claude Haiku 4.5

推論有効

16.9

0.21ドル

出典:Artificial Analysis。個別のモデル結果は、以下の比較内でリンクしている。

Astra対Fable:最上位モデルの比較

両モデルの標準入力・出力料金は同じだ。Fableのキャッシュ入力料金はAstraの4分の1で、対象となるプロンプト内容をアプリケーションが繰り返し使う場合に差が生じる。

Artificial Analysisの現行Intelligence Indexでは、Max設定のAstraが52.7、フォールバック併用のMax設定のFable 5.1が53.4だ。差は小さい。Artificial Analysisが報告する指数1タスク当たりの加重支出額は、Astraが3.26ドルで、Fableは7.63ドル。入力・出力料金が同じでも、Astraは近いスコアを約57%低い実測支出で達成している。Astraの結果、Fableの結果。

Sol対Opus:より低い料金とより高いスコア

Solの通常入力・出力料金はOpusの半額で、キャッシュヒット時の料金は同じだ。OpenAIはGPT-5.6 Solの発売時と比べ、Solの入力・出力料金も半額にした。AnthropicはOpusの同種の料金をOpus 5から20%引き下げた。OpenAIの発売発表、Opusの発売発表。

Artificial Analysisでは、Max設定のSolが47.5、フォールバック併用のMax設定におけるOpus 5.5は57.6だ。OpusはSolを10.1ポイント上回る一方、通常の入力・出力料金は2倍かかる。また、AstraとFableより高いスコアを、入力・出力料金60%安で達成している。実測テスト支出で見ると状況は異なる。Opusの指数1タスク当たりの平均費用は5.98ドルで、Astraより約84%高い。確認時点で、Artificial Analysisが公表した費用チャートにはSolの数値がまだなかった。Solの結果、Opusの結果。

Terra対Sonnet:存在しないGPT-6モデル

OpenAIの現行の発売情報やモデルカタログにGPT-6 Terraはない。比較対象として利用できるのはGPT-5.6 Terraだ。現行のAPIドキュメントでも上記の料金が確認できる。OpenAIのWorkとCodexのガイドも、移行期間中は旧モデルの5.6系列を引き続き利用できるとしている。

Max設定でArtificial Analysisの指数はTerraが42.1、Sonnet 5が38.2だ。指数1タスク当たりの平均費用もTerraは1.40ドルで、Sonnetの5.09ドルと比べ、スコアは高く実測支出は約73%低い。Terraの出力トークン料金は20%高く、トークン消費量やキャッシュが表面上の単価を上回る影響を持つことを示している。Terraの結果、Sonnetの結果。

Sonnet 5は6月30日に公開された。Anthropicは数週間以内にSonnet 5.5を投入すると発表している。後継モデルが予告されていても、新版のテストと料金が確認できるまでは、現行Sonnet 5との比較は変わらない。

Luna対Haiku:公開からの経過時間に最も大きな差

Lunaは、掲載された各トークン料金がHaikuの10分の1だ。Haiku 4.5の公開日は2025年10月15日で、Lunaの公開より342日前に当たる。Haiku 5.5は数週間以内に登場すると予告されているが、現時点で公開済みの最新Haikuは4.5だ。

独立したテストでも性能差が見られる。Artificial AnalysisのMax設定スコアはLunaが37.3で、推論を有効にしたHaiku 4.5は16.9だ。いずれも同じ最新評価スイートにおける指数で、Lunaのトークン料金は90%安い。推論を有効にしたHaikuの指数1タスク当たりの平均費用は0.21ドル。運営元が公表したチャートでは、Lunaに対応する費用はまだ掲載されていなかった。Lunaの結果、推論有効時のHaikuの結果。

Anthropicにとって、最も低価格の現行モデルが、トークン料金をさらに下げながら同じ評価で大幅に高いスコアを示す新モデルに直面している。大量に呼び出す製品を開発する人にとって、予告済みのHaiku更新は次の重要なリリースの一つとなる。

上記のArtificial Analysisの数値は、9月22日に確認した10種類の評価を集約したIntelligence Index v4.3.2に基づく。スコアとともに設定が記載され、FableとOpusには運営元のフォールバック設定が含まれる。指数と評価方法。

エージェントが実際の作業を完了する場合はどうか

ZapierのAutomationBench v1.0.6は、模擬業務アプリケーションで一連の作業を最初から最後までテストする。合格には、採点対象の結果がすべて正しい必要がある。9月22日のランキングは次の通り。

モデル

テスト設定

合格率

タスク当たりの費用

GPT-6 Astra

Max

41.4%

1.73ドル

Claude Fable 5.1

Max、単独実行

22.37%

2.45ドル

GPT-6 Sol

Xhigh

33.2%

0.27ドル

GPT-6 Sol

Max

32.0%

0.34ドル

Claude Opus 5.5

Max

40.0%

1.28ドル

GPT-5.6 Terra

Max

23.59%

0.51ドル

Claude Sonnet 5

Max

10.65%

0.88ドル

GPT-6 Luna

Max

20.7%

0.04ドル

Claude Haiku 4.5

指定なし

0.46%

0.07ドル

FableにOpus 5を組み合わせた別設定の合格率は31.4%だ。Opusはタスクの約40%を担当し、表示された2.45ドルにはフォールバックに使われたトークンが含まれない。

Xhigh設定のSolはMax設定のOpusより、合格率が6.8ポイント低い一方で、1回当たりの費用は約79%低い。LunaはHaikuをタスク費用43%安で上回る。このグループではAstraが最も高い合格率だが、すべてのモデルで合格率は半分に届かない。Zapierの結果と採点方法。

リリース予定は多いが、更新ペースには差がある

両社のAPIリリース記録から、それぞれ選んだモデル系列を比較する。OpenAIの一覧では番号付きGPTのバージョンをGPT-6 Astraまで追う。InstantとCodexのような特化系列、および3月17日のGPT-5.4 mini・nanoや9月22日のGPT-6 Sol・Lunaといった後発の階層展開は除外した。Anthropicの一覧では公開済みのOpus APIバージョンを追う。「間隔」は各社で選んだ系列の直前の項目から数えた暦日数だ。

  • GPT-5系列 — 2025年8月7日:系列を開始。最初の項目のため間隔は該当なし。
  • GPT-5.1 — 2025年11月13日:バージョン更新、間隔98日。
  • GPT-5.2 — 2025年12月11日:バージョン更新、間隔28日。
  • GPT-5.4 — 2026年3月5日:バージョン更新、間隔84日。
  • GPT-5.5 — 2026年4月24日:バージョン更新、間隔50日。
  • GPT-5.6 — 2026年7月9日:階層を伴う系列更新、間隔76日。
  • GPT-6 Astra — 2026年9月3日:新系列の開始、間隔56日。

出典:OpenAI APIの変更履歴。別途、GPT-6 SolとLunaは9月22日に登場し、Astraから19日後だった。この間隔は同一系列内の階層展開を測るため、上記の番号付きバージョン系列には含めていない。

  • Opus 4 — 2025年5月22日:メジャーバージョン。最初の項目のため間隔は該当なし。
  • Opus 4.1 — 2025年8月5日:ポイント更新、間隔75日。
  • Opus 4.5 — 2025年11月24日:バージョン更新、間隔111日。
  • Opus 4.6 — 2026年2月5日:バージョン更新、間隔73日。
  • Opus 4.7 — 2026年4月16日:バージョン更新、間隔70日。
  • Opus 4.8 — 2026年5月28日:バージョン更新、間隔42日。
  • Opus 5 — 2026年7月24日:メジャーバージョン、間隔57日。
  • Opus 5.5 — 2026年9月22日:バージョン更新と値下げ、間隔60日。

出典:Anthropic APIのリリースノート。Fableとアクセス制限付きのMythosは別系列のため、Opusの並びには加えていない。

OpenAIの番号付きモデルの間隔は28日から98日まで変動し、AnthropicのOpusは42日から111日まで幅がある。「メジャーリリース」を系列番号の変更と定義すると、GPT-5からGPT-6までは392日、Opus 4からOpus 5までは428日かかった。短い間隔はポイント更新や階層展開に当たる。どちらの系列も間隔は一定せず、短い期間の後に長い期間が続くこともある。

必要に応じてモデルを選び、段階的に更新する

モデルの発売が続くたび、選択を見直す理由が生まれる。今回の4組の比較から、プロバイダー全体に一括の優劣を付けると有用な違いを見落とすことが分かる。Anthropicは新しいOpusが強く、OpenAIは低価格階層で競争力を高めた一方、両社ともラインアップの一部には旧モデルが残っている。

バージョン変更には開発作業も伴う。AnthropicのOpus 5.5移行ガイドによると、thinkingは常時有効で、ツール選択の強制はエラーになり、以前のcomputer-useツールタイプはClaude APIとGoogle Cloudで拒否される。これらの設定を使っている既存の連携は変更が必要だ。

次に予定されているのは、AnthropicによるSonnetとHaikuの更新だ。これにより、購入者には近いうちに低価格階層を再検討する具体的な理由ができる。現時点の料金表と独立した評価結果からは、競争が動いた部分と、旧モデルを選ぶ余地がまだある部分の両方が分かる。