Anthropicは9月28日、Sonnet 5と同じAPIトークン価格でClaude Sonnet 5.5を公開した。同社によると、出力生成は30%以上速く、トークン数が少なくなるため、タスク当たりの費用も最大30%下がる可能性がある。これらは別々の主張だ。公表された単価は下がっておらず、タスクの請求額はプロンプト、出力、ツール、effortの設定によって変わる。

開発者にとって今回の公開は、効率向上の可能性と、Sonnet 5向けの既存連携を壊しかねない変更が組み合わさっている。AnthropicのドキュメントではモデルIDとしてclaude-sonnet-5-5がClaude API、Google Cloud、Microsoft Foundryで利用でき、Amazon Bedrockではanthropic.claude-sonnet-5-5が利用できる。モデルのページによると、コンテキストウィンドウは100万トークン、最大出力は12万8,000トークン。AWS上のClaude Platformからも利用できる。クラウド事業者の請求額やリージョン別の設定は、Claude APIの公表価格とは異なる場合がある。

評価結果が示すこと

AnthropicのTerminal-Bench 4.0テストでは、Sonnet 5.5は66件のターミナル作業の70.6%を完了した。公開時の比較表にあるSonnet 5の結果は10.3%だった。システムカードによると、このベンチマークはコンテナ化したコマンドライン環境で科学・工学分野の難度の高い作業を行う。AnthropicはClaude Codeをbare mode、最大のthinking effortで実行し、インターネット接続を遮断したうえで、作業に必要なリソースをキャッシュした。安全策によりSonnet 5.5のリクエストの1.2%は代替モデルに送られ、試行の1.5%に影響した。AnthropicはSonnet 5.5の結果について標準誤差を2.5ポイントと報告している。このスコアが測るのはこの設定であり、開発者自身のリポジトリでも同じ改善が得られるとは限らない。

Anthropicのシステムカードによると、CognitionはClaude Codeで150件のリポジトリ課題を使うFrontierCodeを実行し、Sonnet 5.5はxhigh effortのMainセットで52.1%だったと報告した。max effortでは46.2%に下がった。Cognitionが調べた一部のケースでは、エージェントが追加で行ったレビューと編集がベンチマークの範囲または制限時間を超えたためだ。Cursorは実際のエージェント実行環境でCursorBench 4.0を動かし、Cursorのセッションから抽出した課題を使った。Anthropicに送られた結果表には、max effortでのSonnet 5.5の結果として55.5%が記載されている。AnthropicはCursorのトークン数からタスク当たりの費用を推定した。これらの外部評価は課題と実行環境が異なり、ここに記したSonnet 5.5の数値はAnthropicのシステムカードを通じた報告だ。

Artificial Analysisも公開前のモデルで、44職種の220課題を比較するGDPval-AAと、つながりのある知識労働プロジェクトの集合AA-Briefcaseを実施した。カードにはmax effortでのEloスコアがそれぞれ1,844と1,811とあり、これらのテストではOpus 5.5に近かった。Anthropicは、公開前の環境にあった構造化出力のバグが結果に影響した可能性があり、現在は修正済みだと説明している。この比較が示すのはその条件下でのベンチマーク出力であり、自由形式の作業でもSonnet 5.5がOpusに匹敵するとは限らない。Anthropic自身も、継続的な判断が求められる複雑な作業ではOpusの方が依然優れているとしている。

Anthropicが公開時に引用した初期顧客のコメントでは、それぞれの試験で作業が速くなり、使用トークン数が減ったとされている。顧客ごとに作業と手法が異なるため、共通の生産性指標として扱うことはできない。BIG CHANGEはSonnet 5.5を実行しておらず、実際の業務フローで同社の速度・タスク費用の数値を検証していない。

価格と移行

Claude APIの公表単価は入力100万トークン当たり2ドル、出力100万トークン当たり10ドルで、Sonnet 5から変更されていない。5分間のキャッシュ書き込みは100万トークン当たり2.50ドル、読み取りは0.20ドル。Anthropicのタスク当たり費用のグラフは、公表単価と、指定されたeffort水準で消費したトークン数を組み合わせている。これだけでは一律に30%安くなるとは言えない。モデルを比較するチームは、必要な品質基準を満たす代表的な作業を自ら実行し、成功だけでなくトークン数と所要時間も記録すべきだ。

既存のMessages APIコードでは、モデルIDだけを変更しても動かないことがある。Sonnet 5でthinking: {"type": "disabled"}を使うとSonnet 5.5ではエラーになり、事前の推論を避けるための文書上の代替はthinking: {"type": "between_tools"}で、low、medium、highのeffortに対応する。フィールドを省略するとAdaptive thinkingが有効になり、Claude APIの既定値はhigh effortだ。強制指定されたtool_choiceの値anyとtoolもエラーになるため、Anthropicは開発者にautoを使い、対応している場合は厳密なツールスキーマも利用するよう案内している。Amazon BedrockのSonnet 5.5では厳密なツール利用は使えないため、autoをstrictなしで指定し、ツール入力をアプリケーションコードで検証する。ツール呼び出しの間にテキストを表示するコードでは、thinkingブロックで返される進行状況の更新も処理する必要がある。Claude APIとGoogle Cloudでのコンピューター操作連携には新しいcomputer_toolset_20260801を使う一方、Bedrockでは以前のcomputer_20251124バージョンを使う。移行ガイドには、互換性に関する追加変更が記載されている。

大きな変化

コストを重視するチームにとって、Sonnet 5.5はSonnet 5と同じトークン価格で利用でき、指定された複数の評価でより高い結果が出た。出力が速くなったという主張はAnthropicによるものだ。実際の価値は作業内容とeffortの設定に左右される。既存の連携でも設定の見直しが必要だ。次に比較するなら、正しい成果、トークン数、所要時間を自社の作業で測るのが最も明確だ。

出典・参考資料

  • Anthropic:「Claude Sonnet 5.5の発表」には、公開日、同社による速度・タスク費用の主張、ベンチマークの要約、初期顧客のコメントが掲載されている。性能の主張は個別の作業で検証する必要がある。
  • Anthropic:「Claude Sonnet 5.5システムカード」は、ベンチマークの課題、実行環境、effort設定、代替モデルへの切り替え、外部評価の出所を記録している。モデル提供元による一次資料であり、同社に提出された外部実施の結果も含む。
  • Claude Platform:「モデルのページ」にはAPIのモデルID、利用方法、上限、トークン価格が掲載されている。「料金ページ全文」では、Sonnet 5と5.5の基本単価が同じであることと、クラウドごとの価格差が確認できる。
  • 「Sonnet 5.5への移行ガイド」は、変更またはエラーになるリクエスト設定を記録している。既存の連携を移行する際は、完全なチェックリストとして参照できる。