Anthropicは10月7日、エージェントシステムの呼び出し数を大きく占める可能性がある、短時間で頻繁に行う処理向けにClaude Haiku 5.5を公開しました。Claude APIの公開料金は、入力トークン100万個あたり0.10ドル、出力トークン100万個あたり0.50ドルからで、Haiku 4.5の10分の1です。一方、Anthropicによると、同じテキストでも新モデルでは約30%多くトークンを使用し、100,000トークンを超えるpromptには上位の料金帯が適用されます。Haiku 4.5を利用するチームは、請求額の見積もりや本番トラフィックの移行前に、自社のリクエストを再カウントする必要があります。

今回のリリースではMessages APIの使い方も変わります。Haiku 5.5では手動のthinking予算が機能せず、adaptive thinkingがデフォルトで有効になり、最初のレスポンスブロックがテキストではなくthinking になる場合があります。小型モデルを繰り返し呼び出して、分類、抽出、振り分け、要約を行うサービスでは、具体的な互換性チェックが必要です。

大きな変化

  • 変更点: Anthropicは、新たな100万トークンのコンテキストウィンドウとadaptive thinkingを、Claudeで最も低価格の階層に導入しました。Haiku 5.5は短いpromptの料金を下げる一方で、テキストの数え方とレスポンスの開始形式を変更します。
  • 重要な理由: チームは、より低い公表料金で、頻度が高く範囲の限定されたエージェント処理にClaudeを利用することを検討できます。効果はpromptの長さの分布、出力とthinkingのトークン、キャッシュ利用状況、新モデルが各処理の品質目標を満たすかどうかに左右されます。
  • 注意点: Haiku 4.5との連携は、計測しながら移行する必要があります。100,000トークンの境界に近いリクエストは、再カウント後に上位料金帯へ移る可能性があります。また、最初のcontentブロックはテキストだと仮定するコードは、成功したレスポンスを誤って処理することがあります。

価格はpromptの長さによって異なる

Claude APIでは、100,000トークン以下のpromptに対するHaiku 5.5の料金は、入力トークン100万個あたり0.10ドル、出力トークン100万個あたり0.50ドルです。しきい値を超えると、それぞれ0.50ドルと2.50ドルになります。Haiku 4.5は、200,000トークンのコンテキストウィンドウ全体で1ドルと5ドルとされています。Haiku 5.5のコンテキストウィンドウは100万トークン、最大出力は128,000トークンで、Haiku 4.5の200,000と64,000を上回ります。Anthropicは、Claude API、Amazon Bedrock、AWS上のClaude Platform、Google Cloud、Microsoft Foundryでの提供を案内しています。Amazon BedrockのモデルIDはanthropic.claude-haiku-5-5、Claude APIではclaude-haiku-5-5を使用します。Anthropicのモデルページには、各プラットフォームの現在のID、制限、料金が掲載されています。

Anthropicによると、Haiku 5.5の実行コストはHaiku 4.5より平均約75%低くなります。 平均して。脚注では、100,000トークン以下のpromptで公開料金が90%低いこと、それを超える場合は50%低いこと、Haiku 4.5のリクエストの90%が短いカテゴリだったという観察、同じ処理でも新しいtokenizerではトークン数が増えることを組み合わせています。この計算はAnthropicのリクエスト構成を説明するもので、すべてのリクエストに一律の割引が適用されるという意味ではありません。同じ入力テキストに対してトークンが約30%増えるという数字もベンダーの推定であり、正確な変化は内容によって異なります。Anthropicの公開発表 では、主張と算出方法の両方が説明されています。

キャッシュを使わないClaude APIリクエストでは、Haiku 5.5の入力・出力トークン数をそれぞれ、そのリクエストのprompt長に対応する料金帯の料金に掛け、100万で割ります。計算例では、短いpromptの料金で入力80,000トークン、出力10,000トークンなら0.013ドルです。入力120,000トークン、出力10,000トークンの場合、長いpromptの料金では0.085ドルになります。これは料金の計算例であり、実際に観測された処理や予測ではありません。キャッシュの読み取りと書き込みには個別の料金があり、バッチ処理では入力と出力の両方に50%の割引が設定されています。実用的な見積もりでは、実際の呼び出しをpromptの長さとキャッシュの動作別にまとめてから合算します。 Haiku 5.5のモデルページ にはこれらのカテゴリが掲載されています。

保存済みの代表的なpromptをMessageトークン数カウントエンドポイントで再カウントし、claude-haiku-5-5を指定してください。旧モデルのトークン合計から、5.5でpromptがどの料金帯に入るかは判断できません。実際のサンプルでは、タスクの結果とともにレスポンスのusage、出力の長さ、キャッシュ関連フィールド、effort、実際の請求額を記録します。短いリクエスト、最も長い反復会話、100,000トークンに近いケースを含めてください。BIG CHANGEはドキュメントを確認しましたが、Haiku 5.5を実行したり、本番のワークロードを測定したりしていません。

移行時に見直す設定

Anthropicの Haiku 5.5移行ガイド は、Haiku 4.5から移行するクライアント向けに、具体的なチェックリストを示しています。

  1. プラットフォームのモデルIDを変更し、promptを再カウントします。claude-haiku-5-5は、日付の接尾辞や別名のない固定のClaude API IDです。max_tokensを確認してください。thinkingはこの上限を消費し、同じテキストでもより多くのトークンが必要になる可能性があります。
  2. をthinking: {"type":"enabled","budget_tokens":N}adaptive thinkingに置き換えるか、thinkingを未設定のままにします。深さの調整にはoutput_config.effortを設定します。文書に記載されたデフォルト値はmediumです。max_tokensの値が低いと、テキストが出力される前にthinkingブロックの後でレスポンスが終了する場合があります。
  3. コンテンツブロックは位置ではなくtypeに基づいて読み取ります。thinkingブロックはツールの結果と一緒に変更せず返します。別のアカウントでブロックを再生したり、過去のメッセージ、システム指示、ツールを変更したりする会話ストアをテストしてください。
  4. カスタムのtemperature、top_p、top_k設定を削除します。最後のassistant prefillをuser turnに置き換え、制約付き形式ではAnthropicが説明する構造化出力またはツールの方式を使います。クライアントでは、値がstop_reasonのrefusalを処理してください。
  5. Claude APIまたはGoogle Cloudでcomputer useを利用する場合、旧computer_20250124ツールをcomputer_toolset_20260801に置き換え、ガイドに従ってツールループを更新します。Haiku 4.5でPriority Tierの容量を使っている組織は、別の計画も必要です。ガイドによると、Haiku 5.5ではPriority Tierを利用できません。

この変更は、すべてのタスクに同じeffort設定を指定するものではありません。比較では、アプリケーションのタスクと受け入れ基準を一定に保ち、候補となる設定ごとに回答品質、拒否、途中終了、遅延、課金トークンを記録します。Anthropicは複数のベンチマークでHaiku 5.5が4.5を上回ったと報告しており、自社のTerminal-Bench 4.0の表では39.2%対0.0%でした。これらはAnthropicが自社の評価条件で報告した結果であり、読者のエージェントを測定したものではありません。同社はまた、このベンチマークでは複雑なエージェント型コーディングにSonnet 5.5とOpus 5.5がより適していると説明しています。Haiku 4.5のユーザーが当面判断すべきなのは、API変更と新しいトークン数を加味した後も、小型モデルが各限定的な処理の要件を満たすかどうかです。

出典・参考情報