Googleは Gemini 4 Argon 9月30日に発表し、知識業務とコーディングでの高スコア、100万出力トークンという上限の主張、将来のAPI提供価格を明らかにした。まず信頼できるサイバー防御担当者とテスターの一部に提供している。開発者向けの公開モデルIDも、有料API利用者やGoogle AI Ultra加入者が使える日付も示していない。 Googleの発表 と Gemini APIモデル一覧 は、発表から大半の読者が利用できるようになるまでの隔たりを示している。

大きな変化

  • 何が変わったか: Googleは新しい最先端モデルを一部のサイバー防御担当者に提供したが、大半の開発者や加入者はまだ利用できない。主な性能と価格の主張は公開された一方、一般向けAPIはまだ提供されていない。
  • 重要な理由: Vals AIの独立評価では、Argonは幅広い知識業務と金融エージェントのテストで首位となった。モデルを比較するチームにとって、本格的に検討する価値のある候補が増えたことになる。タスクごとに結果が異なり提供範囲も限られるため、各チームの業務での性能や費用はまだ分からない。
  • 今後の注目点: Googleは次の対象として有料API利用者とAI Ultra加入者を挙げたが、日付は示していない。モデルIDとサービス上限が文書化されれば、開発者は重要なタスクを試し、主張されている100万出力トークンを実際に使えるかも確認できる。

今Gemini 4を利用できる人

Googleによると、最初に利用するのは同社の Fairwindプログラムに参加する信頼できるサイバー防御担当者とテスターだ。Fairwindは一部のGoogle Cloud顧客、政府機関、セキュリティパートナーを対象とする限定アクセスのプログラム。Googleは、防御機能を活用できるよう、通常のサイバー安全策を適用せず信頼できる防御担当者にArgonを提供すると説明している。初期提供は特に慎重さを要する用途の管理されたテストだ。

Googleは、有料API利用者とGoogle AI Ultra加入者から始めて、開発者、企業、一般消費者へアクセスを広げる計画だが、時期は未発表。10月1日時点で、Googleの Gemini APIモデルディレクトリ にはGemini 3のモデルが掲載され、Gemini 4 ArgonのIDはなかった。 API料金ページ にもArgonの項目はない。そのためAPI呼び出しの手順を説明するには、Googleが文書化していないモデル名やアクセス方法を作り出す必要がある。

それでもGoogleは発表記事で将来のトークン料金を示した。導入時の価格は 入力100万トークン当たり2ドル、出力100万トークン当たり10ドルで、キャッシュされた入力は入力料金の95%引き。導入期間後は 4ドルと20ドルに引き上げるという。期間の終了日は示していない。これは発表済みの料金で、現在利用できるセルフサービスAPIの価格ではない。トークン単価だけでは、長時間のエージェント作業に必要な推論、ツール利用、出力量が分からず、費用を判断できない。

高いスコアと明らかな弱点

Vals AIによるArgonの独立評価 では、 68.90% ± 0.97 Vals Indexで41モデル中首位となった。Finance Agent v2でも73モデル中首位で、スコアは 65.40% ± 0.32。Vibe Code Benchでは106モデル中2位の 91.91% ± 1.90、Code Migrationでは71モデル中2位の 68.17% ± 4.35、CyberBench v1.1では43モデル中2位の 77.86% ± 5.30だった。複数タスクで好調な初期結果だが、すべてのタスクでArgonが最良という意味ではない。

同じ評価機関はTerminal-Bench 4.0でArgonを42モデル中5位、スコア 57.58% ± 2.31とした。MedScribeでは106モデル中15位、コンピューター操作のCUA-benchでは8モデル中7位で、スコアは 4.83%。テスト当たりの測定費用にも大きな差がある。Vals Indexのテストは $15.68 、CUA-benchは $193.78 だった。これは評価タスクの費用であり、Googleが発表した100万トークン当たりの料金とは別だ。Valsによると、エージェント評価の一部は固定ハーネスを使い、別のものはモデル固有のエージェントを使う。報告された標準誤差には、プロンプト、乱数シード、導入設定の違いは含まれない。小さなスコア差はその点を踏まえて読む必要がある。

Google DeepMind自身の比較表 にも、Argonがあらゆる面で首位という主張に反する例がある。DeepSWE v1.1ではArgonがGPT-6 Astraを上回り、 77.9% to 74.1%、FrontierSWE v2ではAstraを下回り、 55.0% to 65.5%、Terminal-Bench Scienceでも下回った 57.6% to 68.1%。Claude Opus 5.5はTerminal-Bench 4.0でArgonを上回り、 66.4% to 57.4%、PostTrainBenchでも上回った 49.3% to 45.3%。表中のオフラインOSWorld-2.0サブセットでは、Astraが 72.6% 、Argonが 69.2%だった。これらはGoogleが選んだ項目と公表したベンチマーク条件による比較であり、仕様が公開されたサービスで顧客が試すことの代わりにはならない。

Googleによると、Argonは1回の実行で最大 100万出力トークンを生成でき、従来の上限64,000トークンから増えた。Valsは100万トークンの コンテキスト ウィンドウを記載しているが、Argonの評価では最大出力を 262,144トークンに設定した。この設定で将来のGoogle製品の上限が確定するわけではない。ただし、Valsの公開結果は100万トークンすべての生成を示しておらず、Googleも一般の開発者が利用できる出力上限を明らかにする公開API項目をまだ掲載していない。

社内利用と安全性の主張には個別の証拠が必要

Googleによると、ArgonエージェントはC/C++からRustへのコード移行、量子コンピューティングのサブルーチン、データセンターのメモリ最適化を支援した。メモリ変更の一連の展開で300 TiB超を確保したとも説明している。また、パートナーのWizがArgonを使って医療ソフトウェアに影響する重大な脆弱性を発見したという。いずれも社内またはパートナーの仕事についてのGoogleの説明で、発表資料には結果を検証・再現できるだけの独立した詳細がない。Googleは大規模なRust書き換えも本番導入前に自動・手動で審査すると述べている。

安全性についてGoogleは、有害な依頼を拒否する訓練、間接的なプロンプトインジェクションへの防御、ユーザーの意図から外れた動きを検出するためのモデルの推論と行動の監視、評価環境の分離強化を説明している。Argonが間接的なプロンプトインジェクションに最も強いモデルだというのはベンダーの主張だ。Googleによると、初期のサイバー利用者には通常のサイバー安全策なしでアクセスが提供されるため、対象範囲の拡大に伴いアクセス範囲と監視が特に重要になる。

日常の有用性については、初期の情報が食い違っている。 Axiosは報じた 。Bloombergは匿名の情報源を引用し、一部のGoogle社員はArgonの社内性能が低いと感じたと伝えた。Axiosによれば、Googleはその報道は正確でないとBloombergに説明した。GoogleはAxiosに、社員が難しいコーディングや研究にモデルを使ったと語った。どちらの説明も一般公開版の性能を明らかにするものではない。次に必要なのは、条件が文書化されたアクセスと、第三者が確認できるタスク結果や費用だ。