世界は立ち止まらない。RSS
BIG CHANGE.

Markdown版

AI-translated from English; not yet reviewed by a fluent editor.

# Gemini 4 Argon、サイバーセキュリティのテスターに提供開始 API公開日は未定

> Googleは、信頼できるサイバーセキュリティのテスター向けにGemini 4 Argonを発表した。有料APIとAI Ultraへの提供予定日はまだ決まっていない。Vals AIの初の独立評価では、一部のタスクで首位、別のタスクでは下位となった。公開APIのモデル一覧にArgonのエンドポイントはない。

By BIG CHANGE Editorial

Published: 2026-09-30T23:56:07.213Z
Updated: 2026-10-01T02:16:11.971Z
Canonical: https://bigchange.ai/blog/gemini-4-argon-restricted-access-independent-benchmarks

![Charcoal illustration of a sculptural numeral 4 on warm ivory, with a restrained orange edge detail.](https://bigchange.ai/api/media/file/gemini-4-argon-number-4-hero-v2.png)
AI-generated editorial illustration by BIG CHANGE.

Googleは **Gemini 4 Argon** 9月30日に発表し、知識業務とコーディングでの高スコア、100万出力トークンという上限の主張、将来のAPI提供価格を明らかにした。まず信頼できるサイバー防御担当者とテスターの一部に提供している。開発者向けの公開モデルIDも、有料API利用者やGoogle AI Ultra加入者が使える日付も示していない。 [Googleの発表](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/) と [Gemini APIモデル一覧](https://ai.google.dev/gemini-api/docs/models) は、発表から大半の読者が利用できるようになるまでの隔たりを示している。

## 大きな変化

- **何が変わったか:** Googleは新しい最先端モデルを一部のサイバー防御担当者に提供したが、大半の開発者や加入者はまだ利用できない。主な性能と価格の主張は公開された一方、一般向けAPIはまだ提供されていない。
- **重要な理由:** Vals AIの独立評価では、Argonは幅広い知識業務と金融エージェントのテストで首位となった。モデルを比較するチームにとって、本格的に検討する価値のある候補が増えたことになる。タスクごとに結果が異なり提供範囲も限られるため、各チームの業務での性能や費用はまだ分からない。
- **今後の注目点:** Googleは次の対象として有料API利用者とAI Ultra加入者を挙げたが、日付は示していない。モデルIDとサービス上限が文書化されれば、開発者は重要なタスクを試し、主張されている100万出力トークンを実際に使えるかも確認できる。

## 今Gemini 4を利用できる人

Googleによると、最初に利用するのは同社の [Fairwindプログラム](https://blog.google/innovation-and-ai/technology/safety-security/fairwind-program/)に参加する信頼できるサイバー防御担当者とテスターだ。Fairwindは一部のGoogle Cloud顧客、政府機関、セキュリティパートナーを対象とする限定アクセスのプログラム。Googleは、防御機能を活用できるよう、通常のサイバー安全策を適用せず信頼できる防御担当者にArgonを提供すると説明している。初期提供は特に慎重さを要する用途の管理されたテストだ。

Googleは、有料API利用者とGoogle AI Ultra加入者から始めて、開発者、企業、一般消費者へアクセスを広げる計画だが、時期は未発表。10月1日時点で、Googleの [Gemini APIモデルディレクトリ](https://ai.google.dev/gemini-api/docs/models) にはGemini 3のモデルが掲載され、Gemini 4 ArgonのIDはなかった。 [API料金ページ](https://ai.google.dev/gemini-api/docs/pricing) にもArgonの項目はない。そのためAPI呼び出しの手順を説明するには、Googleが文書化していないモデル名やアクセス方法を作り出す必要がある。

それでもGoogleは発表記事で将来のトークン料金を示した。導入時の価格は **入力100万トークン当たり2ドル、出力100万トークン当たり10ドル**で、キャッシュされた入力は入力料金の95%引き。導入期間後は **4ドルと20ドル**に引き上げるという。期間の終了日は示していない。これは発表済みの料金で、現在利用できるセルフサービスAPIの価格ではない。トークン単価だけでは、長時間のエージェント作業に必要な推論、ツール利用、出力量が分からず、費用を判断できない。

## 高いスコアと明らかな弱点

[Vals AIによるArgonの独立評価](https://www.vals.ai/models/google_gemini-4-argon) では、 **68.90% ± 0.97** Vals Indexで41モデル中首位となった。Finance Agent v2でも73モデル中首位で、スコアは **65.40% ± 0.32**。Vibe Code Benchでは106モデル中2位の **91.91% ± 1.90**、Code Migrationでは71モデル中2位の **68.17% ± 4.35**、CyberBench v1.1では43モデル中2位の **77.86% ± 5.30**だった。複数タスクで好調な初期結果だが、すべてのタスクでArgonが最良という意味ではない。

同じ評価機関はTerminal-Bench 4.0でArgonを42モデル中5位、スコア **57.58% ± 2.31**とした。MedScribeでは106モデル中15位、コンピューター操作のCUA-benchでは8モデル中7位で、スコアは **4.83%**。テスト当たりの測定費用にも大きな差がある。Vals Indexのテストは **$15.68** 、CUA-benchは **$193.78** だった。これは評価タスクの費用であり、Googleが発表した100万トークン当たりの料金とは別だ。Valsによると、エージェント評価の一部は固定ハーネスを使い、別のものはモデル固有のエージェントを使う。報告された標準誤差には、プロンプト、乱数シード、導入設定の違いは含まれない。小さなスコア差はその点を踏まえて読む必要がある。

[Google DeepMind自身の比較表](https://deepmind.google/models/gemini/) にも、Argonがあらゆる面で首位という主張に反する例がある。DeepSWE v1.1ではArgonがGPT-6 Astraを上回り、 **77.9% to 74.1%**、FrontierSWE v2ではAstraを下回り、 **55.0% to 65.5%**、Terminal-Bench Scienceでも下回った **57.6% to 68.1%**。Claude Opus 5.5はTerminal-Bench 4.0でArgonを上回り、 **66.4% to 57.4%**、PostTrainBenchでも上回った **49.3% to 45.3%**。表中のオフラインOSWorld-2.0サブセットでは、Astraが **72.6%** 、Argonが **69.2%**だった。これらはGoogleが選んだ項目と公表したベンチマーク条件による比較であり、仕様が公開されたサービスで顧客が試すことの代わりにはならない。

Googleによると、Argonは1回の実行で最大 **100万出力トークン**を生成でき、従来の上限64,000トークンから増えた。Valsは100万トークンの *コンテキスト* ウィンドウを記載しているが、Argonの評価では最大出力を **262,144トークン**に設定した。この設定で将来のGoogle製品の上限が確定するわけではない。ただし、Valsの公開結果は100万トークンすべての生成を示しておらず、Googleも一般の開発者が利用できる出力上限を明らかにする公開API項目をまだ掲載していない。

## 社内利用と安全性の主張には個別の証拠が必要

Googleによると、ArgonエージェントはC/C++からRustへのコード移行、量子コンピューティングのサブルーチン、データセンターのメモリ最適化を支援した。メモリ変更の一連の展開で300 TiB超を確保したとも説明している。また、パートナーのWizがArgonを使って医療ソフトウェアに影響する重大な脆弱性を発見したという。いずれも社内またはパートナーの仕事についてのGoogleの説明で、発表資料には結果を検証・再現できるだけの独立した詳細がない。Googleは大規模なRust書き換えも本番導入前に自動・手動で審査すると述べている。

安全性についてGoogleは、有害な依頼を拒否する訓練、間接的なプロンプトインジェクションへの防御、ユーザーの意図から外れた動きを検出するためのモデルの推論と行動の監視、評価環境の分離強化を説明している。Argonが間接的なプロンプトインジェクションに最も強いモデルだというのはベンダーの主張だ。Googleによると、初期のサイバー利用者には通常のサイバー安全策なしでアクセスが提供されるため、対象範囲の拡大に伴いアクセス範囲と監視が特に重要になる。

日常の有用性については、初期の情報が食い違っている。 [Axiosは報じた](https://www.axios.com/2026/09/30/google-gemini-4) 。Bloombergは匿名の情報源を引用し、一部のGoogle社員はArgonの社内性能が低いと感じたと伝えた。Axiosによれば、Googleはその報道は正確でないとBloombergに説明した。GoogleはAxiosに、社員が難しいコーディングや研究にモデルを使ったと語った。どちらの説明も一般公開版の性能を明らかにするものではない。次に必要なのは、条件が文書化されたアクセスと、第三者が確認できるタスク結果や費用だ。

## Sources

- [GoogleのGemini 4 Argon発表](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/) — 公式発表、アクセス計画、将来の価格、主張される出力上限、社内プロジェクト、安全性に関する説明。社内成果と安全性の比較はベンダーの主張。
- [Google DeepMindのGeminiモデルページ](https://deepmind.google/models/gemini/) — Argonの優位と劣位を含むGoogle選定の直接比較表。10月1日確認。
- [Gemini APIモデル一覧](https://ai.google.dev/gemini-api/docs/models) — 開発者向け公開モデル一覧。確認時にGemini 4 ArgonのモデルIDはなかった。非公開アクセスがないことを示すものではない。
- [Gemini APIの料金](https://ai.google.dev/gemini-api/docs/pricing) — 開発者向け公開料金ページ。確認時にArgonの記載はなかった。発表記事には将来の料金が記載されている。
- [Vals AIのGemini 4 Argon評価](https://www.vals.ai/models/google_gemini-4-argon) — 独立評価機関のベンチマークスコア、順位、タスク費用、評価設定。最大262,144出力トークンを含む。
- [Vals AIの評価方法](https://www.vals.ai/methodology) — タスク設計、エージェント用ハーネスの違い、標準誤差で分かることと分からないことを説明する。
- [GoogleのFairwindプログラム](https://blog.google/innovation-and-ai/technology/safety-security/fairwind-program/) — 限定的なサイバー防御プログラムと想定するパートナーについてのGoogleの説明。
- [Axiosの発表報道](https://www.axios.com/2026/09/30/google-gemini-4) — アクセス状況とGoogleのコメントに関する独立報道。Bloombergが伝えた匿名社員の懐疑論とGoogleの否定を紹介する。
- [Ars Technicaの発表報道](https://arstechnica.com/google/2026/09/google-announces-gemini-4-argon-ai-model-but-you-cant-use-it-yet/) — 発表に関する独立した背景情報。社内利用は引き続きGoogleの説明に基づく。
BIG CHANGEニュースレター

大局を、あなたのペースで。

AI とロボティクスの最新記事、注目すべき変化、活用できる実用的なアイデア。日刊ブリーフィング、週刊ダイジェスト、月刊展望から選べます。