Google 宣布 Gemini 4 Argon 於 9 月 30 日發布,並公布其在知識工作與程式設計上的亮眼分數、宣稱可輸出一百萬個 token 的上限,以及未來 API 版本的價格。Google 正先向一小群受信任的網路安全防禦人員與測試者推出此模型。Google 尚未公布供開發者使用的模型 ID,也未說明付費 API 客戶或 Google AI Ultra 訂閱者何時能使用。 Google 的公告 與 Gemini API 模型型錄 顯示了產品發表與多數讀者實際取得存取權之間的落差。
主要變化
- 有哪些變化: Google 已讓部分網路安全防禦人員使用新的頂尖模型,但大多數開發者與訂閱者仍無法存取。模型的主要能力與價格宣稱已公開,公開 API 卻尚未推出。
- 為何重要: Vals AI 的獨立評測在廣泛知識工作和金融代理人測試中都將 Argon 排名第一,因此比較模型的團隊有了值得認真考慮的新選項。不同任務的結果不一,加上推出範圍受限,讓各團隊無法確定它在自家工作流程中的成效與成本。
- 後續觀察重點: Google 指出下一批對象將是付費 API 客戶與 AI Ultra 訂閱者,但未提供日期。公開記載的模型 ID 與服務限制公布後,開發者就能測試真正重要的工作,也能驗證宣稱的一百萬個輸出 token 是否實際可用。
目前誰能使用 Gemini 4
Google 表示,首批使用者是參與其 Fairwind 計畫的受信任網路安全防禦人員與測試者。Fairwind 是一項限量存取計畫,對象包括特定 Google Cloud 客戶、政府機關與安全合作夥伴。Google 表示,Argon 開放給受信任的防禦人員使用時,未套用一般的網路安全防護限制,讓他們運用模型的防禦能力。這次初步推出是針對格外敏感用途所做的受控測試。
Google 計畫將存取範圍擴大至開發者、企業與一般消費者,首先開放給付費 API 客戶及 Google AI Ultra 訂閱者。這一步何時進行尚無日期。截至 10 月 1 日,Google 的 Gemini API 模型目錄 列出 Gemini 3 模型,沒有 Gemini 4 Argon 的識別碼。其 API 定價頁面 也沒有 Argon 項目。因此,若要提供 API 呼叫教學,就得捏造 Google 尚未記載的模型名稱與存取方式。
不過,Google 在發布文章中公布了未來每 token 的價格。初期價格為 每百萬個輸入 token 2 美元、每百萬個輸出 token 10 美元,快取輸入的價格比輸入費率低 95%。初期優惠結束後,Google 表示費率將升至 4 美元與 20 美元。Google 沒有說明初期優惠何時結束。這些是已公布的未來費率,不是目前可用的自助式 API 價格。每 token 的價格也無法說明長時間代理任務的成本,除非先知道任務所需的推理量、工具使用量和輸出量。
成績亮眼,但弱點也很明顯
Vals AI 對 Argon 的獨立評測 顯示 68.90% ± 0.97 ,在其表列的 41 個模型中排名第一;Finance Agent v2 則在 73 個模型中排名第一,成績為 65.40% ± 0.32位居 106 個模型的第二名;Code Migration 以 91.91% ± 1.90排名 71 個模型中的第二;CyberBench v1.1 則以 68.17% ± 4.35排名 43 個模型中的第二。這些結果顯示 Argon 在多項任務中有不錯的初期表現,但不能據此說它每項任務都勝過其他模型。 77.86% ± 5.30。這些結果顯示 Argon 在多項任務中有不錯的初期表現,但不能據此說它每項任務都勝過其他模型。
同一評測機構在 Terminal-Bench 4.0 將 Argon 排在 42 個模型中的第五名,成績為 57.58% ± 2.31;MedScribe 排名 106 個模型中的第十五名;在電腦操作 CUA-bench 則以 4.83%排名八個模型中的第七。各項測試的成本差異也很大:Vals Index 每次測試 $15.68 ,CUA-bench 每次 $193.78 。這些是評測任務成本,與 Google 公布的每百萬 token 價格不同。Vals 表示,有些代理人評測使用固定測試環境,另一些則採用模型原生代理人;其公布的標準誤差不包含提示詞、隨機種子或部署設定之間的變動。解讀微小的分數差異時,應將這些因素納入考量。
Google DeepMind 自行公布的比較表 也提供了更多反例,顯示 Argon 並非全面領先。表中 Argon 在 DeepSWE v1.1 勝過 GPT-6 Astra, 77.9% to 74.1%,但在 FrontierSWE v2 落後 Astra, 55.0% to 65.5%,在 Terminal-Bench Science 也落後, 57.6% to 68.1%。Claude Opus 5.5 在 Terminal-Bench 4.0 領先 Argon, 66.4% to 57.4%,在 PostTrainBench 也領先, 49.3% to 45.3%。在表中的離線 OSWorld-2.0 子集中,Astra 得分 72.6% ,Argon 則為 69.2%。這些比較採用 Google 選定的評測項目與其公布的測試設定,不能取代客戶在規格明確的公開服務中自行測試。
Google 表示,Argon 單次運作最多可輸出 一百萬個 token,高於先前的 64,000 token 上限。Vals 列出的上下文 視窗 也有一百萬個 token,但其 Argon 評測設定的最大輸出為 262,144 個 token。這項設定不能證明 Google 未來產品的硬性上限。不過,Vals 公開結果並未展示完整的一百萬 token 生成,而 Google 也尚未發布公開 API 項目,說明一般開發者實際能使用的輸出上限。
內部用途與安全宣稱需要各自的證據
Google 表示,Argon 代理人曾協助將 C/C++ 程式碼移植至 Rust、開發量子運算子程序,以及最佳化資料中心記憶體。Google 稱,其中一批記憶體變更推出後釋出了超過 300 TiB 的容量。Google 也表示,合作夥伴 Wiz 曾使用 Argon 找出影響醫療軟體的重大漏洞。這些都是 Google 對內部或合作夥伴工作的描述;發布資料缺乏足夠的獨立細節,無法驗證或重現這些成果。Google 表示,大型 Rust 改寫案在投入正式環境前仍會經過自動與人工審查。
在安全方面,Google 表示已針對有害要求訓練模型拒絕作答、部署防範間接提示注入的機制、監控模型推理與行動是否偏離使用者意圖,並加強評測環境的隔離。Argon 是 Google 最能抵禦間接提示注入的模型,這仍是供應商的說法。Google 表示,首批網路安全使用者也能在沒有一般網路安全防護限制的情況下使用模型;隨著開放範圍擴大,存取範圍與監控方式因此格外重要。
目前有關日常實用性的初步證據並不一致。 Axios 報導 ,Bloomberg 引述匿名消息人士稱,部分 Google 員工認為 Argon 內部表現不佳;Axios 也報導,Google 告訴 Bloomberg 這種說法不實。Google 向 Axios 表示,員工曾用該模型處理困難的程式設計與研究工作。兩種說法都無法證明公開版本的表現。接下來應觀察在有明確文件記載的設定下開放使用,並公布其他人可檢視的任務結果與成本。



