Google 于 Gemini 4 Argon 9 月 30 日发布 Gemini 4 Argon,公布了它在知识工作和编程方面的高分、最高可输出一百万个 token 的说法,以及未来 API 的价格。Google 首先向一小群可信的网络安全防御人员和测试人员提供该模型。Google 尚未公布开发者可用的公开模型 ID,也没有说明付费 API 客户或 Google AI Ultra 订阅者何时可以使用。 Google 的公告 和 Gemini API 模型目录 显示了产品发布与大多数读者获得访问权限之间的差距。

主要变化

  • 发生了什么变化: Google 已把一款新的前沿模型交给部分网络安全防御人员使用,但大多数开发者和订阅者仍无法访问。主要能力和价格声明已经公开,公开 API 却尚未推出。
  • 为什么重要: Vals AI 的独立评测在广泛知识工作和金融代理测试中将 Argon 排在第一位,因此比较模型的团队有了值得认真考虑的新候选。不同任务的结果不一,加上开放范围有限,各团队在自身工作流程中的效果和成本仍未明确。
  • 接下来关注: Google 将付费 API 客户和 AI Ultra 订阅者列为下一批用户,但没有给出日期。公开的模型 ID 和服务限制将让开发者测试真正重要的工作,也能验证所称的一百万输出 token 是否能在实际中使用。

目前谁可以使用 Gemini 4

Google 表示,首批用户是其 Fairwind 计划中的可信网络安全防御人员和测试人员。Fairwind 是面向部分 Google Cloud 客户、政府机构和安全合作伙伴的限量访问计划。Google 称,可信防御人员可以在不受常规网络安全防护限制的情况下使用 Argon,以发挥其防御能力。此次初期开放是针对特别敏感用途的受控测试。

Google 计划将访问范围扩大到开发者、企业和消费者,首先面向付费 API 客户和 Google AI Ultra 订阅者。该阶段尚无日期。截至 10 月 1 日,Google 的 Gemini API 模型目录 列出了 Gemini 3 模型,但没有 Gemini 4 Argon 的标识符。其 API 定价页面 也没有 Argon 项。因此,API 调用指南将不得不编造 Google 尚未记录的模型名称和访问路径。

不过,Google 在发布文章中公布了未来的 token 费率。初始价格为 每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入的价格比输入费率低 95%。初始阶段结束后,Google 表示费率将升至 4 美元和 20 美元。Google 没有说明初始阶段何时结束。这些是已公布的费率,并非目前可用的自助式 API 价格。在不知道长时间代理任务所需的推理、工具调用和输出量之前,每 token 价格也无法说明任务总成本。

成绩强劲,但弱点也很明显

Vals AI 对 Argon 的独立评测 报告 68.90% ± 0.97 ,在表列的 41 个模型中排名第一;在 Finance Agent v2 中也位列 73 个模型第一,成绩为 65.40% ± 0.32。在 Vibe Code Bench 中,它以 91.91% ± 1.90;在 Code Migration 中,以 68.17% ± 4.35;在 CyberBench v1.1 中,以 77.86% ± 5.30。这些结果显示它在多项任务中有不错的早期表现,但并不意味着 Argon 在每项任务中都是最佳模型。

同一评测机构将 Argon 排在 Terminal-Bench 4.0 的 42 个模型中的第五位,成绩为 57.58% ± 2.31;在 MedScribe 中位列 106 个模型中的第十五位,在计算机操作 CUA-bench 中位列 8 个模型中的第七,成绩为 4.83%。每项测试的测算成本也相差很大: $15.68 用于一次 Vals Index 测试,并且 $193.78 用于 CUA-bench。这些是评测任务成本,与 Google 公布的每百万 token 价格不同。Vals 表示,有些代理评测采用固定测试框架,另一些则使用模型自带的代理;其标准误差不包含提示词、随机种子或部署设置的变化。应结合这些背景看待微小的分数差异。

Google DeepMind 自己的对比表 也给出了反例,说明 Argon 并非全面领先。表中 Argon 在 DeepSWE v1.1 上超过 GPT-6 Astra, 77.9% to 74.1%,但在 FrontierSWE v2 上落后于 Astra, 55.0% to 65.5%,在 Terminal-Bench Science 上也落后, 57.6% to 68.1%。Claude Opus 5.5 在 Terminal-Bench 4.0 上领先 Argon, 66.4% to 57.4%,在 PostTrainBench 上也领先, 49.3% to 45.3%。表中离线 OSWorld-2.0 子集的结果是 Astra 得分 72.6% ,Argon 得分 69.2%。这些比较使用了 Google 选定的项目和公布的基准测试设置,不能替代客户在文档齐备的公开服务中进行测试。

Google 称 Argon 单次运行最多可生成 一百万个输出 token,高于此前 64,000 个 token 的上限。Vals 列出一百万 token 的 上下文 窗口,但在 Argon 评测中将最大输出设为 262,144 个 token。这一设置并未确定 Google 未来产品的硬性上限。但它说明 Vals 的公开结果没有展示完整的一百万 token 生成,而且 Google 尚未发布公开 API 项目来说明普通开发者可以使用的输出上限。

内部用途和安全声明需要各自的证据

Google 称 Argon 代理协助完成了 C/C++ 到 Rust 的代码迁移、量子计算子程序和数据中心内存优化。Google 表示,一组内存更改上线后释放了超过 300 TiB。Google 还称,其合作伙伴 Wiz 借助 Argon 发现了影响医疗软件的严重漏洞。这些都是 Google 对内部或合作伙伴工作的描述;发布材料缺少足够的独立细节,无法验证或复现这些结果。Google 表示,大规模 Rust 改写在投入生产前仍会经过自动和人工审查。

在安全方面,Google 介绍了针对有害请求的拒绝训练、对间接提示注入的防护、对模型推理和行动的监控以发现偏离用户意图的行为,以及更严格的评测环境隔离。Argon 是其最能抵御间接提示注入的模型,这属于供应商声明。Google 称,首批网络安全用户也能在没有常规网络安全防护限制的情况下使用模型;随着开放范围扩大,访问范围和监控尤为关键。

关于日常实用性的早期证据并不一致。 Axios 报道 ,彭博援引匿名消息人士称,一些 Google 员工认为 Argon 的内部表现不佳;Axios 也报道称,Google 告诉彭博该说法不准确。Google 对 Axios 表示,员工曾用该模型处理困难的编程和研究任务。这两种说法都无法说明公开版本的表现。接下来需要在设置有文档说明的条件下开放访问,并提供他人可以审查的任务结果和成本。