Gemini 4 Argon:我们前沿智能的新时代

今天,我们宣布推出新的前沿模型 Gemini 4 Argon,该模型正通过我们的 Fairwind 计划 向一组受信任的网络防御者逐步开放。Argon 旨在支持复杂、长周期工作流中的深度推理,正在从根本上改变我们在 Google 工作和构建的方式。它在现实世界的软件工程、法律和金融等企业知识工作以及网络安全防御等复杂工作流中提供前沿性能。
安全地发布这一级别的前沿能力需要分阶段进行。我们正积极参与美国政府关于发布前模型访问的自愿流程,同时逐步扩大访问范围。我们将继续收集早期测试者的反馈,并在护栏方面进行迭代,以便尽快让 Argon 面向开发者、企业和消费者开放。
Argon 将以每百万输入 token 2 美元、每百万输出 token 10 美元的 introductory price 推出
,缓存输入 token 的价格为输入 token 价格的 95% 折扣。
改变我们在 Google 工作和构建的方式
Gemini 4 Argon 已经在为我们的内部工作流提供支持,数千名 Google 员工强调了该模型在专业编码任务、进行更深入研究和写作质量方面的优势。它正在帮助团队更快地构建,推动工程生产力的边界,并加速突破:
量子算法优化:Argon 正在帮助我们的量子计算研究人员优化那些成为重要应用瓶颈的子程序所需的时空资源(量子比特 × 门)。在一个例子中,它在几分钟内就比已发布的基线提高了 40%。
内存效率:一组 Argon 智能体分析了全集群的性能分析遥测数据,以自主识别并在 Google 数据中心应用内存优化,推出后释放了超过 300 TiB 的内存,预计总节省量在 500 TiB 到 1 PiB 之间。
大规模代码库迁移与优化:Argon 智能体正在 Google 内部致力于将 C/C++ 代码库迁移到 Rust——从 re2、libgav1 等核心库的数万行代码,扩展到 Fuchsia Zircon 内核的 80 万行以上。鉴于其中许多系统的关键性,此类大规模重写正在经过严格的自动化和人工审计、仿真测试和审查,然后才会推广到生产环境。
对于 libgav1——Google 用于解码视频的开源软件——Argon 智能体接手了一个现有的 Rust 移植版本,并通过运行多轮性能分析引导的实验、研究编译器输出、生成安全的 Rust 代码以便编译器自动向量化,替换了 32K 行 SIMD 代码。最终结果是一个内存安全的视频解码器,运行速度比 Rust 移植版本快 2.7 倍,视频输出完全相同,使其更接近优化后的 C++。
更努力地解决您最复杂的问题
为了支持 Gemini 4 Argon 在更长、更复杂用例中的能力,我们大幅扩展了模型的输出 token 限制,从之前的 64K token 提升至行业领先的 1M token。当模型有足够的空间深入思考并在单次轨迹中生成数十万 token 时,它为推理增添了新的深度层次,能够一次性解决棘手问题。

赋能跨领域的编码与企业工作流
Gemini 4 Argon 在编码、推理和多模态方面的能力,以及其维持长时、多步骤任务的能力,使其在一系列企业工作流中表现出色。
Google 工程师一直在日常任务中使用 Argon,从日常调试到大规模代码库迁移和算法设计。它在 DeepSWE v1.1(77.9%)上树立了新的最先进水平,该基准衡量模型在真实世界长周期软件工程任务中的表现。
除编码外,Argon 在 Vals Index 上是领先模型,该指数衡量金融、编码、法律和税务工作的经济影响,每个领域按其对美国 GDP 的贡献加权。我们在其他领域特定评估中也看到类似的领先表现,如 Vals Finance Agent v2(多步骤金融研究)和 Harvey 的法律代理基准(法律研究与起草)。在 AutomationBench(Zapier 衡量核心业务职能端到端执行的基准)上,Argon 以 51.3% 的得分排名第一。
当知识工作需要视觉理解时,Argon 也格外强大。它能够驱动专业图表分析、从长视频中识别细节,并根据一系列文档采取行动。例如,在衡量长视频理解的 LVBench 上,Argon 以 91.7% 的得分达到最先进水平。





在防御性网络安全领域领先
为了更好地装备网络防御者应对网络攻击的新时代,我们训练 Gemini 4 Argon 在网络安全防御方面具备高度能力。Argon 能够自主发现、验证和修补关键软件漏洞。对于受信任的防御者和我们在 Google 的内部团队,我们将发布不带网络护栏的 Argon,以便他们能够充分利用其前沿级别的网络安全防御能力。
Wiz 已经通过其 Scan for Good 计划将 Argon 用于网络安全防御——该计划致力于通过发现并修复高风险暴露,免费保护关键公共基础设施。在其影响力的早期演示中,该模型发现了一个关键漏洞,该漏洞暴露了全球各地医院所使用的医疗软件中的敏感个人信息,识别出了此前前沿模型所遗漏的严重风险。
在评估模型修复安全漏洞能力的 CWE-bench v1 上,Argon 以 68% 的最高分并列第一,延续了 3.8 Flash Cyber 在 CWE-bench v0 上的前沿表现。

Gemini 4 Argon 在漏洞发现方面相较 3.8 Flash Cyber 展现出令人瞩目的飞跃。例如:
- 在 Google 内部的综合漏洞基准测试中,Argon 在涵盖 20 种编程语言的复杂代码库中发现了广泛的暴露。
- 在 Wiz 内部的黑盒渗透测试基准中——该基准测试模型在没有源代码的情况下分析实时 Web 系统的能力——Argon 在发现攻击面、识别漏洞以及生成概念验证证据以验证漏洞方面均优于 3.8 Flash Cyber。

在广泛开放之前加强前沿安全保障
在广泛推出 Gemini 4 Argon 之前,我们将继续在四个主要领域加强关键的前沿安全保障:
防御滥用: 为防止恶意行为者利用 Argon 进行网络攻击或化学、生物、放射及核(CBRN)攻击,根据我们的前沿安全框架,该模型被设计为拒绝有害请求,同时保留合法的两用科学研究。我们正在为此次发布加强安全保障的稳健性,包括改进我们监测模型内部激活以发现滥用的技术。这些保障措施经过了内部和外部红队的稳健性测试,测试结合了手动和自动化攻击方法。
防御提示注入攻击: Argon 也是我们迄今为止对间接提示注入最具韧性的模型,间接提示注入是指利用恶意指令或上下文劫持模型行为。这些是复杂的攻击,需要持续警惕和多层防御。通过自动化红队测试和对抗性训练,Gemini 4 Argon 在 Gray Swan 的间接提示注入(IPI)基准上处于提示注入稳健性领先地位。

监测失准: 为了防止 Argon 越界,以超出用户意图的方式尝试完成任务,我们正在部署失准缓解措施,监测 Argon 的思维链和行动,并在必要时停止执行。
我们使用了一套类似的系统来监控训练运行,并向专门的应急响应团队发送警报,同时采取谨慎的预防措施,避免将发现结果反馈到训练中,以免有塑造 Argon 推理以规避我们监控的风险。我们强烈鼓励业界其他各方在能力提升的关键时刻、在应对对齐风险的同时,保持推理透明度,以便模型思维在识别和诊断失准方面仍然有用。
加固系统: 随着前沿模型能力日益增强,安全地测试它们需要能够跟上系统本身的安全环境。根据我们的智能体控制路线图,我们正在高风险训练或评估开始之前,通过隔离和封闭来加固我们的沙盒环境。我们致力于与合作伙伴分享这些智能体安全最佳实践,以提升整个生态系统的安全性。
即将推出
我们构建 Gemini 4 Argon 时,赋予其在编程、知识工作、网络安全防御和创意写作方面前沿水平的能力,使其成为开发者、专业人士和企业在应对最困难问题时的伙伴。我们感谢首批网络防御者和可信测试人员,他们的真实世界评估和反馈将帮助我们在向开发者、企业和消费者发布之前强化我们的系统,首先从付费 API 客户和 Google AI Ultra 订阅者开始。
