Google DeepMind 发布 Gemini 4 Argon 前沿模型
Gemini 4 Argon: our next era of frontier intelligence
Google DeepMind 宣布 Gemini 4 Argon,这一前沿模型将先通过 Fairwind Program 向一组受信任的网络防御者推出,并逐步扩大访问。
原文给出发布节奏、价格和多项基准结果,可用于了解 Google 对高能力模型分阶段开放的安排。
2026 年 9 月 30 日
|
Gemini 4 Argon 在现实世界软件工程、法律和金融等企业知识工作,以及网络安全防御等复杂工作流程中提供前沿性能。
本文内容
- 推出 Gemini 4 Argon
- 改变我们在 Google 的工作和构建方式
- 更深入地处理你最复杂的问题
- 支持跨领域的编码和企业工作流程
- 在防御性网络安全方面领先
- 在广泛开放前加强前沿防护措施
- 即将推出
今天,我们宣布推出新的前沿模型 Gemini 4 Argon,并正通过我们的 Fairwind 计划向一批受信任的网络防御者开放。Argon 旨在在复杂、长周期工作流程中保持深度推理,正在从根本上改变我们在 Google 的工作和构建方式。它在现实世界软件工程、法律和金融等企业知识工作,以及网络安全防御等复杂工作流程中提供前沿性能。
安全地发布这一级别的前沿能力需要分阶段推进。随着我们逐步扩大访问范围,我们正在积极参与美国政府针对预发布模型访问的自愿流程。我们将继续收集早期测试者的反馈,并在迭代完善防护措施后,尽快向开发者、企业和消费者开放 Argon。
Argon 将以入门价格发布: 1 每百万输入 token 2 美元,每百万输出 token 10 美元,缓存输入 token 的价格为输入 token 价格的 5%。
改变我们在 Google 的工作和构建方式
Gemini 4 Argon 已经在支持我们的内部工作流程,数千名 Googler 强调了该模型在专业编码任务、更深入研究和写作质量方面的优势。它正在帮助团队更快地构建,突破工程生产力的边界,并加速突破性进展:
- 量子算法优化:Argon 正在帮助我们的量子计算研究人员优化那些成为重要应用瓶颈的子例程的时空资源(量子比特 × 门)。在一个示例中,它在几分钟内比已发表的基线高出 40%。
- 内存效率:一个由 Argon agent 组成的团队分析了整个机群范围的性能分析遥测数据,自主识别并应用了 Google 数据中心中的内存优化;推出后释放了超过 300 TiB 的内存,预计总共可节省 500 TiB 到 1 PiB。
- Large Scale Codebase Migrations and Optimizations: Argon agents are working on migrating C/C++ codebases to Rust across Google — scaling from tens of thousands of lines in core libraries like re2, libgav1 up to 800K+ lines for the Fuchsia Zircon kernel. Given the criticality of many of these systems, such large-scale rewrites are undergoing rigorous automated and manual auditing, emulation testing, and review before rolling out to production.
对于 Google 用于解码视频的开源软件 libgav1,Argon agent 接手了一个现有的 Rust 移植版本,通过运行多轮基于性能分析指导的实验、研究编译器输出并生成安全的 Rust 代码,让编译器能够自动对其进行向量化,从而替换了 32K 行 SIMD 代码。最终结果是一个内存安全的视频解码器,运行速度比该 Rust 移植版本快 2.7 倍,视频输出完全一致,使其更接近优化后的 C++。
更努力地攻克你最复杂的问题
为支持 Gemini 4 Argon 在更长、更复杂用例中的能力,我们正在大幅扩展该模型的输出 token 上限,从此前的 64K token 提升到行业领先的 1M token。当模型拥有足够余地进行深入思考,并在单次轨迹中生成数十万 token 时,它会为推理增加新的深度,从而一次性解决棘手问题。
支持跨领域的编码与企业工作流
Gemini 4 Argon 在编码、推理和多模态方面的能力,以及持续执行长期、多步骤任务的能力,使其能够在一系列企业工作流中表现出色。
Google 工程师一直在将 Argon 用于日常任务,从日常调试到大规模代码库迁移和算法设计。它在 DeepSWE v1.1 上树立了新的最先进水平(77.9%),该基准衡量模型在真实世界长周期软件工程任务中的表现。
在编码之外,Argon 也是 Vals Index 上的领先模型,该指数衡量金融、编码、法律和税务工作中的经济影响,并按各行业对美国 GDP 的贡献进行加权。我们在其他特定领域评测中也看到了类似的领先表现,例如 Vals Finance Agent v2(多步骤金融研究)和 Harvey 的 Legal Agent Benchmark(法律研究与起草)。在 AutomationBench(Zapier 衡量核心业务职能端到端执行的基准)上,Argon 以 51.3% 的得分排名第 1。
当知识工作需要视觉理解时,Argon 也有独特优势。它能够推动专业图表分析、从长视频中识别细节,并基于一系列文档采取行动。例如,在衡量长视频理解能力的 LVBench 上,Argon 以 91.7% 的得分达到最先进水平。
在防御性网络安全方面领先
为更好地让网络防御者应对网络攻击的新时代,我们训练 Gemini 4 Argon,使其在网络安全防御方面具备很强能力。Argon 可以自主发现、验证并修补关键软件漏洞。对于可信的防御者以及我们在 Google 的内部团队,我们将发布不带网络安全护栏的 Argon,以便他们利用其完整的前沿级网络安全防御能力。
Wiz 已经通过其 Scan for Good 计划将 Argon 用于网络安全防御——该计划致力于通过发现并修复高风险暴露,免费保护关键公共基础设施。在一次早期影响展示中,该模型发现了一个关键漏洞,该漏洞会暴露全球医院所用医疗软件中的敏感个人信息,识别出此前前沿模型未能发现的严重风险。
在 CWE-bench v1 上,Argon 以 68% 的最高分并列第一;该基准评估模型修复安全漏洞的能力,并延续了 3.8 Flash Cyber 在 CWE-bench v0 上的前沿表现。
Gemini 4 Argon 在漏洞发现方面相较 3.8 Flash Cyber 展现出令人印象深刻的飞跃。例如:
- 在 Google 内部的综合漏洞基准上,Argon 在涵盖 20 种编程语言的复杂代码库中发现了广泛的暴露问题。
- 在 Wiz 的内部黑盒渗透测试基准上,该基准测试模型在没有源代码的情况下分析实时 Web 系统的能力,Argon 在发现攻击面、识别漏洞以及生成用于验证漏洞的概念验证证据方面优于 3.8 Flash Cyber。
在广泛开放前加强前沿安全防护
在广泛推出 Gemini 4 Argon 之前,我们将继续在四个主要领域加强关键的前沿安全防护:
防范滥用: 为防止恶意行为者利用 Argon 发起网络攻击或化学、生物、放射性及核(CBRN)攻击,该模型按照我们的 前沿安全框架 设计为会拒绝有害请求,同时保留合法的、具有双重用途的科学研究能力。我们正在为此次发布加强安全防护的稳健性,包括改进用于监控模型 内部激活 以发现滥用的技术。这些防护措施通过内部和外部红队采用手动与自动化攻击方法相结合的方式进行了稳健性测试。
防范提示注入攻击: Argon 也是我们迄今为止最能抵御间接提示注入的模型,在这类攻击中,恶意指令或上下文会被用来劫持模型的行为。这些攻击非常复杂,需要持续保持警惕并采用多层防御。通过自动化红队测试和对抗训练,Gemini 4 Argon 在 Gray Swan 的间接提示注入(IPI)基准测试中处于提示注入稳健性的领先地位。
监控错位: 为防止 Argon 为了完成任务而越界,以超出用户意图的方式行事,我们正在部署错位缓解措施,用于监控 Argon 的思维链和行动,并在必要时停止执行。
我们使用了类似系统来监控训练运行,并向专门的事件响应团队发送警报,同时采取谨慎预防措施,避免将发现反馈回训练中,以免带来塑造 Argon 推理使其规避我们监控的风险。我们 强烈鼓励行业其他参与者 在能力提升的这些关键时刻、应对对齐风险的同时,保留推理透明度,以便模型的思考仍有助于识别和诊断错位。
加固系统: 随着前沿模型能力日益增强,安全地测试它们需要能够跟上系统本身发展的安全环境。根据我们的 智能体控制路线图,我们正在通过在高风险训练或评估开始前隔离并封闭沙盒环境来对其进行加固。我们致力于与合作伙伴分享这些智能体安全最佳实践,以提升整个生态系统的安全性。
即将推出
我们打造 Gemini 4 Argon,使其在编码、知识工作、网络安全防御和创意写作方面具备前沿级能力,从而成为开发者、专业人士和企业在攻克最困难问题时的伙伴。我们感谢首批网络防御者和值得信赖的测试人员,他们的真实环境评估和反馈将帮助我们在面向开发者、企业和消费者发布之前加强我们的系统;发布将从付费 API 客户和 Google AI Ultra 订阅者开始。
来源:Google DeepMind · deepmind.google