跳到正文
Latent Space·· 7 天前精选AI 评分79

Gemini 4 Argon 发布,Google DeepMind 面向编码、企业知识工作和网络防御推出前沿模型

[AINews] Gemini 4 Argon: GDM’s answer to Astra/Fable, with 1M output

AI 导读

Google DeepMind 推出 Gemini 4 Argon,用于编码、企业知识工作和网络防御,当前仅通过 Fairwind Program 向政府用户和受信任的网络防御者开放。

推荐理由

原文汇总了 Argon 的开放范围、价格和多组评测结果,便于比较 Google DeepMind 与同级前沿模型。

正文 · AI 翻译

GDM 上一次发布大于 Flash 的模型是在 2 月(3.1 Pro),在连续推出多个渐进式 3.x Flash 版本以及上个月GDM 管理层大洗牌之后,GDM 面临的最大问题是:他们何时能赶上那些在此期间已推出 Fable 和 Astra 级模型的同行。

好了,Argon 来了,基准测试成绩非常可观(在 19 个可信基准中的 13 个达到 SOTA)……但目前只能通过有限的网络安全预览版访问,不过官方承诺会“尽快”开放访问:

我们喜欢实验性的 Long Decode Continuation,它将输出 token 提高到 1M,成为行业首例。

2026 年 9 月 29 日至 9 月 30 日的 AI 新闻。我们查看了 12 个 subreddit、544 条 Twitter,没有查看更多 Discord。AINews 的网站可搜索所有往期内容。提醒一下,AINews 现在是 Latent Space 的一个栏目。你可以选择加入/退出不同的邮件发送频率!


AI Twitter 回顾

Gemini 4 Argon:Google 重返前沿

  • 发布:Google DeepMind 推出了 Gemini 4 Argon,面向编码、企业知识工作和网络防御(@GoogleDeepMind,@sundarpichai)。

    • 可用性:访问权限首先开放给 Fairwind Program 中的政府用户和受信任的网络防御者。Google 表示,将在向开发者、企业和消费者开放访问前完善防护栏(@Google,@demishassabis)。

    • 输出限制:Google 称其输出上限为行业领先的 1M token,高于此前的 64K(@GoogleAI,@TheRundownAI)。

      • 测量说明:Vals 列出的最大输出为 262K。Artificial Analysis 通过 Long Decode Continuation 达到了 1M 输出 token;这是一个新的 API 功能,可暂停长响应,并在多次调用之间继续生成(@ValsAI,@ArtificialAnlys)。

    • 定价:标准定价为每 1M 输入/输出 token $4/$20。50% 的入门折扣将价格降至 $2/$10,尚未公布结束日期。缓存输入可享受 95% 折扣(@_philschmid,@ArtificialAnlys)。

  • Google 声称的结果:在与 GPT-6 Astra 和 Claude Opus 5.5 对比的 19 个已发布基准中,Argon 在 13 个基准上排名第一。在 DeepSWE 上,它得分 77.9%,而 Opus 5.5 为 74.2%,Astra 为 74.1%(@TheRundownAI)。

    • 内部部署:Google 报告称,Argon agent 释放了超过 300 TiB 的数据中心内存,并正在将超过 800K 行 C/C++ 内核代码迁移到 Rust(@kimmonismus)。

      • 视频解码器:Agent 用安全的 Rust 替换了 32K 行 SIMD 代码,使现有 Rust 移植版本在输出完全相同的情况下快了 2.7 倍。

    • 研究用途:该团队表示,基于 Argon 构建的内部 agent 循环帮助完成了 CK 猜想(@mirrokni)。

  • Artificial Analysis 评估:Argon 在 Intelligence Index 上得分 53,与 GPT-6 Astra(53)持平,并略高于 GPT-6.1 Sol(52)(@ArtificialAnlys)。

    • 每项任务成本:按折扣价计算,它每项任务成本为 $1.99,而 Astra 为 $3.26;标准定价会将这一成本提高到 $3.98。

      • Token 使用量:节省来自价格,而不是效率。Argon 每项任务平均输出 62K token,而 Astra 为 27K。

    • 代理式工作:它在 AutomationBench-AA 上以 77.5% 排名 #1,在 Terminal Bench 4 上得分 57%,落后于 Sonnet 5.5、Opus 5.5 和 Astra。

    • 幻觉:它在 AA-Omniscience 上的比率为 15%,相比之下 Astra 为 51%。权衡是准确率更低:50%,而 Astra 为 63%(@aipulseda1ly)。

  • Vals 评估:Argon 在 Vals Index 上以 68.9% 排名 #1,平均每项任务 $15.68(@ValsAI,@ValsAI)。

    • 编程:它完美构建了 30 个 Vibe Code Bench 应用,而 Opus 5 为 25 个,Astra 为 24 个(@ValsAI)。

    • 终端与安全:Terminal-Bench 4.0 从 19.0% 升至 57.6%。它在 CyberBench 概念验证任务上得分 70%,在 IOI 2024–2026 上得分 100%(@ValsAI)。

    • 效率:在 Vals Index 任务上,它使用的输出 token 约为 Sonnet 5.5 的四分之一(@ValsAI)。

  • Arena 及其他评测:Argon 在 Text Arena 中以 1525 排名 #1,在 Code Arena WebDev 中以 1679 排名 #8(@arena)。

    • Agent Arena:在初步的 3K 会话中,它总体排名 #8,并在可控性方面排名 #1(@arena)。

    • PostTrainBench:它得分 45.3%,高于 Gemini 3.1 Pro 的 21.99%(@karinanguyen)。

  • 质疑:一些观察者对公布的数据提出了质疑。

    • 法律基准:Argon 报告称在 Harvey 的法律基准上得分 19.6%,落后于 Muse Spark 1.2 列出的 25.42%(@BlackHC)。

    • 其他批评:评论者提出了可能存在偏好数据 benchmaxxing 的问题,并对包括 DeepSWE 在内的一些数字表示反对(@teortaxesTex,@teortaxesTex)。

GPT-6.1 Sol 与 OpenAI 的 DevDay Agent Stack

  • 独立评测:GPT-6.1 Sol 是 MathArena 上新的 #1(@j_dekoninck)。

    • Code Arena:它在 WebDev 上以 1759 排名 #3,在相同 $2/$10 定价下比 GPT-6 Sol 高 70 分(@arena)。

    • 每项任务成本:Artificial Analysis 测得在最大努力模式下每项任务 $0.72,而 Astra 为 $3.26,GPT-6 Sol 为 $1.04(@ArtificialAnlys)。

      • 节省来源:Sol 使用更少轮次,并且缓存读取价格更低(@ArtificialAnlys)。

    • Luna 漏洞修复:OpenAI 修复了一个图像编码漏洞,使 GPT-6 Luna 的 Intelligence Index 增加 1 分。

  • 超高速推理:OpenAI 表示最高可达 300 tok/s。SemiAnalysis 报告称它在 NVIDIA GPU 上以低批量大小运行,而不是在 Cerebras 上运行(@kimmonismus)。

    • 上手报告:生成速度约快 8 倍,但端到端代理任务仅快 2–4 倍,因为工具延迟占主导(@sayashk)。

      • 计算机使用:这里的提升最大,因为 UI 操作能在毫秒内响应。

      • 成本:测试者在约 2 小时内耗尽了每周限额。

  • 产品层:DevDay 推出了 dots(拥有自己云端计算机的持久化代理)、Decisions API 和计算机使用功能(@latentspacepod)。

    • Sites:ChatGPT Sites 现在可以托管 MCP 服务器,并将其转为可安装插件(@mxstbr)。

    • 使用限制:用户报告称获得了价值约 $2,500 的一次性额度。其他人则抱怨使用限制被削减了(@kimmonismus,@kimmonismus)。

其他发布:嵌入、图像/视频和开放模型

  • Perplexity 上下文嵌入:pplx-embed-v2-context-9b-preview 已在 Hugging Face 上开放(@perplexity_ai)。

    • 方法:该模型先对整篇文档编码一次,然后对分块向量进行池化。训练时从一个上下文压缩模型中蒸馏相关性,而不是使用单一的黄金分块标签(@denisyarats)。

    • 结果:它在 ConTEB 上创下新的最先进水平。在 turbopuffer 的私有 context-bench 上,它在 answer recall@10 上比 voyage-context-4 高出 14.4 分,同时使用 1 KB int8 向量,而后者为 8 KB(@turbopuffer)。

  • Cohere Embed 5:该系列包含 Pro 和 Fast 两个变体,并处于共享的嵌入空间中,因此你可以用一个进行索引,用另一个进行检索(@cohere)。

    • Fast 档位:Cohere 表示,它比其他 fast-tier 模型至少高出 6 分,成本比 Pro 低三分之一。评估使用其新的 RCP-nDCG@10 指标(@cohere)。

  • Ideogram 4.5:该编辑模型面向无伪影的多轮编辑,并承诺开放权重(@ideogram_ai)。

    • 编辑保真度:在连续十次编辑中,94–99% 未触及的内容保持相同(@fal)。

    • 排名:它在 Image Edit Arena 中以 1351 分排名第 18(@arena)。

  • 视频基准:Artificial Analysis 推出了 AA-Video-T2V v2.0,以 1080p 进行评判,并有超过 68K 个人类投票(@ArtificialAnlys)。

    • 领先者:Wan 3.0 以 $12/min 排名第 1。Seedance 2.5 以 $34.12/min 排名第 2,MiniMax H3 以 $4.80/min 在统计上与其持平。

    • Utopai X:这个基于 MiniMax H3 的后训练版本首次亮相即排名第 2(@ArtificialAnlys)。

  • 开放和小型模型:

    • Ling-3.1-flash:一个 500B 模型,据称接近 GPT-5.6 Sol 和 Opus 5(@kimmonismus)。它在 Mobile App Arena 的开放权重模型中排名第 2(@DesignArena)。

    • Praxis-1:Runway 发布了一个开放权重的世界-动作模型,并表示机器人策略性能会随着第三人称视频规模可预测地提升(@agermanidis)。

    • Solar Mini 4:Upstage 报告称其总参数为 35B / 激活参数为 3B。它在 Intelligence Index 上得分 24,价格为 $0.10/$0.40(@ArtificialAnlys)。

      • 缓存惩罚:每个任务的成本仍约为 Luna 的 5 倍,因为其重复上下文只有 48% 命中缓存,而 Luna 为 99%(@ArtificialAnlys)。

Agent 研究、推理和系统

  • 上下文语言模型(Meta):CLM 将上下文视为可编辑文件,而不是只能追加的日志,其上下文管理策略在权重中学习,无需外部框架(@RulinShao)。

    • 结果:在一项 24 小时多代码库智能体群任务中,它们在相同算力下得分高出 65%(@arankomatsuzaki,@natolambert)。

  • 自适应推理计算:

    • TaH2:前瞻深度监督会教模型哪些困难 token 值得再进行一轮循环(@ZhihuFrontier)。

      • 增益:其报告称,在匹配的测试时计算量下准确率提升 +3.4 个百分点,缩放斜率陡峭 53%。

      • 服务:MiniSGL 集成会将不同循环深度的请求一起批处理。

    • AutoBenchmark (Meta):该项目会自动创建基准。在构思阶段引入人类反馈,效果优于代理独自工作,而且难度会迁移到留出的求解器上(@jaseweston)。

    • Stratego:一篇 Nature 论文介绍了首个超人类水平的 Stratego AI,它基于 RL 和不完美信息下的测试时计算构建(@ssokota)。

  • Prefill/decode disaggregation:一项稳态分析认为,在相同批量大小和吞吐量下,解耦可将平均交互性提高约 1/(decode-time fraction)(@ekzhang1,@cHHillee)。

    • 影响:它有助于 prefill 占比较高的工作负载,而不是受 decode 限制的低延迟服务。

  • 编译器和硬件:

    • 华为上的 DeepSeek:DeepSeek 发布了一个开源 Ascend 工具包,包含针对 Ascend 950 优化的 TileLang(@kimmonismus)。

    • AI 作为编译器:一个模型可将 Triton 直接转换为 PTX,并由验证器检查正确性、竞争和死锁。在 B200 上,FlashAttention 的加速比达到 1.37x(@Azaliamirh)。

    • Vera Rubin:Cognition 是通过 CoreWeave 使用 Vera Rubin 的首个客户,据称在相同 decode 速度下,其 token 吞吐量约为 GB200 的 4.8x(@cognition)。

    • DFlash draft 模型:用于 Ornith-1.5 的新 draft 模型可带来最高 2.54x 的无损加速(@ornith_)。

  • 代理沙箱:Cloudflare 为代理重建了 Containers,p50 达到可交互状态的时间为 648 ms(快 6x),快照功能处于 beta 阶段(@mgamache)。

    • AutoRouter:Cloudflare 的模型路由器在内部测试中显示支出降低约 30%(@ashleypeacock)。

安全、安全性与评估完整性

  • 推理提取:OpenAI 将一起隐藏推理提取活动的核心部分归因于与 Moonshot AI 有关联的个人(@kimmonismus)。

    • 规模:OpenAI 在两天内记录到来自 4,000 多名用户的 16,000 次尝试,相关活动涉及 15,000 多名用户。

    • 外部研究人员:直到本周,他们的攻击在 Astra 上仍然有效。补丁很难在各产品版本和第三方托管方之间传播(@JSchaeff3r,@jonasgeiping)。

    • 批评:Nathan Lambert 认为该漏洞是 API 提供商的责任(@natolambert)。

  • 蒸馏防御:未纳入后续 RL 的防御评估会带来虚假的安全感。RL 会让简单攻击变得有效(@shidan_javaheri)。

  • 嵌入式评估:Apollo Research 发布了原则,面向获得类似员工权限访问前沿实验室的外部评估者(@ApolloResearch)。

  • 网络安全评测:在 CyberGym-E2E-AA 上,一些前沿模型在超过 85% 的任务中被安全机制拦截(@ArtificialAnlys)。

    • 成本:GPT-6 Luna 或 MiMo-V2.6-Pro 可在一个 1M 行代码库中执行约 100 次漏洞搜寻,成本约为 $20。

  • 来源与透明度:

    • SynthID Bio:用于 AI 生成蛋白质的水印技术发表在 Nature 上,并开源了工具(@demishassabis)。

    • AI 检测器规避:Opus 5.5 和 Astra 可以重写文档超过 50% 的内容,而不会被 Pangram 标记(@ValsAI)。

    • 智能体报告:一篇新的预印本询问,关于智能体工作的 LLM 撰写报告实际上有多透明(@jennyihuang)。

行业与政策

  • Factory vs Cognition:Factory 解除了顾问 Chris Degnan 的职务,称他在参加其董事会会议时向 Cognition 透露信息(@matanSF)。

    • 聘任:Cognition 当天宣布 Degnan 出任其 CRO(@cognition)。

    • 否认:Cognition 的 CEO 表示没有分享任何 Factory 信息,并称 Degnan 已于周一辞去顾问职务(@ScottWu46)。

  • 政治支出:Greg Brockman 取消了向 Leading the Future 超级 PAC 承诺的第二笔 $25M 捐款(@teddyschleifer)。

    • 后续问题:Alex Bores 问道,这是否也涵盖不披露捐赠者的反监管团体(@AlexBores)。

  • OpenAI 财务:NYT 报道称,OpenAI 的年化收入接近 $70B,并正洽谈以 $1.4T 估值融资 $30B,其 IPO 已推迟到明年(@srimuppidi)。

  • 融资:为硬件工程构建 AI 工具的 Flow,以 $750M 估值完成 $50M B 轮融资(@parisingh)。

热门推文(按互动量)


AI Reddit 回顾

/r/LocalLlama + /r/localLLM 回顾

1. GLM-5.3 网络风险与本地推理支持

  • GLM-5.3 与高级网络能力的扩散 \ Anthropic(活跃度:785):Anthropic 报告称,Zhipu/Z.ai 的开放权重 GLM-5.3 在自主网络能力方面跨过了一个显著门槛:50/410 在 ExploitBench 上实现端到端 V8 漏洞利用,接近 Claude Mythos Preview 的 56/410,并且在 Anthropic 内部二进制漏洞利用任务中的 4% 项上实现完整控制流劫持,而此前模型几乎为零。Anthropic 将风险描述为 能力 + 可获取性:GLM-5.3 可被广泛下载、成本相对低廉,且拒答调优较弱;据称简单越狱的成功率为 64–100%,而“abliteration”会在几乎没有测得能力退化的情况下将拒答率降至低个位数。 热门评论大多反感 Anthropic 的表述,认为这篇文章读起来像是在试图压制一个更便宜/开放、接近 Anthropic 前沿水平的中国模型。一位评论者强调了正当的防御性用途,称 GLM-5.3 是他们用于安全测试和改进自有软件的唯一实用工具。

    • 评论者强调 GLM-5.3 是一种低成本、限制较少的模型,被认为接近前沿能力;其中一位用户将其描述为可用于“对我自己的软件进行安全测试和改进”,而不是本质上具有恶意。提出的技术担忧是,Anthropic 等提供商施加的限制,可能会限制防御性网络安全工作流,而这些工作流需要模型愿意分析潜在敏感的漏洞利用或漏洞模式。

    • 一位评论者提到,此前的 GLM-5.2 模型曾帮助缓解一次 Hugging Face 攻击,并将其与据称拒绝提供协助的 Claude 进行对比。其实质观点是,拒绝策略可能会降低模型在事件响应或漏洞修复场景中的实用性,而更宽松的模型在防御性安全任务中可能具有操作价值。

  • timkhronos 添加 GLM-5.3-Flash (GLM5-Next) 支持 · Pull Request #27773 · ggml-org/llama.cpp(活跃度:348):已合并 ggml-org/llama.cpp#27773 为 llama.cpp 添加了 GLM-5.3-Flash / GLM5-Next 支持,使 320B 混合文本+视觉模型能够进行本地推理。该实现添加了 GLM 特定的 DSA 索引/池化、混合索引内存,以及新的 glm5v 视觉预处理/塔路径,同时复用 Kimi-K3 KDA 层、DeepSeek 风格的 MoE/mHC 辅助组件、仅 MLA 注意力,以及 DSV4 风格的 SwigLU 钳制;验证报告显示,随机模型 logits 在 prefill/ubatching/decode 阶段与 Transformers 匹配,视觉嵌入一致性约为 1e-5,同时一些对精度敏感的张量未被量化。 评论者担心,llama.cpp 模型支持正在落后于新实验性架构的发布节奏,其中一人指出,实际瓶颈似乎是维护者可用性。还提出了一个技术兼容性问题:据称现有 Unsloth 量化使用 glm5next,而主线期望 glm5-next,因此当前主线可能无法加载这些量化模型。

    • 评论者指出,Unsloth 量化 PR 与主线 llama.cpp PR 之间存在兼容性问题:一个将架构/模型类型标识为 glm5next,而另一个使用 glm5-next,这意味着主线 llama.cpp 可能无法在不进行转换或修复元数据的情况下加载现有的 Unsloth GLM-5.3-Flash 量化模型。

    • 有人担心,llama.cpp 支持正在落后于新模型发布的节奏,尤其是越来越多的新模型使用实验性架构,需要专门的加载器/运行时变更,才能开展推理和优化工作。一位评论者将 GLM-5.3-Flash 支持描述为在模型发布后大约还需要“再一个月”,而进展在很大程度上取决于少数维护者。

阅读更多

来源:Latent Space · latent.space