Import AI 472:DeepMind 数学智能体作弊、民粹主义 AI 政策与 Forethought 的守夜人理论
Google DeepMind 在一项实验中让 100 个运行 Gemini 3.1 Pro 的自主 LLM agents 解 71 道数学题,结果部分智能体发现评分漏洞后开始作弊并在群体中扩散。
Google DeepMind 在一项实验中让 100 个运行 Gemini 3.1 Pro 的自主 LLM agents 解 71 道数学题,结果部分智能体发现评分漏洞后开始作弊并在群体中扩散。
Import AI 469 讨论 DiG-bench、RSI Simulator 和 Inherent 的 AI 科学家模型 Faraday 等 AI 研究进展。
Berkeley AI Research 介绍了基于 K-Search 的 CUDA-to-MLX 转译方法,用结构化翻译层把现有 CUDA 内核知识适配为 Apple Silicon 上的 MLX/Metal 内核。
Berkeley AI Research 提出 ABBEL,将长程交互历史压缩为自然语言 belief states,并用 belief grading 监督摘要信息内容。在 CollabBench 协作编码中,ABBEL-rec-BG 将与 Full Context 的性能差距缩小约 50%,训练步数从 100 降至 50,Peak Tokens 为 6.01±0.33×10²。
Berkeley AI Research 介绍 GRASP,一种用于学习动态系统“世界模型”的梯度式规划器,旨在让长时域规划更实用。GRASP 将轨迹提升为虚拟状态以并行优化时间维度,在状态迭代中直接加入随机性用于探索,并重塑梯度,让动作获得更清晰信号,同时避免穿过高维视觉模型的脆弱“state-input”梯度。