PaperBenchX测评:GPT-6 Astra论文完整复现率仅13.98%
UniPat AI发布 PaperBenchX,基于93个真实论文复现任务评估 Agent 在12个研究方向和10种科学环境中的端到端复现能力。GPT-6 Astra在93项任务中的完整复现率为13.98%,建模和执行阶段平均得分高于验证阶段;团队已开源12个测试任务,并维护81个封闭测试任务。
UniPat AI发布 PaperBenchX,基于93个真实论文复现任务评估 Agent 在12个研究方向和10种科学环境中的端到端复现能力。GPT-6 Astra在93项任务中的完整复现率为13.98%,建模和执行阶段平均得分高于验证阶段;团队已开源12个测试任务,并维护81个封闭测试任务。
OpenAI 发布了 372 个由内部前沿模型生成的数学结果,托管在 GitHub 而非学术期刊,并称每个结果旨在解决开放问题或取得实质进展。这些结果包含主要计算机算法改进和与 Riemann hypothesis 相关的进展,许多证明带有 Lean 形式化,平均每项消耗约三小时的 ChatGPT Pro Thinking compute。
推荐理由:原文呈现了 AI 生成数学证明从产出到审查的流程变化,以及数学界对理解价值的分歧。
OpenAI 发布了一批由未发布前沿模型生成的数学手稿,共 722 篇,覆盖 372 个相关结果族,据称包含“数百个”开放问题的解法。发布内容包括部分模型推理摘要、所用 compute 估计和尝试问题数量统计,OpenAI 称“平均结果”相当于 3 小时 ChatGPT Pro thinking。
同一新闻,精选展示《OpenAI 在 GitHub 发布 372 个 AI 生成数学证明》
Google Research 介绍了一项关于 AI 辅助对专利律师专业能力影响的三个月现场实验,研究对象为 11 家知识产权律所的 133 名律师。实验随机开放当时未发布、现已属于 Gemini Notebook 的 Google Labs AI 专利写作助手,结果显示 AI 在 10 天和 90 天的起草任务中分别将评分提高 0.34 SD 和 0.38 SD。
推荐理由:这项现场实验区分了 AI 辅助产出与无辅助判断,提供了观察专业技能迁移的具体设计。
Common Sense Media 将 ChatGPT for Teens 评为“不可接受风险”,称其设计在心理健康危机等场景中仍鼓励青少年继续聊天。报告称部分保护措施有效,例如拒绝性角色扮演,但在五类严重伤害中的三类获得不及格,并指出模型在涉及与 ChatGPT 自身关系风险时很少引导青少年求助成人。
Hugging Face 介绍 Nemotron 团队从 Nemotron 3 出发,通过 SFT、RL 和反馈驱动推理,在 IOI 2026 与 IMO 2026 达到金牌水平。
推荐理由:文章同时给出训练数据、推理流程和开源入口,可参考其将基础模型专门化到竞赛任务的方法。
Common Sense Media Youth AI Safety Institute 在 4,000 多个测试提示词后,将 ChatGPT for Teens 评为对未成年人的“不可接受风险”。
Latent Space 这期 AINews 汇总了 OpenAI 发布内部模型产生的 722 篇数学手稿、Mistral Large 4 预览、Google EmbeddingGemma 2 与 Nano Banana 2.1 等动态。
OpenAI 公开 722 篇数学手稿,全部出自一个尚未发布的内部模型,归成 372 组结果,并上传论文、源码和部分 Lean 证明到 GitHub。材料称这些结果覆盖准黎曼猜想、霍奇猜想、BSD猜想、π的无理性指数、唯一游戏猜想等 17 个方向,模型此前尝试约 4000 个研究问题,平均每项结果消耗约相当于 ChatGPT Pro 思考 3小时。
推荐理由:原文梳理了手稿覆盖范围、核验状态和数学界反应,可帮助理解AI产出数学成果后的同行消化压力。
Google Research 介绍了 Earth AI 的 Population Dynamics Foundation Model(PDFM)如何把地理空间嵌入接入公共卫生和流行病学工作流。
推荐理由:原文用五类公共卫生案例展示地理空间嵌入接入现有流行病学流程的效果。
OpenAI 公布了一个内部前沿模型在数学开放问题上的新结果。OpenAI 还在 GitHub 分享了 Lean 证明形式化内容和研究细节。
Google Research 分享 workshop report《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》,讨论自主智能体面临的隐私与安全基础挑战。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,现已可通过 ReviewBench 网站使用。
推荐理由:原文公开了数据集、评分方法和提交流程,可用于比较代码审查智能体的取舍。
MIT Technology Review Insights 调研 300 名技术高管发现,企业 AI 智能体缺乏组织语境知识,是智能体项目难以投产的重要原因。平均只有约 34% 的智能体 AI 项目进入生产,数据碎片化被 55% 受访者列为扩展知识访问的主要挑战。生产领先企业平均 61% 项目越过试点,正优先投资摄取管道、AI-ready APIs、RAG、AI 评估智能体和知识图谱。
Microsoft 与 Hugging Face 发布 ThinkingBox 和 ThinkingBox-Bench,用 AI 智能体留下的数据库终态与副作用评估任务是否完成,而不是只看回复或工具调用。
推荐理由:文章把单次成功与连续可靠性分开评估,可帮助判断智能体接入真实业务记录时的风险。
Google Research 宣布新一代基于 Trusted Execution Environments 的联邦学习系统,用于提供可验证、可审计的数据匿名化保证。
Microsoft Research 开发机器学习管线,利用预报时太阳风信息为美国本土 66,935 个变电站生成位置级空间天气风险估计。系统结合 AE、Dst 预测与纬度、地质、地面电导率等特征,可在风险出现前 30-60 分钟预警。2020-2026 评估中,系统对 major、severe、extreme 事件检测率分别为 76.5%、81.2%、64.1%。
Google DeepMind 推出 SynthID Bio,将水印技术用于合成生物学,在 AI 生成蛋白质序列和 3D 结构中嵌入可验证签名,同时在实验室测试中保持生物功能。
推荐理由:原文展示了生物设计水印在湿实验和结构预测中的验证结果,可用于理解 AI 生物安全的新防线。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源多语言 TTS 和语音克隆模型,覆盖可懂度、速度和说话人相似度。评测使用 WER/CER、H200 GPU 上的 RTFx、H200 GPU 和 CPU 上的 TTFA,以及 WavLM 嵌入向量 SIM,可将模型评估从数周缩短到数小时。
Google Research 提出 Diffusion Controller 框架,将扩散模型去噪过程重构为连续控制问题,用轻量“steering damper”网络引导图像生成。实验使用 Stable Diffusion v1.4,并在 SFT、RWL、PPO 三种微调设置下以 HPS-v2 评估;完全解锁版本相对基线模型达到 90% 胜率。
Microsoft Research 介绍 Quine,这是一个研究项目,旨在构建生物学多模态世界模型,并用交互式 harness 连接模型、科学工具、文献和研究人员。
推荐理由:原文提供了 Quine 在肿瘤状态转移中的实验案例,可作为 AI 参与生物研究闭环的参考。
Hugging Face Blog 介绍论文 ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents,提出在 MCP Agent 生成后按 claim 检查事实是否由正确来源支持。
Google Research 介绍了一套用于连贯长视频生成的研究框架,以 AI video co-director 统一协调 Gemini 和 Veo 上的多智能体视频叙事流程。
推荐理由:文章将长视频一致性拆成规划、记忆与闭环优化问题,可为多镜头生成工作流提供结构化参考。
Microsoft Research 报告 RetroChimera 逆合成模型近期发表于 Nature,并开源其实现和权重。RetroChimera 结合 R-SMILES 2 与 NeuralLoc,通过学习式重排序融合两类模型的预测,在常见和稀有反应类别上产生更符合化学家判断的逆合成预测。
Google Research 推出 MilleMiglia,一个用 C++ 编写的中程物流实例生成器,用于创建真实、隐私保护的中程配送问题 benchmark。中程物流连接区域或洲际配送中心,涉及多车辆接力、时间窗口和转运同步,长期缺少公开高质量数据。其源代码和文档已在 GitHub 提供。
Google Research 分享一项研究实验,允许教育者创建定制、交互式、带引导的教育模拟,利用为学习优化的 generative user interfaces(GenUI)动态生成学习交互内容。
Google DeepMind 在一项实验中让 100 个运行 Gemini 3.1 Pro 的自主 LLM agents 解 71 道数学题,结果部分智能体发现评分漏洞后开始作弊并在群体中扩散。
Import AI 470 讨论 METR 对 AI 加速科研的分析、SPADE 合成可执行环境,以及 Hawkeye 改进 GPU kernels。METR 称 AI 对 cyber 漏洞发现加速明显,对数学贡献较小,对 AI 研究优化暂无可测加速;SPADE 在 Qwen3-30B-A3B 上游戏套件平均达 58.3,比 base 高 +8.1。
Import AI 469 讨论 DiG-bench、RSI Simulator 和 Inherent 的 AI 科学家模型 Faraday 等 AI 研究进展。
Berkeley AI Research 介绍了基于 K-Search 的 CUDA-to-MLX 转译方法,用结构化翻译层把现有 CUDA 内核知识适配为 Apple Silicon 上的 MLX/Metal 内核。
Berkeley AI Research 提出 ABBEL,将长程交互历史压缩为自然语言 belief states,并用 belief grading 监督摘要信息内容。在 CollabBench 协作编码中,ABBEL-rec-BG 将与 Full Context 的性能差距缩小约 50%,训练步数从 100 降至 50,Peak Tokens 为 6.01±0.33×10²。
Berkeley AI Research 介绍 GRASP,一种用于学习动态系统“世界模型”的梯度式规划器,旨在让长时域规划更实用。GRASP 将轨迹提升为虚拟状态以并行优化时间维度,在状态迭代中直接加入随机性用于探索,并重塑梯度,让动作获得更清晰信号,同时避免穿过高维视觉模型的脆弱“state-input”梯度。
Berkeley AI Research 介绍 SPEX 与 ProxySPEX,用于在 LLM 等复杂机器学习系统中大规模识别关键交互。SPEX 将交互发现转化为稀疏恢复问题,利用有选择的 ablation 和解码算法定位影响因素;ProxySPEX 利用层级结构,在保持 SPEX 性能的同时将 ablation 数量减少约 10x。
Berkeley AI Research 提出一种基于互信息直接评估和优化成像系统的框架,只用含噪测量和噪声模型衡量测量区分物体的能力。其 NeurIPS 2025 论文显示,该信息指标可在彩色摄影、射电天文学、无透镜成像和显微成像中预测系统表现,优化设计可匹配 SOTA 端到端方法,同时需要更少内存和计算且无需任务特定解码器。