PaperBenchX测评:GPT-6 Astra论文完整复现率仅13.98%
UniPat AI发布 PaperBenchX,基于93个真实论文复现任务评估 Agent 在12个研究方向和10种科学环境中的端到端复现能力。GPT-6 Astra在93项任务中的完整复现率为13.98%,建模和执行阶段平均得分高于验证阶段;团队已开源12个测试任务,并维护81个封闭测试任务。
UniPat AI发布 PaperBenchX,基于93个真实论文复现任务评估 Agent 在12个研究方向和10种科学环境中的端到端复现能力。GPT-6 Astra在93项任务中的完整复现率为13.98%,建模和执行阶段平均得分高于验证阶段;团队已开源12个测试任务,并维护81个封闭测试任务。
Google Research 分享 workshop report《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》,讨论自主智能体面临的隐私与安全基础挑战。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,现已可通过 ReviewBench 网站使用。
推荐理由:原文公开了数据集、评分方法和提交流程,可用于比较代码审查智能体的取舍。
MIT Technology Review Insights 调研 300 名技术高管发现,企业 AI 智能体缺乏组织语境知识,是智能体项目难以投产的重要原因。平均只有约 34% 的智能体 AI 项目进入生产,数据碎片化被 55% 受访者列为扩展知识访问的主要挑战。生产领先企业平均 61% 项目越过试点,正优先投资摄取管道、AI-ready APIs、RAG、AI 评估智能体和知识图谱。
Microsoft 与 Hugging Face 发布 ThinkingBox 和 ThinkingBox-Bench,用 AI 智能体留下的数据库终态与副作用评估任务是否完成,而不是只看回复或工具调用。
推荐理由:文章把单次成功与连续可靠性分开评估,可帮助判断智能体接入真实业务记录时的风险。
Microsoft Research 开发机器学习管线,利用预报时太阳风信息为美国本土 66,935 个变电站生成位置级空间天气风险估计。系统结合 AE、Dst 预测与纬度、地质、地面电导率等特征,可在风险出现前 30-60 分钟预警。2020-2026 评估中,系统对 major、severe、extreme 事件检测率分别为 76.5%、81.2%、64.1%。
Hugging Face Blog 介绍论文 ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents,提出在 MCP Agent 生成后按 claim 检查事实是否由正确来源支持。
Google Research 介绍了一套用于连贯长视频生成的研究框架,以 AI video co-director 统一协调 Gemini 和 Veo 上的多智能体视频叙事流程。
推荐理由:文章将长视频一致性拆成规划、记忆与闭环优化问题,可为多镜头生成工作流提供结构化参考。
Google Research 分享一项研究实验,允许教育者创建定制、交互式、带引导的教育模拟,利用为学习优化的 generative user interfaces(GenUI)动态生成学习交互内容。
Google DeepMind 在一项实验中让 100 个运行 Gemini 3.1 Pro 的自主 LLM agents 解 71 道数学题,结果部分智能体发现评分漏洞后开始作弊并在群体中扩散。
Import AI 470 讨论 METR 对 AI 加速科研的分析、SPADE 合成可执行环境,以及 Hawkeye 改进 GPU kernels。METR 称 AI 对 cyber 漏洞发现加速明显,对数学贡献较小,对 AI 研究优化暂无可测加速;SPADE 在 Qwen3-30B-A3B 上游戏套件平均达 58.3,比 base 高 +8.1。
Import AI 469 讨论 DiG-bench、RSI Simulator 和 Inherent 的 AI 科学家模型 Faraday 等 AI 研究进展。
Berkeley AI Research 提出 ABBEL,将长程交互历史压缩为自然语言 belief states,并用 belief grading 监督摘要信息内容。在 CollabBench 协作编码中,ABBEL-rec-BG 将与 Full Context 的性能差距缩小约 50%,训练步数从 100 降至 50,Peak Tokens 为 6.01±0.33×10²。