PaperBenchX测评:GPT-6 Astra论文完整复现率仅13.98%
UniPat AI发布 PaperBenchX,基于93个真实论文复现任务评估 Agent 在12个研究方向和10种科学环境中的端到端复现能力。GPT-6 Astra在93项任务中的完整复现率为13.98%,建模和执行阶段平均得分高于验证阶段;团队已开源12个测试任务,并维护81个封闭测试任务。
UniPat AI发布 PaperBenchX,基于93个真实论文复现任务评估 Agent 在12个研究方向和10种科学环境中的端到端复现能力。GPT-6 Astra在93项任务中的完整复现率为13.98%,建模和执行阶段平均得分高于验证阶段;团队已开源12个测试任务,并维护81个封闭测试任务。
OpenAI 公开 722 篇数学手稿,全部出自一个尚未发布的内部模型,归成 372 组结果,并上传论文、源码和部分 Lean 证明到 GitHub。材料称这些结果覆盖准黎曼猜想、霍奇猜想、BSD猜想、π的无理性指数、唯一游戏猜想等 17 个方向,模型此前尝试约 4000 个研究问题,平均每项结果消耗约相当于 ChatGPT Pro 思考 3小时。
推荐理由:原文梳理了手稿覆盖范围、核验状态和数学界反应,可帮助理解AI产出数学成果后的同行消化压力。
Google Research 推出 MilleMiglia,一个用 C++ 编写的中程物流实例生成器,用于创建真实、隐私保护的中程配送问题 benchmark。中程物流连接区域或洲际配送中心,涉及多车辆接力、时间窗口和转运同步,长期缺少公开高质量数据。其源代码和文档已在 GitHub 提供。