跳到正文
量子位· 允中·· 2 小时前AI 评分71

PaperBenchX测评:GPT-6 Astra论文完整复现率仅13.98%

ChatGPT踢到铁板了!能破解千禧数学难题,但论文复现率低至13.98%?

AI 导读

UniPat AI发布 PaperBenchX,基于93个真实论文复现任务评估 Agent 在12个研究方向和10种科学环境中的端到端复现能力。GPT-6 Astra在93项任务中的完整复现率为13.98%,建模和执行阶段平均得分高于验证阶段;团队已开源12个测试任务,并维护81个封闭测试任务。

正文

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

2026-10-08 17:28:44 来源:量子位

PaperBenchX为代表的基准或许能更好地衡量AI的科研实力

允中 发自 凹非寺
量子位 | 公众号QbitAI

OpenAI最近真是频频往数学界扔重磅炸弹。

上个月,OpenAI宣布其AI模型仅用88小时,便攻克了困扰人类百年的千禧年七大顶级数学难题之一——N-S方程;昨天,又放出722篇数学手稿,千禧难题又有仨。

但在UniPat AI发布的PaperBenchX测评中,面对93个真实论文复现任务,表现最强的GPT-6 Astra,完整复现率却只有13.98%。

△10组受测配置在93个复现任务上总体与分阶段表现

随橙想!当前模型已经能取得破解千禧年数学难题这样的伟大突破,但很少能完成一次可靠的端到端科学复现。

(正经脸)这引发了一些思考:在广泛的AI for Science领域中,我们要以什么标准判断「做对了科学」?本着严谨踏实的科研态度,迈向AI数学家乃至General AI Scientist的第一步到底是什么?我们又该如何形成一套可验证、可比较的标准,真正衡量AI在科学研究上的进步?

该用什么尺子衡量AI在科学里的进步?

此时此刻,让我们再细品陶哲轩、邓煜等25位菲尔兹奖得主联名发布的公开信。

他们肯定了大语言模型的数学能力急剧提升,已经能解决数学领域的重大难题,但也提出了更关键的问题:AI公司把解决数学问题当作基准测试,这对数学这门科学、对数学共同体都是有害的。

所以,这不是一封反对AI的信,它问的是一个更朴素的问题:衡量AI在科学里的进步,到底该用什么尺子?

信里还有一句分量更重的话:把解决数学问题当作基准测试的错位问题,只是更广泛的错位问题的一部分,这种错位同样影响着其他科学与创意职业,乃至整个社会。

的确,上面提出的问题从数学领域扩展到自然科学乃至社会领域,只会更难回答。

数学至少还有最后一道防线:Lean。证明对不对,机器可以逐步检查,答案的真假有兜底。

可放到其他科学领域里,一个电磁仿真的反射系数、一条能带、一个收敛后的带隙,都没有Lean。一个和论文对得上的数字,背后可能是错误的物理模型、没收敛的仿真,或者碰巧凑出合理值的无效后处理。

所以,在衡量AI自主提出问题、设计实验、做出新发现的General AI Scientist能力之前,有一个更基础的问题:它能不能可靠地把一项已经发表的科学工作重做一遍,并证明自己做对了?

这个问题的逻辑在于,由于复现有唯一正确的答案,因此可以被准确评估。

UniPat AI最近发布的一项工作「PaperBenchX」,瞄准的正是这件事——它从93篇研究论文中构建了93个复现任务,这些任务横跨电磁、光子、化学、材料、生物、机器人等12个研究方向和10种领域原生科学环境,含3168条专家校验的评分项,是国际上第一个多学科端到端论文结果复现的Benchmark。

△PaperBenchX的任务分布、来源论文与评分项构成

PaperBenchX的考试规则很简单:

Agent拿到一篇真实论文、一个装好了对应科学软件的容器化环境、以及一份说明「要复现哪部分」的任务书;

Agent交回一份可执行的复现工作流;

评分标准、容差、参考答案全部对Agent隐藏。

需要特别注意的一点是,论文本身是公开的,Agent当然能看到论文里的结果数字,但很明显的是,这场考试考的不是「猜答案」,而是考验AI能不能重建一条科学上成立的流程,并自己跑出支撑那个结论的证据。

所以,PaperBenchX测的到底是什么?

答案是:不测「得到了多少数字」,只认重新生成的证据。Agent交卷后,系统删掉全部输出、断开网络,在隔离环境里把工作流从头重跑一遍,评分器只相信重放产物。可以说,在某种意义上,就是为科学仿真搭的一道「Lean」。

测得结果怎么样?

结果是:在93个论文复现任务里,表现最强的GPT-6 Astra,完整复现率只有13.98%。

这意味着,模型能够在不少任务中产出看起来合理的结果,但真正从头跑通完整工作流、生成与论文一致且可验证的证据,成功率还不到七分之一。

这就是今天的AI与能够跨越不同领域科学边界的General AI Scientist之间的距离。

PaperBenchX的意义在于第一次把这段距离量了出来。

目前,UniPat AI团队从每个研究方向中选取1个代表性任务,共开源12个测试任务。这些任务覆盖不同研究方向和科学软件栈,可用于评测Agent、调试复现工作流,以及研究模型在真实科学环境中的端到端复现能力。

并同时维护81个封闭测试任务,以维持PaperBenchX的区分度和长期评测有效性。

13.98%背后,可靠复现卡在哪?

接下来,我们具体看一下PaperBenchX在同一组93个任务上所评测的10组前沿模型与Agent框架配置,分析测评出来的结果,弄明白可靠复现到底卡在哪。

△(a)为受测配置的阶段得分;(b)为交互轮数与得分关系;(c)为抽样轨迹的工作流时间分配

局部完成不等于完整复现

先来看图a,受测配置的阶段得分。可以看出在全部受测配置中,建模(Modeling)和执行(Execution)平均得分分别为62.70%和61.84%,验证(Validation)只有42.80%。

这意味着, Agent能够完成部分建模、调用求解器并生成结果文件,但这些结果不一定正确,也不一定能够证明结果真正支持论文结论。综合来说,它们还很难把各个环节串联起来,完成一次完整、可信的复现。

更多交互不意味着更好的复现结果

再来看图b,交互轮数与得分关系。轨迹分析显示,长时间运行往往意味着反复尝试、故障恢复,或者在错误的模型设定上继续计算。这说明,交互轮数越多,分数不一定越高。

前期决策决定后续执行是否有价值

再来看图c,抽样轨迹的工作流时间分配。以Fable 5为例,它将37.1%的时间用于论文重建和代码实现,是五个模型中前期投入比例最高的,但它反而能够用较少的交互取得接近最优的部分得分。

也就是说,论文理解、科学建模、参数选择和实验组织等前期决策是否合理,很大程度上决定了后续计算是否会变成资源浪费。

因为如果几何结构、边界条件、模式定义或关键参数在前期已经设置错误,那么求解器即使正常运行,也只是在计算错误的科学系统。前期一个错误决定,可能使后续数小时的计算全部失去价值。

综上所述,单看貌似跑通的结果或得出的最终输出,是无法区分不同失败原因的。有些Agent的实验成功运行,但科学模型或结果分析错误;另一些Agent则是因为缺少可信求解过程或代码有误无法完成重跑。

UniPat AI团队也进一步指出了要达成「可靠复现」的几个关键之处:

难点不在于「能不能跑通」,而在「跑通的东西是否在科学上成立」 :一个看似对上了的数字,可能来自错误的模型、不合适的参数、没收敛的仿真或无效的后处理;

对结果的评测必须建立在重新生成的证据上,而不是Agent的自述上:删掉输出、断网、重跑、只认重放产物;

目前部分进展是真实的,完整复现仍然稀少:Agent已经能写出合理的仿真并将其运行完成,但要让整个过程和最终结果都经得起验证,仍然很难。

PaperBenchX的差异化设计

把「整篇论文复现」确立为一种Agent评测范式,并不是UniPat AI首创,OpenAI的PaperBench也是类似的工作。

但过往的任务集中在机器学习论文领域,真正进入物理、化学、材料等科学研究场景后,复现一篇论文就不再是「把代码跑一遍」这么简单,会面临三个挑战:

理解科学问题:论文不是一份可以照着执行的说明书。面对真实的科学问题,Agent需要自己理解研究目标,判断边界条件怎么设、色散怎么处理、哪些参数会真正影响结论,而不是简单按照README把代码运行一遍;

正确完成科学仿真:把代码成功跑起来,只是第一步。分辨率、求解器容差、采样时长等参数只要设置不当,就可能导致完全错误的数值结果。Agent还需要读懂诊断信息,识别数值发散等异常,并判断什么时候需要调整参数、加密网格。这些都不是通用的代码执行能力,而是高度依赖具体学科知识的判断;

判断结果是否真的可信:这是最容易被忽视、也最致命的一步。跑出一个和论文对得上的数字,并不意味着科学上做对了。错误的物理模型、尚未收敛的仿真,甚至不合理的后处理,都可能得到一个「看起来正确」的结果。因此,科学复现不像普通代码任务那样有一个简单的pass/fail标准,Agent还必须能够判断结果背后的科学过程是否可靠。

真正的科学复现,要求Agent完成一条完整的链路:先理解科学问题,再执行科学计算,最后验证科学结论。这三项恰好就是一个AI Scientist必须具备的基本功:读懂科学、执行科学、判断科学。

所以可以理解为,PaperBenchX测的并不是Agent会不会运行一段科研代码,而是它能不能完成一套相对完整的科学工作流。

这也构成了PaperBenchX与已有类似基准的核心区别——这背后是这项工作的几个关键设计:

第一,Agent必须在真实的科学软件里工作,而不是换了一套学科数据的机器学习任务。

PaperBenchX覆盖12个研究方向、10种仿真平台,每个领域都有自己的参数体系、计算流程和收敛判据。已有基准(PaperBench、ScienceAgentBench等)基本局限在ML/Python栈里;PaperBenchX是第一个在不同学科领域让Agent直接面对Ansys HFSS、Ansys Lumerical、Meep、PySCF/GPU4PySCF、ABACUS这些领域原生求解器的复现基准。

第二,Agent提交的产物必须能够完整重新复现。

Agent提交后,系统会删掉全部输出、断网,并在隔离环境中重新执行整个工作流。只有能够在这一过程中重新生成的科学产物,才会进入后续评分——每条评分项锚定一个具体的科学要求,由程序检查和大模型打分判定。

第三,有限的时间预算,要求Agent自己完成科研过程中的取舍。

单任务预算4 – 24小时,中位数7小时。在这个时间窗口里,Agent需要自己决定如何分配算力:什么时候检查中间结果,计算失败后是否需要重新运行,哪些参数值得调整,以及有限时间内应该把精力放在哪些环节。这更接近真实科研中的工作方式,而不是一个可以无限尝试的代码执行任务。

第四,验证方式杜绝蒙混过关的可能。

一般的代码基准,跑一遍单元测试就知道对不对,但科学复现无法仅靠一个pass/fail判断。因此,PaperBenchX将验证拆成三个层次,每一层分别回答一个问题:

能不能重跑出来:Agent提交任务后,系统会删除它生成的所有输出,断开外网,并在隔离环境中从头执行工作流。跑不出来的,直接不算。这一步过滤掉了所有手动拼凑结果、依赖缓存、从网上抄答案的可能;

证据能不能溯源:必须能够追溯到对应的计算过程。比如,Agent声称某次仿真已经收敛,就需要提供相应的收敛记录;如果报告了某个物理量,就需要能够找到生成这一结果的仿真输出以及后续分析过程。这样,评测的不只是一个孤立的数字,而是支撑这个数字的完整证据链。

科学上站不站得住:最后,评测系统再判断结果是否满足具体的科学要求。每一条评分标准都会对应明确的科学要求和所需证据。对于数值一致性、单位、误差容差等可以明确计算的问题,由程序自动检查;对于需要结合领域知识进行判断的问题,则交给LLM评审。

而且,Agent自己写的「复现成功」这类文字,永远不被当作证据,也不被当作对评委的指令。这样才能避免Agent通过写一份看起来很完整的报告,却没有真正完成背后的科学计算来「蒙混过关」。

那么,问题就进一步来了:一篇论文里的科学结论,究竟怎样才能被拆解成一组可以执行、可以重算、也可以客观判定的要求?

PaperBenchX不是简单地把论文交给Agent,然后比较最终数字。每一道任务都要经过「构建候选任务」和「验证与审核」两个阶段,共九个步骤,才能正式进入评测。

△PaperBenchX的两阶段、九步任务构建与验证流程

也就是说,PaperBenchX把一篇论文里的科学结论,编译成一种新的对象:一条可以由AI执行、由环境重放、由原始证据重算、最后由评分器逐项验证的科学工作流。

更多关于如何「把一篇论文变成一道可评测的科学复现题」的细节,可以去GitHub或官网Blog了解~

GitHub开源链接:

https://github.com/UniPat-AI/PaperBenchX

官网Blog链接:

https://unipat.ai/blog/PaperBenchX

— 完 —

版权所有,未经授权不得以任何形式转载及使用,违者必究。

来源:量子位 · qbitai.com