跳到正文
The Verge · AI· Robert Hart·· 3 小时前精选AI 评分79

OpenAI 发布近 400 项 AI 数学成果,数学家称理解可能需要数年

‘Pure insanity’: Mathematicians will need years to make sense of OpenAI’s latest drop

AI 导读

OpenAI 发布了近 400 项 AI 生成的数学成果,分布在 700 多篇手稿中;受访数学家表示,理解和评估这批材料可能需要数年。OpenAI 称 719 篇手稿中有 300 项顶层结果已形式化,约占 42%,但研究者指出,形式化和论文质量不一,仍需核实证明是否支撑文中的主张。

推荐理由

报道呈现了大规模数学成果发布与验证、理解能力之间的落差,也记录了研究者对学术工作和职业规划受到冲击的担忧。

正文 · AI 翻译

“惊人。”“令人难以招架。”“前所未有。”“超现实。”“简直疯狂。”

在与 The Verge 的对话中,三十多位数学家试图理解 OpenAI 本周突然向数学界抛出的大量数学成果时,以上是他们用来描述这些成果的部分词语。在敬畏、兴奋和对这场洪流规模感到不安的情绪之中,萦绕着一种根深蒂固的焦虑:这一切意味着什么——接下来又会发生什么。尽管研究人员的反应各不相同,但他们一致认为,仅仅弄清楚 OpenAI 发布了什么就可能需要数年时间,更不用说搞清楚数学家们在这个如今正在他们周围发生变化的领域中将何去何从。许多人担心,OpenAI 不会等这么久才继续推进,或发布更多成果。

OpenAI 总共发布了近 400 项 AI 生成的成果。这些成果分布在 700 多份手稿中,涉及多种数学学科,包括组合数学、几何学的若干分支、数论、理论计算机科学、代数、拓扑学、概率论与统计力学,以及数学物理。这个合集规模庞大,OpenAI 甚至觉得有必要发布指南,说明如何浏览庞杂的 GitHub 仓库。

如此庞大的工作量,使得人们甚至很难对该公司究竟发布了什么做出初步评估。在发布后的数小时和数天里,The Verge 采访的大多数数学家都表示,他们仍在努力消化所有内容;几位数学家说,仅仅通读约 40 页的目录和摘要,就花去了他们将近一个小时。“光是看完所有摘要,就已经让人应接不暇了。”康涅狄格大学数学教授 Álvaro Lozano-Robledo 说。

数百份手稿中还散布着用 Lean 编写的形式化证明。Lean 是一种编程语言和证明助手,可通过计算验证结果。这些形式化证明在评估 OpenAI 先前的一些数学主张时发挥了关键作用,即使研究人员并未完全理解背后的论证,也能确信主张在逻辑上是正确的。

“如果 AI 现在就消失了,就像有外星人来到地球然后离开一样,我们接下来 10 年都会研究这些成果,试图弄明白一切。”

不过,各项成果得到验证的程度差异很大。OpenAI 在 GitHub 上承认,这些成果“处于不同的验证阶段”,而且“许多手稿已完成形式化,但并非全部”。截至撰写本文时,该合集中的手稿似乎不到一半有正式描述。OpenAI 表示,719 份手稿中只有 300 项顶级成果已经形式化,约占 42%;并称“随着我们获得更多形式化证明,将更新该仓库”。

多位数学家向The Verge抱怨缺乏形式化,尤其是考虑到结果数量之多;他们强调,即使某项结果附有 Lean 代码,评估也无法即时完成。研究人员必须检查形式化是否确实证明了结果所声称的内容,这又是一个耗时的过程。多位仔细研读论文的研究人员表示,即使提供了可由计算机验证的证明,其质量也参差不齐,而且这些证明所验证的陈述并不总是能与随附手稿中的主张清晰对应。

伦敦帝国理工学院数学教授 Kevin Buzzard 表示,他在自己的研究领域——代数数论——发现了许多定理,其中只有大约六个立刻“脱颖而出”。这些定理中,很少有(如果有的话)似乎经过 Lean 的形式化验证。“因此,我要么得去读可能不正确的垃圾内容,要么等其他人来做同样的事,要么等有人把它们形式化,这样我才能确定这些结果是否正确。”许多其他研究人员也表达了 Buzzard 的担忧。

Buzzard 并非唯一担心 AI“垃圾内容”的人。这个词是对低质量、频繁出错的 AI 生成材料的简称,这类内容正越来越多地出现在网上——以及现实世界中——包括学术论文。数学家告诉The Verge,与其他领域一样,近年来,他们看到使用 ChatGPT 和 Claude 等工具制作的此类材料大幅增加。其中许多内容令人困惑、难以阅读,也表明作者对主题缺乏理解;在标注其他研究人员的贡献方面,尤其粗制滥造。

OpenAI 之前的数学研究论文因内容粗疏而遭到专家广泛批评,尤其是归属标注不当或根本没有标注。在发布前接受 The Verge 采访时,几位研究人员开始把即将涌现的大量论文称为“slopocalypse”(垃圾末日),或类似的说法。

人们担心的“垃圾末日”是否真的出现,很难说,主要是因为发布的材料数量令人眼花缭乱。早期迹象表明,OpenAI 这次在论文上更加谨慎了,或者至少在其中一些论文上是如此。多位数学家告诉The Verge,他们的第一印象远好于预期;不过他们也承认,鉴于该公司此前发表的作品质量粗劣,这个标准本来就不高。

“这是一团乱麻。它可能导致学术文化彻底崩塌,并直接摧毁大多数院系。这是一个社会问题,而 AI 实验室似乎完全无视了这个问题。”

但更好并不一定意味着好,更不用说达到学术作品通常应有的标准了,尤其是当作品提出如此重大的主张时。OpenAI 的许多主张缺乏形式化验证,因此随附论文的质量尤为重要;数学家主要通过这些论文来确认、理解、审视并放在背景中考量相关结果。

即使在最理想的情况下,撰写严谨的数学论文也是一项艰巨的工作。以这种规模开展这项工作,更是极具挑战。OpenAI 的模型正以令人眼花缭乱的速度,在广泛的专业领域产出数学成果,远远超出其人类员工的处理能力。该公司根本不具备足够广泛的专业知识或资源,无法对其数学前沿研究成果进行恰当审查。研究人员告诉The Verge,这批成果就体现了这一点。

许多人形容,这些论文读起来很困难,有时几乎不可能理解。“我快速读了一遍,发现最熟悉的那个问题的论述几乎说不通,”布朗大学数学教授 Brendan Hassett 告诉The Verge。“如果这是一个人写的,我就不会再花时间试图理解它。当然,还有另外 721 篇预印本!”(Hassett 是在 OpenAI 撤回三篇论文之前说这番话的。)

一些研究人员告诉The Verge,他们或同事注意到,几篇论文似乎涉及其他数学家已经研究过的内容,不过在有机会恰当审阅材料之前,他们不愿公开这么说。另一些人则指出,这些研究篇幅异常简短:他们通常认为需要数百页才能展开的结果,被压缩到了几十页甚至更少。

澳大利亚悉尼大学数学教授 Nalini Joshi 表示,快速检索这批成果后,她发现与自己研究重叠的内容不多,但她指出,自己审阅的一些论文“参考文献很短”。鉴于 OpenAI 过去在署名做法上受到过批评,她表示自己“担心论文中的归属说明可能没有完整交代情况”。

但尽管存在大量粗制滥造的内容和不确定性,普遍共识仍是,这批成果中包含一些确实令人印象深刻的研究。

尽管强调评估如此大量材料的难度,以及恰当核实研究结果的必要性,但许多接受The Verge采访的研究人员表示,尽管呈现方式存在不足,这些研究看起来仍具有很高的水准。他们说,在人工智能出现之前,OpenAI 的许多研究成果显然足以发表在顶级期刊上,也可能足以让作者获得学术职业发展机会。有人形容,其中少数成果足以让数学家成为菲尔兹奖这一学科最高荣誉之一的有力竞争者。

“我只能选择读这些可能并不正确的粗制滥造成果,或者等别人也去读,或者等有人把它们形式化,之后我才能确定这些结果到底是否正确。”

斯坦福大学数学家 Jared Duker Lichtman 表示,他认为有“几十项”成果属于这一类,包括在黎曼猜想、霍奇猜想的一个特殊情形,以及四维 Kakeya 猜想的解答方面取得的进展。这些都是数学领域的重大难题。黎曼猜想——可以说是整个学科中最臭名昭著的未解难题——和霍奇猜想都属于著名的七个千禧年大奖难题。它们分别涉及素数的分布,以及粗略来说,如何用更简单的基本构件来理解复杂的几何形状。与此同时,Kakeya 猜想粗略地探讨了要在各个方向上旋转一根针或铅笔,最少需要占据多大的空间。今年早些时候,纽约大学数学家 Hong Wang 因证明三维版本的 Kakeya 猜想而获颁菲尔兹奖。

数学家 Scott Armstrong 说:“这些并不是那种无人听闻的荒唐问题。它们中的许多都是非常知名的问题,很多人几十年来一直在尝试解决。”

尘埃开始落定时,数学家们不得不面对一个骤然改变的局面。他们中的许多人刚刚目睹多年的工作和精心制定的研究计划在瞬间化为乌有,或者认识遭遇了这种情况的同事。整个领域的反应,无论是夹杂着兴奋、恐惧、绝望,还是介于其中的其他情绪,都带有一种强烈的迷失感。

到了第二天早上,这种情绪并未明显改变。Armstrong 一边在巴黎散步,一边通过电话交谈。他设想,如果索邦大学没有因持续的学生抗议而关闭,若他的同事们正围在平时常用的咖啡机旁,气氛恐怕会相当“沉重”。

在苏格兰,圣安德鲁斯大学数学教授 Colva Roney-Dougal 也形容,同事和学生之间的气氛同样阴郁。她说,这场倾泻而来的成果让人觉得有些“可怕”,但它的到来,也让人结束了数周的不确定感,多少松了口气。她说:“我有一群朋友和同事,他们的拨款申请刚刚全都泡汤了。”

“我有一群朋友和同事,他们的拨款申请刚刚全都泡汤了。”

Armstrong 表示,他知道有一个研究团队的整个研究计划几乎被这次发布“彻底抹去了”。与此同时,纽约大学数学家 Tristan Buckmaster 曾处于OpenAI 早前围绕 Navier-Stokes 问题发生争议的中心;他说自己已经听说“有三个人的整个研究计划都被彻底摧毁了”。

《The Verge》与数学家交谈时,类似的故事屡屡出现,不过这种冲击主要集中在该领域的某些方向。苏格兰赫瑞瓦特大学数学教授 Francesco Fournier-Facio 表示,概率论、组合学和理论计算机科学领域的研究人员似乎“尤其震惊”;他还说,自己所在领域中的一些分支——群论——已经被“推土机碾过”。

Armstrong 和其他研究人员表示,一些领域似乎遭到了近乎军事级精准度的定向攻克。“确实有一些明确的目标,”Armstrong 说。他特别提到了 Wang 今年获得菲尔兹奖的研究领域,以及几个千禧年大奖难题。他说,一系列数理物理学成果清楚表明,OpenAI 正在研究 杨-米尔斯理论——这一数学框架是现代粒子物理学许多理论的基础——以及尚未解决的“质量间隙”问题,这是七个大奖难题之一。

其他地方的研究人员则惊讶之余,松了口气,因为他们自己的研究似乎几乎没有受到影响。Roney-Dougal 说,她所在的领域——主要围绕群论展开——似乎相对安然无恙。她开玩笑说,幸好自己研究的是“一个非常不时髦的领域”,不过后来她发消息说,在发现自己的研究被其中一篇论文引用后,她感到“拿不准”。

Joshi 同样发现自己的研究与这些成果几乎没有重叠。她的研究主要聚焦于可积系统,也就是能够精确求解的复杂系统。她认为,这或许是因为她所在的领域较少受到长期存在、正式表述的猜想和定义驱动,更多是围绕着随着物理学发展而时兴或退潮的问题展开。

截至 10 月 8 日,该记录中已经列出了许多更正,包括对十多份手稿的修订,以及撤下三篇论文,理由是存在“符号错误”,据称该错误使其中一项论证失效。

无论自己的研究是否直接受到影响,《The Verge》采访的大多数数学家都有一种共同感受:这个领域已经跨过了某种门槛,不再是一天前的样子。高等研究院研究员 Constantin Kogler 称之为“数学史上最重要的单一时刻”;伦敦数学科学研究所研究员 Yang-Hui He 则将视线追溯到数千年前,把今年由 AI 推动的发展比作欧几里得《几何原本》的问世——这是该学科最具影响力的著作之一。

很少有研究人员对这一变化作出如此宏大的评价,但大家普遍认为,数学正在迅速变化,数学家也必须随之改变。

OpenAI 知道这次发布会带来颠覆性影响,并采取了一些措施来减轻冲击、与数学界沟通。今年早些时候,公司与研究人员几次交锋颇为激烈,此后便转向数学家寻求帮助,与新成立的数学与人工智能顾问小组(AGMAI)合作,探讨如何负责任地发布这些成果。

AGMA此前已经阐明了它认为负责任的参与应当是什么样。AI 实验室理想情况下应发布“人类能够理解”的论文,或者提供必要的“支持,帮助人类开展理解和吸收 AI 生成的数学输出所需的额外数学活动,并找出其可能的应用”。他们表示,在可能的情况下,应对证明进行形式化处理,公司还应公开用于生成这些成果的模型和提示词。该团体还敦促 AI 实验室不要再把数学成果发布当作“推广其模型的营销工具”,并应“停止在专有模型上测试高级数学问题”,因为更广泛的科学界无法使用这些模型。

“并不是说这些只是些没人听说过的愚蠢问题。其中许多都是非常著名的问题,很多人几十年来一直在尝试解决。”

OpenAI 采纳了该团体的部分建议。该公司表示,将围绕其数学领域的工作资助一系列研讨会和会议,帮助社区梳理和理解相关工作,但没有说明这些活动会是什么形式,或何时举行。公司披露的信息也比以往发布时多得多——研究人员再次指出,这个标准很低——其中包括其模型尝试了 4,000 多道题,典型结果使用了约三小时的 ChatGPT Pro 推理算力。公司还实施了“论文修订和引用方面的规范”,并在 GitHub 上表示,将“保留该合集的公开发布历史”。截至 10 月 8 日,该记录已列出多项更正,包括修订十多篇稿件,以及因“符号错误”导致论证失效而撤下三篇论文。OpenAI 未就 The Verge 要求提供更多详情一事作出正式回应。

这一变化解决了与数学家摩擦的一个主要来源。一些数学家表示,对该公司发布的说法,他们多少抱有一种“疑虑”。该公司有悄悄修改新闻稿和论文以回应批评,却不明确披露这些改动的习惯。

但 OpenAI 并未遵循该团体的所有建议——其中包括一些影响最重大的建议。它没有指出此次发布所用的模型,也没有披露使用的提示词或模型尝试过的完整题目集。OpenAI 似乎也承认其形式化工作有所欠缺——它表示会在获得更多形式化成果后予以补充——且论文质量不佳;公司称,“未来发布时,我们会致力于通过完善引用、数学论述和结果呈现,进一步提升论文质量,以便读者更好地理解。”

“我熟悉的那个问题,其解说稿匆匆读过一遍后,几乎让人摸不着头脑。”

接受 The Verge 采访的研究人员质疑,OpenAI 为何不能提升这些论文的质量;他们也对公司似乎不愿提前将许多结果形式化——或至少检查一遍(对于后来撤下的论文而言)——感到失望。诸如所用提示词之类的信息,也会极大减轻许多人认为自己不得不承担的负担:评估公司突然抛给他们的大量材料。

最重要的是,该公司表示没有计划停止用数学问题测试其模型,甚至暗示这样做是势在必行的。该公司在公布最新成果时表示:“我们希望直接为科学家提供最先进的能力,并正努力以负责任的方式发布生成这些成果的模型。这就是为什么继续用数学和其他科学领域的问题评估我们的内部前沿模型至关重要,这样我们才能加快开发推动这些领域发展的工具。”

OpenAI 发布其成果后,AGMAI 称这次发布是“第一步”,并再次呼吁公平地获取算力和研究工具。更根本地说,该组织指出:“数学研究的未来不能只局限于理解 AI 实验室产出的结果。”

尽管 OpenAI 声称解决了数百个长期悬而未决的问题,数学家们表示,还有大量工作要做。许多人估计,理解该公司刚刚发布的所有内容可能需要整个学界数年时间。

Armstrong 将如此大量的新数学成果突然涌现,比作短暂外星造访后可能引发的骚动。“如果 AI 现在就消失了,就像外星人来到地球后又径自离开一样,我们接下来的 10 年都会研究这些成果,试图理解一切。”

其中许多工作本身就会令人振奋。研究人员必须补齐空缺、提取有用的思路和关联,并将解决方案置于更广泛的数学背景中;这些工作通常都与为人类提供解决方案密不可分。Lichtman 表示:“对于许多这样的成果,相关领域的专家非常重视这些解决方案,我相信他们能够理解并向更广泛的世界介绍这些成果。”他认为,随着 AI 改变各个领域,解释、验证和阐释研究成果的工作应当得到更多重视。“作为一个社会,我们应该给予这些消化理解工作更多回报。”

人类或许还有大量数学工作要做。Lichtman 表示,据他所知,所有这些成果虽然“令人惊叹”,但都“源自现有方法和技术”。它们填补的是已知数学版图中的空白,而非开辟全新的领域。Lozano-Robledo 对此表示赞同:“事实证明,还有比专家此前所知多得多的空白有待填补!”他还说:“这些成果都是以非常巧妙的方式运用现有技术。”

而现有版图远非极限。Lozano-Robledo 表示:“数学研究本质上是无限的。研究会继续下去。”伦敦研究院的 He 表示,他尤其期待接下来会出现什么,并猜测研究人员最终或许会创造出新的理念,“甚至可能开辟新的数学领域”。

这些公司似乎已经准备好立刻转向下一步,远在学界有合理机会消化它们产出的成果之前。

The Verge 采访的数学家中,很少有人从原则上反对 AI 创造新的数学成果。事实上,许多人对此表示欢迎,也在不同程度上表示自己热衷于使用 AI 工具。大多数人的不安,针对的是开发这些工具的 AI 公司进入他们领域的方式。

看到 OpenAI 和其他 AI 实验室在数学领域发布的成果,你可能会以为,数学研究基本上就是逐项攻克清单上的问题。AI 实验室发布成果的方式也强化了这种看法:先是引人注目的公告,接着是初步论文,然后把剩下的工作一股脑丢给数学家去研究和梳理。多位研究人员告诉 The Verge,这些公司似乎随时准备转向下一件事,远远早于学界有机会充分消化它们的成果。

研究人员称,这种看法曲解了数学研究的实际运作方式。解决问题固然重要,但寻找答案的整个过程同样重要:发展想法、建立联系、提出新问题或开辟其他研究方向。数学家表示,当 OpenAI 这样的公司只给出答案,却不做周边工作时,这些工作就又落回学界身上。

“有新的成果固然很好,但这种规模已经是另一个层次了。”波兰波兹南的亚当·密茨凯维奇大学数学家 Bartosz Naskręcki 说。“这会造成一团乱,”他说,“它可能导致学术文化大规模崩塌,甚至直接扼杀大多数院系。这是一个社会问题,而 AI 实验室似乎完全忽视了这一点。”

需要数年才能理解的,不只是数学本身。研究人员也在努力理解这场巨变对他们意味着什么。许多人描述说,学界弥漫着一种黯淡、近乎存在主义的情绪;数学家们正试图弄清自己在这个迅速变化的领域中身处何处。他们可能没有太多时间来想清楚。

数学家之间已经开始流传有关 OpenAI 将进一步发布成果的传闻。OpenAI 未回应 The Verge 关于是否计划发布更多成果的问题。

Roney-Dougal 说,她很担心又会有新的成果发布,也担心 Anthropic 或其他 AI 实验室会加入这场角逐。

这场动荡对博士生、初级研究人员以及其他没有终身教职的人打击尤其严重。像 OpenAI 的模型正在攻克的那些未解问题,可能成为论文、基金申请、求职申请以及多年研究计划的基础,而这些都是学术生涯的重要基石。多位研究人员表示,一种日益普遍的焦虑正在蔓延:他们赖以建立职业生涯的研究工作可能突然就成为下一个被攻克的目标;而 AI 模型在关闭一些研究方向的同时,却很少开辟未来的探索途径。“对资金即将用完或正在求职的人来说,这会造成极大的冲击,”瑞士苏黎世联邦理工学院数学家 Simon Machado 说。他即将加入法国国家科学研究中心(CNRS)。

“数学研究本质上是无穷无尽的。研究会继续下去。”

士气可能尤其低落,因为一切都让人觉得没有尽头。OpenAI 的成果一波接一波地涌来,规模越来越大,彼此之间几乎没有间隔,而且该公司不断暗示还会有更多成果。“你会觉得他们其实并不在乎这些单项成果,”Roney-Dougal 说。“这种感觉真的很糟糕。”

数学家几乎还没来得及消化一批成果,下一批更大的成果就又砸了下来。“再过两个月,就会有某个东西把这次的成果远远甩在后面,”Armstrong 说。“这就像一枚又一枚越来越大的炸弹反复袭来。”

Armstrong说,他认为自己属于最热衷于人工智能、对其最乐观的数学家之列。他在自己的工作中使用这项技术,并相信它潜力巨大。但即便是他,也越来越感到不安。“晚上有点难以入睡,”他坦言。

当被问及接下来打算做什么时,Armstrong显得不那么确定。他仍走在巴黎街头,正准备去吃午饭。他说,眼下的首要任务是完成自己一直在做的一些工作——有时会借助 OpenAI 的 Codex——“赶在 OpenAI 抢先之前”。

除此之外,即便是这位自称对 AI 持乐观态度的人,也感到茫然,并质疑自己在数学领域还有怎样的未来。他尤其担心该领域的年轻研究人员。“数学领域接下来的几年会非常奇怪,”他说。

关注本文相关话题和作者,即可在个性化主页动态中查看更多类似内容,并接收电子邮件更新。

  • Robert Hart

来源:The Verge · AI · theverge.com