职业生涯在一夜之间被颠覆,学者们必须在 OpenAI 继续向前推进的同时,从大量低质量内容中筛选出真正有价值的解法。
作者:Robert Hart,2026 年 10 月 9 日 UTC 时间 19:09


"令人震惊。""压倒性的。""前所未有。""超现实。""纯粹疯狂。"
在与 The Verge 的交谈中,三十多位数学家用这些词来形容他们试图理解 OpenAI 本周突然向数学界抛出的海量数学成果时的感受。在敬畏、兴奋以及对这轮"倾泻式发布"巨大规模的不确定之中,还夹杂着一个深层的焦虑:这究竟意味着什么?接下来又会发生什么?无论反应如何不同,研究者们一致认为,仅仅理解 OpenAI 已经发布了什么,就可能需要数年时间,更不用说弄清楚在正在发生剧变的数学领域里,自己应当如何自处。许多人都担心 OpenAI 不会等那么久就会继续前行——或者再次发布更多成果。
总体而言,OpenAI 发布了近 400 项由 AI 生成的数学结果。这些结果分散在超过 700 篇手稿之中,涵盖了多种数学分支,包括组合数学、若干几何学分支、数论、理论计算机科学、代数学、拓扑学、概率论与统计力学,以及数学物理。这批资料的体量之大,以至于 OpenAI 认为有必要发布一份使用指引,教人们如何浏览这个庞大的 GitHub 仓库。
相关报道
如此庞大的工作量,使得哪怕是对 OpenAI 究竟发布了什么进行初步评估也极为困难。在发布后的数小时乃至数日内,The Verge 采访的大多数数学家都表示,他们仍在艰难地消化这一切;其中几位说,光是通读那份大约 40 页的目录与摘要,就花掉了他们将近一个小时。"光是过一遍所有摘要就已经让人喘不过气了,"康涅狄格大学数学教授 Álvaro Lozano-Robledo 说道。
在这数百份手稿之中,夹杂着用 Lean(一种允许以计算方式验证结果的编程语言与证明辅助工具)完成的"形式化"工作。在评估 OpenAI 此前提出的某些数学主张时,这些形式化工作被证明是极具价值的工具——即便研究者并不能完全理解论证过程,他们也可以由此确信某个结论在逻辑上是正确的。
"如果这些 AI 现在就消失,就像有外星人来到地球然后立刻离开一样,我们也要在未来 10 年里研究这一切,努力去理解所有内容。"
然而,每项结果被验证的程度差异巨大。在 GitHub 上,OpenAI 承认这些结果"处于不同的验证阶段",并且"许多——但并非全部——手稿已经完成了形式化"。截至撰稿时,整批资料中形式化完成的手稿似乎还不到一半。OpenAI 表示,在 719 篇手稿中,只有 300 项最重要的结果被形式化,比例约为 42%,并称其"会在获得更多形式化结果后更新仓库"。
多位数学家向 The Verge 抱怨形式化程度不足的问题,尤其考虑到结果数量如此庞大;他们还强调,即便一篇结果附带了 Lean 代码,评估也并非立竿见影。研究人员必须检查形式化工作是否真正证明了该结果所宣称的结论——这又是一道耗时的工序。几位细读过论文的人表示,即便在那些附带了计算机可验证证明的地方,质量也参差不齐,被验证的命题与对应手稿中声称的结论之间并不总是能够干净利落地对应起来。
伦敦帝国理工学院的数学教授 Kevin Buzzard 表示,他已在自己所从事的领域——代数数论——中识别出许多定理,但其中能让他立刻"眼前一亮"的只有大约六条。这些定理中,几乎没有一条看起来是用 Lean 形式化验证过的。"因此,我只能去读那些可能并不正确的低质量内容,或者等别人也去读一遍,又或者等到有人把它们形式化之后,我才能确定这些结果到底正不正确。"Buzzard 的担忧得到了许多其他研究者的呼应。
在担心 AI "低质量内容(slop)"这一点上,Buzzard 绝非个例。这个词是用来简略指代那些低质量、常常带有错误的 AI 产物的代称,如今它们在网上——甚至在现实世界——越来越多地出现,学术论文也不能幸免。正如其他领域的情况一样,数学家们告诉 The Verge,近年来他们看到大量由 ChatGPT、Claude 等工具生成的此类材料。其中多数内容令人困惑、难以阅读,且几乎没有显示出对所涉主题的理解;在引用其他研究者的工作方面尤其粗糙。
OpenAI 此前的数学报告曾被专家们广泛 批评 为 粗制滥造,尤其是其糟糕乃至缺失的引用问题。在此次发布前与 The Verge 的交流中,几位研究者已经把即将到来的论文洪流戏称为"低质量内容末日(slopocalypse)",或是类似的变体说法。
人们担心的"低质量内容末日"是否真的降临,很难下定论,主要原因在于这次发布的资料数量本身已经让人头晕目眩。早期迹象显示,OpenAI 这一次在论文上花了更多心思——或者说至少在部分论文上花了更多心思。多位数学家告诉 The Verge,他们的第一印象远好于预期,尽管他们也承认,考虑到 OpenAI 此前那些粗劣的出版物,这个预期本身就已经低得不能再低了。
"这是一团巨大的乱麻。它可能在学术界引发一场巨大的崩塌,简单地扼杀掉大多数院系的生存空间。这是一个社会问题,而 AI 实验室看起来完全忽视了这一点。"
然而,"更好"并不等于"好",更不用说达到通常用来衡量这一量级学术成果的标准。由于许多 OpenAI 的主张都缺乏形式化验证,配套论文的质量就显得尤为重要——它们是数学家确认、理解、审视并将这些结果置于恰当语境中的主要手段。
写出严谨的数学论文,即便在最佳条件下也是一项艰难的工作。以这种规模来完成它,更是一项艰巨的任务。OpenAI 的模型正在以令人目眩的速度、在广泛得多的专业方向上吐出数学成果,远远超出了其内部人力的处理能力。这家公司根本不具备足够广博的专业知识或资源,来恰当地审视其在数学前沿上的发现。研究者们告诉 The Verge,这一点在结果中体现得淋漓尽致。
许多人描述说,那些论文读起来很困难,有时几乎不可能读懂。"我最熟悉的那道题目的书面报告,在快速浏览之后几乎读不出什么意思,"布朗大学数学教授 Brendan Hassett 对 The Verge 说。"如果这是某个人写的,我不会再花时间去试图理解它。当然,这就意味着还有 721 篇预印本等着呢!"(Hassett 在 OpenAI 撤下三篇论文之前发表了上述评论。)
一些研究者告诉 The Verge,他们或同事注意到的若干论文所讨论的内容,似乎已经被其他数学家覆盖过;不过在有机会对材料进行仔细复核之前,他们对公开表态持谨慎态度。还有人指出,这些工作篇幅异常简短——通常应当展开数百页去论述的结果,被压缩到了几十页乃至更少。