10月6日,OpenAI将其未公开的内部模型生成的719篇数学论文上传至GitHub,此举迅速在学术圈引发讨论。就在一周前,该公司的外部咨询小组曾建议各大实验室暂停在封闭系统中进行高阶数学问题的测试。
位于普林斯顿高等研究院的“数学与人工智能咨询组”基于超过600份反馈,在9月29日发布指导声明。其核心观点为:当前做法不可持续,应立即停止在专有模型上开展前沿数学探索。该小组指出,若任由少数机构垄断资源,将导致整个领域出现“双轨制”——即部分团队凭借封闭数据和算力快速领先,而其他研究者难以追赶,严重削弱学术生态的公平性。
OpenAI在代码库中解释称,这些论文是模型开发流程的一部分,旨在拓展现有基准测试的边界。随着传统数学评估体系趋于饱和,公司扩大了测试范围。尽管表示已与咨询组保持沟通,并参考其建议,但该小组在10月6日重申:其顾问角色并不构成对此次发布行为的背书。最终是否合规,仍需由更广泛的数学界共同判断。
这719篇论文被划分为372个数学家族,每个家族围绕一个核心定理及其证明展开。模型共处理约4,000个问题,平均每个结果需ChatGPT Pro运行约三小时完成推理。目前,OpenAI公布了10个推理摘要,其中约42%的主要结论附带了用Lean语言编写的计算机可验证证明。
Lean是一种用于形式化数学证明的编程工具。一旦代码成功编译,仅说明逻辑结构无矛盾,但并不能保证其与原始书面论证完全一致。因此,形式化验证只是辅助手段,不能替代严谨的人类审查。
10月6日,三位学者Alexander Bastounis、Fabian Circelli与Anders C. Hansen发表研究,揭示关键差距。他们在分析纳维-斯托克斯方程相关论文时发现,文字陈述中的数学强度远超其对应的Lean代码所实际支持的内容,甚至存在对输入导数阶数的错误设定。
类似问题也出现在欧拉方程的证明中。作者强调:“无论是人工撰写的证明还是自动形式化的代码,都必须经过与传统论文同等严格的同行评审流程,不能因出自AI之手就获得例外待遇。”
此前,9月8日OpenAI宣布纳维-斯托克斯成果后,纽约大学数学家Tristan Buckmaster曾质疑其中人类参与程度过低。对此,公司承诺将资助未来关于重大AI成果的研讨会与专题活动,以推动学术交流。
著名数学家陶哲轩于10月6日在社交平台发文,指出许多提示工程师在完成任务后便不再深入理解其成果,无法回答后续问题或进行学术讲解。他虽未点名具体机构,但隐含对自动化产出缺乏深度理解的担忧。
《Cryptopolitan》此前报道,OpenAI方面曾表示,其顾问团队无权干预研究节奏,强调自主决策权。这一立场进一步加剧了外界对其透明度与责任机制的质疑。