2026-10-08 09:18:48
icon loading...

OpenAI发布722篇数学论文:单提示生成引发学界争议

摘要
OpenAI发布722篇由单一提示词驱动生成的数学手稿,仅162篇完成计算机可验证的形式化,引发学界对透明度与可信度的广泛质疑。尽管宣称实现重大进展,但缺乏原始提示与完整验证流程,令专家呼吁更严格的标准。

周二,OpenAI在GitHub上公开了722篇由其内部未披露模型生成的数学手稿。据公司发言人介绍,这些成果几乎全部源于一个单一提示指令,虽部分结果需多次迭代才达成,但整体展现了极高的自动化生成能力。

成果数量与真实意义

这些论文被划分为372个研究“家族”,涵盖主定理、推论及替代证明等关联内容。实际发布的722篇并非对应相同数量的问题,而是从约4000个提问中筛选出的具有学术价值的结果。

计算成本与验证现状

每项输出平均消耗相当于ChatGPT Pro用户三小时的推理算力,远低于此前纳维-斯托克斯问题所用的88小时与10,000个智能体协同模式。然而,仅162篇附带了由计算机验证的逻辑形式化,占总数约22%。

所有验证均基于Lean语言——一种支持机械检查逻辑链条的工具。但该工具仅能确认推导过程是否符合预设规则,无法判断结论是否正确或具备原创性,因此仍存在潜在错误风险。

学界反应两极分化

麻省理工学院数学家安德鲁·萨瑟兰指出:“在模型和提示未公开前,‘单次提示解决复杂问题’的说法应视为未经证实的推测。”他强调必须看到可复现证据才能接受这一主张。

普林斯顿高等研究院则警告:当AI能产出人类无法理解、验证或担责的数学论证时,现有学术责任体系面临挑战。他们呼吁建立以人类理解为核心的新型研究范式。

与此同时,阿比舍克·萨哈教授认为这是“数学界的大日子”,尽管多数成果属于已有路径上的显著进展,而非颠覆性突破。其中唯一具备变革潜力的是“准黎曼猜想”。

透明度缺失与行业对比

此次发布未遵循普林斯顿顾问小组9月提出的建议标准,包括未提供模型名称、具体提示词、思维链摘要、每项任务的时间与资源开销。

相比之下,Anthropic已将费马大定理的形式化证明(含1300万行代码)完全开源,作为非新发现的严谨验证案例。而OpenAI目前仅公布了平均算力数据与10份简化推理摘要。

OpenAI表示正逐步补充形式化工作,当前已完成162篇,未来将根据验证进展持续更新。

声明:文章不代表币圈网观点及立场,不构成本平台任何投资建议。投资决策需建立在独立思考之上,本文内容仅供参考,风险自担!转载请注明出处!侵权必究!
币圈快讯
查看更多
回顶部