周二,OpenAI在GitHub上公开了722篇由其内部未披露模型生成的数学手稿。据公司发言人介绍,这些成果几乎全部源于一个单一提示指令,虽部分结果需多次迭代才达成,但整体展现了极高的自动化生成能力。
这些论文被划分为372个研究“家族”,涵盖主定理、推论及替代证明等关联内容。实际发布的722篇并非对应相同数量的问题,而是从约4000个提问中筛选出的具有学术价值的结果。
每项输出平均消耗相当于ChatGPT Pro用户三小时的推理算力,远低于此前纳维-斯托克斯问题所用的88小时与10,000个智能体协同模式。然而,仅162篇附带了由计算机验证的逻辑形式化,占总数约22%。
所有验证均基于Lean语言——一种支持机械检查逻辑链条的工具。但该工具仅能确认推导过程是否符合预设规则,无法判断结论是否正确或具备原创性,因此仍存在潜在错误风险。
麻省理工学院数学家安德鲁·萨瑟兰指出:“在模型和提示未公开前,‘单次提示解决复杂问题’的说法应视为未经证实的推测。”他强调必须看到可复现证据才能接受这一主张。
普林斯顿高等研究院则警告:当AI能产出人类无法理解、验证或担责的数学论证时,现有学术责任体系面临挑战。他们呼吁建立以人类理解为核心的新型研究范式。
与此同时,阿比舍克·萨哈教授认为这是“数学界的大日子”,尽管多数成果属于已有路径上的显著进展,而非颠覆性突破。其中唯一具备变革潜力的是“准黎曼猜想”。
此次发布未遵循普林斯顿顾问小组9月提出的建议标准,包括未提供模型名称、具体提示词、思维链摘要、每项任务的时间与资源开销。
相比之下,Anthropic已将费马大定理的形式化证明(含1300万行代码)完全开源,作为非新发现的严谨验证案例。而OpenAI目前仅公布了平均算力数据与10份简化推理摘要。
OpenAI表示正逐步补充形式化工作,当前已完成162篇,未来将根据验证进展持续更新。