
本周,OpenAI 在 GitHub 上公开了数百道世界级数学难题的"答案",称其已咨询一个由顶尖数学家组成的顾问小组,以避免上次模型解决该领域悬而未决难题时引发的风波。
这个顾问小组名为"数学与人工智能顾问组"(AGMAI),隶属于普林斯顿高等研究院,成员来自全球多家知名机构,共九位研究员。
核心争议:建议听了一半
AGMAI 于 9 月底发布了面向前沿实验室的 数学问题解题指南。在 OpenAI 此次发布后,AGMAI 发表声明称:"我们的建议究竟落实了多少,最终要由数学界来评判。" 然而,AGMAI 的第一条建议是"停止在自有模型上测试高级数学问题"——而 OpenAI 此次恰恰是在自有模型上评估公开研究级数学题。
部分原则得到了执行:OpenAI 尽可能快地公开了结果,并附上了模型推理路径信息。但仅此而已:
- 719 份手稿中,只有 10 份附上了模型的完整思维链
- 公开的证明中,仅 42% 经过了形式化验证(用 Lean 编程语言编译确认)
深层问题:自然语言与代码之间的"翻译鸿沟"
最令数学界担忧的,是一份由剑桥大学与伦敦国王学院数学家联合发布的 论文。论文指出,当前前沿模型解题的流程是:先用自然语言给出解释,再将结果"翻译"为 Lean 代码(理论上编译通过即证明正确),但这两个环节之间存在偏差。
论文记录了 OpenAI 对一道源自纳维-斯托克斯方程(描述流体复杂运动)的题目所给解答中,至少发现 两处 自然语言证明与 Lean 代码之间的不一致。
这些差异不一定推翻整个证明,但它们引发了一个根本性疑问:模型能否在不依赖人类的情况下,独立完成自我形式化验证?
AGMAI 曾建议 OpenAI"附上机器可读的元数据,关联自然语言与形式化产物"——OpenAI 此次发布并未做到这一点。
"由于翻译偏差现象的存在——正如本论文所强调的——OpenAI 的自然语言证明及其他自动形式化的 Lean 证明,在未经与常规证明同等的同行评审与审核&查验之前,不应先验地被视为可信。"论文作者如此总结。
数学家的立场:理解才是终点
数学家在发现新成果后的标准流程是:撰写论文、公开发表演讲、参加研讨会,与整个学术社区互动。这一过程既能深化对解答的理解,也能提炼出可用于其他问题的方法,最终让新知识落地到实际应用领域。
而当模型被提示解决一道难题并直接吐出答案时,"在发布时并没有人类的理解,后续工作才刚刚开始。"哈佛大学数学教授 Melanie Wood 告诉 TechCrunch。
著名数学家陶哲轩(Terence Tao)也公开批评了 OpenAI 的做法。他在 社交媒体帖子 中写道:
问题正被 AI 提示工程师们自主解决,一旦初始目标被"攻克",他们便对整个领域失去兴趣,也没有足够能力回答关于结果的提问、做报告或与领域内其他人士交流。
影响与建议
综合来看,OpenAI 此次发布在形式上向 AGMAI 的部分原则靠拢,但在最关键的两点——停止自有模型测试、确保人类理解同步——上打了折扣。数学界的担忧并非针对答案本身是否正确,而是对"发布即终点"这一逻辑的质疑。
AGMAI 曾建议 OpenAI 出资支持人类数学家的工作——毕竟,正是这些数学家才能让实验室的解答在真正意义上变得有价值。


评论