OpenAI 公开 722 篇 AI 数学论文
内部模型产出、GitHub 开源(Apache-2.0)、多数带 Lean 证明;IAS 顾问组此前要求「停止」。

OpenAI 10 月 6 日在 GitHub 仓库 openai/math(Apache-2.0 许可)一次性公开 722 份数学手稿,归入 372 个问题族。产出者是一个未公开命名的内部前沿模型——8 月 28 日起训练、官方口径称能力「显著强于 GPT-6 Astra」;模型面对约 4000 个问题,平均每个结果耗费约 3 小时 ChatGPT Pro 等效算力。多数手稿带 Lean 形式化证明;两个 standout 结果走了不同路径:黎曼 zeta 函数零点无零区(Re(s)>11/12,人工执笔成文)与 CM 阿贝尔簇上的 Hodge 猜想证明。The Verge、NYT 当日跟进。
要点
- 规模:722 份手稿 / 372 个问题族,Apache-2.0 开源
- 模型:未命名的内部前沿模型(训练自 8 月 28 日,强于 GPT-6 Astra),9 月 5 日完成首个结果
- 算力:平均每个结果 ≈ 3 小时 ChatGPT Pro 等效算力
- 验证:多数带 Lean 形式化;README 自认「未形式化的结果可能有问题」,承诺版本化更正
- 亮点:黎曼 zeta 零点无零区(Re(s)>11/12)、CM 阿贝尔簇 Hodge 猜想;样题包括 π 的无理性指数、Mahler 猜想、自由群因子同构等
- 反对声音:IAS 数学与 AI 独立顾问组 9 月 29 日建议书明确「不背书,要求停止在专有模型上测试高等数学问题」
顾问组与执行差距
IAS 的独立顾问组(9 月 29 日、600+ 社区意见后)给出的要求清单具体而苛刻:结果存入非实验室控制的仓库、披露模型名、提示词、思维链摘要、算力成本与失败尝试。对照本次发布:仓库确实是 GitHub 而非自家平台,Lean 形式化与 10 份推理摘要提供了部分可验证性——但模型名未公开、失败尝试未披露、算力数字只有平均值。执行了一半,正是这场治理拉锯的现状。
数学界怎么消化这件事
顾问组的「停止」建议 vs OpenAI 的 722 篇,夹在中间的是数学家社区的注意力经济:Unite.AI 与 The Verge 都指出,这批手稿里真正的新定理占比未披露——大量结果可能是已知定理的新证明或强化版本。对职业数学家,722 篇里淘金的成本不低;但 Lean 形式化部分可以程序化筛读,已有数学家在 X 上组织「Lean 先行」的分拣。德高望重的拥趸(如 9 月为 OpenAI 背书的陶哲轩阵营)与顾问组的审慎形成两极,社区共识还没形成。
形式化是这批手稿的护城河
区分「AI 生成的数学文本」与「AI 证明的数学」的关键在 Lean:机器可检验的证明不依赖审稿人的善意,722 篇里能过 Lean 的部分是硬成果,不能过的部分(README 自己承认可能有问题)则回到了传统评审的世界。这也解释了 OpenAI 为什么敢一次放 722 篇——有形式化兜底,出错可版本化更正,审稿成本从「人读」转移到「机器验」。
编辑判断:与限流对撞
arXiv 上月刚实施每月 2 篇限流,防的是人类灌水;722 篇的 AI 产能正面撞上人类评审体系的容量上限。顾问组的「停止」要求没有强制力,但它把问题摆上了台面:当证明可以机器检验,出版体系的价值还剩什么?对研究者,这批手稿是免费的题库与对照集;对出版体系,这是本月第二次被 AI 产能逼到墙角——第一次是 722 篇本身的规模,第二次是「机器可检验的证明不需要期刊」这个越来越难反驳的论点。可以预期的折中方案正在成形:AI 生成结论走形式化验证仓,人类叙述走传统出版,两套体系各发各的 DOI。