当证明变得廉价:OpenAI Astra 如何把数学研究推进到“生成—形式化—追责”流水线
2026-08-02
一、一句话定义
Astra 最重要的变化,不是把数学榜单再推高几分,而是把前沿研究变成一条可观察的流水线:模型寻找论证,人机共同整理论文,模型把论证写成 Lean 证书,最后由人类说明贡献边界、解释过程并承担责任。
这还不是“自动数学家”。它提出的新问题是:当候选证明可以低成本批量生成并由机器逐步检查,数学共同体应把稀缺注意力放在哪里?答案已经不只是证明。
二、纵向分析:从会写 Lean,到批量交付研究结果
1. 2013—2021:先造一台不相信任何人的检查器
2013 年,Leonardo de Moura 在微软研究院启动 Lean,2014 年发布 0.1 版。Lean 用尽可能小、可独立实现的逻辑内核检查证明,把复杂自动化留在可信内核之外:无论证明由人、模型还是不可信的搜索系统生成,只要证明项通过检查,结论就在已声明公理和定义之下成立。Lean 官方历史
Mathlib 则提供可复用的定义、引理和策略。Lean 3 时代,它已有超过一百万行形式化数学;迁移到 Lean 4 后,Polynomial Freiman–Ruzsa 猜想形式化、Liquid Tensor Experiment 等项目证明它已能承载前沿研究。Mathlib 官方介绍
Astra 能一天发布十套证书,不只是模型推理变强,也因为十余年公共基础设施提前支付了“可验证数学”的固定成本。
2. 2022:OpenAI 第一次把语言模型接进证明搜索
2022 年 2 月,OpenAI 的神经定理证明器开始为已形式化的 Lean 命题生成 tactic 和数学项,再由 Lean 检查每一步。它把 miniF2F 最好成绩从 29.3% 提高到 41.2%,并通过八轮 statement curriculum learning,把新找到的证明反复变成训练数据。OpenAI:Solving (some) formal math olympiad problems
这套系统仍不负责选题、形式化真实问题或判断研究价值,但确立了关键分工:语言模型提出下一步,形式系统负责冷酷地说“不”。
3. 2024—2025:两条路线分叉,又重新汇合
2024 年,AlphaProof 与 AlphaGeometry 2 在 IMO 获得相当于银牌的 28 分;AlphaProof 将语言模型与 AlphaZero 式强化学习结合,在 Lean 中搜索证明,但需要专家来回翻译自然语言与形式语言,部分题目耗时三天。Google DeepMind:IMO 2024 银牌结果
2025 年,Gemini Deep Think 直接读取自然语言题面,在 4.5 小时内解出六题中的五题,以 35 分达到 IMO 金牌标准。Google DeepMind:IMO 2025 金牌结果
两条路线并非相互淘汰:探索阶段需要容忍模糊、类比和失败,交付阶段必须收紧到定义、引理和可检查步骤。
同年,OpenAI 从专用 Lean 证明器转向通用推理模型。GPT-5 的科学协作案例显示,模型能贡献文献检索、证明思路、反例和跨领域联想;但它也曾给出正确的编码理论论证,却未主动发现同一证明早已发表。OpenAI:Early experiments in accelerating science with GPT-5
正确性和原创性由此正式分家:证明可以正确却不新,也可以在自然语言中完整、形式化后才暴露定义错位。
4. 2025 年末—2026 年初:从比赛题迈向开放问题
2025 年 12 月,GPT-5.2 Thinking 在 FrontierMath Tier 1—3 上解出 40.3%;一个统计学习理论案例中,研究者未提供证明大纲,GPT-5.2 Pro 给出解法后由作者和外部专家审查,并推广到更高维和其他统计模型。OpenAI:Advancing science and math with GPT-5.2
2026 年 2 月的 First Proof 要求模型处理十个跨领域研究问题。OpenAI 最初认为至少五份大概率正确,但过程包含人工建议重试、根据专家反馈扩写和从多次尝试中挑选最佳版本,后来还撤回了对第 2 题的乐观判断。OpenAI:Our First Proof submissions
First Proof 说明,研究级评测不能只报通过率:人类提示、尝试次数、计算量和事后改判都会影响能力解释;专家审核也可能跟不上模型生成速度;“模型觉得自己正确”没有意义,结果必须交给模型之外的裁判。
5. 2026 年 5 月:单点里程碑证明“陌生连接”确实能产生新数学
2026 年 5 月,OpenAI 的内部通用模型推翻延续近八十年的 Erdős 平面单位距离问题主流猜想,以代数数论和离散几何之间的陌生连接构造出多项式改进。OpenAI:单位距离猜想反例
九位数学家随后核查、简化并推广结果,区分模型生成的数学内容与人类借助 Codex 改善的表述。Alon 等:Remarks on the disproof of the unit distance conjecture
这个案例展示了理想的“第二棒”:专家不只盖章,还重写论证、追溯思想并解释人类为何错过这条路径。机器首先扩大的可能不是智慧深度,而是扫过问题清单的注意力广度。
6. 2026 年 8 月:Astra 把单点成果推成批量交付
2026 年 8 月 1 日,OpenAI 一次发布十项数学与理论计算机科学结果,称这些问题至少十年未见主要进展;寻找十项解法所耗 Token 按 Sol API 价格约合 2,000 美元。OpenAI:Ten advances in mathematics and theoretical computer science
交付物包括 249 页研究合集、62 页 Mathematical Discovery Notes和十套 Lean 4 证书。仓库固定 Lean 4.32.0、Mathlib 和 Lake,并提供统一构建及 Comparator 独立检查入口。
代码能够构建,只说明 Lean 接受了形式化陈述的证明项;它不自动证明自然语言问题被准确形式化,也不替代专家对新颖性、重要性、可读性和既有文献的检查。
截至 2026 年 8 月 2 日,十项结果发布仅一天,共同体尚无足够时间完成独立消化。OpenAI 也未披露模型参数、训练方法、候选问题总数、失败数、搜索时长或多智能体编排结构。约 2,000 美元只是成功结果所用 Token 按公开 API 价格的折算,不是研究计划全成本,更不能推出“每解决一个开放问题只要 200 美元”。
三、横向分析:五种“AI 数学家”其实在做五种工作
| 系统 | 主要工作 | 验证方式 | 最强生态位 | 当前边界 | |---|---|---|---|---| | OpenAI Astra | 从自然语言开放问题生成论文、思路说明和 Lean 证书 | 事后形式化并开放代码 | 跨领域发现与完整交付链 | 候选池、失败率、编排和独立复核披露不足 | | DeepMind AlphaProof Nexus | 搜索已形式化命题的 Lean 证明 | Lean 编译器反馈、多子代理与进化协调 | 大规模、可测量的正式证明搜索 | 依赖高质量形式化题目和 Mathlib 覆盖 | | Gemini Aletheia | 探索自然语言研究题并生成论证 | 自然语言 verifier 修订、重做或拒答 | 文献浏览、自我批评和低成本迭代 | 形式保证较弱,专家仍是最终裁判 | | Harmonic Aristotle | 将自然语言或形式命题转为 Lean 证明 | 专用 Lean 搜索、非形式推理和几何求解器 | 面向数学家的垂直工作台 | 研究广度、开放过程与规模证据待观察 | | DeepMind AlphaEvolve | 优化可编程、可自动评分的算法与构造 | 确定性 evaluator 与进化搜索 | 可执行算法和组合构造 | 不适合无法稳定定义评分函数的理论问题 |
1. Astra:通用模型的优势是跨过学科边界
Astra 的核心赌注是:通用模型先在非形式世界中发现结构,再把结果压进形式系统。它能横跨多个方向,也更可能组合不同领域的现成零件;代价是生成能力不等于准确归因、选题判断或人类可复用的理论组织能力。
2. AlphaProof Nexus:把证明搜索做成可测量的工程
AlphaProof Nexus 让多个子代理依据 Lean 反馈独立搜索,再以进化算法协调。其最强代理在尝试的 353 个开放 Erdős 问题中解决 9 个,在 492 个 OEIS 猜想中证明 44 个;单个 Erdős 问题推理成本为数百美元。Advancing Mathematics Research with AI-Driven Formal Proof Search
Nexus 的优势是可测量尝试数、成功数和成本;代价是自然语言开放问题必须先被正确形式化。Astra 把探索面铺宽后向形式系统收口,Nexus 从形式系统内部扩大搜索,两者更可能拼接而非互相取代。
3. Aletheia:让模型学会承认“这次没解出来”
Aletheia 由 Gemini Deep Think 生成候选解,再交给自然语言 verifier;小问题修订,严重问题重做,也可直接承认失败,并能借助 Google Search 和网页浏览核对文献。Google DeepMind:Gemini Deep Think for scientific discovery
Aletheia 覆盖编译器无法表达的方向错误、虚假引用和既有结果,但软反馈的确定性弱于 Lean。它更像可反复交互的研究助理;Astra 更像完成长程项目后集中交付论文与证书的研究团队。
4. Aristotle:专用系统把“可信”放在品牌中心
Harmonic Aristotle 结合非形式推理、Lean 证明搜索和专用几何求解,在 2025 年 IMO 达到金牌水平。Aristotle 论文
它的竞争单位不是一次榜单证明,而是能否把自然语言草稿稳定转成可读、可维护、可复用的 Lean 代码。专注有利于打磨数学工作流,但基础模型进步也可能削弱部分专用脚手架优势。
5. AlphaEvolve:只要能自动评分,就能把发现变成进化
AlphaEvolve 让 Gemini 生成程序,由自动 evaluator 运行评分,再以进化框架保留和变异候选,已用于数据中心、芯片设计、AI 训练、矩阵乘法和组合数学。Google DeepMind:AlphaEvolve
只要候选能写成代码且优劣可自动计算,它就能建立高速反馈循环;定义不稳定、价值依赖解释的开放理论问题则难以放进这个框架。终局系统很可能把 Astra 的跨域探索、Nexus 的形式搜索、Aletheia 的自我批评、Aristotle 的日常工作流和 AlphaEvolve 的自动评分压进同一循环。
四、横纵交汇:Astra 改变的不是证明,而是稀缺性的分配
1. Astra 今天的位置,是三次“绕路”共同塑造的
2022 年,OpenAI 在 Lean 内练习“生成—检查—再训练”;2025 年,通用推理模型绕开形式语言,在自然语言和跨学科知识中扩大探索;2026 年,它重新回到 Lean,但把形式化放到发现之后。
这不是路线摇摆,而是阶段分工:探索要扩大候选思路,验证要减少信任,发表要恢复可读性、文献归因和责任主体。Astra 的生态位正是连接这三段。
2. “Lean 通过”解决了逻辑问题,没有解决翻译问题
Lean 真正保证的是:在特定形式定义、公理和依赖库下,证明项能够推出被编码的命题。自然语言问题若在形式化时漏掉条件,证明仍可能完美通过;Comparator 可以降低实现层面的信任,却不能判断形式命题是否就是原问题。
Terence Tao 因此主张由人类编写或仔细审查定理陈述,并为微妙定义增加类似软件单元测试的例子。Terence Tao:AI 观点动态总结
证明通过是必要条件,不是论文获共同体接纳的充分条件;代码让复核可以开始,不等于复核已经结束。
3. 成本下降最快的环节,会把压力转移给旁边的人
如果约 2,000 美元大致反映成功候选解的 Token 成本,那么生成成本已骤降,审查成本却没有同步下降。模型可以批量产出格式完整的候选论文,即使只有少量正确,也足以淹没稀缺的专家审核能力。
Leiden Declaration on AI and Mathematics警告,自动系统可能生成貌似可信的错误论证,形式化与人类概念之间也可能错译;廉价草稿还会挤压审稿、归因和青年研究者训练。
Astra 的真实成本还包括核对定理陈述、运行独立检查、文献查重、组织理解,以及错误发生后的修正责任。OpenAI 此次明确由系统生成数学论证、人类协助手稿与形式化并承担正确性责任;这种安排未必是最终制度,但比笼统的“AI 辅助”更可审计。
4. 数学研究的价值,会从“产出证明”向“组织理解”移动
证明越丰富,理解越昂贵。机器接受的长证明未必产生可迁移直觉;仅用于确认命题为真的形式化,与可进入公共库、可读、模块化、可复用的形式化,服务于不同目标。
更稀缺的工作将是选出有生成力的问题、测试定义、把偶然奏效的证明压缩为概念、连接结果形成理论、准确归因,并决定哪些机器结果值得共同体继续投入。单位距离案例已有九位数学家接过“第二棒”;Astra 一次交出十项结果,把这种需求放大了十倍。
5. 三个未来剧本
最可能的剧本:验证分层,研究流程半自动化
未来一到两年,更可能出现分层流程,而非直接交付“自动数学家”:模型扫题和查文献,独立模型批评候选,Lean 等证明助手检查关键结论,人类审查形式陈述与原创性,最后整理高价值结果。大量结果会停在“机器通过但尚未人类消化”,少部分进入专家审阅,更少部分正式出版。
最危险的剧本:证明通胀,信任成为新的算力瓶颈
最危险的不是一个惊天错误,而是一百万个“看起来值得检查”的结果。若实验室不披露候选池和失败率,证书验证的是弱化或错译命题,模型重组旧证明却遗漏引用,少数专家又被迫承担验证,数学文献会充满公式、代码和论证俱全、贡献却无人能确认的稿件。
最乐观的剧本:机器扩大注意力,人类重建理论
最乐观的路径是让机器扫描长期无人照看的问题、发现跨语言旧文献、测试被主流审美放弃的路线并承担可形式化的重复劳动;人类转向提出新对象、连接结果、建立理论和解释重要性。若开放模型、公共算力、独立实验室和 Mathlib 资产同步建设,验证后的结果还能回流公共数学,继续降低研究成本。
五、结论:十个答案之后,真正的问题才刚出现
Astra 把通用模型的跨域搜索、形式系统的可执行证书,以及人类的整理、归因与责任连接起来,因此值得认真对待。
但发布仍缺候选问题总数、失败率、完整计算账单、模型与编排细节,独立专家也尚未完成逐项消化。Astra 已经把“机器能否贡献研究级数学”从争论题变成工程题;它还没有把“机器能否独立承担数学研究”变成肯定句。
证明正在变便宜。定义、理解、归因、选题和信任不会自动跟着降价。真正的问题是:怎样让更多证明增加理解,而不只是增加文件。
信息来源
- OpenAI:Ten advances in mathematics and theoretical computer science(访问时间:2026-08-02)
- OpenAI:Ten Advances 249 页研究合集(访问时间:2026-08-02)
- OpenAI:Mathematical Discovery Notes(访问时间:2026-08-02)
- OpenAI GitHub:ten-proofs Lean 4 证书仓库(访问时间:2026-08-02)
- Lean 官方文档:项目历史与可信内核(访问时间:2026-08-02)
- Lean 官方:Mathlib 研究与验证基础设施(访问时间:2026-08-02)
- OpenAI:Solving (some) formal math olympiad problems(访问时间:2026-08-02)
- Google DeepMind:AlphaProof 与 AlphaGeometry 2 的 IMO 2024 结果(访问时间:2026-08-02)
- Google DeepMind:Gemini Deep Think 的 IMO 2025 结果(访问时间:2026-08-02)
- OpenAI:Early experiments in accelerating science with GPT-5(访问时间:2026-08-02)
- OpenAI:Advancing science and math with GPT-5.2(访问时间:2026-08-02)
- OpenAI:Our First Proof submissions(访问时间:2026-08-02)
- OpenAI:An OpenAI model has disproved a central conjecture in discrete geometry(访问时间:2026-08-02)
- Alon 等:Remarks on the disproof of the unit distance conjecture(访问时间:2026-08-02)
- Tsoukalas 等:Advancing Mathematics Research with AI-Driven Formal Proof Search(访问时间:2026-08-02)
- Google DeepMind:Gemini Deep Think for scientific discovery(访问时间:2026-08-02)
- Harmonic:Aristotle: IMO-level Automated Theorem Proving(访问时间:2026-08-02)
- Google DeepMind:AlphaEvolve(访问时间:2026-08-02)
- Terence Tao:AI 观点动态总结(访问时间:2026-08-02)
- Leiden Declaration on Artificial Intelligence and Mathematics(访问时间:2026-08-02)