当证明变得廉价:OpenAI Astra 如何把数学研究推进到“生成—形式化—追责”流水线
2026-08-02
选定主题:OpenAI Astra 批量生成并形式化十项数学与理论计算机科学研究结果。
今日触发:OpenAI 于 8 月 1 日公开一份 249 页研究合集、逐项推理说明和十套 Lean 4 证书,称其内部版 Astra 生成了十项至少十年未见主要进展的问题成果;寻找这些解法所耗 Token 按 Sol API 价格约合 2,000 美元。人类参与整理手稿并承担正确性责任,Astra 尚未公开发布。
一、一句话定义
Astra 这次最重要的变化,不是又把数学榜单往上推了几分,而是把前沿数学研究做成了一条可以观察的流水线:模型寻找论证,人机共同整理成论文,模型再将论证写成 Lean 证书,最后由人类公开说明贡献边界、解释过程并承担责任。
这条链还远未等于“自动数学家”。但它已经把问题从“模型会不会做题”,推到了更难的一层:当候选证明可以低成本批量生成、并通过机器逐步检查时,数学共同体究竟要把稀缺注意力放在哪里?
答案不再只是证明。
二、纵向分析:从会写 Lean,到批量交付研究结果
1. 2013—2021:先造一台不相信任何人的检查器
Astra 的故事不能从大模型开始讲,得从 Lean 开始。
2013 年,Leonardo de Moura 在微软研究院启动 Lean;2014 年发布 0.1 版。Lean 的设计目标里有一条后来变得格外关键:用尽可能小、可以独立实现的逻辑内核检查证明,同时把自动化工具留在可信内核之外。一个证明可以由人写,也可以由模型写,甚至可以由一套非常复杂、根本不值得信任的搜索系统写。只要最后交给小内核的证明项通过检查,结论就在已声明公理和定义之下成立。Lean 官方历史
这和普通的自然语言审稿不一样。审稿人读一段漂亮的论证,会判断作者有没有跳步、偷换概念、遗漏边界。Lean 则不欣赏漂亮。缺一个类型、少一个条件、调用不了前置定理,证明就停在那里。
但检查器只是半座桥。另一半是 Mathlib。
数学家不会为了证明一个新定理,从自然数加法重新搭起。Mathlib 把定义、引理、策略和不同分支的形式化知识组织成可复用的公共库。Lean 3 时代,它已有超过一百万行形式化数学;迁移到 Lean 4 后继续增长。Polynomial Freiman–Ruzsa 猜想形式化和 Liquid Tensor Experiment 等项目说明,这套基础设施不再只适合课本习题,已经能承载研究前沿。Mathlib 官方介绍
这段看似与 Astra 很远的历史,其实决定了今天的竞争位置。Astra 能在一天里发布十套证书,不只是因为模型更会推理,也因为十余年公共基础设施把“可验证数学”的固定成本提前支付了。它借用的不是一个工具,而是一整片由研究机构、开源维护者和数学家铺出来的知识地基。
2. 2022:OpenAI 第一次把语言模型接进证明搜索
2022 年 2 月,OpenAI 发布神经定理证明器。它面对的是已经被翻译成 Lean 的命题,通过语言模型生成 tactic 和数学项,再由 Lean 判断每一步是否成立。系统在 miniF2F 上把当时的最好成绩从 29.3% 推到 41.2%,也解出了一批 AMC、AIME 以及两个改编自 IMO 的问题。OpenAI:Solving (some) formal math olympiad problems
这时的模型处在一个非常整洁的世界里:题目已经形式化,成功与失败都有确定反馈。OpenAI 采用 statement curriculum learning,把不同难度但没有证明的命题放进训练集。模型先解容易题,将新找到的证明变成训练数据,反复八轮,逐渐够到更难的问题。
它解决的是“给定一个精确命题,如何在无限大的 tactic 空间里找到一条通路”。它还没有负责决定真正的问题是什么,也没有处理研究论文里大量含混的定义、背景和价值判断。
但一条路线已经出现:语言模型负责提出可能的下一步,形式系统负责冷酷地说“不”。生成与验证不是两个互相替代的阵营,而是一对分工明确的齿轮。
3. 2024—2025:两条路线分叉,又重新汇合
2024 年,Google DeepMind 的 AlphaProof 与 AlphaGeometry 2 在 IMO 上拿到相当于银牌的 28 分。AlphaProof 把预训练语言模型与 AlphaZero 式强化学习结合,在 Lean 中搜索证明。代价也很清楚:专家要先把自然语言题目手工翻译成形式语言,再把结果翻回去;部分题目耗时达到三天。Google DeepMind:IMO 2024 银牌结果
一年后,路线发生了一次有意思的折返。2025 年 IMO,Gemini Deep Think 直接读取官方自然语言题面,在 4.5 小时内解出六题中的五题,拿到 35 分。形式化翻译的瓶颈暂时被绕开,模型依靠 parallel thinking 同时探索、合并多条思路,由 IMO 组织者按人类标准评分。Google DeepMind:IMO 2025 金牌结果
形式系统擅长保证结论,通用模型擅长在自然语言、文献和不同领域之间移动。2024—2025 年的变化不是形式化路线被自然语言路线淘汰,而是行业终于看清:研究级数学需要两者来回切换。探索阶段必须容忍模糊、类比和失败;交付阶段又必须收紧到定义、引理和可检查步骤。
OpenAI 同期也从“专用 Lean 证明器”转向通用推理模型。2025 年 7 月,其未公开通用模型在 IMO 获得 35/42;11 月发布 GPT-5 科学协作案例,模型开始承担文献检索、证明思路、反例和跨领域联想。报告同时记录了一个不那么光彩、却更有价值的案例:GPT-5 给出一个正确而漂亮的编码理论论证,却没有主动指出同样的证明早已发表,直到新会话被追问才找到原文。OpenAI:Early experiments in accelerating science with GPT-5
正确性和原创性,从这里正式分家。
一个证明可以对,却不新;可以新,却没有被放到正确的历史位置;也可以在自然语言里看似完整,到了形式化时才暴露定义错位。研究不是把“答案正确”放大一千倍,它还包含选题、归因、解释和共同体判断。
4. 2025 年末—2026 年初:从比赛题迈向开放问题
2025 年 12 月,OpenAI 披露 GPT-5.2 Thinking 在 FrontierMath Tier 1—3 上解出 40.3%,并给出一个统计学习理论案例:研究者直接把未解问题交给 GPT-5.2 Pro,没有提供证明大纲,模型给出解法后再由作者和外部专家审查,还将结果推广到更高维和其他统计模型。OpenAI:Advancing science and math with GPT-5.2
这一步仍然是“人类提出一个问题,模型贡献一段关键研究”。真正把压力推高的是 2026 年 2 月的 First Proof。
First Proof 发布十个来自不同专业领域的研究级问题,目的不是考短答案,而是看模型能否生成完整、可核查的论证。OpenAI 用训练中的内部模型全部尝试,最初判断至少五份大概率正确。团队也坦白:过程包含人类建议重试某些策略、依据专家反馈让模型扩写,以及从数次尝试中人工挑选最好版本。更重要的是,OpenAI 后来根据官方评论和社区分析撤回了对第 2 题的乐观判断。OpenAI:Our First Proof submissions
First Proof 给后来者留下三件东西。
第一,研究级评测不能只报一个通过率。人类提示了什么、挑了几次、用了多少计算、哪些问题事后改判,都会改变对能力的解释。
第二,专家审核速度可能赶不上模型生成速度。十份跨学科证明看似不多,但每一份都要求极少数真正懂该子领域的人花时间消化。
第三,“模型觉得自己正确”没有意义。一个系统必须把结果交给模型之外的裁判。
5. 2026 年 5 月:单点里程碑证明“陌生连接”确实能产生新数学
5 月,OpenAI 的内部通用模型推翻 Erdős 平面单位距离问题中延续近八十年的主流猜想。它构造出一族点集,使单位距离数量获得多项式改进。OpenAI 称模型不是为数学专训,没有为该问题搭建特定搜索脚手架;外部数学家随后核查结果。OpenAI:单位距离猜想反例
这个案例比比赛成绩更接近真正的研究,因为问题的难处不只是沿已知套路推演。模型把离散几何与代数数论中的材料接到一起,走了一条人类专家可能因学科分工而错过的路。九位数学家随后写出人类消化、简化并推广的版本,明确区分“模型最初生成数学内容”与“人类借助 Codex 改善表述”。Alon 等:Remarks on the disproof of the unit distance conjecture
这份人类版论文比一条“AI 解开八十年难题”的新闻更重要。它展示了理想中的第二棒:模型发现候选结果之后,专家没有只盖章,而是重写、解释、追溯思想来源,并讨论为什么人类之前没有走这条路。
Daniel Litt 在文中点出一种可能的机制:当前最有效的自动数学系统会扫过整份问题清单,解出其中一部分;人类数学家则受兴趣和职业分工影响,只能长期盯住少数问题。机器增加的首先不是智慧的深度,而是注意力的广度。
6. 2026 年 8 月:Astra 把单点成果推成批量交付
8 月 1 日,数量级变了。
OpenAI 一次发布十项结果,覆盖高维球堆积、二进制与球面码、非 sofic 群、Connes 刚性猜想、算术电路复杂度、量子并行重复、最近向量问题、Ehrhart 体积猜想、多色 Ramsey 数和极值图论。官方称,这些问题的主要结论至少十年没有进展,多数更久;寻找十项解法所需 Token 按 Sol API 价格约合 2,000 美元。OpenAI:Ten advances in mathematics and theoretical computer science
结果不是十条摘要,而是三种相互咬合的交付物:249 页论文、62 页“思路如何形成”的说明、十个 Lean 4 文件。代码仓库固定了 Lean 4.32.0、Mathlib 和 Lake,提供一条命令构建全部形式化,也给出 Comparator 独立检查入口。OpenAI ten-proofs 仓库
其中几项如果经共同体消化后站得住,分量很重。球堆积章节称给出 1978 年以来一般高维球堆积指数的首次改进;群论章节声称构造首个显式非 sofic 群;复杂度章节给出 permanent 的新下界;密码学相关章节给出欧氏最近向量问题的多项式因子近似困难性。
但 8 月 2 日这个时间点必须守住事实边界:代码能构建,说明 Lean 接受了形式化陈述的证明项;它不自动证明自然语言里的问题被形式化得毫无偏差,也不替代各领域专家对新颖性、重要性、可读性和已有文献的检查。十项结果发布仅一天,除 OpenAI 自己承担责任外,数学共同体还没有足够时间完成类似单位距离案例那样的独立消化。
还有一个细节需要纠正日报可能带来的想象:OpenAI 的公开页面披露了 Astra 是“下一代主要模型”的内部版本,却没有公开模型参数、训练方法、候选问题总数、失败数、搜索时长或多智能体编排结构。约 2,000 美元是成功结果所用 Token 按公开 API 价格的折算,不是整个研究计划的全成本,也不能据此计算“每解决一个开放问题只要 200 美元”。
数字很诱人,但分母还藏在幕后。
三、横向分析:四种“AI 数学家”其实在做四种工作
如果只看宣传标题,Astra、AlphaProof、Gemini Aletheia、AlphaEvolve 和 Harmonic Aristotle 都像在“用 AI 做数学”。放到同一张切面里,它们解决的却不是同一道题。
| 系统 | 主要输入与产物 | 验证方式 | 最强生态位 | 当前短板 |
|---|---|---|---|---|
| OpenAI Astra | 自然语言开放问题;论文、思路说明、Lean 证书 | 事后形式化,开放代码供复核 | 通用模型跨领域发现,单次覆盖十个研究方向 | 候选池、失败率、编排和独立复核尚未披露完整 |
| DeepMind AlphaProof Nexus | 已形式化命题;Lean 证明 | Lean 编译器反馈,多子代理与进化协调 | 大规模、可度量的正式证明搜索 | 依赖高质量形式化题目与 Mathlib 覆盖 |
| Gemini Aletheia | 自然语言研究题;自然语言论证 | 独立自然语言 verifier 反复生成、修订或拒答 | 文献浏览、开放问题探索、低成本迭代 | 人类专家仍是最终裁判,形式保证较弱 |
| Harmonic Aristotle | 自然语言与形式命题;Lean 证明 | 专用 Lean 搜索、非形式推理和几何求解器 | 把形式证明能力做成面向用户的垂直产品 | 研究广度、开放过程和规模证据仍需长期观察 |
| DeepMind AlphaEvolve | 可写成程序并自动打分的问题;算法与构造 | 确定性 evaluator + 进化搜索 | 算法优化、组合构造、可执行科学问题 | 不适合无法写成评分函数的开放理论问题 |
1. Astra:通用模型的优势是跨过学科边界
Astra 的核心赌注不是“我比专用证明器更会 Lean”,而是“一个足够强的通用模型可以先在非形式世界里发现结构,再把结果压进形式系统”。
这解释了十项结果为什么横跨八个方向。通用模型训练中接触过代码、论文、教材和不同领域的表达方式,更容易尝试人类专家觉得陌生、笨重或不合审美的组合。单位距离案例已经给过一次预演:模型并非创造一套全新的数学,而是把分散在代数数论和离散几何中的现成零件接成一条此前无人完成的链。
它的短板也由同一个历史选择带来。通用模型擅长生成,未必擅长记清思想来自哪里;擅长扫问题列表,未必知道什么问题值得一个共同体投入十年;能写出通过检查的证书,也未必自动生成适合人类继续使用的理论结构。Astra 的 62 页思路说明和责任声明,正是在补通用模型最容易欠下的账。
2. AlphaProof Nexus:把证明搜索做成可测量的工程
DeepMind 2026 年公布的 AlphaProof Nexus 走得更“形式优先”。系统让多个子代理在 Lean 编译器反馈下独立搜索,再用进化算法协调;其最强代理在尝试的 353 个开放 Erdős 问题中解决 9 个,在 492 个 OEIS 猜想中证明 44 个,单个 Erdős 问题的推理成本为数百美元。Advancing Mathematics Research with AI-Driven Formal Proof Search
这条路线的优点是可测。研究者知道尝试了多少题、解出多少题、不同代理结构成本如何变化,也能让 Lean 对每一步提供密集反馈。它很像把搜索引擎搬进一个不会撒谎的迷宫:路径可以成千上万,但出口条件不含糊。
代价是入口昂贵。开放问题往往没有现成的 Lean 陈述,甚至连定义都存在多个传统。把自然语言问题变成正确、可复用的形式对象,本身就是研究劳动。形式证明搜索越强,这个入口越容易成为新瓶颈。
Astra 与 Nexus 不是简单的强弱关系。一个把探索面铺宽,再向形式系统收口;另一个从形式系统内部出发,把搜索规模做大。未来更可能出现两者拼接,而不是一方消灭另一方。
3. Aletheia:让模型学会承认“这次没解出来”
DeepMind 的另一条线 Aletheia 更接近研究助理。它由 Gemini Deep Think 驱动,生成候选解后交给自然语言 verifier;小问题进入修订,严重问题退回重做,也可以直接承认失败。系统还能用 Google Search 和网页浏览核对文献。Google DeepMind:Gemini Deep Think for scientific discovery
这套架构针对的是研究环境里一个朴素问题:错误反馈并不总能写成编译器报错。证明思路可能方向不对,引用可能并不存在,结论可能早已被人做过。Aletheia 用另一个推理过程提供软反馈,覆盖面比 Lean 广,确定性却更弱。
对用户来说,它更像一个愿意反复改稿、也愿意认输的研究搭档。Astra 则更像一支在内部跑完项目后,一次性交付论文与证书的研究团队。前者强调交互过程,后者用发布成果证明长程能力。两者最终都绕不开外部专家,因为 verifier 仍可能与 generator 共享盲区。
4. Aristotle:专用系统把“可信”放在品牌中心
Harmonic 的 Aristotle 从成立起就围绕数学推理与形式验证建设。它把非形式推理、Lean 证明搜索和专用几何求解结合,在 2025 年 IMO 达到金牌水平。Aristotle 论文
与大实验室把数学作为通用模型能力样板不同,Harmonic 必须让数学家愿意在日常工作中使用产品。它的优势是专注:交互、证明搜索、形式化和领域工具可以围绕数学用户打磨。它也面临垂直产品常见的约束:基础模型进步可能迅速抹平某些专用脚手架优势,而广度、算力与分发又很难同通用模型平台硬碰硬。
用户选择 Aristotle 的真实理由,不会只是“它在榜单上更高”,而是它能否把一份自然语言草稿稳定地变成可读、可维护、可复用的 Lean 代码。这里的竞争单位不是一次证明,而是研究者每天少花多少时间对付形式化细节。
5. AlphaEvolve:只要能自动评分,就能把发现变成进化
AlphaEvolve 走的是另一条窄而锋利的路。Gemini 模型生成程序,自动 evaluator 运行并评分,进化框架保留更有希望的候选继续变异。它已经用于数据中心、芯片设计、AI 训练、矩阵乘法和组合数学。Google DeepMind:AlphaEvolve
它不必先证明一段自然语言论证,只要候选解能写成代码,并且好坏可以自动计算,就能建立极快反馈循环。这使它在“找一个更优构造”“改进一个可执行算法”上格外强,却难以直接处理定义尚不稳定、价值依赖解释的理论问题。
把五条路线摆在一起,竞争图谱就清楚了:
- Astra 争的是跨领域发现的广度,以及从自然语言到正式交付的完整链条;
- AlphaProof Nexus 争的是形式证明搜索的规模、成本和可复现性;
- Aletheia 争的是开放研究中的自我批评与人机交互;
- Aristotle 争的是数学家的日常工作台;
- AlphaEvolve 争的是所有能被自动 evaluator 包住的问题。
真正的终局系统,大概率会把这五种能力压进同一个循环。
四、横纵交汇:Astra 改变的不是证明,而是稀缺性的分配
1. Astra 今天的位置,是三次“绕路”共同塑造的
回看时间线,Astra 的优势来自三次看似反复的路线选择。
2022 年,OpenAI 在 Lean 内部练会了“生成—检查—再训练”;2025 年,通用推理模型绕开形式语言,获得在自然语言和跨学科知识里大范围探索的能力;2026 年,它又回到 Lean,把形式化放在发现之后,而不是之前。
这不是技术路线摇摆,而是研究过程被拆成了不同阶段。探索阶段要最大化候选思路,不宜过早受形式语法束缚;验证阶段要最小化信任,不能继续靠模型的自信;发表阶段则要恢复人类可读性、文献归因和责任主体。
Astra 今天占据的生态位,正是这三段之间的连接处。
2. “Lean 通过”解决了逻辑问题,没有解决翻译问题
形式证书很容易被误读成终极裁判。它真正保证的是:在某套形式定义、公理和依赖库之下,给定证明项能推出被编码的命题。
最危险的错误可以发生在检查器开工之前。自然语言问题被形式化时漏掉一个条件,证明依然可能完美通过。Comparator 等独立内核可以降低实现层面的信任,却不能自动判断“形式命题是不是我们原来想问的那个问题”。Terence Tao 因此主张由人类编写或仔细审查定理陈述,并给微妙定义添加类似软件单元测试的例子。Terence Tao:AI 观点动态总结
这也是为什么 Astra 的十项结果还需要逐领域专家检查。证明通过是必要条件,却不是论文被共同体接纳的充分条件。8 月 1 日发布的代码让复核可以开始,不等于复核已经结束。
3. 成本下降最快的环节,会把压力转移给旁边的人
如果 2,000 美元的折算大致反映候选解生成成本,那么前沿数学第一次面对一种软件行业熟悉的现象:生成成本骤降,审查成本没有同步下降。
过去,一个长证明能被写出来,本身就过滤掉大量不成熟想法。现在这道过滤器变弱了。模型可以不断扫开放问题数据库,生成格式完整、语言流畅的候选论文。哪怕其中只有少量正确,也足以淹没专家审查能力。
Leiden Declaration 的担心正落在这里:自动系统不仅会产出貌似可信却错误的论证,形式化与人类概念之间的翻译也会出错;廉价草稿还可能挤压审稿、归因和青年研究者训练。Leiden Declaration on AI and Mathematics
所以,Astra 的真实成本不能只算 Token。还要算:谁核对定理陈述,谁跑独立检查,谁做文献查重,谁把 249 页证明变成可理解的思想,谁在错误出现时承担撤稿和修正责任。
OpenAI 这次至少正面回答了最后一个问题。官方没有给模型安上人类作者身份,而是说明数学论证由系统生成,人类协助准备手稿与形式化,并由人类承担正确性责任。这种安排未必是最终制度,但比模糊写成“AI 辅助”更可审计。
4. 数学研究的价值,会从“产出证明”向“组织理解”移动
证明一旦丰富,理解反而变贵。
一个 20 万行、机器完全接受的证明,可能几乎不给人类留下可迁移的直觉。Tao 区分了不同质量层级的形式化:有些只为确认一个命题为真,有些则要进入公共库,要求人类可读、模块化、可复用。两者都有效,但它们服务的不是同一目标。
这会重新定义数学家的工作。
更稀缺的能力将包括:挑选真正有生成力的问题;设计能暴露错误的定义测试;把一条偶然奏效的证明压缩成可复用的概念;判断不同结果之间是否指向一套新理论;给思想找到准确来源;决定哪些机器结果值得整个共同体继续投入。
单位距离案例之所以完整,不只因为模型找到了反例,而是九位数学家随后把它消化成人类可以争论、推广和继承的数学。Astra 一次交出十项结果,等于把这种“第二棒”需求放大十倍。
5. 三个未来剧本
最可能的剧本:验证分层,研究流程半自动化
未来一到两年,头部实验室不会直接交付一个“自动数学家”,而会把流程拆成等级:模型扫题与查文献,独立模型批评候选,Lean 或其他证明助手检查关键结论,人类专家审查形式陈述和原创性,最后再把高价值结果整理成论文。
不是每个候选结果都值得 249 页手稿。大量结果会停在“机器通过但尚未人类消化”一层,少部分进入专家快速审阅,更少部分进入正式出版。期刊、开放问题数据库和预印本平台会新增机器生成披露、证书构建状态、独立复核人与撤回记录。
这个剧本最符合现有路径:OpenAI 的 Astra 发布包、DeepMind 的 generator-verifier 循环、AlphaProof Nexus 的批量搜索,正在从不同方向拼出同一条生产线。
最危险的剧本:证明通胀,信任成为新的算力瓶颈
危险不一定来自模型给出一个惊天动地的错误,而可能来自一百万个“看起来值得检查”的结果。
若实验室只公开成功样本,不披露候选池与失败率;若形式证书只检查了弱化或错译的命题;若模型在训练语料中重组旧证明却遗漏引用;若少数专家被迫替商业系统免费承担验证,数学文献会出现一种新型污染:每篇稿子都有像样的公式、代码和论证,却没人有时间确认它究竟贡献了什么。
这时,Lean 反而可能制造虚假的心理安全感。证书是真的,标题却夸大;证明成立,原创性却不存在;命题重要,解释却无法复用。
最乐观的剧本:机器扩大注意力,人类重建理论
更好的可能是,Astra 这类系统承担数学中长期无人照看的部分:扫描数千个开放问题,发现跨语言旧文献,测试被主流审美过早放弃的路线,把可形式化的重复劳动交给机器。人类则把时间用在提出新对象、连接结果、建立理论和解释为什么某个证明重要。
如果同时建设开放模型、公共算力、独立实验室和可复用的 Mathlib 资产,机器发现就不会只沉淀为少数公司的封闭优势。每一份被验证和整理的结果还能反过来扩充形式知识库,降低下一次研究的成本。
这是最乐观的闭环,也是最难建立的制度:公共数学提供训练与验证基础,商业模型产生结果,结果又必须公平地回流公共数学。
五、结论:十个答案之后,真正的问题才刚出现
Astra 的十项结果值得认真对待,原因不在“AI 又赢了”。它把过去四年的几条线真正接了起来:通用模型负责陌生连接和大范围搜索,形式系统把正确性压到可执行证书,人类把结果整理为共同体可读的论文,并公开承担责任。
但这次发布也留下了同样重要的空白:没有候选问题总数,没有失败率,没有完整计算账单,没有模型和编排细节,独立专家还没有时间逐项完成类似单位距离案例那样的消化。
我的判断是,Astra 已经把“机器能否贡献研究级数学”从争论题变成工程题;它还没有把“机器能否独立承担数学研究”变成肯定句。
证明正在变便宜。定义、理解、归因、选题和信任不会自动跟着降价。
十个答案摆在桌上之后,数学共同体真正要回答的是:怎样让更多证明增加理解,而不是只增加文件。
信息来源
- OpenAI:Ten advances in mathematics and theoretical computer science(访问时间:2026-08-02)
- OpenAI:Ten Advances 249 页研究合集(访问时间:2026-08-02)
- OpenAI:Mathematical Discovery Notes(访问时间:2026-08-02)
- OpenAI GitHub:ten-proofs Lean 4 证书仓库(访问时间:2026-08-02)
- Lean 官方文档:项目历史与可信内核(访问时间:2026-08-02)
- Lean 官方:Mathlib 研究与验证基础设施(访问时间:2026-08-02)
- OpenAI:Solving (some) formal math olympiad problems(访问时间:2026-08-02)
- Google DeepMind:AlphaProof 与 AlphaGeometry 2 的 IMO 2024 结果(访问时间:2026-08-02)
- Google DeepMind:Gemini Deep Think 的 IMO 2025 结果(访问时间:2026-08-02)
- OpenAI:Early experiments in accelerating science with GPT-5(访问时间:2026-08-02)
- OpenAI:Advancing science and math with GPT-5.2(访问时间:2026-08-02)
- OpenAI:Our First Proof submissions(访问时间:2026-08-02)
- OpenAI:An OpenAI model has disproved a central conjecture in discrete geometry(访问时间:2026-08-02)
- Alon 等:Remarks on the disproof of the unit distance conjecture(访问时间:2026-08-02)
- Tsoukalas 等:Advancing Mathematics Research with AI-Driven Formal Proof Search(访问时间:2026-08-02)
- Google DeepMind:Gemini Deep Think for scientific discovery(访问时间:2026-08-02)
- Harmonic:Aristotle: IMO-level Automated Theorem Proving(访问时间:2026-08-02)
- Google DeepMind:AlphaEvolve(访问时间:2026-08-02)
- Terence Tao:AI 观点动态总结(访问时间:2026-08-02)
- Leiden Declaration on Artificial Intelligence and Mathematics(访问时间:2026-08-02)