AI科研范式革命:花200美元即可攻克一道数学世纪难题

AGI
科研的边际成本从百万美元级降至百元级,重新定义成本结构往往意味着产业变革的开始。

OpenAI日前确认,其下一代模型Astra以约2000美元推理成本攻克了十道数学与理论计算机科学前沿难题,全部成果通过Lean形式化验证,代码开放在GitHub仓库中。这些难题涵盖高维球堆积、编码理论、群论、量子复杂性和极值组合学等多个领域,每道题学术积压均超十年。

需要说明的是,这十道题是从多次尝试中筛选出的成功案例。

据OpenAI披露,模型在早期探索阶段存在大量失败,GPT-5.2 Pro对Erdős问题的一次通过率仅1%-2%。Astra呈现的是“成功精选集”,而非无差别的全面碾压。

即便如此,Astra交出的成绩单仍然是一道分水岭:AI已从“解已知答案的题”跨越为“产出人类也未知的原创证明”。AI不再是科研的“助手”,而是科研的“参与者”。此次重塑基础科学发现范式的不是单一技术突破,是形式化验证、多智能体协同与成本崩塌三股力量的交汇。

从“解题”到“发现”

要理解Astra十题意味着什么,必须回溯AI数学能力的进化曲线。

2025年10月,OpenAI宣称GPT-5解决了十个Erdős问题,但随后被澄清——GPT-5所做的不是原创证明,而是文献搜索,在已有论文中找到了未被数据库收录的解答。AI擅长检索,不证明AI擅长创造。

转折发生在2026年1月。软件工程师Neel Somani使用GPT-5.2 Pro在短时间内生成了一份Erdős问题#397的原创证明,经Harmonic的Aristotle系统完成Lean形式化验证,菲尔兹奖得主陶哲轩亲自确认该证明为此前文献中不存在的新论证。随后问题#728和#729也在此后数日内相继被攻克。

今年5月20日,OpenAI内部通用推理模型推翻了平面单位距离问题的核心猜想,一个自1946年提出、近80年无人撼动的离散几何命题。AI找到了一族反例,核心思路借用了代数数论领域的Golod-Shafarevich定理,实现了多项式级别的改进。菲尔兹奖得主Tim Gowers称之为“AI数学的里程碑”。

从GPT-5的“查资料”到GPT-5.2的“原创三题”,再到5月模型“推翻80年猜想”,最后到Astra的“2000美元横扫十题”,八个多月的时间,AI完成了从“图书馆管理员”到“独立研究者”的跃迁。

AI数学能力进化时间线,从文献检索到独立发现,八个月完成角色跃迁

  • 多智能体协同:从“一人解题”到“团队作战”

Astra的核心不是参数规模更大,而是组织方式根本不同。据报道,Astra可以让多个智能体协同工作,拆分复杂任务、分配子目标、相互校验,并在数小时甚至数天内持续推进。十个开放问题不是由一个模型一口气推导出来的,而是由一个协调者将问题拆解为子命题,分配给不同专长的子智能体并行执行,再由验证智能体筛选、合并、检查逻辑一致性。

这一流程与人类数学研究团队的组织方式高度同构。Anthropic的Managed Agents、OpenAI的Agents SDK、微软Agent Framework 1.0、LangChain的supervisor-as-tool,四家主流厂商的共识是:让多个AI自由讨论不是最优方案,一个管理者分配任务、多个执行者交付结果才是。

  • 全球共振:不止OpenAI一家

Astra并非孤例。Google DeepMind的AlphaProof Nexus自主解决了9个Erdős开放问题,其中最早一题已困扰学界56年,单题成本最低仅7.5美元。北京大学AI4Math团队采用双智能体框架(Rethlas+Archon)推翻Anderson猜想,完成国内首次由AI自主解决数学开放问题并完成大规模形式化验证,生成了约19000行Lean代码。Math Inc的Gauss在5天内完成了8维(E8)情形的球堆积定理形式化,随后再用约一周完成24维(Leech格)情形,总计产出约20万行Lean代码(经优化后),原人类团队估计剩余工作量需6个月。

此外,Anthropic、字节跳动Seed-Prover、月之暗面Kimina-Prover、DeepSeek-Prover-V2等系统也在各自方向推进神经定理证明的自动化。形式化推理赛道已经形成全球性竞争格局。

如果说上述突破展示了AI“能做数学”的能力,那么下一个问题就是:我们如何信任AI产出的数学结果?这正是Lean形式化验证所要回答的。

信任锚点

如果没有Lean,以上所有突破都缺少一个关键环节——可验证性。

Lean是一种交互式定理证明器,由微软研究院开发,将数学证明写成可被计算机逐行检查的代码。不同于传统学术论文依赖同行评议的主观判断,Lean验证是二进制的,要么编译通过,要么报错。一旦一个证明在Lean中“编译”成功,它就不需要人类相信它,它本身就是正确的。Astra十项成果的GitHub仓库中“sorry”计数为零,意味着形式化证明中无任何步骤遗漏或未证。

大语言模型的“虚假推理”问题在科研场景中是一个不可忽视的风险:同行评议精力、复现预算、沿着错误方向继续深挖的研究周期,都可能被“看起来对”的AI生成论文无声吞噬。Lean提供了独立于AI的“终极裁判”系统,人类不需要逐行审阅AI产出的数千行推理,只需确认Lean编译器通过了即可。

产业界已率先为形式化验证买单。在芯片验证领域,25岁华人创业者洪乐潼创立的Axiom Math,据公司披露其AxiomProver系统在2025年12月Putnam数学竞赛中获得满分12/12的成绩,公司于2026年3月以超16亿美元估值完成2亿美元A轮融资。在密码学领域,形式化验证正在被用于后量子密码原语的安全性证明。在生物医药领域,形式化推理框架向“靶点-疾病”因果链推演的迁移也已进入早期探索阶段。

Lean形式化验证生态关键指标,Mathlib已积累超27万条已形式化定理

据Mines Paris PSL官方数据,Lean数学库Mathlib已积累约210万行代码、超27万条已形式化的定理。Meta的ATLAS项目消耗1830亿token,将26本数学教材翻译为Lean代码库。让机器自动检查“是不是对的”的能力,正在从增值功能变成基础设施。

形式化验证解决了“可信度”问题,但另一个更根本性的变化正在发生,科研的成本结构正在被重写。

成本崩塌:从百万美元到两百美元

2000美元这个数字,是Astra故事中最具冲击力的细节,但需要明确的是,这仅指推理算力的边际成本,不包括模型训练(数亿美元级)、基础设施投资以及人类研究者的选题与验证时间。

即便如此,边际成本的下降幅度仍然惊人。传统数学研究中,一个Erdős级别的开放问题可能需要一位顶尖数学家耗费数年甚至数十年,背后是终身教职的薪资、研究经费、博士生培养费用,折算成本在百万美元量级以上。Astra以2000美元攻克十题,平均每题200美元,约相当于一个初级软件工程师一周的工资

这是成本结构的崩塌。

成本下行趋势同样值得关注。2026年5月单位距离问题,推理成本约1000美元。2026年8月Astra十题合计2000美元,平均每题200美元。同期DeepMind AlphaProof Nexus单题成本最低仅7.5美元。同代模型的推理优化、专用硬件普及、多智能体架构对token利用效率的提升,都将在Astra发布后继续压缩这个数字。

AI数学难题推理成本下降趋势,从单题1000美元降至7.5美元

当解决一个前沿数学猜想的边际成本降到200美元以下,“只有天才数学家才能做前沿数学”这个隐含前提开始松动。

  • 密码学冲击波

成本下降最直接的连锁反应发生在密码学领域。7月28日,Anthropic披露Claude Mythos Preview在约60小时、10万美元成本内,发现了NIST后量子签名候选算法HAWK-256的格结构对称性缺陷,将密钥恢复的理论工作量从2的64次方降至2的38次方。次日,HAWK开发者宣布从NIST标准化进程中撤回该方案。

这不是量子计算机攻破RSA,这是纯粹由AI推理能力驱动的密码分析,不需要量子比特,不需要超低温冷却。当多智能体系统能以200美元一题的边际成本求解开放数学问题时,密码学家面临的不再是“AI能不能找到漏洞”,而是“低成本密码分析何时平民化”。

  • 科研预算结构重配

科研能耗正从实验密集型转向推理密集型。高校计算中心的采购清单将从“更多GPU”扩展为“更多能跑形式化推理管线的算力配额”。OpenAI于7月29日推出的“ChatGPT学术研究者计划”向十万名科学家免费提供前沿模型访问权限,承诺到2027年前投入2.5亿美元——表面上是公益,本质上是在下一代科研范式中抢占用户习惯。

成本的急剧下降正在将一个问题推向台前:当AI能够以极低成本产出数学成果时,数学家自身的存在价值又该如何定义?

科学家从“证明者”走向“提问者”

6月2日,国际数学联盟(IMU)正式背书《莱顿人工智能与数学宣言》。截至撰写时,该宣言已获超过3000人签署,陶哲轩称其为“必要框架”,多位菲尔兹奖得主也已签署。《自然》杂志于6月18日发表社论全面支持,呼吁其他学科效仿。

宣言指出AI对数学的五大威胁:不可靠结果、归属缺失、依赖不平等、过度炒作、自主性丧失。OpenAI在其Astra报告中回应了这些关切,承认AI有“贡献”,既不是把AI当成无生命的工具,也不是赋予AI作者身份,而是把人类放在“最终承担责任”的位置。

  • AI的边界与科学家的新定位

Astra解决的是“证明一个长期猜想是否成立”的证明型突破。而“提出一个全新交叉方向、需要直觉跳跃的猜想”的概念型突破,依然是人类最稀缺的能力。不过,单位距离问题的突破也展示了AI超出预期的跨域联想能力,它将代数数论的Golod-Shafarevich理论应用于离散几何,这种跨学科联系被数学家Arul Shankar评价为“具备原创、精妙的独立思想”。AI的跨域联想能力正在快速进步

随着Astra可以200美元一题解决开放难题,人类数学家的工作重心将从“产生证明”向上游迁移到“提出好问题”。莱顿宣言的务实建议是:人类研究者选择问题、设定标准、批判想法、验证结果;AI贡献广度、速度和并行探索能力。

陶哲轩在2026年初的演讲中判断:“AI将成为数学研究中值得信赖的合作者。”Tim Gowers在5月20日当晚最初误以为AI“证明”了单位距离猜想,写道:“如果AI能想出这样的证明,数学家的好日子可能很快就要结束了。”但次日他得知AI是“推翻”了猜想(而非证明),明确表示“如释重负”。这一细节折射出数学界对AI能力的复杂心态,既为其潜力震撼,又为其边界感到宽慰。

  • 验证机制的递归困境

如果Astra能以每天几十个问题的速度产生候选解,当前人类同行评议体系根本消化不了这个流量。Lean形式化验证提供了部分答案,但将自然语言证明翻译为Lean代码本身也需要成本。AI辅助的自动形式化正在缩小这个差距,但远未达到即插即用的水平。

于是出现一个绕不过去的困境:要规模化验证AI产生的数学结果,我们需要AI来自动化验证过程——但这又回到了“谁来验证验证AI的AI”的递归问题。当AI产出速度是人类验证速度的百倍以上时,最终裁决权可能退化为抽样检查权,而系统性犯错的风险窗口始终存在。

2000美元不是奥尔特曼在国会山抛出的营销数字,它是一道分水岭。在这条线的左边,科学发现是人类智力的专属领地,昂贵、缓慢、依赖天才的偶然出现。在这条线的右边,科学发现开始变成一种可以被工程化、被规模化、被定价的服务。

当一个数学猜想的边际解决成本降到200美元,它就不再是“科研”,它变成了“查询”,“做科研”这件事本身的成本结构也正在被重新定义。从历史经验看,重新定义成本结构往往意味着产业变革的开始。

基础科学的前沿发现,不再是一件只有人类才能做的事。但“什么值得发现”、“发现之后如何理解”、“谁来为发现负责”。这些问题,仍然只属于人类。(本文首发钛媒体APP,作者 | 硅谷Tech-news,编辑 | 焦燕)

作品声明:内容由AI生成
本文系作者 硅谷Tech news 授权钛媒体发表,并经钛媒体编辑,转载请注明出处、作者和本文链接
本内容来源于钛媒体钛度号,文章内容仅供参考、交流、学习,不构成投资建议。
想和千万钛媒体用户分享你的新奇观点和发现,点击这里投稿 。创业或融资寻求报道,点击这里

敬原创,有钛度,得赞赏

赞赏支持
发表评论
0 / 300

根据《网络安全法》实名制要求,请绑定手机号后发表评论

登录后输入评论内容

扫描下载App