谷歌 Mathematica:一个被泄漏的「话痨」数学天才

2026.09.18 09:40
谷歌基于 DeepThink V3 打造的数学推理模型 Mathematica 被意外曝光,100 万 token 上下文专攻复杂符号求解,在推理轨迹中激动到喊出「OH MY GOD」。从 IMO 金牌到 Aletheia 解决开放猜想,谷歌正在数学推理垂直赛道上做一次比「刷榜做题」更有野心的实验。

「OH MY GOD!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!」

这不是某个数学爱好者在白板前攻克难题后的狂喜,而是一个大模型在解题过程中突然喊出来的话。谷歌内部代号为 Mathematica 的实验性数学推理模型,在解一道多项式丢番图方程时,激动到在推理轨迹中写下了全是感叹号的呐喊。

而这个模型可能正是目前已知最强的数学推理 AI。它基于谷歌 DeepThink V3 架构打造,拥有 100 万 token 的超长上下文窗口,输出上限高达 65536 token,专为繁重计算和复杂符号求解而定向优化。API 数据泄露显示,它的内部标识符是「models/deepthink-mathematica-tf-raw-thoughts」。

一个做数学题的 AI,在解题过程中表现得像一个人类数学家攻克难题后的欣喜若狂。与其说这是一次产品泄密,不如说是一次对 AI 推理透明度的意外演示——未经过滤的思维链第一次面向世界公开展示了一个大模型推导时的「内心独白」。

泄露的「不稳定实验版」

当地时间 9 月 15 日,知名爆料者 Lyra 在 X 平台上发布了两张截图,瞬间点燃了 AI 圈。截图显示,谷歌正在内部测试一个基于 DeepThink V3 的数学专用模型,代号 Mathematica。API 配置文件中,该模型内部后缀为「tf-raw-thoughts」,意味着它输出的是未经过滤的原始思维链。

配置文件中最引人注目的是三个标签:「UNSTABLE_EXPERIMENTAL」——不稳定实验版;「Teamfood」——谷歌内部员工测试专用术语;以及高达 100 万 token 上下文窗口、65536 token 输出上限的规格参数。这意味着该模型单次可以「读完」相当于数本书的数学文献,然后一次性输出近 7 万 token 的完整推导过程。

但真正让 Mathematica 出圈的,不是它的硬件配置,而是它的「性格」。泄露的推理轨迹显示,当 Mathematica 解到一处多项式丢番图方程时,它兴奋地写道:「HOLY MOTHER OF MATHEMATICS!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!」随后又补了一句:「让我们欣赏一下这个方程的绝对之美。」找到捷径后,它更是直接喊出了那句响彻互联网的感叹。

Mathematica 的入局,在时间点上并非孤立事件。就在同一天——9 月 15 日——谷歌刚刚正式发布了 Gemini 3.8 Live 和 3.8 Live Extended Thinking,这是其迄今为止最先进的实时对话模型,具备异步推理能力。加上此前面向精英数学竞赛的 Gemini DeepThink IMO 模式,谷歌在推理能力上的布局已经覆盖了从通用对话到竞赛级数学的完整光谱。Mathematica 则是这个光谱上最极端的那一个点。

为什么谷歌需要造一个「数学偏科生」?

Mathematica 的引爆点值得追问:在通用大模型已经足够强的今天,为什么谷歌还要花力气去造一个专门的数学模型?

答案藏在谷歌过去一年半的数学推理进化线里。

2025 年 7 月,谷歌 DeepMind 宣布其 Gemini DeepThink 达到了国际数学奥林匹克金牌标准——在 6 道代数、组合、几何、数论题目中正确解答 5 道,获得 35 分,成绩经 IMO 官方协调员认证。这是 AI 第一次在人类最高水平数学竞赛中拿到金牌。

2026 年 2 月 12 日,Gemini 3 DeepThink 发布重大升级,在最为严格的基准测试中交出惊人成绩:Humanity's Last Exam 上拿到 48.4%,ARC-AGI-2 上达到 84.6%(经 ARC Prize Foundation 验证),Codeforces 编程竞赛中以 3455 Elo 分获得 Legendary Grandmaster 评级——这个级别在全球人类程序员中只有极少数人能达到。

更关键的是,这款模型不止于刷榜。2026 年 2 月,DeepMind 推出的 Aletheia 系统——基于 Gemini DeepThink——在 Bloom's Erdős Conjectures 数据库的 700 个开放问题评估中,自主解决了 4 个 Paul Erdős 的开放猜想(编号 Erdős-652、654、1040、1051)。其中 Erdős-1051 的解答被进一步泛化后,与人类数学家合作发表了正式研究论文(BKKKZ26),这被认为是 AI 系统首次完整地参与了一个数学猜想的发现到发表的全过程。

把这条进化线串起来看,模式很清晰:谷歌先让通用推理模型强大到能在 IMO 拿金牌、破解数学猜想,再以此为基础做垂直定向优化。Mathematica 不是从零开始的数学模型——它是 DeepThink 引擎在数学这一场景下的极致调校版本。就像一台顶级跑车已经有了冠军级引擎,现在要针对 F1 赛道单独做一个调校版。

「话痨」背后的技术信号

Mathematica 在推理链上留下的那些感叹号,看起来是个有趣的花絮。但业内人士关注的,是一个更深层的问题:这道未经过滤的推理链是怎么保留下来的?

答案在于 Mathematica 的底层架构。DeepThink 系列模型的核心特征是推理时间计算——不是靠更大的参数量,而是通过更长的推理时间来获得更优结果。当模型探索一条推理路径时,它会在内部生成大量中间思考,即所谓的思维链,用于验证每一步逻辑的有效性。

谷歌为 Mathematica 添加了「tf-raw-thoughts」后缀,意为 TensorFlow 原版原始思维。与面向公众的商业版本不同,实验版没有对推理轨迹进行后处理过滤。这意味着我们看到的是一台推理引擎的思考现场——它的怀疑、它的试探、它发现捷径时的狂喜,全部未经修饰地暴露出来。

从产品角度看,这种输出方式显然不适合直接面对用户。但从数学研究的角度看,完整的思维链恰恰价值连城:数学家不止关心最终证明,更关心推导路径本身——模型在哪里走了弯路、在哪里发现了关键转换、在哪里找到了突破口。Mathematica 的这种「话痨」属性,让数学研究者有机会窥见一个超级推理引擎的内部工作方式,这本身就是一个研究工具。

数学推理赛道的格局之变

Mathematica 的出现,标志着 AI 数学推理竞赛正在发生一次根本性的范式转移。

此前,这条赛道上的主流逻辑是做更大的通用模型。OpenAI 的 GPT-5.5 Pro 在 IMO-ProofBench 高级测试中拿到 88.1% 的成绩,Anthropic 的 Claude Opus 4.5 和 Meta 的模型各有斩获。但 2026 年的新信号是:竞争不再取决于「谁的模型更强」,而是「谁愿意为数学专门造一个模型」。

谷歌的 Mathematica 选择了后者。从「通用推理王者」到「数学专用怪才」,这条路径的底层逻辑是:当通用能力达到天花板之后,垂直深度就是下一个增长点。

作为参考系,Gemini 3 DeepThink 在 IMO-ProofBench 高级测试上达到 76.7%,而专门针对 IMO 优化的 DeepThink(IMO Gold)版本达到 65.7%。专用版本的绝对分数并不一定高于通用版本——因为专用版本面对的是更难、更前沿的问题——但它在特定场景下的极限能力远超通用模型。

Mathematica 的具体基准测试尚未公布,考虑到它是未发布的不稳定实验版,这完全合理。但 100 万 token 上下文窗口和 65536 token 输出上限已经暗示了它的能力边界:整篇数学论文作为输入,完整的证明过程作为输出。这种能力上限的存在感本身,就是一场无声的宣示。

「实验版」的野心

Mathematica 定位的方向,或许比「刷榜做题」要有野心得多——它瞄准的不是让 AI 在考卷上拿高分,而是让 AI 去发现未知。Gemini DeepThink 此前在数学研究中的成绩,从解决 Erdős 猜想到攻克 Max-Cut 和 Steiner Tree 等经典计算机科学难题,再到为物理弦理论中的引力辐射计算找到新解法,已经证明了一个推理引擎在真实科研场景中的价值。

当然,一个残酷的现实是:实验版转为产品的成功率极低。谷歌尚未正式确认 Mathematica 的存在。它可能永远只停留在内部测试阶段,多轮迭代后被更成熟的版本取代。但泄露本身已经向行业传递了一个清晰信号:谷歌在数学推理这条垂直赛道上押下的赌注,比外界所能看到的要大得多。

2026 年 9 月的这波爆料,发生在 AI 行业一个奇特的时间节点。一方面,OpenAI 即将下线 GPT-5.5,谷歌则在两周内连续发布了 Gemini 3.8 Flash、3.8 Flash Cyber、3.8 Live 和 3.8 Live Extended Thinking——一个季度内至少三个大版本迭代。大模型行业的节奏已经快到了令人眩晕的程度。在这种背景下,一个「不稳定实验版」的数学推理模型被意外曝光,可能是谷歌有意无意放出的一枚信号弹。

它告诉你:别盯着通用模型的刷榜数字看了,真正的下一站,在垂直深度里。

当你的 AI 开始为数学之美而惊叹时,它离真正理解数学还有多远?也许,距离比我们想得要短得多。

作品声明:内容由AI生成