OpenAI已经两年没有换过底座了。
两年,足够让一家AI公司从领跑者变成追赶者。
2026年8月,一则X爆料搅动了整个AI圈:OpenAI正在秘密推进一个代号为“Doug”的全新大模型预训练项目。据知情人士透露,这将是该公司历史上规模最大的一次预训练工程,目标是在11月前完成交付。
SemiAnalysis在8月7日的最新报告中确认了这则消息:“OpenAI已经解决了他们的预训练问题,一个规模更大的、代号为‘Doug’的模型正在积极开发中。”
这则消息之所以引发行业震动,不是因为OpenAI又发布了新模型——这家公司几乎每个月都在发新版本——而是因为Doug代表了一个根本性的方向转变。
同一个底座,不同的后处理
回顾过去两年,OpenAI的模型能力图谱可以用一句话概括:同一个底座,不同的后处理。
2024年5月,GPT-4o正式亮相,成为OpenAI多模态战略的基石。此后,o1、o3、GPT-5系列——包括GPT-5.1、5.2、5.3、5.4、5.5、5.6——所有这些旗舰模型,底层使用的都是同一个GPT-4o底座。
SemiAnalysis的研究清晰地指出了这一点:“OpenAI在18个月里,所有旗舰模型的性能提升完全由后训练和强化学习计算规模的扩展来驱动。”同一份报告还指出,Anthropic、xAI和Google都从预训练扩展中获得了显著收益,但OpenAI凭借一个旧底座,靠着后训练硬撑了18个月。
这本身就是一个行业奇观。
但在2025年底,情况开始发生了变化。2025年11月,Google发布Gemini 3 Pro,被业界评为当时全球最强的模型。据Fortune报道,这一事件直接触发了Sam Altman在OpenAI内部发布“Code Red”警报。Apptopia的数据显示,ChatGPT的美国移动端市占率从2025年1月的69%暴跌至2026年初的45%,Gemini成为最大的受益者。
压力不只是来自外部。SemiAnalysis指出,长期依赖后训练和推理计算,底座缺乏同等级别的世代跃迁,终将面临边际收益递减。这座用旧引擎跑新赛道的大厦,到了必须换地基的时候。
后训练的红利,边际递减的阴影
要理解Doug的意义,必须先理解OpenAI过去两年在做什么。
2024年,OpenAI内部代号为“Orion”的新模型预训练遭遇了滑铁卢。据The Information报道,Sam Altman在2024年春天告诉员工,Orion将显著超越GPT-4。但到了秋天,结果令人失望:虽然Orion的性能超过了之前的模型,但提升幅度远小于从GPT-3到GPT-4的跨越。
这次失败是一个分水岭。它意味着传统Scaling Law——堆更多算力、喂更多数据、模型就更好——正在失效。OpenAI不得不寻找新的策略。
他们的答案是后训练。
后训练是指在基础预训练完成后,对模型进行强化学习和对齐微调的过程。OpenAI发现,即使底座不变,通过大规模RL训练和推理期计算扩展,模型仍然可以持续变强。o1的链式推理能力、o3的编程突破、GPT-5的统一路由架构——这些能力的跃升,全部来自GPT-4o这个老引擎的调校。
但这是一条有天花板的路。
SemiAnalysis打了一个比方:后训练就像给一辆车不断改装,加涡轮、换悬挂、调ECU,确实能跑得更快,但永远不可能换掉发动机本身。预训练才是决定模型智能上限的那个发动机排量。
到2025年底,边际收益递减的迹象已经很明显。GPT-5.5是GPT-5之后OpenAI首个基于新预训练版本“Spud”的公开模型,但SemiAnalysis的调查显示,其号称的“100K GB200 NVL72集群训练”实际上只用于后训练阶段,预训练从未达到该规模。这意味着,OpenAI在2025年全年发布的每一款模型,底层的预训练规模并没有发生真正的代际跃升。
Garlic的修复:重新学会预训练
改变发生在2025年12月。
OpenAI发布了GPT-5.2,内部代号“Garlic”。表面上看,这只是又一个小版本迭代。但ZDNet的报道揭示了一个关键细节:在开发Garlic时,OpenAI“解决了预训练阶段的问题,让模型在开始针对特定任务训练之前,先学习更广泛的数据连接。”
简单来说,OpenAI在Garlic上验证了一套全新的预训练方法论——不是简单地堆更多数据和算力,而是从根本上优化了预训练的数据组织和学习策略。
在此之前,OpenAI的预训练配方已经失效了。据Fortune报道,2025年全年,OpenAI多次大规模的预训练运行都未能产出比之前更好的模型,这“可能是OpenAI内部焦虑的主要原因之一,因为它意味着公司目前无法复现模型改进的某种成功公式。”
Garlic是一个转折点。它证明OpenAI的预训练问题是可以被解决的。但Garlic本身只是一个相对较小的模型——它的意义不在于性能,而在于验证了修复方案的有效性。
而Doug,就是这套修复方案在更大规模上的工程放大。
带着后训练的know-how回归预训练
如果Doug只是一个更大的预训练模型,那这个故事就太简单了。但事实远比这复杂。
OpenAI的竞争对手们这几年从未停止预训练。Anthropic有Capybara,Google有Gemini 3系列,xAI的Grok也在不断迭代。这些公司都没有像OpenAI那样停掉底座更新。但OpenAI在后训练上的极端投入,反而可能让他们在预训练方法论上积累了独特的经验。
SemiAnalysis对此的评价是:“OpenAI已经解决了他们的预训练问题,随着这个维度的扩展被解锁,进步将更加迅速。”
这句话包含了一个关键信息:OpenAI不是简单地重新开始预训练,而是带着后训练积累的know-how,重新回到预训练的牌桌上。当他们知道如何用RL让模型更聪明之后,再回头去优化底座本身,两者的叠加效应可能远超竞争对手。
Doug的另一个关键变量是时间窗口。据爆料,计划11月前发布,意味着OpenAI只有不到三个月的时间来完成这个史上最大规模的预训练工程。数万亿Token的训练数据、海量的工程调试,任何一环出问题,都可能让这个时间表落空。
如果Doug成功,格局将被改写
一旦Doug顺利落地,OpenAI将重新夺回底座预训练的话语权。过去两年,行业一直在讨论Scaling Law是否已死,而OpenAI用后训练证明了另一种可能性。但如果Doug能够实现底座级别的代际跃升,同时结合其已经成熟的RL体系,OpenAI将拥有预训练加后训练双引擎驱动的能力。这可能是整个行业第一次看到两种技术路线在同一家公司形成闭环。
竞争格局也将加速分化。Google的Gemini 3虽然一度领跑,但SemiAnalysis在8月7日的报告中直言“Gemini已熟透了”——人才流失、3.5 Flash表现不佳,差距正在拉大。Anthropic的Fable 5和OpenAI的GPT-5.6目前处于领跑位置,Doug将决定接下来12个月的竞争走向。
整个行业对预训练的认知也可能被刷新。如果Doug的成功建立在Garlic验证的新方法论之上,那么“更大不等于更好”的行业共识将被挑战——不是预训练不重要,而是预训练的方法论需要重构。
谁最危险
最危险的是那些还在堆算力的公司。如果Doug证明,预训练的突破不在于算力规模,而在于训练方法的根本性革新,那么那些还在沿着旧路径盲目扩张的公司,将面临巨大的沉没成本风险。
对于AI应用开发者而言,Doug的发布意味着底层API的能力上限将被重新定义。如果底座能力实现一次代际跃升,与其配套的Agent框架、工具链和应用生态,都需要同步升级。
OpenAI用两年时间证明了后训练的天花板有多高,现在,他们要用Doug来证明预训练的地基能挖多深。这场换底座的赌局,赌的不只是一家公司的技术路线,而是整个AI行业下一个时代的基本范式。






快报