0.07美分破解ARC-AGI:150M参数的“隐形推理”重新定义AI能效比

2026.08.11 20:21
Pathway团队发布BDH-CQ,一个仅150M参数的小模型,以每任务0.0007美元的成本在ARC-AGI-1上达到29.5%的准确率,打破了此前所有模型的成本-精度帕累托前沿。相比o3的4,560美元/任务,推理成本压缩了超过650万倍。论文揭示了“潜在空间推理”替代“链式思维”的全新范式,并系统分析了上下文学习的能力边界与局限。

2026年8月10日,一篇arXiv论文悄然上线。作者来自欧洲AI实验室Pathway以及纽约大学。论文标题很学术,“BDH-CQ: In-Context Learning with Recurrent Latent Reasoning”。但如果你把它放在ARC-AGI的能效图上,会发现一个令人不安的事实:一个仅150M参数的小模型,以每任务0.0007美元的计算成本,打破了此前的精度-成本帕累托前沿。作为对比,OpenAI o3在2024年首次挑战ARC-AGI-1时,每任务耗资高达4,560美元。今天,这个数字被压缩到了0.07美分。

这不是渐进式改进,而是数量级上的跨越。当整个行业用“亿美元”堆砌模型时,Pathway证明了0.07美分也能完成有效的抽象推理。

一场“静默推理”的范式突破

BDH-CQ不是传统意义上的大语言模型。它不靠链式思维来推理,不把每一帧思考翻译成文字,不消耗大量token。相反,它把所有中间计算压缩在一个高维连续潜在空间里,用循环记忆不断更新内部状态,最后只输出答案。

这听起来像技术细节,但它撕开了一个根本性缺口:当整个行业都在堆砌参数、延展CoT长度时,BDH-CQ证明了一条截然不同的路同样可行,甚至更便宜。

论文披露的数据简洁但震撼:150M参数配置,在ARC-AGI-1公开评测集上达到29.5% pass@2,每任务成本0.00070美元。论文明确指出,这“突破了此前报告的ARC-AGI-1成本-精度帕累托前沿,建立了该基准成本效率的新最先进水平”。

过去两年,ARC-AGI-1的右上角被巨头们占据。o3用4,560美元/任务堆出87.5%的准确率,Gemini 3 Deep Think以7.17美元/任务达到96%以上,Claude Opus 4.6以1.88美元/任务做到93.0%。但左下角,高精度加低成本的甜蜜区,始终是空白。BDH-CQ的到来直接点亮了这个点。29.5%的准确率或许不算高,但0.0007美元的成本将能效边界向左平移了三个数量级。这不是单纯的性能提升,而是范式的改变。

为什么“不说话”可能更聪明

BDH-CQ的核心创新在于融合上下文学习和循环潜在推理。传统Transformer每生成一个token都要重新处理整个上下文,CoT链延长时计算成本线性增长。BDH-CQ的解法完全不同:它引入了一个高维连续潜在空间,所有中间推理都在这个空间内完成,不需要翻译成语言。输入样例不断更新循环记忆,模型在潜在空间中迭代计算,逐步逼近答案。整个过程像一个“无声的思考者”。

论文将推理过程称为“演示条件操作模式”(demonstration-conditioned operator schema)。演示绑定了一个可复用的视觉操作,模型在推理时执行这个操作,而不是从头学习全新任务。

这一思路与Pathway此前发布的BDH架构一脉相承。BDH的设计理念是“语言不足以支撑智能”。在2026年3月的Sudoku Extreme测试中,BDH以97.4%的准确率碾压了所有主流LLM,后者的准确率接近0%。论文作者来自Pathway、Bielik AI以及纽约大学。

从4,560美元到0.0007美元

ARC-AGI由François Chollet于2019年创建,旨在衡量AI系统的“技能获取效率”。这个基准很快成为衡量AI推理能力的金标准,Anthropic、Google DeepMind、OpenAI和xAI都在模型卡上报告了ARC-AGI性能。

2024年,OpenAI o3以约4,560美元/任务首次取得突破。但代价巨大:低效率模式下需要1,024个并行样本和5.7B token。高效率模式(6个样本)成本降至26美元/任务,准确率也降至75.7%。2025年,效率开始大幅提升。Jeremy Berman以8.42美元/任务达到近80%准确率。Claude Opus 4.6以1.88美元/任务做到93.0%,GPT-5.2 Pro以11.64美元/任务做到90.5%,Gemini 3 Flash以0.17美元/任务达到84.7%。2026年,Gemini 3 Deep Think以7.17美元/任务将准确率推高至96%以上。

从1.88美元到0.0007美元,是一个超过2,600倍的跳跃。BDH-CQ的推理成本不到o3的百万分之一,确切地说,是4,560美元的约650万分之一。更重要的是,BDH-CQ只有150M参数。作为对比,主流前沿模型参数规模在数百亿到数千亿级别。BDH-CQ证明了架构设计,尤其是推理方式,可能比参数数量更能决定能效比。

上下文学习的深层边界

论文还进行了一系列精细的行为分析实验,系统性地测试了模型的推理边界。在简单算子外推方面,模型在颜色变换、形状变化上表现良好,但当变换涉及顺序或嵌套结构时,表现明显下降。在40个任务的受控梯级测试中,条件规则选择的准确率从100%骤降至56.7%。当演示中缺少关键参数时,准确率从30%降至0%。面板合并(从两个到三个面板)的准确率从65%暴跌至2.5%。

这些数据告诉我们:BDH-CQ在简单的、可枚举的变换上表现出色,但当推理需要处理条件分支、缺失信息或多元素组合时,边界仍然清晰。论文还分析了错误预测的性质。在失败案例中,89.2%的错误保持了正确的输出维度,72.9%保持了正确的颜色调色板。即使推理失败,模型也没有完全偏离目标。

Pathway的“后Transformer”叙事

BDH-CQ隶属于Pathway的BDH研究体系,一条激进的“后Transformer”技术路线。Pathway的核心理念是:Transformer的推理能力本质上是“事后粘上去的”,通过CoT让模型在生成token的过程中完成推理,这种“思考即写作”的范式在深度推理和约束满足任务上存在根本局限。

BDH家族通过创建更大的内部潜在推理空间,并赋予模型记忆机制,让推理脱离语言的束缚。Pathway已与AWS合作,将BDH部署在Amazon SageMaker HyperPod上,瞄准企业级“持续学习、无限上下文、实时适应”的需求。BDH-CQ的0.0007美元/任务的推理成本,意味着大规模部署不再是奢侈。

从商业角度看,BDH-CQ的出现可能比29.5%的准确率更有意义。当推理成本跌到“几乎免费”的程度,AI推理的“卖水人”逻辑就可能被重写。不是每个场景都需要96%的准确率,但每个场景都希望推理成本足够低。

0.07美分的未来

BDH-CQ为ARC-AGI能效竞赛开辟了一条全新的支线。当主流玩家在比拼“谁能在100美元预算内拿到更高分”时,BDH-CQ把基准线拉到了0.001美元以下。这不只是一个学术成就,更是一个商业信号。推理成本的大幅下降,将加速AI推理从“少量高价值场景”向“大规模嵌入式场景”的扩散。

当然,29.5%的准确率还有巨大提升空间。论文作者指出,同样的架构可以通过模型规模扩展、更长的训练时间、语言和数学推理能力的融合来进一步改进。如果潜在推理加上下文学习能够持续扩展,如果有一天一个150M参数的模型能达到50%甚至70%的ARC-AGI-1准确率,那么整个AI行业关于“推理需要多大规模”的假设,都将被重新审视。

在通往AGI的道路上,我们或许已经习惯了用“更大、更贵、更慢”来换取“更聪明”。BDH-CQ提出了一个截然不同的命题:也许真正的智能,不需要说那么多话。

作品声明:内容由AI生成