2026 年 7 月 24 日,一个数字让沃顿商学院教授 Ethan Mollick 在 X 上只写了一句话:“This is a big jump in ARC-AGI-3。”他说的不是哪家公司的股价,不是融资新闻,甚至不是任何实用产品,而是 ARC-AGI-3 上一个孤零零的分数:30.2%。
这个分数的拥有者是 Anthropic 刚刚发布的 Claude Opus 5。而它击败的对手,仅仅是两周前还被视为“最强模型”的 GPT-5.6 Sol,后者在同一测试上的成绩是 7.8%。
30.2% 对 7.8%。不是 10% 的进步,不是 20% 的进步,是接近 4 倍的差距。在一个专门设计来让 AI 无法作弊的测试上。
这个测试为什么让所有模型都翻车
ARC-AGI-3 不是普通的 AI 基准测试。它由 AI 研究者 François Chollet 于 2019 年首次提出,经过三次迭代,2026 年 3 月在 Y Combinator 正式发布的第三版彻底改变了游戏规则。
它的前两版测试的是静态推理:给模型一个输入输出网格,让它推断变换规则。到 2025 年,ARC-AGI-1 和 ARC-AGI-2 已经接近饱和,Gemini 3.1 Pro 在 ARC-AGI-1 上达到 98%,Gemini 3 Deep Think 在 ARC-AGI-2 上达到 84.6%。但 ARC-AGI-3 完全不一样。它不再是一个“看图写答案”的测试,而是一个交互式游戏环境。AI 被丢进一个 64×64 的彩色网格中,没有任务说明,没有规则手册,没有胜负条件。它必须自己搞清楚:这些颜色意味着什么?我能做什么动作?这个世界的目标是什么?怎么才算完成?
对人类来说,这不算太难。ARC Prize 基金会的数据显示,普通人类参与者,没有经过任何特殊训练,在全部 135 个环境上通关,中位用时仅 7.4 分钟。
但 AI 的遭遇只能用惨烈来形容。
2026 年 3 月 ARC-AGI-3 发布时,最好的前沿模型成绩是多少?Gemini 3.1 Pro 0.37%,GPT-5.4 0.26%,Claude Opus 4.6 0.25%,Grok 4.20 0.00%。所有模型全部低于 1%。
更残酷的是评分机制。ARC-AGI-3 使用 RHAE(Relative Human Action Efficiency)指标,公式是 (人类操作数 / AI 操作数)²。如果人类用 10 步完成,AI 用了 100 步,得分不是 10%,而是 1%。如果 AI 用了 200 步,得分降到 0.25%。一旦超过人类操作数的 5 倍,直接终止。暴力探索、随机尝试、无限回溯,这些策略不仅无效,还会被平方级惩罚。
在这个测试上,GPT-5.6 Sol 在 7 月 9 日交出了 7.8% 的成绩,成为第一个在 ARC-AGI-3 上真正“赢了一局”的模型,在其中一个环境(FT09)上拿到了 87%。当时这个成绩被描述为“一个里程碑式的低分”。既是里程碑,也是低分,两个词放在一起本身就说明了一切。
然后 Claude Opus 5 来了。
不是增量,是断层
ARC Prize 基金会在 7 月 24 日发布的官方验证结果中写道:在分析过程中,他们观察到 Opus 5 展现了“前所未有的行为”(novel behavior),使其能够解决此前无法攻破的环境,并超越了 Fable 5 的表现。
这句话的关键信息是:Fable 5 作为 Anthropic 定价 $10/$50 每百万 token 的 Mythos 级旗舰,在 ARC-AGI-3 上甚至没有进入公开榜单,而 Opus 5 作为定价 $5/$25 的“中端”模型,拿下了 30.2%。
从 1.5%(Opus 4.8)到 30.2%。从 7.8%(GPT-5.6 Sol)到 30.2%。这不是一次常规的版本迭代,这是一次能力断层。
X 上一位用户 Gage 的评论抓住了本质:“ARC-AGI 上 4 倍的跃升,形状上是非连续性,而不是增量。这个基准测试专门构建来抵抗模式匹配,因此这种规模的 gains 通常意味着模型组合解决方案的方式发生了结构性变化。”
它到底新在哪里
ARC Prize 此前对 GPT-5.5 和 Opus 4.7 的 160 场 replay 分析揭示了前沿模型在 ARC-AGI-3 上的典型失败模式,这些分析对于理解 Opus 5 的突破至关重要。
最普遍的问题,是模型看到了局部效果,但无法构建世界模型。Opus 4.7 在玩一个名叫 cd82 的环境时,感知到了“ACTION3 旋转了容器”,也看到了“ACTION5 蘸取了颜料”,但它从未将这两件事串联为“先旋转容器,再蘸取颜料,然后在目标位置放置”的完整策略。它看到了因果,但建立了错误的因果链。
另一个常见问题是模型从训练数据中提取了错误的抽象层级。模型反复将陌生的环境映射到已知游戏上:Tetris、Frogger、Sokoban、Breakout、Pong。视觉上的局部相似性劫持了行为选择。ARC Prize 的分析发现,Opus 4.7 的问题在于“压缩过度”,从一个观察迅速跳到自信但错误的结论;GPT-5.5 的问题在于“无法压缩”,提出了正确假设,但不断在多个游戏框架之间游移,从不执行。
最令人沮丧的则是即使模型通过某种方式通关了一关,这种成功并没有转化为对游戏机制的真正理解。下一关它又从零开始。通关的奖励是它自己,而不是对游戏规则的理解。
Opus 5 的 30.2% 意味着它在至少部分场景中突破了这些限制。ARC Prize 提到的“novel behavior”暗示模型展现出了一种更接近人类的学习方式:在交互中形成假设,检验假设,修正错误,然后将学到的知识应用到后续动作中。
这不是一个跑分的故事,这是一个智能类型的故事
Chollet 在设计 ARC 时有一个核心哲学主张:智能不应该被测量为“系统知道多少”,而应该被测量为“系统从少量经验中获取新技能的能力”。
这个区分至关重要。一个在训练数据中见过 10 万个 Python 代码片段的模型,写代码时看起来像“会思考”,但本质上它是在做模式匹配。ARC-AGI-3 测试的是它无法从训练数据中直接提取的东西,每个环境都是全新的、手工设计的,没有文化知识可依赖。
心理学中有一个经典区分:晶体智力(crystallized intelligence)和流体智力(fluid intelligence)。晶体智力依赖已有知识和经验,流体智力是在面对新问题时灵活推理和解决问题的能力。绝大多数 AI 基准测试衡量的是前者,你记得多少,你匹配得有多好。ARC-AGI-3 衡量的是后者。
Opus 5 在 ARC-AGI-3 上的跃迁,可能意味着 AI 在流体智力上迈出了实质性的一步。这不是关于它知道多少,而是关于它在未知面前有多敏捷。
商业层面的降维打击
Opus 5 的定价是 $5/$25 每百万 token,与 Opus 4.8 完全相同。在 Artificial Analysis Intelligence Index 上它拿到了 61 分,超过 Fable 5 的 60 分和 GPT-5.6 Sol 的 59 分,但定价只有 Fable 5 的一半。
在需要真正“做对事情”的任务上,差距更加明显。AutomationBench(Zapier 的企业工作流基准)上,Opus 5 达到 26.0%,GPT-5.6 Sol 为 18.1%,Fable 5 为 17.4%。这是一个测试“能否把一个真实任务从头到尾做完”的基准,不是“能否生成看起来不错的输出”。
Harvey AI 的测试显示,Opus 5 在法律任务上比 Opus 4.8 平均少用 26% 的 token。Letta 在金融建模上发现时间减少了 60%,工具调用减少了三分之一。这不是营销话术,这是“同样价格,能力翻倍”的实打实的数据。
更值得玩味的是 Anthropic 的定位策略。他们不喊“我们打败了 OpenAI”,而是说“我们以一半的价格达到了几乎同样的水平”。Opus 5 的 ARC-AGI-3 成绩,一个 Fable 5 甚至没有公开分数的测试,让这个低调的叙事突然有了攻击性。
谁会赢,谁危险
Opus 5 的 ARC-AGI-3 成绩是一个信号,不止关于 Anthropic,更关于整个行业的方向。它证明了一个判断:模型能力的下一个瓶颈不是参数规模,不是训练数据,而是“在未知中学习的能力”。
Anthropic 选择在 Opus 5,一个中端产品上实现这种突破,而不是把它留给 Mythos 级旗舰,这件事本身就很有意思。这意味着他们相信这种能力应该被广泛使用,而不是锁在最高价产品里。
那些仍然依赖“更大、更多、更贵”策略的模型厂商面临一个拷问:如果 7.8% 到 30.2% 的跃迁发生在 $5/$25 的价格带上,而不是 $10/$50 甚至 $2000/月的企业方案上,那么“用更多算力换取更多智能”的假设还成立吗?
写在最后
短期来看,如果你正在为企业 AI 选型,ARC-AGI-3 分数比任何编码基准都更值得关注。不是因为你要让 AI 玩游戏,而是因为这个测试衡量的是“当 AI 面对从未见过的东西时,它能不能自己搞清楚”,而这正是企业落地 AI 时最头疼的问题。
长期来看,30.2% 离人类的 100% 还有巨大差距。但方向已经变了。从“模型能记住多少”到“模型能自学多少”,这条路上的每一步,都比一堆编码基准的满分更有意义。
当大家都在拿编码基准互相碾压时,Claude Opus 5 在一个 AI 几乎不可能作弊的测试上,把天花板从 7.8% 推到了 30.2%。不是因为它知道得更多,而是因为它开始学会“不知道的时候该怎么办”。这或许才是 2026 年最值得记住的 AI 信号。






快报