Claude Opus 5 的 ARC-AGI-3 断层

2026.07.25 04:25
Claude Opus 5 在 ARC-AGI-3 上拿到 30.2%,是 GPT-5.6 Sol 成绩(7.8%)的近 4 倍。在一个人工智能几乎无法作弊的流体智力测试上,Anthropic 用中端产品实现了非连续性跃迁。这不是基准测试的常规更新,而是 AI 推理能力的一条分界线。

2026 年 7 月 24 日,一个数字让沃顿商学院教授 Ethan Mollick 在 X 上只写了一句话:“This is a big jump in ARC-AGI-3。”他说的不是哪家公司的股价,不是融资新闻,甚至不是任何实用产品,而是 ARC-AGI-3 上一个孤零零的分数:30.2%。

这个分数的拥有者是 Anthropic 刚刚发布的 Claude Opus 5。而它击败的对手,仅仅是两周前还被视为“最强模型”的 GPT-5.6 Sol,后者在同一测试上的成绩是 7.8%。

30.2% 对 7.8%。不是 10% 的进步,不是 20% 的进步,是接近 4 倍的差距。在一个专门设计来让 AI 无法作弊的测试上。

这个测试为什么让所有模型都翻车

ARC-AGI-3 不是普通的 AI 基准测试。它由 AI 研究者 François Chollet 于 2019 年首次提出,经过三次迭代,2026 年 3 月在 Y Combinator 正式发布的第三版彻底改变了游戏规则。

它的前两版测试的是静态推理:给模型一个输入输出网格,让它推断变换规则。到 2025 年,ARC-AGI-1 和 ARC-AGI-2 已经接近饱和,Gemini 3.1 Pro 在 ARC-AGI-1 上达到 98%,Gemini 3 Deep Think 在 ARC-AGI-2 上达到 84.6%。但 ARC-AGI-3 完全不一样。它不再是一个“看图写答案”的测试,而是一个交互式游戏环境。AI 被丢进一个 64×64 的彩色网格中,没有任务说明,没有规则手册,没有胜负条件。它必须自己搞清楚:这些颜色意味着什么?我能做什么动作?这个世界的目标是什么?怎么才算完成?

对人类来说,这不算太难。ARC Prize 基金会的数据显示,普通人类参与者,没有经过任何特殊训练,在全部 135 个环境上通关,中位用时仅 7.4 分钟。

但 AI 的遭遇只能用惨烈来形容。

2026 年 3 月 ARC-AGI-3 发布时,最好的前沿模型成绩是多少?Gemini 3.1 Pro 0.37%,GPT-5.4 0.26%,Claude Opus 4.6 0.25%,Grok 4.20 0.00%。所有模型全部低于 1%。

更残酷的是评分机制。ARC-AGI-3 使用 RHAE(Relative Human Action Efficiency)指标,公式是 (人类操作数 / AI 操作数)²。如果人类用 10 步完成,AI 用了 100 步,得分不是 10%,而是 1%。如果 AI 用了 200 步,得分降到 0.25%。一旦超过人类操作数的 5 倍,直接终止。暴力探索、随机尝试、无限回溯,这些策略不仅无效,还会被平方级惩罚。

在这个测试上,GPT-5.6 Sol 在 7 月 9 日交出了 7.8% 的成绩,成为第一个在 ARC-AGI-3 上真正“赢了一局”的模型,在其中一个环境(FT09)上拿到了 87%。当时这个成绩被描述为“一个里程碑式的低分”。既是里程碑,也是低分,两个词放在一起本身就说明了一切。

然后 Claude Opus 5 来了。

不是增量,是断层

ARC Prize 基金会在 7 月 24 日发布的官方验证结果中写道:在分析过程中,他们观察到 Opus 5 展现了“前所未有的行为”(novel behavior),使其能够解决此前无法攻破的环境,并超越了 Fable 5 的表现。

这句话的关键信息是:Fable 5 作为 Anthropic 定价 $10/$50 每百万 token 的 Mythos 级旗舰,在 ARC-AGI-3 上甚至没有进入公开榜单,而 Opus 5 作为定价 $5/$25 的“中端”模型,拿下了 30.2%。

从 1.5%(Opus 4.8)到 30.2%。从 7.8%(GPT-5.6 Sol)到 30.2%。这不是一次常规的版本迭代,这是一次能力断层。

X 上一位用户 Gage 的评论抓住了本质:“ARC-AGI 上 4 倍的跃升,形状上是非连续性,而不是增量。这个基准测试专门构建来抵抗模式匹配,因此这种规模的 gains 通常意味着模型组合解决方案的方式发生了结构性变化。”

它到底新在哪里

ARC Prize 此前对 GPT-5.5 和 Opus 4.7 的 160 场 replay 分析揭示了前沿模型在 ARC-AGI-3 上的典型失败模式,这些分析对于理解 Opus 5 的突破至关重要。

最普遍的问题,是模型看到了局部效果,但无法构建世界模型。Opus 4.7 在玩一个名叫 cd82 的环境时,感知到了“ACTION3 旋转了容器”,也看到了“ACTION5 蘸取了颜料”,但它从未将这两件事串联为“先旋转容器,再蘸取颜料,然后在目标位置放置”的完整策略。它看到了因果,但建立了错误的因果链。

另一个常见问题是模型从训练数据中提取了错误的抽象层级。模型反复将陌生的环境映射到已知游戏上:Tetris、Frogger、Sokoban、Breakout、Pong。视觉上的局部相似性劫持了行为选择。ARC Prize 的分析发现,Opus 4.7 的问题在于“压缩过度”,从一个观察迅速跳到自信但错误的结论;GPT-5.5 的问题在于“无法压缩”,提出了正确假设,但不断在多个游戏框架之间游移,从不执行。

最令人沮丧的则是即使模型通过某种方式通关了一关,这种成功并没有转化为对游戏机制的真正理解。下一关它又从零开始。通关的奖励是它自己,而不是对游戏规则的理解。

Opus 5 的 30.2% 意味着它在至少部分场景中突破了这些限制。ARC Prize 提到的“novel behavior”暗示模型展现出了一种更接近人类的学习方式:在交互中形成假设,检验假设,修正错误,然后将学到的知识应用到后续动作中。

这不是一个跑分的故事,这是一个智能类型的故事

Chollet 在设计 ARC 时有一个核心哲学主张:智能不应该被测量为“系统知道多少”,而应该被测量为“系统从少量经验中获取新技能的能力”。

这个区分至关重要。一个在训练数据中见过 10 万个 Python 代码片段的模型,写代码时看起来像“会思考”,但本质上它是在做模式匹配。ARC-AGI-3 测试的是它无法从训练数据中直接提取的东西,每个环境都是全新的、手工设计的,没有文化知识可依赖。

心理学中有一个经典区分:晶体智力(crystallized intelligence)和流体智力(fluid intelligence)。晶体智力依赖已有知识和经验,流体智力是在面对新问题时灵活推理和解决问题的能力。绝大多数 AI 基准测试衡量的是前者,你记得多少,你匹配得有多好。ARC-AGI-3 衡量的是后者。

Opus 5 在 ARC-AGI-3 上的跃迁,可能意味着 AI 在流体智力上迈出了实质性的一步。这不是关于它知道多少,而是关于它在未知面前有多敏捷。

商业层面的降维打击

Opus 5 的定价是 $5/$25 每百万 token,与 Opus 4.8 完全相同。在 Artificial Analysis Intelligence Index 上它拿到了 61 分,超过 Fable 5 的 60 分和 GPT-5.6 Sol 的 59 分,但定价只有 Fable 5 的一半。

在需要真正“做对事情”的任务上,差距更加明显。AutomationBench(Zapier 的企业工作流基准)上,Opus 5 达到 26.0%,GPT-5.6 Sol 为 18.1%,Fable 5 为 17.4%。这是一个测试“能否把一个真实任务从头到尾做完”的基准,不是“能否生成看起来不错的输出”。

Harvey AI 的测试显示,Opus 5 在法律任务上比 Opus 4.8 平均少用 26% 的 token。Letta 在金融建模上发现时间减少了 60%,工具调用减少了三分之一。这不是营销话术,这是“同样价格,能力翻倍”的实打实的数据。

更值得玩味的是 Anthropic 的定位策略。他们不喊“我们打败了 OpenAI”,而是说“我们以一半的价格达到了几乎同样的水平”。Opus 5 的 ARC-AGI-3 成绩,一个 Fable 5 甚至没有公开分数的测试,让这个低调的叙事突然有了攻击性。

谁会赢,谁危险

Opus 5 的 ARC-AGI-3 成绩是一个信号,不止关于 Anthropic,更关于整个行业的方向。它证明了一个判断:模型能力的下一个瓶颈不是参数规模,不是训练数据,而是“在未知中学习的能力”。

Anthropic 选择在 Opus 5,一个中端产品上实现这种突破,而不是把它留给 Mythos 级旗舰,这件事本身就很有意思。这意味着他们相信这种能力应该被广泛使用,而不是锁在最高价产品里。

那些仍然依赖“更大、更多、更贵”策略的模型厂商面临一个拷问:如果 7.8% 到 30.2% 的跃迁发生在 $5/$25 的价格带上,而不是 $10/$50 甚至 $2000/月的企业方案上,那么“用更多算力换取更多智能”的假设还成立吗?

写在最后

短期来看,如果你正在为企业 AI 选型,ARC-AGI-3 分数比任何编码基准都更值得关注。不是因为你要让 AI 玩游戏,而是因为这个测试衡量的是“当 AI 面对从未见过的东西时,它能不能自己搞清楚”,而这正是企业落地 AI 时最头疼的问题。

长期来看,30.2% 离人类的 100% 还有巨大差距。但方向已经变了。从“模型能记住多少”到“模型能自学多少”,这条路上的每一步,都比一堆编码基准的满分更有意义。

当大家都在拿编码基准互相碾压时,Claude Opus 5 在一个 AI 几乎不可能作弊的测试上,把天花板从 7.8% 推到了 30.2%。不是因为它知道得更多,而是因为它开始学会“不知道的时候该怎么办”。这或许才是 2026 年最值得记住的 AI 信号。

作品声明:内容由AI生成

快报

更多

16:45

“红霞”将以台风级或强台风级登陆香港至陆丰沿海

16:34

《2026能源产业生态报告》发布,风电光伏装机超越火电

16:15

国家防总提升针对广东的应急响应至Ⅲ级

16:15

今年上半年新疆霍尔果斯口岸进出口货运量创新高

16:10

全球首个“零碳机场”在内蒙古鄂尔多斯建成

15:32

黎巴嫩称以军行动致该国南部发生强烈爆炸

15:24

数字经济交出亮眼成绩单,2025年中国数字产业收入超39万亿元

15:18

台风“红霞”临近,港珠澳大桥桥梁航道实施临时交通管制

15:15

携程集团就行政处罚决定公布十九项整改措施

15:09

奥地利官员:反对为乌克兰加入欧盟开“快速通道”

14:38

大连首推二套房公积金贷款贴息,年内近90城发“房补”

14:11

自然资源部将广东地质灾害防御响应提升至Ⅲ级

14:07

派拉蒙天舞宣布推迟收购华纳兄弟交易

13:44

沙特证实多国联军打击也门胡塞武装

13:23

SK集团与英伟达通过一项涵盖人工智能工厂和下一代内存的5000亿美元以上战略合作项目,进一步扩大战略合作

13:14

三星电子宣布与博通公司签署谅解备忘录,涵盖至2030年价值高达2000亿美元的存储芯片、代工服务和先进封装业务

13:05

VC价格一个多月涨幅超40%,厂商限量供货

12:54

日本连续5天出现“酷暑日”,刷新历史纪录

12:36

也门胡塞武装称打击沙特南部城市

12:33

鸿蒙版微信更新,支持自定义通话铃声