想象一下这个场景:你从宜家搬回一张TONSTAD床架,打开包装,对着一份21个步骤、39个零件的说明书折腾了一下午。你拧好了螺丝,装好了侧板,自我感觉还挺良好。但AI只扫了一眼你的照片,立刻告诉你,第三步骤错了,层压板朝向装反了。
这不是科幻画面。这是Epoch AI在9月23日发布的家具组装基准测试(Furniture Assembly Benchmark,以下简称FAB)里每天都在做的事。测试任务听起来简单,做起来极难:AI需要看一张照片、读一份安装说明书,判断安装是否有误,有误则精确指出哪一步、错在哪。
十个月前,业内最好的模型(Anthropic的Claude Opus 4.5)只拿到了28%的正确率。十个多月后,OpenAI的GPT-6 Astra把这个数字推到了80%。推理中位耗时仅3分钟,在所有被测试模型中最快。
从28%到80%,不是渐进式改良。这是一次质的跃迁,也是AI从“能看会读”走向“能动手判断”的一小步,但可能是最接近现实世界的一步。
一张“看图找茬”的60题考卷
FAB的数据规模不大,只有60张照片,覆盖宜家三款产品。但它的难度从不在于量,而在于任务本身的多步推理链条。
Epoch AI采购了三款复杂度不同的宜家家具:STÄLL鞋柜(IKEA复杂度指数4032,14张照片)、TONSTAD床架(复杂度10878,25张照片)和GULLABERG八屉柜(复杂度21320,21张照片)。他们按说明书组装,在过程中故意制造了真实感强的安装错误,很多情况下还在错误发生后继续组装,使错误更难被一眼看出,就像一个用户真的装错了却浑然不知,继续往下装。
模型被要求完成三个层次的能力叠加:第一层,看懂照片里有什么(一个半装好的家具);第二层,读懂安装说明书(技术图纸与文字步骤);第三层,将照片与说明书逐步骤比对,发现差异,定位错误步,描述错在哪。
评分采用三级制。模型先要判断安装是否正确;如果识别出错误,必须准确指出错误发生在哪一步;最后,它的错误描述由GPT-5.6 Sol作为LLM裁判判定是否准确。裁判被故意设置为“非常宽容”,大致描述出问题就算通过。如果模型在80步的agentic sandbox预算内未能完成,会被要求直接给出最终答案,实际应用中只有不到5%的样本触到了这个上限。
最终排名揭晓:GPT-6 Astra以80%准确率领跑,Claude Fable 5.1以70%位居第二,Claude Opus 5以61%位列第三。作为对比参考,2025年11月时的最强模型Claude Opus 4.5在同一测试上只拿到28%。
精确到个位数的数字,框出了一个并不精确但无法忽视的事实:在物理世界推理这件事上,前沿模型在10个月内进步了近三倍。
快,是一种被低估的能力
准确率之外,速度可能是更贴近实际应用的指标。GPT-6 Astra的中位推理时间是每张照片约3分钟,在所有被测模型中最快,是此前领先模型的2到10倍。
3分钟听起来并不快。Epoch AI在报告中直言,对于实时的维修指导场景,这个速度仍然太慢。但对比此前领先模型动辄近十几分钟的等待,这是一个巨大的进步。
想象一个真实的维修场景:用户拿着手机拍下故障的洗碗机、歪掉的柜门或者装错的床架。如果AI能在几十秒到几分钟内给出“哪里错了”的判断,它就从一个实验室玩具变成了一个真正的工具。从“没有AI也能修”到“让AI看一眼再动手”,FAB暴露的不只是模型之间的准确率差距,更是通向实用化的物理世界推理速度门槛。
视觉推理:AI的下一个硬瓶颈
AI在文本推理上的进步已经近乎常规化了。GPT-6 Astra在前不久发布时,在ARC-AGI-3上首次达到了超过人类平均效率的表现,在FrontierMath Erdős上以Lean形式独自证明了两道开放数学问题。但在视觉推理(特别是“看到实物并对照说明书”这个任务)上,FAB给出了一个更真实、也更残酷的能力画像。
为什么视觉推理这么难?核心原因在于,它需要的不是“识别”,而是“比较”。
传统视觉模型擅长的事可以概括为“这是什么”,从一张图片中分辨出猫、人脸或交通标志。但FAB需要的能力是“这应该是什么 vs. 这实际上是什么”,把一张实物照片和一份技术图纸放在一起,逐像素、逐步骤地比对。这相当于要求模型同时具备图像理解、空间推理、多步骤指令匹配和异常检测能力,缺一不可。
Epoch AI在报告中指出,尽管这种能力对维修、安装、质检等经济活动有直接价值,但“几乎没有现有的视觉推理基准测试它”。FAB测试是填补这一空白的一次系统尝试。
AI模型在这项测试中呈现出了两种截然不同的错误模式。以Google Gemini 3.1 Pro为代表的部分模型倾向于“过度举报”,对大量正确安装也标记为错误。以OpenAI为代表的部分模型则倾向于“漏报”,错过实际存在的错误。一种模型像过度警觉的安检员,什么都要拦下来查一查;另一种像太随和的验收员,经常让问题蒙混过关。
在安全关键的检测场景中,漏报的危害远大于误报。一个没被发现的安装错误可能导致家具倒塌或设备故障。仅仅看准确率这一个指标,可能掩盖模型在真实部署中的行为差异。
十个月,从28%到80%:中间发生了什么
2025年11月,Claude Opus 4.5在FAB上只拿到28%,超过七成的照片模型都判断错了。2026年9月,GPT-6 Astra拿到80%,八成的安装错误它都能找出来。
这个进步背后是多重因素的叠加。
最核心的变化是推理(Reasoning)能力的飞跃。GPT-6 Astra在FAB上的运行方式不是“一次性地看照片给出答案”,而是被放置在一个agentic sandbox中:它可以在80步预算内自由调用图像放大工具检查细节、使用Python进行计算、翻阅PDF格式的安装说明书,并自主决定下一步做什么。这种“先探索、再回答”的范式,让它在处理“图纸对实物”这种模糊匹配时,比一次性推理模型有本质优势。
第二,多模态对齐的质量显著改善。GPT-6 Astra不只是能“看”能“读”,它能在看一张实物照片时想到说明书上的对应图示,在读一个安装步骤时映射到照片上的对应位置。这种跨模态的对应能力在十个月前的模型中几乎不存在。
但也需要冷静看到:即使是最强的GPT-6 Astra,在FAB上仍有20%的失败率。这20%里包括最隐蔽的错误,拍摄角度诡异的照片、错误被后续安装步骤遮挡的案例、甚至说明书上本就容易混淆的图示。这意味着视觉推理距离“可靠到可以放心交给用户”还有相当距离。
中国开源模型的七个月之痛
在这次测试中,中国模型的表现值得单独拎出来看。
最好的被测试中国模型是Moonshot AI的开源模型Kimi K3,参数规模达2.8万亿,是迄今最大的开源模型之一,2026年7月发布。它是中国阵营里得分最高的选手,但仍然是孤军奋战。
Kimi K3在FAB上落后前沿闭源模型约七个月。这个差距在Epoch AI的综合能力指数(ECI)上已被印证:Kimi K3的ECI得分158,排名第12,而同期闭源前沿模型在162到169之间,综合差距约4.4个月。但在FAB这个视觉推理专项上,差距被拉大到7个月。
4.4个月到7个月,说明了一个令人不安的趋势:在视觉推理这种高门槛任务上,开源追赶的难度远大于文本能力领域。
更严峻的是,参与测试的中国模型数量极其有限。DeepSeek V4 Pro和V4 Flash、智谱GLM 5.3甚至缺乏图像输入支持,根本没法参加FAB测试。在视觉推理赛道上,中国模型不仅落后前沿闭源模型,而且选项少得可怜。
这不只是单个公司的技术选择问题。视觉推理训练需要海量高质量的多模态数据和巨量算力。开源团队在这方面天然处于劣势,他们没有微软、Google或Amazon级别的云计算资源,也没有亿万用户的反馈数据来微调模型在“看实物对图纸”这类任务上的表现。
当然也要看到希望:Kimi K3作为一个开源模型,在多项编码测试中已经接近甚至超过了Claude Opus 4.8等闭源模型。Moonshot AI通过开源策略正在快速迭代模型能力。视觉推理的短板并非结构性问题,而是资源投入的时间差问题。
闭源加速,开源跟不跟得上
Epoch AI整体ECI数据显示,截至2026年9月,开源模型在综合能力上落后闭源前沿约4个月。这个差距自2025年以来基本稳定。但在视觉推理专项上,差距骤升到7个月。
这个反差释放了一个值得警惕的信号:随着AI能力从文本对话向物理世界推理延伸,开源追赶的难度正在从“算术题”变成“几何题”。视觉推理不仅需要更大的模型,更需要高阶的多模态对齐能力,而这两样需要大公司级的算力和数据投入。
这对于企业用户意味着什么?如果你的应用场景不涉及图像和空间推理,开源模型目前完全可以胜任。文本理解和代码生成上,Kimi K3、Qwen等开源模型已经逼近闭源水平。但如果你的业务涉及维修指导、自动质检、现场安装验收这类“看实物说话”的场景,闭源模型的领先优势仍然显著。
FAB之后:AI走进物理世界的临界点
Epoch AI的FAB测试为行业提供了一个宝贵的量化坐标:AI离“能看实物推理”还有多远?
答案是,正在接近临界点,但还没有跨过去。
GPT-6 Astra的80%和3分钟中位时间,已经足够让人看到“能用”的轮廓。如果再给六个月到一年的迭代周期,这个数字有望进入90%以上区间。届时,AI辅助维修、AI质检、AI现场安装指导将不再是论文中的demo视频,而是可以部署的产品。
在这条赛道上,受益者是同时拥有最强多模态模型和真实物理世界数据的公司。OpenAI在这两点上同时领先,GPT-6 Astra是最强的多模态模型,而OpenAI的生态系统正在为其提供源源不断的真实场景数据。
受影响最大的,则是“只刷文本榜”的模型公司。如果一个模型在MMLU和HumanEval上拿到再高的分数,但在FAB上连60%都达不到,它在更广泛的企业应用场景中就会面临信任危机。企业客户需要的不是一个会考试的天才,而是一个能上台干活的员工。
最后,对于中国AI公司来说,视觉推理的短板已经不能再忽略。当GPT-6 Astra已经在帮用户检查床架是否装反的时候,如果国产模型连一张家具照片都“看不明白”,那么“应用落地”四个字永远是空中楼阁。好消息是,Kimi K3已经证明了中国团队能做出世界级的开源模型。接下来要补的,在视觉推理这条线上,从数据、算力到对齐训练,每一环都需要实打实的投入。
这场“看图找茬”考试的最大意义,不是证明AI能装宜家家具。它第一次向行业证明:AI终于开始学会“看一眼就知道哪里错了”。而这项能力,离每一个家庭维修现场、每一间工厂质检车间、每一个装修工地,可能只差一到两个模型版本的距离。从考场到工位,隔的不是一个版本号,而是视觉推理范式从“能识别”到“能判断”的最后一公里。






快报