一台人形机器人走进一栋从未见过的房子,面对陌生的床、陌生的毛巾、陌生的玩具,在没有任何提前训练的情况下完成了三项家务,成功率56%。这是Figure AI在2026年9月17日交出的成绩单。
放在五年前,这是一个科幻情节。放在两年前,这是一个实验室里反复排练后的Demo。而今天,它发生在旧金山湾区30栋真实住宅中,420次尝试,237次成功。Figure明确表示,机器人在这些房子里没有提前采集过任何数据。
估值390亿美元、由布雷特·阿德科克创立的人形机器人公司Figure,刚刚发布了其神经网络模型的最新版本Helix 2.5。它不是一款新的机器人硬件,跑的仍然是Figure 03,而是一次纯软件层面的跃迁。但这次跃迁可能比任何一次硬件迭代都更接近那个终极问题:人形机器人到底什么时候能走进你家?
56%零样本,比听起来更猛的进步
Helix 2.5接受的三项测试任务分别是整理床铺、叠毛巾、归置客厅玩具。每一件都平凡到人类不需要思考,但对于机器人来说,这三件事各自代表着一类极其困难的泛化挑战。
整理床铺需要理解床单的物理形态,它是软的、可折叠的、有弹性的,需要协调双臂运动,需要在不同尺寸和款式的床具之间迁移能力。叠毛巾涉及对可变形物体的精确操作,毛巾不是刚体,每一次折叠的角度和力度都必须在线调整。归置玩具则是最难的,不同形状、不同材质、不同摆放方式,而且散落状态完全随机。
最终成绩单如下:铺床以94/140(67%)领先,叠毛巾87/140(62%),归置玩具56/140(40%),综合成功率56%。
这个数字单独看可能不够惊艳,毕竟还有44%的失败率。但关键在于对照基线。如果拿掉Helix 2.5的关键预训练数据,用同样的硬件、同样的任务设置、从零开始训练一个模型,其成功率仅为9%。从9%到56%,是超过6倍的提升,而且是在完全陌生的环境中实现的零样本泛化。
Figure CEO布雷特·阿德科克将Helix 2.5描述为“公司承担过的最重要项目”。这句话的分量,需要放在一个更大的叙事里理解。
Index,藏在56%背后的“人类经验工厂”
Helix 2.5的飞跃性进步有一个明确的来源,Figure在2026年8月25日上线的Index数据平台。这是一个收集人类行为记录、用于训练机器人模型的数据库。Index的运作模式堪称“人类经验工厂”。它从大量真人参与者那里收集日常操作视频和传感器数据,经过过滤、去重、平衡和标注五步流水线处理,最终成为训练Helix模型的原料。
Figure披露的数据令人咋舌。Index目前拥有超过50万名活跃数据提供者,他们被称之为“创作者”,累计上传超过1600万条视频,公司已向这些创作者支付了1500万美元报酬。Index上线时以每秒30分钟的速度接收新视频,现已提升至每秒约35分钟的新人类经验数据。而Figure宣称已为Helix的训练投入了35亿美元的算力资源。
每1000小时采集数据中,Index包含373项独特任务、1146种独特操作对象、116种独特环境。这些不是实验室里的标准化场景,而是真实人类在各种真实环境中与各种真实物品交互的记录。
这才是Helix 2.5零样本能力的底层秘密。它不是靠更聪明的算法打败了9%的基线,而是靠一个规模前所未有的“人类行为数据库”让模型先学会了人类是怎么做这些事的。用阿德科克的话说,不是让机器人从零开始理解世界,而是让机器人先看过无数人是怎么理解世界的。
从Helix到Helix 2.5,一条加速的进化线
要理解Helix 2.5的位置,需要回溯Figure的AI模型进化史。
2025年2月,Figure发布了第一代Helix,一个视觉-语言-动作(VLA)模型,首次实现用同一套神经网络权重控制两台机器人协作。它能让机器人在无需手动编程的情况下抓取几乎所有小型家居物品。这个模型的意义在于,Figure证明了“单一模型、多项技能”是可能的。
2026年1月,Helix 02上线。这是一次质的飞跃,将控制范围从上半身扩展到全身。Figure引入三层系统架构:System 2负责高层推理和目标规划,System 1以200Hz频率将感知转化为关节指令,System 0作为底层全身控制器以1kHz频率处理平衡、接触和协调。Helix 02用单一神经网络取代了109504行手工编写的C++代码,并展示了长达4分钟的连续自主洗碗操作。Figure称其为“迄今人形机器人自主完成的最长时间跨度、最复杂的任务”。
现在,2026年9月的Helix 2.5,在继承了Helix 02全身控制架构的基础上,用Index数据集的预训练实现了从“一个机器人能在特定环境中完成复杂任务”到“一个机器人能在从未见过的环境中完成任务”的能力跳跃。Helix 2.5还实现了数据效率的巨大提升,使用仅一半的微调数据就达到了与Helix 02相同的任务成功率。
这条进化线的方向非常清晰,从“能干活”到“在哪都能干活”。
家用人形机器人的三岔路口
Figure不是唯一在冲刺家用人形机器人终局的公司。理解Helix 2.5的行业意义,需要把它放在更大的竞争格局中看。
特斯拉Optimus是Figure最常被比较的对象。马斯克为Optimus规划了激进的量产路线,2025年中V2版本产能目标每月1万台,2026年以后第三条生产线瞄准每月10万台。但现实是,截至2026年初,Optimus在工厂内“仍然没有做有用的工作”,这是马斯克自己在Q4财报会上承认的。Optimus的硬件迭代很快,2026年2月的Gen 3版本手部自由度提升到22个,但在自主任务完成的软件能力上,特斯拉尚未发布类似Helix 2.5的零样本泛化测试数据。
挪威公司1X的Neo机器人走了一条不同路线。Neo采用轮式底盘而非双足行走,降低了稳定性难度,在家务演示中展示了洗碗、叠衣服等能力。但轮式底盘也意味着它无法像Figure 03那样处理上下楼梯、进出不同高度的空间。
英伟达在2025年3月发布的Project GR00T则代表平台型路径。英伟达不造机器人,但提供底层模型和算力平台。这一定位让GR00T有可能成为“机器人操作系统”标准,但也意味着它不会直接与Figure在终端市场竞争。
从融资角度看,Figure处于绝对领先位置。2025年9月完成的C轮融资超过10亿美元,估值达到390亿美元,较2024年2月的26亿美元估值暴涨15倍。投资人包括英伟达、微软、英特尔资本、贝佐斯、OpenAI初创基金等。超过19亿美元的总融资额、位于桑尼维尔的BotQ工厂(每90分钟下线一台机器人,2026年4月实现月出货量翻倍),这些让Figure的资金厚度和执行速度都远超同行。
56%之后,家用机器人离你还差几个迭代
回到那个最核心的问题,人形机器人什么时候能走进你家?
Helix 2.5的56%给出了迄今最明确的乐观信号,但同时也画出了一道不能回避的底线。
乐观的一面是,零样本泛化是家用人形机器人面临的最硬核技术瓶颈之一。一个家庭不是一个固定的场景,你家的客厅和邻居家的客厅不一样,你家今天的客厅和明天也不一样。Helix 2.5证明了不预先训练就能干活是可行的,并且成功率可以从个位数拉升到五成以上。这是从“不可能”到“可能”的质变。
克制的一面是,56%同时意味着44%的失败率。家用场景对可靠性的要求接近于100%,没有人能接受一台每做两次家务就搞砸一次的机器人。而且此次测试的三项任务属于中等复杂度,现实中家庭需要的任务种类远超铺床、叠毛巾和归置玩具。做饭、清洁、照看儿童、物品归位,每种能力都需要独立验证。
此外,安全性仍然是一个悬而未决的问题。Figure前产品安全负责人罗伯特·格伦德尔(Robert Gruendel)在2025年11月起诉公司,理由是他因提出“机器人力量足以击碎人类头骨”的安全担忧而被解雇。诉讼文件指出,测试中Figure 02的冲击力超过了击碎颅骨所需阈值的两倍,某些撞击达到人类痛阈的20倍,甚至在一次故障中在钢制冰箱门上留下了四分之一英寸的划痕。Figure否认了这些指控,称其离职系绩效原因。
这一事件暴露出家用场景中一个尚未被充分讨论的核心矛盾:机器人要足够强壮才能做家务,但足够强壮本身就意味着潜在的安全风险。
在家用场景全面铺开之前,Figure选择了一条更务实的路径,先在商业和工业场景中积累经验。2025年,Figure 03进入宝马工厂进行试点,与Catalyst Brands签署了4000万美元的自动化部署协议。这些商用部署不仅是收入来源,更是AI模型的训练场,在真实生产环境中反复打磨感知、决策和操作能力,再迁移到家场景中。
CEO阿德科克曾明确表态,Figure的目标是在2026年让机器人具备在家中“全天自主完成大部分事务”的能力,然后才会推向消费者。这意味着Helix 2.5不会是最后一个版本,甚至可能不是最重要的一版。
56%零样本泛化是一个里程碑,但它更像是一盏信号灯,照亮了尚未完工的最后一公里。
机器人的手脚已经够快了,Helix给了它一颗能思考的头脑,Index给了它一双看过千万次人类操作的眼睛。但从“能做好”到“永远不会搞砸”,从“能在30栋房子里干活”到“能在任何一栋房子里干活”,这中间的鸿沟正好定义了接下来几年人形机器人行业的全部争夺。






快报