宇树翻跟头,Figure爬梯子,人形机器人两条路

2026.08.02 11:24
2026年7月,Figure AI的F.03人形机器人完全自主爬上了真实金属梯子,全程无遥控、无云端接管。这一看似简单的动作,背后是感知、平衡、力控三项技术瓶颈的集体突破,比任何后空翻和跳舞都更接近人形机器人的商业落地。当中国机器人公司还在表演炫技,Figure已经在攻克真实工厂场景中最核心的通用能力——爬梯子只是开始,人形机器人正在从为机器人准备的世界走向为人类设计的世界。

你敢信?人形机器人行业正在发生一件比任何后空翻都重要的事——它爬上了一架梯子。

2026年7月,Figure AI 创始人 Brett Adcock 在社交媒体上发布了一段视频。没有激昂的背景音乐,没有炫酷的灯光,画面里只有一个1.73米高、61公斤重的金属人形机器人,面对一架普通的金属梯子,伸出右手抓住第一根横撑,左脚踩上去,然后右脚,然后左手。一步一步,缓慢而坚定地爬了上去,站到了顶端的平台上。

全程没有任何遥控器,没有云端接管,没有工程师在后台悄悄修正。F.03 用它自己的眼睛看横撑的位置,用它自己的手和脚协调重心,用它的算法实时计算每一厘米的偏移量。

你可能觉得这没什么。对人来说,爬梯子三岁小孩都会。但如果你知道在此之前,人形机器人面对梯子时的集体表现——要么原地发呆,要么需要人扶,要么在实验室里摆个矮梯子意思一下——你就会明白,这段看似笨拙的攀爬,可能比十个后空翻更接近人形机器人的商业落地。

现象层:两个世界,两种表演

2026年,关于人形机器人,你大概率看到的是这样的画面。

2026年春晚,宇树科技的G1机器人在央视舞台上表演武术,后空翻、醉拳、集体舞,动作行云流水,引发全网刷屏。波士顿动力的Atlas在CES 2026上展示了后空翻,虽然落地时手部保护罩被甩飞,但仍然展示了惊人的动态平衡能力。国产机器人公司轮番秀出后空翻、跑酷、钻火圈,每个视频都在社交媒体上获得百万点赞。

这些画面让人兴奋,但它们有一个共同点:准备好的舞台

宇树G1的后空翻,是预设动作序列的精确执行,需要工程师数月定制开发,标配遥控器,远程操控是常态。波士顿动力Atlas的后空翻,同样需要精确标定的场地和环境。这些表演固然展示了惊人的运动控制能力,但本质上是在“为机器人准备的世界”里跳舞。平整的地面,充足的灯光,预设好的动作序列,随时待命的工程师。

而Figure F.03的爬梯子,发生在另一个世界。

一架真实的金属梯子,横撑间距不均,表面有磨损,放在一个没有特别改造的普通环境中。F.03没有预设动作序列,它必须自己用摄像头识别每一根横撑的位置,自己规划手和脚的抓握点,在身体倾斜、重心不断变化的过程中,实时调整姿态和力量分配,完成一次全自主的攀爬。

从表演到干活,这两个世界之间隔着一道天堑。而爬梯子,就是跨越这道天堑的第一座桥。

分析层

为什么爬梯子这么难

对于人形机器人来说,爬梯子是出了名的鬼门关。

感知容错率极低。梯子的横撑宽度通常只有3到5厘米,脚踩的面积比一张银行卡还小。手抓的竖撑也不过2到3厘米粗。机器人必须在移动中精准识别每一根横撑的位置,偏差超过1厘米就有滑脱风险。这和走平地的难度完全不是一个量级。走平地时,脚底的支撑面是整块地面,偏差几厘米也没关系。

动态平衡极难维持。人爬梯子时身体是倾斜的,重心不在脚掌正上方,而是悬在梯子外侧。每往上一步,重心位置都在变化,需要上肢和下肢协同调整。对双足机器人来说,这意味着它必须在每一步都重新计算全身的质心位置,并调整关节力矩,防止向后翻倒。

视觉、触觉与运动必须形成一个实时闭环。单纯看到横撑位置不够,机器人的手抓住横撑时,需要通过触觉传感器判断是否抓牢;脚踩上去时,需要通过力传感器判断是否踩实。F.03的指尖传感器可以检测到约3克压力,足以感知一枚回形针的重量。这些信息必须实时融合,毫秒级做出反馈。任何一个环节出现延迟或误判,结果就是滑落。

正因如此,在F.03之前,几乎所有机器人公司在面对梯子时都选择了绕道走。要么用坡道替代梯子,要么在实验室里用矮梯子慢慢蹭,要么干脆让机器人只走平地。

这不是在做秀,这是在做工程

Figure F.03的爬梯子之所以重要,不是因为技术难度本身,而是因为它的通用性。

F.03没有为这把特定的梯子做过特训。根据Brett Adcock的表述,F.03运行的是Helix AI系统,Figure自研的视觉-语言-动作大模型(VLA)。Helix 02版本已经实现了全身自主控制:一个统一的神经网络,直接从像素输入控制全身所有关节,不需要任务特定的微调。这意味着F.03爬的不是这把梯子,而是任何梯子。

这一点和宇树G1的后空翻有本质区别。G1的后空翻是预设动作序列的精确执行,需要工程师数月开发,是运动控制编程的胜利。F.03的爬梯子是自主感知、决策与执行的完整闭环,是具身智能的胜利。

打个比方:G1后空翻就像体操运动员在训练馆里反复练习一套固定动作,节奏、力度和落点都精确到毫秒。F.03爬梯子则像让一个普通人第一次走进一个完全陌生的建筑工地,自己判断哪架梯子稳、哪根横撑能踩、怎么爬最安全。

前者是表演,后者是通用能力。

一条梯子背后的390亿美元产业逻辑

Figure AI 目前估值390亿美元,在2025年9月完成了超过10亿美元的C轮融资,投资者包括Parkway Venture Capital、英伟达、英特尔资本、微软、OpenAI Startup Fund和Jeff Bezos的Bezos Expeditions。这家2022年才成立的公司,没有公开披露过收入,凭什么值390亿美元?

答案就在这架梯子上。

Figure的商业模式是机器人即服务(Robot-as-a-Service),目标客户是工厂、仓库、建筑工地等需要体力劳动的行业。在这些场景中,机器人需要面对的不是为机器人准备的世界,而是为人类设计的世界。狭窄的通道,不平的地面,需要爬高上低的作业环境。

能爬梯子,意味着F.03可以上脚手架、可以进狭小夹层、可以做高处检修。它从地面员工变成了全能工人。

在现代制造业中,有大量工作需要在不同高度上完成:设备检修、管线巡检、货架理货、建筑施工。这些工作占制造业总用工量的相当比例,但因为需要爬高,长期以来只能由人类工人完成。如果人形机器人可以自主爬梯子并完成这些任务,它的可替代劳动场景将大幅扩展。

Figure的BotQ工厂已经实现了每小时生产一台F.03的速度,从每天1台提升到每小时1台,仅用了不到120天。截至2026年5月,已交付超过350台F.03。第一条产线年产能达1.2万台,计划四年内生产10万台。配合爬梯能力,每一台机器人能覆盖的工作场景,都在呈指数级增长。

两条路线,两种哲学

2026年的人形机器人行业,正在发生一次深刻的路线分岔。

一边以宇树科技、波士顿动力为代表,走的是运动能力极致化路线。后空翻、连续空翻、跑酷、武术,这些动作在技术层面极难实现,视觉冲击力极强,适合社交媒体传播和品牌曝光。但问题是,这些能力在工厂里有什么用?一个在后空翻上做到极致的机器人,面对一个需要爬梯子的实际场景,可能仍然束手无策。

另一边以Figure为代表,走的是任务通用性路线。不追求运动能力的极限,而是追求在真实环境里完成真实任务的能力。从洗碗、叠衣服到爬梯子,Figure一直在打磨让机器人适应人类世界的能力,而不是让人类世界适应机器人。

两条路线没有绝对的对错。宇树和波士顿动力的运动控制能力,在未来的特种作业(救灾、勘探、军事)中有巨大价值。但如果说谁更接近人形机器人走进工厂那一天的到来,爬梯子的Figure显然走在了前面。

结论与展望

F.03的爬梯子,标志着一个转折点:人形机器人从为机器人准备的世界走向为人类设计的世界。

在此之前,机器人公司都在做同一件事——降低世界对机器人的要求。坡道替代楼梯,加宽通道,预设标记,人工遥控。这些妥协让机器人能够看起来在干活,但本质上,是整个环境在为机器人服务。

而现在,F.03爬上了人类的梯子。这意味着它开始适应人类的三维世界了。它不再要求世界为它改变。

这就像自动驾驶第一次自己开上了多层立交桥、开进了地下车库。在此之前,所有自动驾驶demo都是在为自动驾驶准备的道路上跑。有清晰的标线,没有复杂的立交,天气条件良好。而真正能开上立交桥的那一刻,意味着自动驾驶进入了真实世界。

人形机器人同理。能爬梯子,意味着它能进建筑工地、能上脚手架、能做高空检修、能在立体空间里工作。它从地面员工变成了全能工人。

当然,F.03的爬梯子还很慢,像80岁老大爷一样谨慎。速度可以练,算法可以迭代。能自主完成这个能力,属于真正的0到1。从1到100,只是时间问题。

而那些还在翻跟头、跳舞、后空翻的机器人,可能需要认真思考一个问题:当观众看腻了表演,真正需要干活的时候,你的机器人能爬上一架普通的梯子吗?

人形机器人真正进厂的那一天,可能就是从这一爬开始的。

作品声明:内容由AI生成