文 | 具身志,作者 | 仲庆元,编辑 | 越十三
一台机器人还没正式进厂,它的培训账单先到了。
8月12日,具身智能数据基础设施公司元点科技披露,40天内完成两轮融资。相比融资速度,更值得注意的是它拿到的第一批生意——已经启动的它石智航千万级数据订单。
这笔钱购买的不是一批已经装进硬盘、按小时计价的数据,而是一套围绕真实任务展开的服务。元点科技负责定向场景数据采集,再通过MatrixOS平台处理,相关服务被用于支持它石智航A系列机器人进入安波福工厂的多个作业场景。
具身智能行业过去几年一直在说数据重要,问题是,相比于大语言模型可以从互联网上读完人类留下的大量文字和图片,机器人要理解的却是一个更麻烦的世界,很多经验没有现成语料,必须有人或者机器人在真实环境里做一遍,再将视觉、动作、关节状态、力觉和触觉记录下来。
不过,“数据很重要”和“有人愿意花真钱购买数据服务”,终究是两件不同的事。
现在,第二件事开始发生了。
1、机器人为什么要先交培训费?
把一台机器人送进工厂,它要面对的并不是一个抽象的“工业场景”,而是一连串具体到近乎琐碎的问题。
工件从哪里送来,允许多大误差,抓取失败后如何恢复,动作做到什么程度才算通过验收,都需要在现场重新适配。
这也是理解元点科技订单的关键。它石智航购买的不是若干TB的数据,而是让机器人更快学会一项工作的一段研发与交付流程。
这条流程从任务定义开始,经过场景采集、数据处理和模型训练,最终还要回到现场验证。机器人在哪里失败,就要补充哪里的经验,再进入下一轮训练。
因此,机器人数据并不像一批摆在货架上的标准商品,更接近一种仍在生产中的经验。数据公司也不只是帮忙“多录一些视频”,而是在回答机器人缺什么,哪些动作值得采,哪些数据能够进入训练,以及现场失败后应该补采什么。
理论上,本体公司离机器人最近,完全可以自己完成这些工作。事实上,很多头部公司也正在大规模自建数据采集体系。问题在于,当机器人要进入更多工厂、商场和家庭,数据生产会逐渐变成一种与造机器人不同的组织能力。
本体公司要研发硬件、控制系统和模型,要管理供应链,还要负责客户交付;数据生产则需要寻找场景、部署设备、组织采集、统一格式,再完成清洗、筛选和管理。前者更像制造一台机器人,后者越来越像经营一张分布式生产网络。
如果每进入一个新场景,本体公司都要从头组建采集团队,它很容易陷入无休止的项目交付。专业数据公司的机会,就来自这部分工作能否被工具化、平台化和规模化。
所以,数据生意早于机器人大规模上岗,并不矛盾。训练机器人如何工作,本来就可能比机器人真正工作更早成为一门生意。
2、数据从研发成本里“长”了出来
过去,机器人公司同样在为数据花钱,只是这些钱通常藏在研发预算里。
建设数采场地、购买遥操作设备、招募操作人员、组织算法工程师清洗和训练,都会形成成本。但这些成本未必对应一家独立供应商、一份单独合同和一个公开价格。
如果说数据只是造机器人的内部环节,那么元点科技案例的变化,是让这部分成本拥有了自己的订单。
假若元点科技只是一个孤立案例,还不足以说明产业分工正在形成。8天前出现的另一条消息,补上了更重要的一块证据。
8月4日,恺望数据宣布完成逾亿元战略融资。投资者名单中不只有产业基金和财务机构,还出现了鹿明机器人、松延动力、自变量机器人,以及智元旗下觅蜂科技等具身智能产业方。
这些机器人企业大多仍在融资、研发和扩张,却已经拿出资金,成为一家数据公司的股东。
如果数据只是普通外包服务,机器人公司按项目采购即可,为什么还要通过股权建立更深的关系?
媒体报道揭示了一部分答案。松延动力等产业方希望持续获得真实场景中的高质量数据,而恺望则在第一视角裸手、触觉手套、UMI夹爪、第三视角视频等数据品类上布局,并进入商超、餐饮、家庭和汽车工业产线等场景。
现有公开材料不能证明这些投资附带排他条款、数据优先权或特殊所有权安排,但是多家本体公司不约而同选择成为数据公司的股东,本身已经说明:数据正在从普通服务,变成机器人公司愿意提前绑定的上游能力。
有意思的是,机器人公司一直把数据视为自己的核心资产,现在却开始把其中一部分交给外部公司生产。其中缘由可能并不是数据不再核心,恰恰是它重要到不能只依赖临时搭建的内部团队。
当数据规模继续扩大,一套采集工具可以在不同场景重复部署,一套质量控制系统可以减少无效数据,一张场景网络可以服务多家公司。第三方公司只有把这些能力沉淀下来,才可能获得单一本体企业难以形成的规模效应。
而这也正是目前尚未得到证明的地方。一笔千万级定向服务订单,可以证明需求开始出现,却不能证明成熟的数据商品市场已经形成。
在「具身志」看来,判断这门生意能不能独立,关键不只是第一位客户愿意付多少钱,而是第二位客户能否从第一位客户的项目中受益。
如果每种机器人、每项任务、每个工厂都必须从头采集,所谓数据平台最终仍可能是一家项目公司。只有工具、流程、场景资源乃至部分数据能够跨项目复用,它才真正具有基础设施的雏形。
数据从研发成本里“长”成一门独立生意,靠的不是给原有外包换一个更时髦的名字,而是能否建立规模经济。
3、需求已出现,产品未定型
机器人公司对数据的需求是真实的,问题在于,没有人能够确定今天最值钱的数据,几年后是否仍然值钱。
目前最直接的办法,是通过遥操作采集机器人动作数据。这类数据离执行最近,却受到设备、人力和本体差异的限制。另一批公司正在尝试从人类视频中扩大数据来源。
8月10日,DYNA Robotics发布DYNA-2。按照公司披露,这一模型使用超过100万小时的第一视角人类视频进行预训练,再用少量本地数据适配具体机器人。它试图证明,机器人不必完全依赖昂贵的遥操作数据,也能先从人类行为中学习大量物理经验。
![]()
虽然DYNA所发布的模型还需要更多外部验证,但它已经提出一个足以影响数据价格的问题。如果更便宜、更丰富的人类视频能够承担大部分预训练,昂贵的机器人动作数据可能只需要集中在最后的动作适配和现场优化。
与此同时,潜界科技正在研发的UTAM又把触觉、机器人状态和动作纳入统一训练链路。这意味着,今天只有视觉和动作的数据,未来也可能被认为不够完整。
人类视频、仿真数据、真实机器人数据和触觉数据未必互相替代,更可能分布在预训练、后训练和现场优化的不同阶段。但不同组合会直接改变每一种数据需要生产多少、应该卖多少钱。
于是,机器人数据产业出现了一种少见的状态。需求已经真实到足以产生千万级订单,产品定义却仍在变化。
这也是为什么,把今天的数据公司直接称为“机器人时代的Scale AI”,还为时过早。
它们确实有机会成为基础设施。多数本体公司都缺数据,而数据采集又重场景、重运营,假使第三方平台能够同时连接本体公司、模型公司和行业客户,就可能拥有更大的生产网络,并把采集设备、处理工具和场景成本摊薄到更多订单中。
但机器人数据也比文本和图片更难标准化。不同本体之间未必能够直接迁移,工厂数据可能涉及生产机密,头部公司可能坚持自建闭环,新模型还可能让某些昂贵数据迅速折旧。
因此,数据可以成为资产,也可能成为库存。
判断一家机器人数据公司究竟是基础设施,还是高端项目外包商,不能只看它宣称拥有多少小时、多少节点或者多少TB数据。
真正重要的是三个结果:一份数据能否服务更多机器人,新增数据能否持续提高任务成功率,以及单位能力提升的成本能否不断下降。
“最关键的,是数据与真实工作之间的兑换关系。”一家机器人本体公司负责人曾对「具身志」分享过他对数据的看法。
哪怕十万小时数据也未必构成壁垒。如果它只能服务一个客户的一项任务,仍然只是一次项目交付。相反,即使数据量没有那么惊人,只要它能反复帮助机器人缩短调试时间、提高任务成功率、进入更多客户现场,就开始拥有基础设施的价值。
元点科技的千万级订单还不足以证明一个成熟市场已经形成,但它至少记录了一个产业变化:在机器人能够大规模出售自己的劳动以前,机器人公司已经开始为它们学习劳动支付费用。
未来真正决定数据价格的,不会是采集了多少小时、保存了多少TB,而是这些数据能够让机器人少调试多少天、多完成多少任务、多进入多少真实客户现场。
机器人还没有大规模上岗,但训练机器人如何工作的生意,已经先开张了。







快报
根据《网络安全法》实名制要求,请绑定手机号后发表评论