互联网时代的数据是被发现的,具身智能时代的数据需要被制造。
过去十年,AI 数据产业最重要的生产资料,是“人”。
成千上万的数据标注员坐在电脑前,给图片画框、给语音转写、给文本分类。自动驾驶最火的时候,他们标车道线、红绿灯和障碍物;大模型爆发后,他们又开始做 RLHF、指令数据和模型评测。
但到了具身智能时代,数据生产的方式正在发生一次更彻底的变化。
「人不再只是坐在电脑前“标数据”,而是开始真正进入物理世界“生产数据”。」
一个操作员戴着 VR 设备,远程控制机械臂拿起杯子、叠衣服、整理货架;机器人完成一次动作,背后同步产生相机视频、深度信息、机械臂关节角、末端执行器轨迹、夹爪状态甚至力觉数据。
过去的数据工厂,是一排电脑。未来的数据工厂,可能是一排机器人。
这也是为什么,一批传统数据标注企业正在重新审视自己的下一站:从“数据标注”进入“具身智能数采”。
表面看,这只是业务从 annotation 延伸到了 collection。
但真正的问题是:
「这是一次自然升级,还是一次跨行业冒险?」
本文看点
01
机器人数据需要被“制造”
02
把机器人实验室变成工业产线
03
从人力生意升级为基础设施
1、具身智能真正缺的,可能不是机器人,而是数据
过去两年,具身智能行业最热门的话题一直围绕“大脑”和“本体”。
谁家的 VLA 模型更强,谁家的机器人更便宜,谁家的灵巧手自由度更多。
但随着机器人公司真正开始训练模型,一个越来越现实的问题浮出水面:
「机器人数据从哪里来?」
大语言模型可以吃互联网。机器人不行。
一个语言模型想学习“苹果是什么”,互联网上已经有几十亿张图片和文本。
但一个机器人想学会“把苹果从桌子上拿起来放进篮子”,需要的数据完全不同。
模型不仅需要知道苹果长什么样,还需要知道:
手应该从什么方向接近;
机械臂每一帧应该移动多少;
什么时候闭合夹爪;
夹取失败以后如何恢复;
不同大小、材质、位置的苹果分别应该怎么操作。
这类数据不是天然存在于互联网里的。
它必须被“做”出来。
这也是具身智能和上一代 AI 最大的区别之一。
「互联网时代的数据是被发现的,具身智能时代的大量数据则需要被制造。」
于是,一个新的产业开始出现:
机器人数据工厂。
今天,一家机器人公司如果想训练一个泛化能力更强的 manipulation 模型,通常有几条路。
自建机器人团队和数据中心;
从真实用户机器人运行中积累数据;
通过仿真生成数据;
第四种,也是越来越重要的一条路径:
找外部公司帮助自己规模化采集真人示教数据。
这正好落在传统数据标注公司的能力半径附近。
2、数据标注公司最大的资产,不是标注员
很多人理解数据标注行业,第一反应是“廉价劳动力”。
但这恰恰低估了这个行业。
一家能够长期服务自动驾驶和大模型客户的数据公司,真正积累的能力通常有四个。
大规模人的组织能力
100 个人按照同一套 SOP 做同一件事并不难。1000 个人连续六个月,把错误率控制在一个很低的水平,这件事并不简单。
质量管理
AI 数据业务最核心的问题从来不是“能不能做”,而是:
「能不能稳定地做对。」
标注行业过去十年建立了一整套成熟的方法,包括任务拆分、培训、考试、抽检、复审、返工、golden set 和质量评分。
数据工程能力
真正大型的数据项目,并不是把文件扔给标注员。数据要经历采集、清洗、切片、分发、处理、质检、版本管理、交付等完整生命周期。
To B 项目交付能力
机器人公司需要的不只是操作员。它需要一个供应商告诉它:
一个月可以交付多少小时数据;有效率是多少;失败轨迹如何定义;传感器数据如何同步;数据格式如何交付;出现问题以后多快返工。
这些事情,恰恰是数据标注企业熟悉的语言。
所以,从商业组织形态来看,传统数据标注公司其实是目前最接近“具身数据服务商”的一类企业。
只是过去管理的是电脑和标注员。
未来要管理的是机器人、操作员和真实物理场景。
3、但机器人数据,不是“高级一点的数据标注”
这也是最容易踩坑的地方。
很多数据标注公司进入具身智能以后,会天然认为:
既然都是数据生意,那就把机器人买回来,再招一批操作员就可以了。
真正跑起来以后才会发现,完全不是一回事。
传统数据标注的问题主要发生在软件世界。
具身数据的问题,大量发生在物理世界。
机械臂会撞。相机会漂。夹爪会坏。标定会失效。网络会掉线。
一台机器人可能上午还能正常工作,下午某个关节就开始异常。
更麻烦的是,很多问题并不会让机器人彻底停止工作。
它仍然可以采集数据。
只是采出来的数据已经不能用了。
比如 RGB 和深度相机时间没有对齐;机械臂关节状态出现丢帧;相机外参变化;动作轨迹记录频率不稳定。
在传统标注项目里,一个操作员做错一个 bounding box,返工即可。
但在具身数据项目里,如果机器人运行了三个小时才发现标定错误,意味着:
「这三个小时的数据可能全部报废。」
因此,具身数采真正考验的是一个新能力:
「把机器人实验室,变成工业化生产线。」
这也是未来数据公司的竞争壁垒所在。
4、第一批机会,不在“做一个机器人数据 Scale AI”
所有进入新行业的公司都有一个冲动:
一上来就想做平台。
数据标注时代诞生过 Scale AI,因此很多创业者自然希望在机器人时代复制一个“Robot Scale AI”。
但对一家传统数据标注公司而言,更现实的路径可能恰恰相反。
💡 先不要做平台,先做产能。
原因很简单。
机器人行业现在最缺的不是一个新的数据管理 SaaS。
而是:
“我下个月需要 5000 个小时的 manipulation data,你能不能交出来?”
因此,一个数据公司的第一阶段产品,最好不是平台,而是一项非常具体的服务:
机器人遥操作数据采集。
客户提供机器人和任务。数据公司提供场地、操作员、SOP、质检和数据交付。
比如客户希望训练机器人整理桌面。数据公司需要在几十个不同桌面环境里,让操作员完成:
拿杯子;
移动瓶子;
整理餐具;
打开抽屉;
把垃圾放进垃圾桶。
每完成一次任务,就产生一条episode。
模型真正需要的,可能不是 1000 条完美轨迹。
而是几十万条包含不同物体、不同光照、不同桌面、不同初始位置的数据。
这恰好进入了传统数据公司的舒适区:
规模化复制。
5、最值得做的,不是“采数据”,而是“把采数据工业化”
未来具身数采产业真正可能产生利润的地方,不是单纯卖操作员小时。
如果一家企业只做:
客户给 20 台机器人;企业派 40 个操作员;然后按人天收费。
那么它最终仍然会变成传统外包业务。
价格竞争几乎不可避免。
真正应该建立的是一套“数据工厂能力”。
比如一个 50 工位的数据中心,可以像工厂一样计算:
每台机器人每天运行多少小时;
每小时产生多少条 episode;
成功率是多少;
设备利用率是多少;
操作员熟练度是多少;异常率是多少;数据有效率是多少。
最终甚至可以算出:
💡 一条合格机器人轨迹的生产成本是多少。
当这个数字可以持续下降,规模效应才真正出现。
一个成熟的机器人数据工厂,本质上应该像富士康。
客户给的是任务定义。工厂负责把任务拆解成可以规模复制的生产流程。
区别只是富士康生产的是手机。机器人数据工厂生产的是:
行为。
6、第一批客户,可能只有几十家
这是这个市场目前最大的现实。
数据标注行业曾经可以服务互联网、电商、金融、安防、地图、自动驾驶等大量行业。
但真正大规模采购机器人数据的客户,在今天仍然高度集中。
机器人本体公司;
VLA 和机器人基础模型团队;
大型科技公司的机器人实验室;
希望开发行业机器人的企业。
这些客户数量可能不算多,但单个客户的数据需求可能非常大。
原因是机器人训练存在一个非常残酷的规律:
「数据永远不嫌多。」
如果一家机器人公司发现,模型能力随着真实示教数据增加仍然持续提升,那么它的数据采购预算很可能迅速放大。
这会让具身数采呈现一种和自动驾驶数据非常类似的市场结构:
客户少。项目大。认证周期长。供应商一旦进入供应链,合作粘性很强。
因此,对于传统数据公司来说,第一个目标不是获取 100 个客户。而是:
拿下 3 个真正有模型训练能力的客户。
7、一个现实的入局方式:10 个人、4 台机器人、3 个月
如果今天是一家传统数据标注公司的老板,最危险的事情可能是:
先租一个 3000 平方米厂房。然后买 100 台机器人。再成立一个“具身智能事业部”。
更合理的方式,是做一个非常小的MVP。
第一阶段甚至只需要:
4 台机械臂;
4 套遥操作设备;
8 个操作员;
1 个机器人/ROS 工程师;
1 个数据工程师。
总共大约 10 人。找一个 100—200 平方米的场地。场景也不用复杂。
桌面、货架、厨房台面。
选择 20—30 个高频 manipulation task:
拿。放。移动。整理。开抽屉。关抽屉。倒水。折叠。装箱。
然后验证三个指标。
第一:一天到底可以稳定采多少有效小时?
第二:数据有效率能不能稳定超过 90%?
第三:客户是否愿意持续购买?
如果这三个问题没有跑通,就不要扩张。
因为具身数据真正的商业模式,从来不是卖机器人。而是:
设备利用率 × 人员利用率 × 数据有效率。
8、真正的壁垒,会从“人力池”变成“任务库”
数据标注公司过去最喜欢讲一个指标:
有多少标注员。
10 万人。20 万人。覆盖多少城市。
但到了机器人时代,这个数字的重要性会下降。
因为机器人操作员是可以快速培训的。
真正有价值的是企业积累了多少:
task template;scene template;failure case;operation policy;quality rule。
举个例子。“把杯子放进洗碗机”看起来只是一个简单任务。但工业化以后,会拆成大量变量:
杯子材质。杯子大小。杯子位置。洗碗机高度。门打开的角度。环境光照。左右手。抓取姿态。失败恢复方式。
这些变量组合以后,本质上就是一个巨大的任务空间。
因此,未来优秀的数据公司可能会建立一个“机器人任务库”。
客户说:我要训练家庭机器人。数据公司不是从零开始设计采集方案。而是直接调用:
Kitchen Pack。包含 300 种场景、2000 个任务组合和对应的质检规则。
这时,公司卖的就不再是“操作员”。而是:
「数据生产能力。」
9、再往后一步,是从数据外包走向数据资产
具身智能数据行业最终可能出现三个阶段。
第一阶段:人力服务。客户给机器人,供应商提供操作员。
第二阶段:数据工厂。供应商自己建设机器人产线,根据客户需求规模化生产数据。
第三阶段:数据资产。供应商提前生产标准化数据,然后授权给多个模型公司使用。
第三阶段一旦成立,商业模式就会发生巨大变化。
因为服务业务卖一次赚一次。数据资产可以卖很多次。
比如一家数据公司积累了 100 万条家庭场景 manipulation episode。其中包括厨房、卧室、客厅、货架、仓储等大量任务。
如果这些数据足够标准化,它未来可能会像今天的图像数据集一样,成为机器人基础模型的训练资产。
那时,这家公司就不再是一家传统意义上的外包公司。而更接近:
「机器人时代的数据基础设施公司。」
10、真正的机会窗口,可能只有两三年
具身智能数据服务现在最大的机会,恰恰来自一个短暂的不平衡。
模型公司的数据需求增长速度,大概率会快于自己的数据基础设施建设速度。
早期机器人创业公司最重要的任务是:
做机器人。训模型。找融资。拿订单。
它们不一定愿意同时管理几百个操作员、几十个场景和上百台设备。
于是第三方数据公司获得了窗口期。
但这个窗口不会永远存在。
当一家头部机器人公司的数据需求达到足够大规模以后,它一定会考虑自建。
因此,第三方数据公司必须在客户自建之前建立一个足够强的理由:
「为什么外包给你,比自己做更便宜、更快、更稳定。」
这个答案不应该是:“因为我们人工便宜。”而应该是:
同样 100 台机器人,你的数据有效率比客户高;
设备利用率比客户高;
操作员培训速度更快;
新任务上线时间更短;
失败数据管理更成熟。
最终让客户发现:自己建一个数据中心,需要管理机器人、场地、招聘、培训、设备维护和质量体系。
而找你,只需要提出一个需求:
「给我 10 万条高质量轨迹。」
11、AI 数据产业,正在从电脑桌走向真实世界
过去十年,数据标注行业经历过两次巨大的机会。
一次是计算机视觉。一次是大模型。
很多公司抓住过第一个周期,却错过了第二个。
现在第三个周期正在出现。
只是这一次,数据不再只存在于硬盘里。它发生在真实世界。发生在机械臂拿起杯子的那一秒。发生在机器人推开抽屉的一瞬间。发生在人类把自己的动作,通过遥操作设备传给机器人的过程中。
对于传统数据标注公司来说,具身智能最大的机会,并不是把“数据标注”四个字换成“具身智能”。而是完成一次更彻底的能力迁移:
「从管理数据的人,变成管理数据生产线的人。」
未来几年,这个行业或许会诞生一种新的公司。
它没有最先进的机器人。也没有最大的基础模型。但它拥有几千台持续运行的机器人、数万个真实场景,以及每天稳定生产数百万条行为轨迹的能力。
如果说大模型时代最重要的基础设施之一是 GPU 集群。那么在具身智能时代,另一种基础设施可能正在形成:
「机器人数据工厂。」
💡 而这,或许正是传统数据标注企业最后一次把“人力生意”,升级成“基础设施生意”的机会。
培训咨询热线:
北京中心:010-58612706
成都中心:028-67835378








