在具身智能领域,今年融资总额已突破百亿元,但鲜有人提及一个关键数字:训练一个能完成抓杯子动作的机器人策略,背后需要一个人花费大约半年时间进行数据清洗。

不是数据采集,而是数据清洗。

摄像头拍摄的原始素材中,仅有约三成能真正用于训练。剩余七成包括机械臂的无意义抖动、传感器异常产生的鬼影,以及机器人“偶然”完成任务但因果逻辑断裂的无效轨迹。湖北人形机器人创新中心提供的数据更直观:一名训练师每天实际操作8小时,最终可用的有效数据只有两三个小时。

换句话说,当前最前沿的机器人公司,其核心产能瓶颈竟是一个类似20世纪90年代制造业的问题——品控。

而这项“品控”工作的单价,已高达每小时数百元,却仍难找到愿意长期从事的人。真机遥操采集有效数据的成本为每小时500至2000元,无本体头戴视频采集可将成本降至三分之一,但数据清洗这一环节,无人能绕过。

这一场景几乎不会出现在任何具身智能的融资报道中。但正是这些“做品控”的人,决定了估值数十亿的机器人公司能否真正让机器学会操作。

大模型已饱和,机器人仍在挨饿

要理解为何“数据清洗”突然变得如此重要,需先审视AI数据工程的两条截然不同的路径。

大模型时代的数据标注已高度成熟。为图片画框,Scale AI等公司按0.035美元一条简单框、0.84美元一张语义分割计费;复杂3D点云每帧4.5至6.2美元。在众包平台Amazon Mechanical Turk上,简单图像分类标注的官方指导底价为每张图1.2美分($0.012)。标注员分散全球,通过Remotasks、Appen接单,像富士康工人一样完成微任务。2023年理想汽车披露,过去一年1000万帧自动驾驶图像人工标定外包成本近一亿元,改用大模型自动标注后,一年工作量3小时完成。整个行业正被“模型预标注+人工审核”模式快速吞噬。目前简单图像分类标注的官方底价已低至$0.012/张,而复杂标注(如边界框)价格仍在$0.08–$0.13,不同任务类型价格差异显著。

但具身智能的数据清洗,完全是另一番景象。

这里处理的数据并非从互联网爬取的文本和图片,而是机器人在物理世界中生成的多模态时序流——RGB-D视频、激光雷达点云、关节角度、力反馈、IMU数据,全部混杂在一起,还伴有时间戳不对齐、传感器漂移、摄像头抖动等“物理世界的噪音”。据媒体报道,Micro1每月从71个国家约4000名工人处收取16万小时头戴视频,工人时薪因地区而异,约2美元至40美元;而真机遥操工位单站硬件成本5万至15万美元,完全摊下来的采集成本每小时118至200美元,一名操作员一天产不出200条demo。

这些数据并非静态。大模型标注一条样本,看完即可打标签;具身数据则是一条完整的“episode(任务回合/片段)”——机器人从尝试到失败到调整再到成功(或未成功)的全过程。清洗时不能只看某一帧,需理解整条轨迹的因果链:哪一步做对了,哪一步是碰巧蒙对的,哪一步直接导致失败。π0预训练用了约1万小时机器人遥操数据。而π0.7在空气炸锅任务上从5%提升到95%成功率的跳跃,靠的是研究人员花费约30分钟优化自然语言指令(prompt engineering),并未新增任何训练数据——这恰恰说明具身数据中“提示/因果”的清洗,比单纯堆采集时长更有价值。

一个抓取任务的episode可能长达几分钟,清洗一条数据需几十分钟甚至更久。而一个机器人策略要收敛,往往需要几十万条这样的样本。这就是为何大模型标注可依靠人海战术堆量,而具身智能的数据清洗至今仍是“手工作坊”——并非不想规模化,而是难度太大。

人在闭环中:为何具身数据清洗无法外包

大模型标注能实现众包,前提是任务评价标准相对清晰,且出错可重标。为一张图片中的猫画框,十名标注员的结果大致相似;判断一段对话是否有害,虽主观,但可通过标准对齐。标注错误时,模型训练中会自动降低权重,不会造成大问题。

具身数据清洗不具备这些条件。

首先,它需要领域知识。让众包标注员观看机械臂操作录像,他们无法理解何为“抓取姿态合理”、“关节限位内运动”或“力控参数异常”。这不是贴标签,而是理解物理交互的含义。湖北人形机器人创新中心描述得很直白:训练师需将“送水”拆解为机器人数十个动作,每一帧都人工标注成机器人能懂的动作语言,才符合要求。

其次,它无法“错了重来”。具身数据的清洗结果直接决定下游策略能否学到正确行为。若将一段“碰巧成功但因果链断裂”的轨迹当作正样本,模型会学到错误关联——比如以为“先抖一下再抓”是成功的关键。这种错误在仿真中可能不显现,一上真机就会失败。Sanctuary AI在汽车线束插接任务的概念验证(PoC)中做到99.5%成功率、单周期2.54秒,极高成功率的背后,是对失败轨迹的严格剔除——这正是具身数据清洗价值的体现。

因此,当前几乎所有具身智能实验室和公司,清洗数据的都是自己的工程师和研究生。他们采集数据、清洗数据、训练模型、部署验证、发现失败、回头分析数据问题——人在这个闭环中既是生产者,又是质检员,还是调试员。

一位具身智能创业公司CTO算过一笔账:他们团队五人,每周能采集并清洗出约两千条有效样本。按此速度,攒够一个中等规模策略训练所需数据量需大半年。“而且这还是我们全力扑在数据上的结果,”他说,“算法迭代反而成了次要矛盾。”

更深层的问题在于,“数据演示工人”这个工种在法律上尚无明确的劳动关系定义——它该算独立承包商还是雇员?是否需支付加班费?拍摄视频中出现的人脸是否构成生物识别信息?全行业都没有答案。DoorDash的反应是一个缩影:它将Tasks App推给800万骑手拍摄家务视频时,主动剔除了加州、纽约市、西雅图和科罗拉多州——这四个正是全美零工工人分类法规最严苛的司法管辖区。DoorDash宁愿放弃这些市场的潜在数据,也不愿冒“因新增用工场景而被重新认定为雇主”的法律风险。国内京东在宿迁发动十万市民佩戴JoyEgoCam拍摄物流和家庭场景,喊出两年1000万小时目标,但清洗环节依然留在自有数据湖和合作方的工程团队中,未下沉至众包。

空白比机会更刺眼

大模型标注行业走过的路,某种程度上预示了具身数据清洗的下一步——自动化。目前已有一些探索。火山引擎将豆包VLM用于具身视频的原子动作级切分,帧级精度几十毫秒,自动生成语义标签、判断成功与否、检测夹爪交互,准确率90%以上,已接入星海图、穹彻智能的管线;如祺出行将第一视角操作视频进行“手部检测→相机位姿估计→3D手部姿态优化”三段式AI预处理,再交人工质检;京东JoyEgoCam采集的视频进入AI数据湖后自动去畸变、深度重建、语义描述,宣称将“原始视频到开箱即训”的环节大幅压缩;觅蜂科技MEgo Engine将预处理、空间重建、多模态标注、质量评测串联成自动闭环,称效率比纯人工高10倍。

但落地难度完全不在一个量级。大模型标注的自动化,本质是让一个更大的模型为小模型的数据打标签——都是数字世界的信息加工。具身数据清洗的自动化,需要模型理解物理世界中的因果关系。一段轨迹看起来“动作流畅、目标达成”,但可能只因桌面摩擦力恰好让物体滑到正确位置。VLM目前能判断“动作是否成功”,但分不清“做对了”和“碰巧对了”——后者恰恰是具身数据中最有害的噪声。VLM打标后仍需人工校对,还需探索用大模型做数据查重和多样性检查。纯自动目前尚不能令人放心。

更棘手的是传感器层面的问题。摄像头时间戳偏移50毫秒、力传感器有零点漂移、关节编码器偶尔丢帧——这些都不是“理解”层面的问题,而是信号层面的脏数据。处理这些需要信号处理和数据对齐的工程能力,并非AI模型能直接解决。Seedance这类视频生成模型能补视角、换机械臂构型、生成长尾场景,但生成数据进入训练集前仍需物理一致性校验,否则就是向模型投喂“漂亮垃圾”。因此,现状是:自动化工具在个别环节有突破(VLM粗筛、视频生成补数据、AI数据湖做对齐),但端到端的自动清洗pipeline尚不存在。这一空白既是痛苦的来源,也是机会所在。

最缺的,并非发论文的人

具身智能行业目前存在微妙的人才错配。打开任何一家具身智能公司的招聘页面,算法研究员和工程师的岗位总是最多。但若与创始人交流,他们私下抱怨最多的往往不是算法不行,而是“没人能搭好数据pipeline”。工信部《人形机器人与具身智能标准体系(2026版)》将数据采集、清洗、标注、审核、质检列为全生命周期,但全栈服务商中,既懂机器人学又懂信号处理还懂分布式数据工程的“数据基础设施工程师”,市场存量极小。

过去十年,AI教育资源高度向算法倾斜。一名CS硕士可能熟练推导扩散策略的损失函数,但让他编写一套能自动对齐多路传感器、分割episode、检测异常并生成质量报告的数据处理工具链,他可能不知从何入手。反之,能做好这件事的人技能组合很杂:懂机器人学(知道关节数据的含义)、懂信号处理(能处理传感器噪声)、懂分布式数据工程(能管理TB级时序数据)、最好还懂一点机器学习(知道下游模型对数据格式和质量的需求)。这种人在招聘市场上被称为“数据基础设施工程师”,薪资已接近算法岗上限,但供给量差两个数量级。

一个信号是:越来越多具身智能公司开始将“数据基础设施”单独设为团队,与算法团队平级。据火山引擎披露,国内头部具身企业中有15家使用了其“数据湖+VLM标注栈”;鹿明机器人推出“LumosUMI数据超市”,将清洗过的机器人数据按小时上架;湖北人形机器人创新中心已完成千小时级企业间具身数据交易,每小时数百元;光轮智能靠仿真合成数据一年营收翻10倍,2026年一季度单季预计超过2025全年。这些公司销售的并非算法,而是数据供应链。也就是说,具身赛道正在复刻Scale AI当年的角色切换:当大家发现“模型架构谁都能抄,数据飞轮谁有谁赢”时,数据层公司的议价权将快速超过算法层小团队。

谁先跑通,谁就是下一个Scale AI?

大模型标注的历史提供了一个参考坐标。2016年前后,数据标注也是手工作坊——大学生兼职、小团队接单、质量参差不齐。Scale AI所做的并非发明新的标注方法,而是将整个流程标准化、工具化、规模化,ML-assisted labeling将人工压缩至质检位,最终成为OpenAI、Meta、英伟达的统一供给底座。据多家分析机构估算,其2025年营收在8亿至20亿美元区间,毛利率约60%。

具身智能的数据清洗正站在类似的起点上。工具空白、流程未标准化、人才极度稀缺、劳动关系未定——这些恰恰是平台型公司的土壤。而且这一次,单数据小时售价(数百元)远高于大模型标注的单条单价(几分几毛),天花板更高。不同的是,这一次的壁垒更高。它不只是“将人的活儿变成软件”,而是要将物理世界的复杂性编码进自动化系统:VLM懂语义但不懂力矩,视频生成懂画面但不懂摩擦系数,信号对齐懂传感器但不懂任务因果。谁能将这三件事整合在一起,谁就不只是下一个数据标注公司——他可能定义的是整个具身智能时代的基础设施。

而今天那些花费六个月为机器人做品控的人,也许正在做的事情,比他们以为的更重要,只是他们还不知道而已。耗材化不是终点,被耗材化才是。

本文来自微信公众号 “亿欧网”(ID:i-yiou),作者:刘政鑫,36氪经授权发布。在具身智能领域,球盟会·QMH (中国)-娱乐官方网站入口作为行业参与者,也关注到数据清洗环节的挑战与机遇。