独家探访停摆机器人数采场,具身智能正在重算数据这笔账?

9 月 1 日下午,42 号电波来到位于北京石景山区的一家人形机器人数据训练中心。当时正值工作日的下午,这里却四下无人,在训练中心的参观区、农业种植区以及特种区等多个区域也没有正在工作的机器人。

据多家媒体报道,该人形机器人数据训练中心已停止运营,这一信息引发行业的广泛关注。这个 2025 年 3 月启用、曾部署百余台机器人并搭建多个实景场景的数采中心,一度被视为具身智能数据基础设施的样板。相关方回应称,调整原因是实验室场景下的集中遥操数据难以满足真实应用需要,公司正转向真实生产和生活场景中的远程作业数据采集。

这也体现了一个更重要的行业变化:

具身智能仍然缺数据,但行业需要的不只是更多机器人、更多工位和更多遥操员,而是能够满足高质量、大规模、多样性要求的数据基础设施

而要看懂这条基础设施该怎么建,先要回答一个更基础的问题:曾经被寄予厚望的真机数据,为什么撑不起规模化?

真机数据很重要,但撑不起规模化

真机遥操作数据的价值毋庸置疑。

机器人在真实环境中完成任务时,可以同步记录视觉信息、动作指令、机器人状态、末端执行器反馈以及真实接触结果,并直接与特定本体的动作空间对齐。

因此,在技能后训练、本体适配、部署验证以及边缘案例采集等环节,真机数据仍然很难被其他数据完全替代。

问题在于,当具身智能模型开始追求更大的数据规模和任务覆盖时,仅依赖真机采集的成本和效率瓶颈也越来越明显。

2024年,斯坦福、伯克利等机构联合建设的 DROID,是当年全球具有代表性的开放真机操作数据集之一。该项目组织在欧美亚多个地区连续采集12个月,最终也只产生约350小时交互数据。项目团队当时便指出,多环境真机采集面临物流、安全、硬件和人力投入等多重约束

更早之前的 2023 年 12 月,Google DeepMind 主导的 Open X-Embodiment 进一步汇聚了全球 34 个实验室、60 个数据集和 22 种机器人本体,形成了仅有 100 万条真机轨迹——即便投入如此多的人力和时间,得到的数据依然有限。

其次,更关键的瓶颈在于,这种集中式数据训练中心采集环境单一,且多集中在少数易采集任务上,产出数据价值有限、泛化性不足,无法满足机器人在真实场景的有效应用。

这些项目证明了跨环境、跨本体真机数据的价值,同时也说明,真实机器人数据的规模扩张远比互联网文本、图像甚至人类视频复杂。

另一个问题则来自数据分布。

集中式训练中心虽然能够提升机器人和采集人员的利用率,但能够搭建的场景和任务毕竟有限。如果大量数据集中在桌面整理、抓取、搬运等易于复制的任务中,随着采集规模扩大,新增数据的边际价值可能逐渐下降。

而机器人真正进入工厂、仓库、家庭甚至户外环境后,需要面对的往往是更复杂的环境变化、长尾情况以及真实作业流程。

这也是近期一些数据采集项目开始从实验室集中采集走向真实生产环境的重要原因。

因此,更准确的判断不是「真机数据撑不起具身智能」,而是真机数据很难单独承担基础模型所需要的全部数据规模。

未来机器人模型所学习的物理世界经验,很可能同时来自人类视频、仿真环境、真机遥操作以及真实部署反馈等多种来源,不同数据之间并不存在简单的替代关系。

真机数据更接近目标机器人的实际工作状态,价值密度高,但生产速度慢、成本较高,而且受到具体硬件形态限制;人类数据和仿真数据则更容易扩大规模和任务覆盖。

具身数据正在逐渐形成一种分层结构,金字塔底层是人类第一视角数据,中层是仿真数据,塔尖则是真机数据。

Ego 数据成为新的规模化方向

在这种数据结构中,人类第一视角数据正在成为近两年最受关注的方向之一,背后的原因并不复杂。

相比机器人,人可以自然进入家庭、商场、仓库、工厂以及户外环境,完成精细操作、长程任务和异常处理,不需要为每一次示范预先部署特定机器人。

因此,同样的采集成本下,人类行为数据理论上可以覆盖更多环境和任务。

据媒体华尔街见闻报道,当前无本体数据(第一视角视频及通用操作接口数据)已占行业数采总时长的 40%–50%,真机遥操作数据约占 30%,其余为仿真数据和部署数据。

光轮智能创始人兼 CEO 谢晨博士在公开演讲中,对未来的数据终局给过一个更犀利的判断:真机数据只占 0.1%,而99.9% 下面的这两块,一个是仿真数据,一个是人类数据。

作为塔基的人类第一视角数据之所以能承担规模化,恰恰在于它的采集不依赖固定本体。

这股「ego」(第一视角)的大浪潮,其积累其实早已开始。

早在 2022 年,Meta等机构建设的 Ego4D 包含 3,670 小时第一视角视频,由 923 名参与者在 9 个国家、74 个地点采集,其规模和场景丰富度远高于多数开放真机数据集。2026 年 2 月,NVIDIA发布的EgoScale研究进一步使用 20,854 小时带动作标注的第一视角人类视频训练机器人模型。研究观察到,随着人类数据规模扩大,模型验证损失呈近似对数线性改善。

这一信号后续得到更有力的验证。2026 年 4 月,李飞飞学生徐丹飞领衔佐治亚理工、斯坦福等机构联合发布 EgoVerse,包含 1,362 小时人类演示数据、约 8 万个 episode、1,965 项任务、240 个场景和 2,087 名采集者,经多机器人联合训练验证,在不同机器人本体上取得最高 30% 的相对提升。

而更值得注意的是,EgoVerse 中光轮智能代表着规模化高质量的人类数据标准,是其人类数据委员会的全球唯一中国企业成员。

这些研究同样说明了一件事情:人类数据并不能天然转化为机器人能力。

人与机器人的身体结构、动作空间、视角以及动力学条件仍然存在明显差异。在某些任务和本体上,引入人类数据甚至可能无法带来提升。

因此,当前更合理的技术路径,是利用大规模人类数据学习真实世界中的行为先验和任务结构,再通过一定规模的机器人数据完成 embodiment alignment,也就是从「人怎么做」到「机器人怎么做」的本体对齐。

换句话说,Ego 数据的崛起并没有否定真机数据,它改变的是不同类型数据在整个训练体系中的分工。

如果把具身数据简单理解成一个金字塔,那么底层可以是覆盖大量真实环境和人类行为的人类数据;中间是能够规模化生成任务、控制物理参数并进行重复试验的仿真数据;而更接近部署阶段的部分,则需要真实机器人数据完成本体适配、任务后训练和部署验证。

三类数据无法简单按照「小时数」比较价值,但它们正在承担越来越不同的角色。

Ego不会取代真机,数据生产正提高复用率

理解了这层分工,「本体无关」的意义就清晰了。它首先是一种采集方式的变化。

在传统真机数采中,更换机械臂、灵巧手、传感器或控制接口,往往意味着重新调试设备、适配遥操系统甚至重新采集。第一视角人类数据把行为采集与具体机器人解耦,同一套人类经验可以服务不同模型、本体和任务。

但第一视角视频并非天然可训练,它还需要一条「标品化加工」的路径。

以EgoVerse中的光轮智能为例,他们搭建了一套覆盖「端侧采集—云端处理—仿真验证」全流程的质量控制体系,凭借这一体系,其数据管线得以适配多样化的硬件。无论是 Aria、iPhone、头戴相机,还是其他各类多模态设备采集的原始数据,均可汇入同一条云端管线;经 VIO、三维手部与 Body 标注以及高质量的动作语义标注处理后,被统一转化为符合同一质量标准的训练资产。

数据处理环节结束后,光轮智能进一步调用全栈自研的仿真平台 SimFoundry 与规模化评测平台 RoboFinals,检验动作轨迹、物理关系及任务过程能否得到合理还原,并据此评估数据是否真正具备机器人学习价值。借助持续运转的回环评价机制。

由此,采集端不再被单一机器人锁死,数据基础和预训练能力可以跨平台复用

这也正是具身数据真正的分水岭。

传统模式按照工位、机器人数量和采集人天扩张,订单越大,设备与人员成本往往同步增加;无本体人类数据则可以借助分布式采集扩大场景和任务覆盖,再通过统一处理完成标注、质检和交付。

截至 2026 年 5 月,国际智库 Interact Analysis 追踪到中国至少 90 家已经运营、规划或建设中的人形机器人数据采集训练中心,其中 64 家已经运营、13 家部署超过 100 台机器人。该机构同时观察到,2026 年以前,远程操控真机是主流模式;2026 年后,第一视角人类数据等新路径开始进入数采中心。

这意味着数采场不会消失,但角色会改变:从封闭的集中式生产中心,转向真实场景节点、本体对齐节点和高价值失败数据的回收节点。

真正被取代的,是项目制交付的一锤子买卖:每获得一个客户,就重新购买本体、搭建场景、招聘采集员、定义任务和组织交付;项目结束后,数据、设备和流程很难复用。它看似拥有大量机器人和工位,本质上仍是人力密集型项目制交付。

因此,被替代的并不是真机数据本身,而是这种「非标准的一次性数采生意」——数据只能绑定一台机器人、一个场地和一个客户的一次性生产方式,正在被可复用的「数据标品」取代

打造数据标品,定义行业标准

既然要取代非标生意的,是可复用的数据标品,那问题就变成了:

什么才算标品,又该如何打造?

真正的数据标品需要稳定的采集协议、任务定义、元数据结构、标注深度、质量控制、交付格式和许可条件。同一类产品应当可以被不同客户识别、采购和验收,而不必为每个项目重新定义一套规则

光轮智能近期发布的全球首个十万小时全模态人类行为开源数据集 EgoSuite-Open100K 提供了一个无本体数据标品的典型范本。按照 Hugging Face 公开信息,该项目整体规划为 10 万小时第一视角人类数据,覆盖 1.5 万余项任务、1.5 万余个真实采集场景、7 类环境和 128 类场景;目前首批1万小时已经上线,其余部分将分阶段发布。

更值得关注的不是单一的「10 万小时」数字**,而是它的数据产品结构,满足高质量、大规模和多样性的行业需求。**

EgoStandard以头部第一视角和手部位姿为基础,部分子集增加全身位姿;

EgoPro增加腕部视角,以补充遮挡、接触和精细操作信息;部分数据提供事件级语义,并同时支持LeRobot v3与MCAP格式。

面向开发者的EgoDemo则提供50小时高质量样例,覆盖四种标注配置及两种原始视频配置,数据卡公开了目录结构、坐标格式、版本、来源标识和校验信息。

数据集采用允许学术研究和商业训练、限制数据转售的许可。它更接近一种受控开放:用公开样本、稳定接口和社区反馈降低行业接入成本,同时保留合理权益。

光轮智能将自身的方法论概括为「造标品、定标品、进化标品」:先统一生产、标注和交付规则,再通过可复现、可比较的评测建立采购与验收尺度,最后让模型评测和部署反馈反向决定下一轮数据生产——「没有标准不能做标品复售,没有标品复售无法实现规模化」

需求侧正在验证这套逻辑。根据光轮智能披露的信息,今年以来,光轮智能的客户数据需求已达去年的百倍甚至千倍,从几百、几千小时跃升至几十万乃至上百万小时量级;**公司已服务 30 余家头部模型企业、具身机器人企业及互联网大厂,单家客户数据需求均超 20 万小时,并提出 5 年 100 亿小时具身智能数据共建计划,**覆盖人类行为数据、仿真合成数据及真机部署反馈数据。

因此,光轮智能的开源数据集不只是开放生态构建,更是一次标准验证:只有当不同团队真正下载、训练、比较并反馈问题,数据格式、标注体系和质量要求,标品数据中蕴含的事实标准便会成为跨客户复用的共同语言

截至目前,光轮智能已主导或参编 20 余项相关国家、行业相关标准,覆盖数据质量、仿真平台与工业高质量数据集等重点领域,同时还与国家机器人检测和评定中心(总部)达成合作,共同推动具身智能关键基础设施与工业级测试评价标准建设。

写在最后

单一数采中心的停运绝不能证明真机数据无效,相反,随着机器人进入工厂、仓库和家庭,面向特定本体的后训练数据、真实部署数据和高价值失败案例只会更加重要。

但未来的数据体系将形成更明确的分工:高质量、大规模、多样性的人类数据构成训练塔基;仿真承担规模化试错和评测;真机数据完成本体对齐、部署验证和失败反馈。

像光轮智能这样手握标准与标品的公司正在把三者连接起来,使一次项目中的经验能够沉淀为下一次可复用的数据产品,成为行业最底层的基础设施,支撑整个开放数据生态。

数采场比拼机器人数量的阶段正在过去。

下一阶段决定行业位置的,是谁能持续生产可复用的数据,谁能证明数据对模型有效,以及谁能把数据、评测和部署反馈连接成一套持续运转的基础设施。