首次!北大、南洋理工等 30 位研究者联手厘清具身数据金字塔
7 月 28 日,来自北京大学、南洋理工、港科大、新加坡国立、港大、上海交大等十余所机构的近 30 位研究者联合发布了一篇 72 页长文综述《Data Pyramid for Embodied Manipulation》。该综述通过一个五层数据金字塔具象化数据体系,并探讨具身基础模型利用异构数据的发展史和未来方向。
该论文的作者团队包括通讯作者北大仉尚航老师,合作者中还包括穆尧、刘子纬、杨剑飞、罗平等多位具身领域知名学者。
随着「数据」作为具身圈讨论的热点话题,大家都能隐约察觉存在一个用于判断各类数据价值的评估体系。此处也能体现这篇综述的贡献,是把圈子里那些「大家心里都有数、但没人系统写下来」的东西,第一次整理成了公共语言。
这意味着以后讨论具身基础模型所用的数据类型和配比,不需要再各自定义概念,直接说「金字塔第几层」就够了。

上图是具身数据金字塔从塔尖到塔底,依次排列着五层数据:
-
第一层 ,真实机器人数据:在物理机器人上遥操作或脚本化采集的轨迹,直接可执行,但也是最昂贵的。
-
第二层 ,UMI 风格数据:用手持夹爪在野外采集,不依赖机器人,保留了末端执行器监督,却缺乏关节级本体感知。
-
第三层 ,自我/外部中心数据:人类第一/第三人称视频,捕获真实的物理交互和灵巧操作,但需要重定向到机器人。
-
第四层 ,仿真数据:在物理引擎中生成的交互数据,可并行、低成本,带有特权标签,然而其物理保真度存疑。
-
第五层 ,通用数据:互联网规模的图文、视频、3D 数据,提供广泛的语义和推理先验,但完全没有动作落地。
数据金字塔的核心洞察在于,越往下,数据越容易获取但离机器人越远;越往上,数据越接近可执行动作但越难扩展。
但这并不代表最顶层的数据质量好,就全去使用真实机器人数据了。这个数据金字塔的价值在于提供一个系统性的权衡,研究机构或机器人企业可以根据任务需求、预算和模型架构,在金字塔的不同层级之间做出更明智的选择。
当然,数据金字塔只是综述的部分价值,更重要的是,综述第一次回答了「真机、UMI、人类视频、仿真、互联网数据到底怎么搭配」这件具身圈各家都在摸索的事,摆到台面上做了系统拆解。
虽然最优数据配方尚无定论,但它画出了现有模型的「数据食谱」,标出了缺口在哪里,为下一代具身基础模型的数据策略提供了可对照、可迭代的公共框架。
数据「军备竞赛」已打响,但 Scaling Law 还没写进教科书
下图直接描绘了一个清晰的趋势,不管是仿真数据、UMI数据、真实机器人数据、自我中心数据还是通用数据,
所有类别的数据规模都在指数级增长。

真实机器人数据,从 2015 年 Pinto 和 Gupta 的 5 万次抓取试验,到 2025 年 AgiBot World Beta 的 100 万条轨迹和近 3000 小时交互,再到 Open X-Embodiment 横跨 22 种机器人平台的 240 万条轨迹。十年间,数据集规模膨胀了 50 倍。
仿真数据同样夸张。DexGraspNet 2.0 直接怼出了 4.27 亿个抓取样本,MolmoB0T 的训练数据号称达到了 10 亿级别。当然,在仿真世界里,「数据不够」显然不是问题,关键是生成的这些数据到底有没有用。
自我中心数据同样在狂飙。从 2018 年 EPIC-KITCHENS 的 55 小时厨房视频,到 Ego4D 的 3,670 小时全球化第一人称视频,再到 2025 年的 EgoDex 用 Apple Vision Pro 采集的 829 小时高质量手部交互数据。「看人类干活」像是「真实机器人数据的昂贵」与「通用数据的低质量」间的权衡,正在成为具身智能预训练的新标配。
通用数据的规模已是天文数字。SA-1B 提供了 11 M张图像和 1.1B 个分割掩码,LLaVA 系列构建了百万级的多模态指令数据。可以说,通用数据跟机器人没有任何直接关系,但它们正在成为机器人基础模型的「常识底座」。
数据规模在暴涨,这毫无疑问。但问题来是,有 Scaling Law 吗?
研究者对此相当严谨:尽管数据规模在增长,不同模型的数据来源、混合比例和处理方式差异巨大,目前还没有系统性的消融实验能够证明「更多数据=更强性能」在具身智能领域成立。
但是研究者也给了些值得关注的线索。

EgoScale 做了一个非常漂亮的实验:他们控制了以自我为中心数据的预训练规模,从 1,000 小时到 20,000 小时不等,结果发现性能在持续提升,至少在 2 万小时以内,还没看到天花板。这暗示了自我中心数据可能确实存在某种 Scaling Law。

Xiaomi-Robotics-1 先在 10 万小时的真实世界 UMI 轨迹上预训练,再用 1 万小时的跨具身数据进行后训练,后训练中包含 7,200 小时的自有机器人轨迹和 1,000 小时的指令标注 UMI 数据。
Xiaomi-Robotics-1 预训练与后训练数据规模跨度的重点在于,这复刻了 LLM 领域已被验证的「海量互联网文本预训练 + 少量高质量指令数据微调」的两阶段 Scaling 范式。
当然,研究者也举出些不符合 Scaling Law 的反例。LingbotVLA 和DreamZero 等模型仅用机器人数据就达到了很强性能,并没有因为缺少异构数据而落后。至少在目前的实验证据下,异构数据混合并不一定总是更好。
值得一提的是,π0.7 发现低质量轨迹在配上足够清晰的提示后,仍然可以提供有用的监督信号。 这暗示了一个潜在的范式转变:与其用激进的质量过滤扔掉「不够好」的数据,不如学会「条件化」地使用不同质量的数据。即 π0.7 让模型知道「这是一个标准答案」和「这是个错误答案以及怎么改」之间的区别。
可以说,方向性 Scaling Law 已经出现,但精确量化的 Scaling Law 还需要等待。即更多样化的数据、更广的任务覆盖、更丰富的感知模态在趋势上对性能是有帮助,然而不同数据源的贡献没有被系统隔离,在此之前,或许先要解决的问题是最佳数据配比。
具身大脑模型、VLA和世界动作模型,对数据的「胃口」不同
首先了解一下三类具身基础模型的基本能力要求,方便后续看懂三类模型各自侧重哪些数据,以及对各类数据的规模要求。
具身大脑(VLM)的核心任务是建立对物理世界的感知、推理和规划能力,包括时空感知、物理推理、空间构建和任务分解;VLA 的出发点是不仅要理解场景和任务,还要把理解转化为可执行的动作;世界模型的目标是物理世界的时间演化和预测,以及动作的因果效应。

上图所展示的是 VLA 和世界模型的发展路线和所用到的数据类型,可以看到真实机器人数据是必不可少的,人类视角的 Ego 数据也日益发挥重要作用,因此文中重点通过有无加入动作数据来区分三类模型的「数据食谱」。
对于具身大脑,其模型能力的关键在感知和规划,因此用无动作的数据来建立「世界知识」更为重要。如下图,该类数据包括通用图文数据、视频文本数据、VQA、OCR 数据、空间和时间 QA 数据、指令跟随数据,以及经过重新标注的自我中心视频。

这些数据虽然提供了物体识别、语言理解、视觉常识、时空推理等能力,但这些能力不能用作机器人的具体动作执行,所以 RoboBrain 和 ShareRobot 也探索了加入动作数据作为核心监督信号的可能性。
VLA 模型则确立了动作数据的核心地位。关于动作表征,VLA 的发展有一条清晰路线,从 RT-2 的离散化动作 token,到 GR00T N1、RDT-1B 使用扩散策略建模高维连续动作分布,再到 π0.7、InternVLA-A1 的流匹配策略直接生成动作轨迹。
上述 VLA 的「动作表征」发展路径核心需求在于减小动作误差,连续控制中的小误差就可能毁掉一次操作。
另一个有意思的是 VLA 模型如何利用无动作数据,论文也梳理了三条技术路线。
最直接是潜在动作代理(Latent Action Proxy),从无标注视频中学习「动作相关」的隐式表征。这个方法的优势是规模化,不需要精标注就能从海量视频中学习动态先验,但仍需要少量机器人演示来落地。
第二个路线是几何运动表征,例如 VideoDex 将人类手部运动迁移到机器人策略。相比隐式方法,这些几何表征更具可解释性和跨具身迁移性,但也更依赖可靠的感知。
VLA 利用无动作数据的第三种方式作是层次化的中间监督。π0.5、CoT 风格 VLA 模型利用这些数据引导下游动作生成,即让模型「想得更清楚再执行」。
这些能解释前文提到的数据类型有收敛到「自我中心人类视频」的趋势。论文指出,通过手部姿态重建、重定向、手部修复或共享表征空间,人类灵巧操作数据可以赋能机器人灵巧策略学习,大幅扩展「有动作数据」的覆盖范围。
最后,有别于具身大脑偏向无动作数据、VLA 的数据核心是有动作数据,世界动作模型(WAM)为了预测发生动作后的状态,天然同时需要这两类数据。即有动作数据建立「动作→后果」的因果链,无动作数据建立「世界通常如何变化」的先验。
无动作数据方面,互联网视频构成了最大的动态监督源。UniPi 将决策制定重构为文本条件视频生成,UniSim 将异构视频和交互数据聚合为交互式真实世界模拟器,Cosmos 在数十亿帧互联网视频上预训练全模态世界模型,V-JEPA 2 从超过 100 万小时的互联网视频中学习潜在视频预测。
有动作数据方面,大部分 WAM 构建在扩散式视频生成模型之上,将动作预测作为连续生成的问题处理。Genie Envisioner 挂载流匹配动作专家,Motus 分离视频与动作专家,Cosmos Policy 则将动作转化潜在帧。例外的是 WorldVLA,它基于自回归架构,将观测和动作统一离散化为 token 联合预测。
后续也会展开一个关于世界模型的闭环,训练好的世界模型也可以「反哺」数据。例如 DreamGen、Cosmos 可以生成合成交互数据,WorldGym、WorldEval 可以在策略评估中部分替代物理环境。
仿真数据和真实数据,从来不是二选一
在所有关于具身数据的讨论中,「仿真 vs 真实」的争论可能是最情绪化的一个。一边有人认为仿真数据永远无法替代真实物理,另一边有人坚持真实数据太贵太慢根本做不大。

事实上,文中认为仿真数据真正的价值在于,它提供了真实世界永远无法提供的东西:完美的可控性和特权标签。
先说特权标签。也就是在仿真中,研究者可以精确知道每一个物体的 6D 姿态、每一个接触点的力分布、每一次任务的成功与否、每一步关节的精确状态,这些都是真实世界数据中,几乎不可能以同等精度获取的信息。
更重要的是可控性,仿真允许你做「反事实」数据生成。相比于在真实世界中只能获得「发生了什么」,仿真数据能可控地指导任务工作「可能发生什么」,这种「结构化探索」对于学习鲁棒策略的价值才是仿真数据的意义所在。

上表总结了大规模合成和仿真数据资源,从近期的数据集可以看出,日益纳入多种具身形态和更大数据量,并通过更多样的任务加以验证。
关于仿真还有一个有意思的趋势。从论文提到的 GenSim、GenSim2、RoboGen 等系统,到近期英伟达的 SimFoundry、字节跳动的 TableVerse,仿真数据的生成正在从「人类手写专家策略」转向「LLM驱动的自动生成」。这意味着仿真「可扩展性」的真正优势正在被二次放大。
事实上,论文还讨论了关于 Sim-to-Real 的这层 Gap,主要是两个层面的不匹配。
第一,最直接的就是观测不匹配。尽管最近的数据集通过 3D 资产、光照、相机模型和多种传感器提升真实感,但渲染的纹理、深度噪声、遮挡模式、触觉响应和力信号,与真实世界的差异仍然难以完全消除。
第二,对机器人在真实世界工作至关重要的交互不匹配。细分为与关节限位、坐标框架、控制频率差异相关的运动学 gap,以及更难消除的,涉及执行器延迟、摩擦、接触、变形、物体惯性等仿真引擎只能近似捕获的动力学 gap。
论文指出仿真的核心问题不再只是数据生成,还有生成的数据是否捕获了决定真实部署成败的感知变化、运动学一致性和动力学不确定性。
值得一提的是,论文讨论了仿真的另一条崛起路线:世界模型作为「学出来的仿真器」。论文将世界模型在机器人学习中的角色分为三重:
-
作为策略训练的虚拟环境:World-Env、VLA-RFT、DiWA 等方法让策略在「想象中的交互」上进行优化,减少对物理机器人的反复依赖。
-
作为策略评估工具:WorldGym 和 WorldEval 研究生成的 rollout 能否支撑策略评估。
-
作为合成数据引擎:DreamGen 生成机器人视频并恢复伪动作,GigaWorld-0 将世界模型作为具身学习的数据引擎。
与基于物理引擎的传统仿真不同,世界模型既有仿真的规模化潜力,又有从真实数据中学习到的「物理先验」。当然,论文也指出一些不足,预测误差、模型利用、动作歧义和分布偏移可能导致生成「看起来合理但物理上无效」的轨迹。
关于仿真和真实的对比,论文的立场是:仿真数据和真实数据没有「谁替代谁」的问题,关键是如何系统和互补地利用它们。
真实机器人数据提供最直接、最可信的物理监督。它们天然包含真实传感噪声、控制延迟、接触动力学和硬件约束,记录的动作在对应平台上直接可执行。
关于两者互补的最佳实践或许是:仿真用于大规模预训练和覆盖长尾场景,真实数据用于微调和校准;数字孪生和域随机化缩小视觉gap;世界模型作为中间层连接真实观测和合成生成。
未来最值得押注的方向
这或许是全文最有指导价值的章节,蕴含了具身智能学术圈对未来技术发展的思考,围绕「采集什么」、「怎么采集」、「怎么用」三个问题提出了六个方向。
-
为补齐接触层缺失,所需的大规模触觉数据。这是当前数据金字塔最大的「结构性缺口」。虽然 RoboMIND 2.0、Humanoid Everyday 等最新数据集已经开始纳入触觉信号,但触觉数据仍受限于传感器专用硬件、不一致的信号格式、有限的任务覆盖和与长周期操作轨迹的较弱数据整合。
-
失败与恢复数据,让模型从「成功学」到「抗打击训练」。这不禁令人想起了自动驾驶领域的 corner case 数据,正是那些罕见但关键的失败场景,定义了系统的安全边界。如 RoboFail 等工作已经开始从多个角度探索失败数据。

-
真正建立数据工程所需的可扩展的数据采集管线。如上图,当前自我中心数据采集正在从单纯的 RGB 视频走向多模态可穿戴传感。头戴 AR/MR 设备、腕部相机、手部 IMU、仪器化手套、触觉贴片、力传感器等数采设备逐渐补齐多模态数据采集拼图,但视角遮挡、运动模糊、漂移、时间同步等问题也意味着设备并不算太成熟。
-
跨具身状态-动作对齐。这是具身相对于 LLM 所独有的问题。不同机器人的关节数量、动作维度、坐标框架、控制频率等都不同,没有一个公共的数据库能让具身基座模型从「专才」走向「通才」。
-
自我中心数据赋能灵巧手,跨越人-机鸿沟。论文认为人-机鸿沟不仅是视觉层面的(人手与机器人手的外观差异),更是运动学、形态学和物理层面的,反映在真实硬件上可能「违反机器人约束」或「无法产生稳定接触」。
-
数据配方。这是论文最有前瞻性的讨论之一,也可能是整个领域最被低估的问题。正如前文所说,具身基础模型用于训练的数据越来越多样、规模也越来越大,但现有报告在数据源组合、采样比例、分阶段分配策略上差异巨大,没有两个模型用完全相同的「配方」。
回到那三个问题,前两个方向回答了应该采集触觉数据、失败数据,第三个方向说明需要更合适、更通用、更轻量的数采设备去采集,后面三个问题则系统指导了通过对齐、硬件适配、合理配比等方式使用数据。
写在最后
事实上,综述中用了不少篇幅讨论「数据规模」和 UMI 等各种数据类型的优劣、发展。但在整个社区「越大越好」的叙事下,质量往往是最容易被牺牲的,也是另一方面需要关注的地方。
正如论文在引言部分把「质量」放在四个补充评估维度之首,多样性、可重用性、物理保真度是另外三个。业界与学术界正在出现以下几种趋势,称不上危险但仍需要警惕。
其一,自动标注的质量稀释。通用数据越来越多地依赖多模态 VLM 模型自动生成标注,但这些自动标注可能包含幻觉对象、错误关系和模板化的语言表达。论文也明确指出,自动标注通常需要经过置信度估计、一致性检查或人工验证才能使用。

其二,多样性与质量之间的权衡。上图展示了不同数据集轨迹多样性的巨大差异,有些数据集覆盖了广泛的3D空间,有些则高度集中。高多样性数据来自不可控的实验室外,高质量数据来自可控的实验室里。在两者之间找到平衡点相当重要。
所以说,包括信息密度、标注可信度、物理一致性等指标在内的数据质量评估体系可能是比 Scaling Law 本身更紧迫的基础设施建设。
正如这篇综述所展示的,具身智能的数据生态正处于从「蛮荒时代」向「精耕时代」过渡的关键节点。72 页的综述,本质上作出了重要提醒:拥有了这座五层数据金字塔,我们是否真的知道每一层的价值?不同层之间如何形成互补?为特定任务和模型架构选择的数据配方,有没有被系统性地思考和验证过?
这些问题没有现成答案,却或许比「我们用了多少T的数据」重要得多。
