模型之外,Ego2Robot 让数据处理管线当回主角

一台机器人在固定桌面上完成任务,和换了桌布、改了光照、挪了相机位置之后仍然做对,是两种完全不同的能力。前者说明策略已经收敛,后者才决定它能不能走出实验室。
众所周知,机器人遥操作天然比人类中心视频慢、贵。而此前工作仅在小规模单任务上验证过「重定向手部姿态,渲染机器人臂,替换画面中的人手」这条路,并且合成数据对 VLA 模型预训练的增益到底来自哪里这个问题,一直欠缺系统回答。
8 月 3 日,阿里千问团队与中国人民大学等机构发布《Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data》(基于第一人称人类数据的可扩展机器人数据合成),该工作把约 1,940 小时人类中心操作视频,通过动作对齐、视觉对齐和多级质量筛选三条流水线,生成了覆盖 15 种机器人形态的 18,561 小时合成训练数据,并用解耦评测证明合成数据能显著提高泛化能力。
同时,借这篇论文发布契机,我们与 Ego2Robot 的共同一作陈雄辉聊了一下,他也是前段时间比较火的工作《Qwen-RobotManip》的核心作者之一。主要跟他讨论了以下几个话题:
-
之前尝试用人类第一视角视频训练机器人的方法一般会卡在哪些环节,这篇论文算跑通「人类视频转机器人数据」这条路吗?
-
流水线里有三个非常关键的环节:动作对齐、视觉对齐、多级质量筛选。相信许多人都会认为渲染到夹爪中间有层 gap,这层 gap 该怎么看?
-
Ego2Robot 做了一个很创新的「解耦式评估基准」,结果上看,合成数据和真实机器人数据混合训练后,在视觉、本体、语义扰动下的泛化性提升明显,但在 Franka 机型上的提升却很小。 这个现象背后说明了什么?是不是意味着跨本体迁移是有边界的?
论文所展现的具体效果上,1:1 混合训练在光照变化下把成功率从 58% 拉到 66%,未见过的物体实例从 29% 跳到 40%,真机上五个长序任务全部产生了明确增益。对此,结合与雄辉的交流,以及论文的研究内容与效果,可以对以上话题作简要解答:
-
首先,雄辉自己的回答比较克制。他没有说「跑通了」,用的是「看到跑通的希望」。另外,他给了两个「看到希望」的支撑,一是现在这个规模的数据是有效的,它能够促进 OOD的泛化;其二,走这套管线之后,ego (人类中心数据)和 robot (机器人数据)可以通过混训来得到 cross-embodiment(跨具身本体迁移)的 knowledge sharing(知识共享)。
-
关于 gap,他没有回避,「不只是夹爪,每个步骤都会有 gap。」他的解决思路分两层。数据层面,通过筛选管道耦合到每一个处理环节,把 gap 比较大、不是很好的数据筛选掉;训练层面,对误差较大的维度,比如从手部关键点映射过来的夹爪开合,在训练时降低权重。
-
首先,Franka 的单臂垂直铰接结构跟人的运动学差异最大。其次,ego 数据负责提供场景、物体和指令的多样性,防止模型过拟合到遥操作那套狭窄的分布,精细的动作精度仍靠真机遥操数据保底。雄辉也提到可以由此引出另一个可以探索的方向: object-centric(物体中心)管线,试图绕开整手运动学 bias(偏差),让不像人的形态也能吃到 ego 数据的红利。
事实上,Ego2Robot 不仅展示了扎实的数据处理管线,更突出了其数据治理的内核。Ego2Robot 花了大量精力在三级质量筛选、训练降权和跨形态对齐上,恰恰因为大规模异构数据融合的命门或许不在「造数据」,在「筛数据」。
对具身智能产业来说,这条路的走通,意味着机器人训练数据的瓶颈开始从「采得多不多」变成「筛得好不好」,而后者是工程上可以被持续优化和规模化的。
一条管线,三步走通
Ego2Robot 远不止合成数据管道里的算法组合,其更是一个系统性工程。这篇工作的共同第一作者陈雄辉在交流中提到,「不能忽略它其实是一个比较系统性的、偏工程性的东西。我们花了大量精力在数据的治理上,可能没有这些数据的治理,它也是最终比较难跑通的。」

整条管线分三大模块:动作对齐、视觉对齐、质量筛选。与此同时,输入支持两条路径。路径一,已有手部姿态标注的数据集直接进入管线;路径二,完全没有标注的普通视频,则先用 WiLoR 逐帧估计手部姿态,DynHaMR 做时序优化,Qwen3.5 自动把长视频切成带自然语言描述的子任务,再进入统一的处理流程。
先看动作对齐模块。和 QwenManip 有点类似,就是让手的关键点变成夹爪的位姿。论文及附录讲解得相当详细,研究者具体定义了虚拟指尖,包括食指和中指指尖的加权平均,该加权平均和拇指指尖一起确定夹爪的 TCP 位置、开合宽度和抓取朝向。
手性符号保证左右手映射到同一个夹爪坐标系。同时,逐帧检测有高频抖动,靠 Savitzky-Golay 滤波和高斯加权 SLERP 把轨迹平滑掉。
值得一提的是速度对齐。因为人类第一人称视频里手的移动速度远快于机器人遥操作,所以研究者适当降低了采样速率,其中 ViTRA 得降到原始帧率的 25%(相当于 4 倍减速),EgoVerse 降到 45%,EgoDex 和 ANT 降到 60%,各个数据源的动作分布才能贴近真实机器人的节奏。
视觉对齐负责把人手从画面里抹掉,换上一个渲染好的机械臂。SAM 3 分割手臂,ProPainter 修复背景,填充被手臂遮住的区域。事实上,真正麻烦的是考虑机器人底座放哪儿。robot-to-robot 机器人迁移基本有个源底座可以参考,ego 轨迹完全没有。
论文的处理是在轨迹质心周围选一圈候选底座,用 MuJoCo 逆运动学求解器逐个验证关键帧的可解率,选最高的评分作为底座。这步对不同臂长、不同关节配置的 15 种机械臂形态各自独立跑一遍。后续底座定了,就逐帧解 IK,从原始相机视角渲染机器人,再用 SAM3 深度估计做感知合成,夹爪像素按深度关系决定显示还是被场景挡掉。
最后一个也是比较创新的质量筛选模块,其分成三级作兜底。L1 管线内过滤基本的 IK 失败、自碰撞、动作异常的直接丢;L2 统计后处理,包括 Q1/Q99 过滤加突变检测,整条episode 无效帧率超 60% 的整段丢弃;L3 让 VLM 做终审,具体为 Qwen3.5 以 4fps 采样视频帧,判断渲染出的机器人动作和任务描述是不是一回事。

事实上,筛选不是独立跑完前面几步之后才介入的,其实是耦合到前面的处理管线的。比如 IK 解得不好就丢掉,类似这样的思路会在后面各个处理环节都有体现。最后再用 VLM 去判断行为是不是跟指令一致。整条管线的设计逻辑就是给数据做减法,筛掉不能用的,留下能用的。
除了在数据层面做筛选,训练阶段也有对应的兜底策略。雄辉透露,团队也巧妙对某些误差较大的维度,比如夹爪开合,在训练时降低权重,「避免那些维度对整体预训练造成比较大的干扰,让它结果更鲁棒一些。」
合成数据补了哪块短板
管线讲完,回到核心问题:这么多数据砸下去,策略到底在哪变强了?
雄辉在谈话中说了一句很关键的话:「pretrain(预训练)应当在 OOD(分布外)的场景下去度量,所以我们整体在验证这些管线的时候,更关注 OOD 的测评。」这个先验判断直接决定了评测应该更针对泛化场景。
首先,现有的泛化评测有个「一锅烩」的通病。背景、光照、桌面高度、干扰物一起上,最后只给一个 OOD 总分。模型到底是抗住了光照还是碰巧对背景不敏感,完全没法区分。
为此,Ego2Robot 在 RoboTwin 2.0 基础上把泛化拆成了四个独立维度,12 个评测设置,包括视觉外观(背景纹理、光照、机器人颜色)、场景布局(桌面高度、干扰物、相机偏移)、具身形态(零样本换成 UR5-WSG、ARX-X5、Franka Panda)、任务语义(未见过的物体实例、口语化改写的指令)。
实验放了四组对照,包括纯机器人数据(DROID + AgibotWorld + InternData,共 6,565 小时),以及合成数据与机器人数据按 1:3、3:1、1:1 混合。

先看总分。Clean 设置下 1:1 混合达到 68.1%,比纯机器人的 62.2% 高出 5.9 个百分点。Randomized(随机化)下 1:1 混合 53.5%,比 50.9% 高出 2.6 个百分点。1:3 低比例的增益几乎可以忽略,多数维度在 ±1 个百分点之间。也就是说,得把合成数据比例拉到 1:1 甚至 3:1,效果才真正出来。
总分只能说明有效,解耦数据才能表明有效在哪。维度之间差距很大。

视觉维度是最大受益方。光照变化从 58.2% 提升到 65.8%,提高 7.6 个百分点;机器人颜色从 59.4% 提升到 65.8%,提升 6.4 个百分点。自我中心视频在厨房、客厅、工厂等场景里天然覆盖了各种照明和背景,15 种形态的随机颜色渲染又把机器人外观的多样性拉高了一个量级。两重因素叠加,模型可以适配更多场景。
语义泛化同样拉起来了。未见过的物体实例从 29.3% 跳到 39.6%,增多 10.3 个百分点,是四个维度里绝对增幅最大的一项。口语化改写指令从 63.1% 到 68.5%,增加 5.4 个百分点。ego 视频里的物体种类和自然语言多样性,给模型塞进了一个更丰富的语义先验。
具身迁移这一项值得聊一聊。ARX-X5 从 44.1% 到 51.2%,涨了 7.1 个百分点;UR5-WSG 在 3:1 混合下达到 31.4%。但 Franka 始终压在 7% 以下,纹丝不动。
不难发现,迁移这一项上效果比较好的,基本上是更像人类的手部布局。Franka 不太像人的双臂结构,这个也比较符合客观规律。
四个泛化维度上,视角鲁棒性则揭示了一条更底层的规律。相机偏移从 50.4% 提升到 56.3%,因为自我中心视频天然伴随头部运动。这个基线进一步放大了这个效应。它的相机更高、机器人双臂布局更接近人体,3:1 混合在这里冲到 51.7%,比纯机器人的 39.6% 高出 12.1 个百分点。
回到最核心的问题:1:1 混合数据的训练为什么有效?
雄辉给了一个非常清晰的互补定位:「比较精细的 action grounding(动作落地),我们更侧重于用真实的遥操来解决。Ego 对我们而言是提供了更 diverse (多样化)的场景、任务、指令,和一些比较粗糙的、但是被 align (对齐)起来的 action。它让模型不太容易 overfit (过拟合)到遥操那个比较窄的 distribution (分布)里面。」
从总体实验上看,这是数据维度上的两条腿走路,真机数据保动作精度,合成数据提供覆盖面和抗过拟合。
真机上试了一下
研究者用真机测试了合成数据对任务效果的影响。

实验设置上,真机选择 ARX ACone 双臂平台,构建了五个长序任务,包括放水果进篮子、放积木进抽屉、叠毛巾、扫垃圾、拧螺丝。每个任务只给 20 个遥操作演示,额外录了约 35 分钟自我中心操作视频(ego play),视频走完整管线生成 ACone 形态的合成演示。
同时,真机演示数据作了三个条件对比:Robot-only(纯机器人预训练 + 20 个演示微调),Mix(1:1 预训练 + 20 个演示微调),Mix + Ego2R Play(Mix 基础上,微调时把遥操演示和管线转化后的 ego play 数据 1:1 混合)。

直接看结果。Mix + Ego2R Play 在五个任务上全部最优。放积木比 Robot-only 高了 14 个百分点,拧螺丝高了 13 个百分点。
事实上,光是 Mix 预训练这一步就已经超过了 Robot-only,ego play 数据再加进微调里,真机表现又往上推了一层。

此外,论文附录里还放了一组可视化对比,上面是原始人手操作,下面是管线渲染后的 ACone 叠加画面,感官上相当直观。
不过雄辉专门提醒了一个细节:这次 ego play 的录制并没有用手机随便拍。人手是伸到机器人自带的头部相机前面去做操作的,「我们是拿着本体本身的相机,把手放在前面去做操作,所以一定程度已经屏蔽了比较多的视角 gap。」
也就是说,当前实验已经把相机视角这个变量控制住了。换成手机在任意位置拍呢?他直接说,「我觉得还挺远,能做和做到 99.9%,这个可能还是会有 gap。」
但从这组真机实验里也看到了一个积极的信号,除了相机视角外的其他环节似乎都走通了,雄辉认为:「只要把相机视角的问题再处理得好一点,可能未来可以更容易地看到像手机拍一个视频,机器人就能一定程度上学会。」
值得优化之处
Ego2Robot 证明了 egocentric 人类视频可以规模化转化为多形态的机器人训练数据。大规模合成数据对视觉泛化和语义泛化的增益最明确。简单说,合成数据和真实机器人数据是互补关系,前者补覆盖面,后者保精度。
当然,无论是论文里,还是论文外,都有优化的空间。
首先,基础模型的锅不应该数据管线来背。 可以看到,管线依赖 SAM3 做手臂分割、依赖开源单目模型做深度估计,这两块都不是团队自己能控制的。
雄辉说得很直接,「不管是 SAM3 还是深度估计,这些都能看到明显的 limitation(限制)。」
因此,团队目前的策略是后处理兜底。分割不准就靠 IK 筛选丢掉,深度不准就靠 VLM终审筛掉。当然,这套逻辑在小规模下跑得通,但如果数据量继续往上走,这些影响可能会被凸显出来。
另外,相机视角的 gap 比想象中难啃。 真机实验的 ego play 用的是机器人自带的头部相机,人手伸到相机前面操作,视角和机器人实际运行时的视角天然一致。
这背后有两层问题:一是手机拍摄的视角、高度和机器人的头显相机完全不同,二是即便视角对齐了,从「能做」到「可靠完成」还需要额外的后处理管线。
对此,除了软件算法部分上的视角对齐,雄辉也提及了 ego 录制设备本身的硬件层面也存在提升空间:「带三视角的 ego (头部 + 两个腕部)是会比纯单目的好。目前开源三视角好的不多,但相信随着领域发展,这应该会让 data 的利用率再上一个台阶。」
这也意味着,管线本身的优化是一方面,上游数据采集方式的升级同样不可忽视。
最后是具身迁移的硬边界。Franka Panda 在所有混合比例下都压在 7% 以下,这显然不是多塞几种形态的数据就能解决的。
此外,论文自身也提出了一些限制。重定向只支持平行夹爪,多指灵巧手不在覆盖范围内;视觉修复和深度合成在严重遮挡或复杂光照下仍会产生伪影;评测范围限于 RoboTwin 2.0,扩展到更多场景和具身配置后的结论还需要独立验证。
写在最后
交流部分里有一段讨论值得放在结尾,关于数据再往下加会不会碰到数据墙的。
雄辉严谨地表示:「数据再往下加,会不会有数据墙?这个我不好说,因为我们目前还没看到那个点。我们现在也是在把 data 再 scaling 一下,看后面会发生什么。再乘个 10 乘个 100 会发生什么,我也不太好给你回答。」
但紧跟着他补了一句很关键的话,也体现了该论文的价值。雄辉说:「没有把前置的一些工作做好,单单乘 10 乘 100 是没有用的。不管是正确评估模型能力,还是有一个好的清理管线,以及有好的 alignment(对齐)技术,不然就只有垃圾进垃圾出。」
这段对话比其他说辞都更能说明 Ego2Robot 所处的位置。它是一条看到了明确迹象、但前面还有明确坎要过的路线。OOD 泛化在涨、真机表现上在涨、知识共享在发生,所以值得继续往下走。
至于数据墙在哪、管线里的哪些噪声会在加大规模后翻车、机器人形态边界能不能突破,都是还没答案的问题。
不过当前看来,少量真机演示保精度,大量合成数据扩展视觉和语义多样性,或许会是机器人通用操作走出实验室的下一步。
