上交卢策吾、浙大等团队提出 Track4Action:把「动作后的 3D 世界」蒸馏进 VLA
VLA 模型可以把图像和语言指令转换成机器人动作,训练的过程中,研究人员通常只评价机器人的动作像不像专家。至于机器人的动作会怎样改变物体、空间关系和任务状态,通常没有被明确交给模型学习。短任务可能掩盖这个缺口;一旦任务变长,或者视角、背景和物体布局发生变化,机器人就更容易失去对下一步的稳定判断。
简单来说,机器人学会了动作,但是不知道这个动作会让世界怎样变化。
8 月 4 日,来自浙江大学、上海交通大学、上海创智学院和穹彻智能的团队提交了一篇题为《Track4Action: Distilling World-Centric 3D Tracker into Vision-Language-Action Policies(将三维追踪能力蒸馏进 VLA)》的论文,其中提出的 Track4Action,就试图解决 VLA 模型中的这一难题。
论文的作者团队非常值得关注,人工智能学术界大咖卢策吾就是作者之一,他现任穹彻智能联合创始人兼 CEO、上海交通大学人工智能学院副院长、教授。此外,上海交通大学人工智能学院助理研究员、博士生导师杨理欣担任通讯作者。
这篇论文提出的 Track4Action,没有让机器人在执行时额外运行一套庞大的三维追踪系统,而是把追踪模型放在训练阶段充当「老师」:它先从完整演示片段中读出物体、机器人和相机在三维世界里的变化,再把这段变化压缩成特征,教给只看当前观测的 VLA。训练完成后,演示片段和三维追踪器都会被移除,部署端仍然是一套从当前图像、语言和机器人状态直接生成动作的 VLA 策略。

这套做法在四项真机双臂任务上取得 67.5% 的平均完整成功率,相比去掉追踪对齐的同架构版本提高 25 个百分点;在不接触测试扰动数据的 LIBERO-Plus 零样本评测中,平均成功率达到 82.3%,比无对齐版本提高 7.6 个百分点。论文最值得关注的变化,由此不只是一组分数,而是演示视频开始同时承担两种监督:既告诉机器人做什么动作,也告诉它这些动作应当怎样改变世界。
动作标签缺了什么
VLA 的典型输入是当前的多视角图像、语言指令,以及可选的机器人本体状态;输出则是一段关节、末端位姿或夹爪命令。只要预测动作与专家示范足够接近,模型就能获得较低的训练损失。
问题在于,相同的末端位移,在不同三维关系下可能代表完全不同的事件。机械臂向前移动,可以只是穿过一段自由空间,也可以与辣椒发生接触,随后带着它一起移动;同样一次抬升,既可能成功抓起物体,也可能因为夹爪没有夹稳而空手返回。动作坐标本身不能区分这些情况,语言指令也没有包含逐帧的几何反馈。
演示视频里却保留了这些信息。假设一段动作包含 K 条连续命令,那么与它对齐的 K+1 帧画面,就完整记录了 K 次状态转移:哪些三维点在移动,物体是否被遮挡,相机视角怎样改变,机器人与物体之间是否形成了持续接触。Track4Action 的核心,就是把这段「已经发生过的世界变化」变成训练期的特权监督。
这里的「特权」有明确含义:老师在训练时可以看到动作执行后的完整片段,学生却只能根据动作发生前的当前观测和任务指令,推断与这项任务有关的三维变化表示。到了部署阶段,机器人当然拿不到尚未发生的未来画面,因此老师和完整片段都不再出现。
追踪对齐的真机收益
论文的真机平台由两台六自由度 Piper 机械臂和平行夹爪组成,采用一台正面相机和两台腕部相机提供 RGB 观测。策略每次输出 14 维双臂动作,包括每条手臂的六个关节命令和一个夹爪命令。
研究者选择了四项操作:把红绿辣椒放进盘子;用双臂折毛巾;把两支笔依次放进抽屉并关上;把卷心菜放进锅里再合上锅盖。它们分别覆盖刚体抓放、柔性物体操作、双臂协调和多阶段长程任务。每项任务使用 50 条演示训练,每种策略进行 10 次测试。

Track4Action 的四项平均完整成功率为 67.5%,对比基线 π0.5 为 65.0%,去掉三维追踪对齐后的版本为 42.5%。与无对齐版本相比,Track4Action 在每项任务上都至少提高 20 个百分点;涉及多个有序阶段的「放笔并关抽屉」和「卷心菜入锅并合盖」任务,提升都达到 30 个百分点。

为了避免一次后期失败掩盖前面已经完成的动作,论文还把每项任务拆成四个等权里程碑。例如,抽屉任务会分别检查两支笔是否放入、机器人是否扶住抽屉、最后是否成功关上。Track4Action 的平均过程分为 75.0,比无对齐版本的 60.6 高 14.4 分,并与 π0.5 持平。这说明三维变化监督带来的收益,不只出现在最终「成功/失败」的二元判断上,也体现在多阶段任务的完成进度中。
团队还改变了真机环境中未在训练时出现的视觉条件:移动辣椒并加入干扰物,把红毛巾换成绿色,在桌面铺上新的纹理背景。在这三项分布外设置中,Track4Action 的平均成功率从无对齐版本的 23.3% 提高到 50.0%。其中,新物体布局下的辣椒转移从 30% 提高到 60%,纹理桌面上的卷心菜任务从 30% 提高到 70%。
真机结果为论文的核心判断提供了直接支撑:三维追踪信息虽然只在训练时出现,但被它塑造过的动作表示,确实可以在不调用追踪器的真实机器人上产生收益。
三维变化如何蒸馏
Track4Action 的老师来自 Track4World。这是一套冻结参数的世界中心三维追踪模型,可以从短视频中组织场景结构、三维运动轨迹、可见性和相机变化。所谓「世界中心」,可以理解为它不只追踪某个像素在二维画面里去了哪里,还要尽量把相机自身运动与场景中物体的真实运动区分开来。
训练时,Track4World 读取与动作段严格对齐的主视角视频。K 条动作对应 K 次画面转移,老师将这段视频编码成场景、运动与相机等 token,再汇聚成一个紧凑的追踪特征。这个特征不是下一帧图像,也不是一条要让机器人逐点复现的显式轨迹,而是对整段三维世界变化的压缩表示。

学生一侧使用 Qwen3.5-2B 作为 VLA 主干。当前多视角图像和语言指令先被编码成多模态隐藏状态,一组可学习的「追踪查询」(track queries)再通过交叉注意力读取这些状态,尝试推断老师已经从完整片段中看到的三维变化特征。学生特征与老师特征被投影到同一空间,通过对齐损失拉近。
这组查询并没有在完成对齐后被丢到一边。Track4Action 通过可学习的逐特征门控,把查询中学到的信息重新融合进 VLA 隐藏序列,再交给基于 DiT-B 的流匹配动作头生成动作块。整个模型约 33 亿参数,训练目标由动作生成损失和追踪特征对齐损失共同组成。
这条连接很重要。如果三维追踪只是一个独立的辅助预测头,模型即使把辅助任务做对,也未必会在动作上使用这些信息。Track4Action 让同一组追踪查询既接受老师监督,又直接参与动作生成,相当于把「世界将怎样变化」放进动作决策真正经过的表示通道里。
老师特征本身不会直接输入动作头。这一设计避免了训练时依赖完整未来片段、部署时却突然缺少输入的问题。推理时保留下来的,是已经学会从当前场景和任务语义中推断相关三维变化的查询与融合模块;Track4World、完整演示片段和对齐分支全部退出运行链路。
零样本到双臂仿真
如果三维变化监督只是让模型更好地记住训练画面,它在背景、相机和物体外观改变后不应继续有效。LIBERO-Plus 因而构成了这篇论文更有针对性的一项测试。
这一基准要求所有模型只在原始 LIBERO 演示上训练,不使用 LIBERO-Plus 的扰动数据做适配,然后直接面对相机、机器人外观、语言表达、光照、背景、图像噪声和物体布局七类变化。Track4Action 的官方平均成功率为 82.3%,高于 LaMP 的 79.3%和无对齐版本的 74.7%。相对后者,七个类别没有一个下降,提升最大的三项分别是相机变化 18.3 个百分点、图像噪声 9.0 个百分点和机器人外观变化 8.7 个百分点。

论文表格中,Track4Action 在相机、光照、噪声和布局四项上排名第一,在机器人、语言和背景三项上排名第二,也就是在七类扰动中都进入前两名。对于一套利用三维运动监督的方法来说,相机变化上的大幅增益尤其契合其设计目标:模型需要从训练期学到的世界变化中,分辨视点改变与物体运动,而不只是依赖固定画面的外观对应关系。
在常规 LIBERO 上,Track4Action 的平均成功率为 97.0%,相比无对齐版本提高 2.8 个百分点,并以 0.1 个百分点超过 π0.5。更能体现差异的是多阶段的 LIBERO-Long:加入追踪对齐后,成功率从 86.2%升至 95.8%,提高 9.6 个百分点。短任务的基础分数已经接近饱和时,保持多个阶段之间的任务状态,反而更能体现世界变化表示的作用。
团队还在 RoboTwin 2.0 上测试了 50 项双臂仿真任务。与 LIBERO 的单臂末端控制不同,这里的策略接收一个外部视角和两个腕部视角,不使用机器人状态,直接预测 14 维双臂关节与夹爪动作,动作块长度也从 LIBERO 的 8 步增加到 16 步。
Track4Action 在干净设置下取得 80.44% 的平均成功率,在域随机化设置下为 81.48%。作为表格中最强的外部基线,未预训练的 Motus 分别为 77.56% 和 77.00%;无追踪对齐的同规模版本则为 41.32% 和 39.90%。在数据、优化器、训练计划、模型规模和执行接口保持一致的受控比较中,完整追踪蒸馏路径分别带来 39.12 和 41.58 个百分点的提升。

把三组实验放在一起,可以看到收益出现的位置并不随机:常规短任务已经接近满分时,增量相对有限;当测试转向零样本视觉变化、长程任务、不同的双臂动作空间和真实机器人时,差距明显扩大。论文据此把三维追踪特征定义为一种面向动作的训练监督,而不是只服务于视觉重建的中间表示。
空间智能进入动作
Track4Action 的方法图把两类模型画在了一起:三维追踪器知道场景里的点如何随时间变化,却不知道人类到底要求机器人完成什么任务;VLA 能把「把辣椒放进盘子」这样的语言指令与当前画面对应起来,却没有被显式要求描述接下来几秒的三维运动。前者偏向空间与运动,后者偏向语义与动作。
这项工作的选择,不是让两套模型在机器人上长期并行运行,也不是让 VLA 额外生成一段高清未来视频,而是把三维追踪器对真实运动的表示能力蒸馏到 VLA 的动作通道。对部署端而言,接口没有改变;对训练端而言,同一条演示数据却多了一层关于世界状态转移的监督。
这种思路也给机器人数据的价值提供了另一种理解。一条演示不只是若干图像与动作标签的配对,它还是一段真实物理过程的记录。只要预训练的视觉模型能够把其中的几何、遮挡、相机和物体运动提取出来,历史演示就可能被重新加工成更密集的训练信号,而不必为每一种中间变量重新进行人工标注。
写在最后
过去,机器人演示数据最直观的用途,是让模型模仿专家动作。Track4Action 往前多走了一步:动作序列是命令,和它对齐的视频则是物理世界对这些命令作出的响应。二者原本就在同一条演示里,只是后者没有被充分利用。
对 VLA 来说,这相当于在「看懂任务」与「输出动作」之间,补进一层对三维状态变化的认识。机器人上线时不需要携带那位看过完整过程的老师,却可以把老师教会的表示留在策略内部。
如果这一训练范式继续扩展到更多机器人本体、更多相机配置和更长的操作序列,三维与四维视觉基础模型未必需要直接变成控制器,也可以作为训练 VLA 的教师。Track4Action 展示的,正是这条路径的一个清晰版本:让空间智能先进入训练,再从动作中体现出来。
