清华大学弋力团队发布 PASSAGE,让人形机器人自己挑动作穿过杂物间

PASSAGE 研究将场景对齐的人体动作数据积累至100小时量级,通过流匹配规划器搭配感知增强的全身追踪器架构,让人形机器人能够在杂乱受限环境中自主选择并组合跨越下穿侧身避让等多元运动动作。仿真测试结果可以直观证明,机器人无接触通行的成功率会随着训练数据规模的提升持续走高。
银河通用、上海期智研究院、上海科技大学、北京中关村学院、上海交通大学、新加坡国立大学、清华大学与北京大学联合团队于9月16日正式发布相关论文,论文标题为《PASSAGE: Scaling Scene-Aligned Motion Learning for Perceptive Humanoid Traversal in Cluttered Environments》。该论文共计二十位作者,Yuxuan Ma、Zicheng Zeng与Chunlin Peng担任共同一作,清华大学交叉信息研究院助理教授、博士生导师弋力为通讯作者。弋力曾参与PointNet++与ShapeNet两大经典三维视觉研究工作,长期深耕三维感知与人形机器人学习相关研究方向。
在此之前,人形机器人掌握复杂环境穿行能力主要依托两类技术路径。一类依靠强化学习针对特定场景训练专属专家策略,再通过模型蒸馏得到通用控制器,整体研发成本偏高,机器人可实现的动作范围也会被人工设定的运动目标限制。另一类方式是采集人体演示动作数据,但想要让演示动作适配杂乱障碍物场景并被机器人自主调用,要求演示数据与场景几何特征高度对齐,而过往公开数据集的体量始终存在明显局限。该团队的核心突破在于将场景对齐的演示数据扩充至100小时、覆盖1500类场景,同时搭建起完整的技术链路,打通从机载激光雷达到关节指令输出的全流程感知规划与控制体系。
01 机器人要先决定怎么过
凭借完备的全身关节结构,人形机器人硬件层面可以实现多种通行动作,能够跨过齐膝障碍、侧身穿过狭窄通道、低头从悬空横梁下方穿行。真正的技术难点,是让机器人在无人工干预的前提下自主判断适配场景的通行方式,连贯组合多元动作完成全程行进,且整套决策与执行体系完全依托机载传感器实现。
现阶段主流技术方案可以归为两类。第一种通过强化学习为专属场景训练专家策略,再将多场景专家模型蒸馏整合为通用控制器。这类方案在杂乱环境中具备可行性,但不仅需要人工前置定义运动目标,专家模型的训练算力开销巨大,同时现有通用控制器仅支持十二个腿部关节驱动,大幅限制了机器人全身协同运动的能力边界。第二种方案依托真人动作数据采集训练,核心痛点在于杂乱场景下的动作复用门槛极高,只有与周边几何结构精准对齐的演示数据,才能被机器人有效识别调用。
过往领域内的场景对齐演示数据体量普遍偏小,公开数据集仅完成2.3小时数据采集、覆盖145个程序化生成场景,相关研究重心大多局限在数据构建与基准测试层面。行业内始终留存两个待验证的核心问题,场景对齐的演示数据能否支撑端到端的感知规划控制全链路落地,以及演示数据的体量规模会对机器人动作生成质量与下游执行精度产生多大影响。
PASSAGE 的研究目标十分清晰,仅向机器人输入终点目标位置,完全交由机器人自主判断通行路径与运动方式。该研究聚焦地面侧面头顶三类空间约束的组合通行场景,暂不覆盖上下楼梯平台攀爬远距离障碍跨越等复杂动作场景。团队针对性搭建了从数据采集筛选增广到真机机载部署的完整技术链路,并在统一技术框架下量化验证数据规模对整机通行能力的增益价值。
02 真机 50 次试走全部到达
团队将统一的规划器与追踪器模型部署至真机,在五十组差异化物理场景布局中完成实测验证。测试场景分为五大类别,包含单一跨越穿行侧身挤压、上下空间同步受限、多元动作顺序组合,每类场景各设置十组不同布局,每组布局仅执行一次通行测试。测试全程仅向机器人下发终点位置指令,无任何预设行为标签,也无上层技能筛选调度模块,完全依托模型自主决策。
五十次真机实测中,机器人全部成功抵达终点区域,全程无摔倒情况且无需人工介入干预。其中四十五次实现全程零碰撞通行,无接触通行占比达到百分之九十。二十组双约束与组合动作场景全部顺利完成通行,十七次实现全程无接触,八组顺序组合场景达成零接触通行效果。场景接触情况均由人工现场标注确认。团队在论文中明确指出,五次存在轻微接触的通行案例足以说明,当前技术的核心瓶颈集中在极致避障能力,机器人的路径规划与全程抵达能力已经完全成熟。
仿真测试进一步补充了精细化对照实验。测试集选取一百五十组从未参与训练的全新场景,均分三类难度各五十组,每种算法在单一场景中重复测试五次,总计七百五十个测试回合,单回合最大测试时长限定六十秒。抵达成功的判定标准为机器人进入终点零点五米范围以内,零接触抵达需要在此基础上满足全程无障碍物碰撞。采用通用版CAT算法且未做二次训练的模型,在零样本场景测试中抵达率为百分之七十点三,零接触抵达率为百分之十四点零,摔倒率为百分之二十点一,单位行走距离接触时长为零点三一九二秒每米。团队还参照Zhang等人的研究方案,搭建扩散加追踪的对照技术管线,依托十二小时训练数据实现百分之八十六点零的抵达率与百分之十九点二的零接触率。在完全相同的十二小时训练数据前提下,PASSAGE模型三组随机种子的平均抵达率可达百分之九十点零,零接触抵达率提升至百分之四十八点六,单位行走距离接触时长降至零点一二三零秒每米。
本次对照实验存在明确的口径界定。本次测试场景虽未参与PASSAGE模型训练,但贴合其训练数据分布特征,而CAT算法全程以零样本状态适配全新场景。因此本组对比结果,主要用于验证整套系统的场景迁移泛化性能,并非对两种动作生成算法的纯横向能力对标。
03 100 小时动作数据怎么来
这批数据全部依托真人演示采集得到。团队搭建一套程序化场景生成器,在十米长的走廊内拼接方块障碍,沿着走廊选取八个难度变量,包含台阶高度、横向偏移、通道长度与宽度、天花板出现的概率与高度、地面凸起的概率与高度,覆盖地面侧面头顶三类空间约束。
采集环节里操作员穿戴诺亦腾 PN Link 惯性动捕服与 VR 头显,以虚拟角色的第一视角在各类场景穿行。虚拟躯体一旦和场景发生碰撞就会触发触觉反馈,这条演示样本直接作废。团队还要求操作员主动变化动作与穿行策略,避免所有人采用同质化的行走方式。
团队对采集得到的原始样本执行碰撞剔除与质量筛选,最终留存一万九千三百一十条序列,合计一千七百四十七万零一百二十八帧,总时长接近一百小时,分布在一千五百个不同场景当中。采集完成的动作随后重定向到拥有二十九个自由度的宇树 G1 机器人,配套场景同步缩放,动作与几何之间的对齐关系保持不变。

原始数据之后继续做扩增处理。动作和场景几何分开存储,重定向与增广操作可以独立开展。团队为每一段动作生成十种障碍变体,尺度区间维持在零点五至一点五倍,旋转角度控制在正负十五度以内,统一缩放匹配重定向后的动作,再借助 MuJoCo 完成运动学回放,只保留不存在碰撞的动作场景配对。经过这一轮验证,原本一百小时的原始样本扩充至大约一千小时的动作场景配对,扩增全程沿用同一批真人演示动作。训练阶段继续增加样本多样性,单个场景最多搭配三十种背景布局,同时以零点五的概率对动作执行左右镜像。
04 规划器、追踪器与机载系统
PASSAGE 框架将动作生成和动作执行划分给两个独立模块,两个模块分开训练,依靠一套约定好的接口完成对接。这种架构不需要针对每一类行为单独训练控制器,机载感知与算力单元同样接入这套统一接口,真机运行阶段只需要向机器人输入一个目标点。
规划器与追踪器怎么分工
规划器负责确定接下来半秒的运动方案。它接收四帧动作历史,每一帧是六十五维状态,涵盖躯干高度姿态倾斜平面速度与转向角速度,以及二十九个关节的位置和速度。另外两类输入是机器人坐标系下的局部目标点,还有一张以躯干为中心的三层高程图,尺寸为 3×31×61,三层分别记录可供踩踏的支撑面侧面遮挡区域以及头顶可用净空。规划器输出未来二十五帧也就是零点五秒时长的参考动作,采用条件流匹配完成生成,从噪声出发积分形成完整动作块,推理频率维持六点二五赫兹。
训练阶段团队加入多项约束项,包含根状态与关节速度重建位置和速度有限差分一致性脚滑关键点抖动以及包围盒穿透。还有一项约束取自 HumanoidPF,团队从场景符号距离场预计算势场,在骨盆躯干头部肩部手掌膝盖脚部十一个锚点上采样。锚点进入障碍物零点二米范围以内就会生成斥力,锚点背离引导方向移动同样会产生损失。这项势场仅用于训练过程,推理阶段不会新增输入也不会带来额外算力开销。

追踪器负责把参考动作转化为关节指令。团队沿用 ScaleBFM 全身追踪接口,接口基础检查点来自团队另一项研究成果,依托约一千小时通用动作语料完成预训练,适配搭载 AGX 计算背包的二十九自由度 G1 机器人。地形信息以八个卷积网络编码得到的 token 追加进参考序列,预训练 transformer 与动作头结构不作改动。适配过程采用非对称 actor-critic PPO,先用两百次迭代优化地形编码器与 critic,再引入动力学观测和外部扰动的随机化对整体策略微调。追踪器以五十赫兹频率运行,输出二十九维残差关节位置指令,它的训练素材取自数据集内的参考动作,规划器输出不会参与这一步训练。
感知与算力都在机上
真机部署采用同一套规划器和追踪器。全部计算任务都在宇树 G1 本体上完成,额外搭载一块 NVIDIA Jetson AGX Orin 与一只 Manifold Tech Odin 模块。整套系统不依赖预先构建的地图,任何计算环节都不会转移到设备外部。
感知工作由机载激光雷达承担,配准后的点云与里程计在线融合,送入 ROG-Map 维护以机器人为中心的三维占据栅格。三层高程图直接从栅格当中提取,每一根垂直体素柱输出三类信息,最高占据表面该表面下方由已观测自由空间支撑的障碍下沿,还有更下层的支撑表面,依次对应可踩踏区域侧面遮挡和头顶净空。未观测到的体素不会直接判定为空,这条规则对运行安全十分关键。提取得到的表面会在躯干坐标系缓存,依托最新里程计以二十赫兹重新采样,缓解点云更新间隙带来的位姿陈旧问题。

规划器和追踪器分属两个进程。规划器导出为 ONNX 模型,依托 ONNX Runtime 的 TensorRT 后端以 FP16 精度运行,每八个五十赫兹控制步请求一次新规划,对应六点二五赫兹的规划频率。追踪器在机载 CPU 上以五十赫兹运行。最新关节目标借助共享内存交给进程外 C++ 桥接模块,再以五百赫兹下发至机器人本体。
05 数据规模与四组消融
数据从 6 小时加到 100 小时
研究团队单独针对数据规模开展变量对照实验,整体设置6小时、12小时、24小时、48小时、100小时五档不同体量的训练数据。每一档数据均搭配三个独立随机种子分别完成规划器训练,实验过程中全程固定模型架构与优化预算,同时锁定RTC机制势场目标闭环强化学习后训练方式追踪器检查点以及评测回合等全部核心条件,唯一变量仅为规划器所使用的预训练数据子集。
五档梯度实验的测试结果能够清晰体现,模型避障相关性能的优化趋势最为稳定。任务到达率可以实现持续提升,从6小时数据训练对应的84.3%稳步增长至100小时数据训练后的96.4%,零接触到达率由48.1%提升至68.9%,单位距离接触时长也从0.3565秒每米下降至0.0499秒每米。6小时到12小时区间内的零接触性能波动处于种子随机误差范围之内,不具备有效参考价值,但不同种子测试得出的任务到达率与接触时长均呈现持续优化状态。摔倒率与脚滑概率并未形成统一的单调变化规律,这也说明数据规模扩容带来的性能提升,主要集中在任务抵达与自主避障两大维度。

研究团队在100小时基础数据的前提下叠加场景增广策略,进一步挖掘模型性能上限。优化后的模型最终实现98.7%的任务到达率与70.3%的零接触率,单位距离接触时长优化至0.0422秒每米。对比仅使用100小时原始数据且未做场景增广的三组种子均值,新增场景增广能够让任务到达率提升2.2个百分点,零接触率提升1.3个百分点,单位距离的接触暴露时长减少15.4%。这一部分性能增益仅来自场景几何形态的变体拓展,并未增加真人动作演示的整体体量,所以性能提升幅度远不及原始数据规模扩容带来的效果。
四组消融各测出什么
研究团队通过四组独立消融实验,逐一量化拆解各个技术模块的独立贡献。去除RTC机制之后,模型综合性能出现大幅回落,任务到达率从98.7%下降至92.7%,零接触率从70.3%大幅跌落至24.5%,单位距离接触时长从0.0422秒每米上升至0.4038秒每米,整体误差接近十倍。团队分析认为,相邻两次规划迭代过程中一旦出现几何形态跳变,缺少RTC一致性约束的调节作用,微小的参考坐标偏移会被执行层持续放大,最终演变为机器人实际运行过程中的碰撞问题。
移除规划器侧的强化学习后训练模块后,模型性能再次出现明显下滑。任务到达率回落至94.4%,零接触率降至26.4%,单位距离接触时长上升至0.1985秒每米,脚滑概率也从0.0113升高至0.0185。本组实验可以证明,在锁定追踪器性能参数的前提下,让规划器依托真机实际运行产生的偏差持续迭代优化,能够同步改善任务抵达效果避障能力与整机执行精度。

研究团队保持规划器与交互接口配置不变,仅将高性能追踪器替换为基础ScaleBFM检查点,模型各项核心性能大幅衰减。任务到达率降至84.4%,零接触率跌至18.4%,摔倒率从0.9%大幅升高至6.9%。本组实验可以精准测算追踪器侧感知增强带来的纯收益,局部几何实时反馈的优化效果在狭窄通道等复杂限位场景中表现得尤为突出。在此基础上单独去除势场损失约束,模型任务到达率维持在84.8%,零接触率为20.1%,单位距离接触时长回升至0.1538秒每米,整体避障能力再次出现明显弱化。
结合四组消融实验的综合结果,研究团队梳理出整套技术体系的模块分工逻辑。场景对齐的演示数据可以搭建适配各类几何环境的动作资源库,势场损失能够构建显性的避碰先验条件,RTC机制可以保障相邻规划迭代过程的动作连贯性,规划器侧强化学习能够让机器人动作适配执行端的真实运行偏差并完成精细化优化,追踪器侧的感知增强则可以在实时执行阶段完成局部几何修正,保障整机运动的稳定性。
06 写在最后
PASSAGE方案实现的核心突破,是将场景对齐动作数据的训练体量推进至100小时的全新量级,同时依托规划器叠加追踪器的组合架构,打通行为决策与全身运动执行的完整链路,让整套智能调控逻辑能够全程落地于真机运行。以往人形机器人的行为选择与运动执行处于相互割裂的状态,行为策略要么依靠强化学习训练的专家模型,要么依托人工整理的固定技能库,两种技术路径在拓展全新行为适配全新场景的过程中,都需要投入大量额外研发成本。
这套方案当前存在的短板同样清晰且明确。50次真机实测过程中一共出现5次障碍物碰撞问题,训练所需的接触数据完全依赖人工标注,样本仅覆盖单一硬件平台与50种场景布局,数据丰富度与场景覆盖面存在明显局限。感知层面仅保留几何感知通道,激光雷达无法识别透明表面与细微线缆等特殊结构,后续会通过增补RGB感知能力补齐这部分短板。现有动作库仅适配地面侧面头顶三类空间约束,暂时无法实现上下楼梯平台攀爬障碍跨越等复杂运动行为。场景增广手段只能实现几何形态的多样化拓展,模型泛化能力的上限依旧受制于真人演示数据的丰富程度。
对于整个人形机器人研发领域而言,本次研究形成了具备复用价值的结论。场景对齐动作数据与执行层感知反馈分别具备独立且不可替代的作用,RTC一致性机制与规划器侧强化学习后训练带来的性能增益均可量化验证。这套框架目前还无法适配长距离行进与复杂地形穿梭等高难度场景,但它完整勾勒出数据规模扩容与机器人避障性能提升的正向关联,为人形机器人具身智能与自主避障能力的迭代升级提供了可落地可复用的技术参考。
论文:https://arxiv.org/abs/2609.18732 项目页:https://galaxygeneralrobotics.github.io/PASSAGE/
