IROS 现场对话 ULTRA 团队,机器人的「运动自由」还差什么?

灵巧手、驱动电机、控制算法、大模型......这些组成具身智能的「躯体」部件,正在变得越发精密。

以搬箱子为例,机器人的灵巧手要找到接触的位置,双脚撑住身体,电机驱动身体蹲下的同时,躯干要随重心变化调整姿态,随后再带着箱子、协调重心、缓慢移动。对一个熟悉这项劳动的人类而言,这些动作只需数周即可形成身体的协调与肌肉记忆,而不必逐一思考。

人形机器人也在学习这样的能力。研究者提供一套动作示范,随之设计的「动作跟踪」已经能让机器人跟随完成复杂的运动,但它常常需要外部持续提供参考,告诉机器人下一刻应该怎样行动。

但有限的动作示范远远不够。要使机器人形成接近人体的控制步态,在真实世界中物理交互,全身自主移动是必然目标。

如此,该怎么由控制向通用的行动能力转化?怎么向机器人解释「肌肉记忆」、「自主协调」?即便存在,这种记忆形式怎么在机器人的躯体上写入?

ULTRA 可能提供了一种解法。IROS 2026 期间,何夏麟、徐思睿团队的《ULTRA: Unified Multimodal Control for Autonomous Humanoid Whole-Body Loco-Manipulation》在众多投稿中突围,成为入围 IROS 2026 最佳移动操作论文奖项的团队之一。

何夏麟是 UIUC(University of Illinois Urbana-Champaign) 计算机科学博士三年级生,师从 Saurabh Gupta 教授,本科就读于上海交通大学 ACM 荣誉班,曾在张韦楠教授指导下与 SJTU APEX 实验室合作研究强化学习在四足机器人运动中的应用。大四期间,何夏麟有幸在 UCSD 实验室中担任研究实习生,接受 Xiaolong Wang 教授指导,并与 David Held 教授密切合作。研究方向为强化学习、机器人学习、计算机视觉和控制理论。

徐思睿与何夏麟同为 UIUC 计算机科学专业博士生,师从 Yuxiong Wang 教授和 Liangyan Gui 教授,硕士就读于 UIUC,本科就读于北京大学,研究重心在于构建能够像人类一样理解、练习并掌握物理交互的交互式具身智能体。

在 UIUC 计算机科学系 Liangyan Gui 教授的指导下,何夏麟、徐思睿共同合作进行了 ULTRA 的研究与开发。这项研究旨在让机器人从人的示范中学会全身配合,再根据目标和自己观察到的环境行动。

在大会 28 日的现场论坛报告上,何夏麟、徐思睿团队提到,当前的具身智能要跨越任务执行的连续性与跨场景执行的泛化性两道坎。当机器人仅被设定目标时,它要按照目标自行组织中间的动作。而如果换一种指挥方式,或者换一种观察环境,已经学会的本领还要在分布外场景举一反三、有效泛化。

在专访中,徐思睿将这件事概括为把人类数据中的经验压缩、保留下来,让不同任务都能调用学过的技能。但他也指出,如何把这些技能与机器人对复杂世界的观察联系起来,仍然需要探索。

机器形成「肌肉记忆」

实现自主且多功能的全身移动操作(loco-manipulation),仍是让人形机器人真正实用化的核心障碍。其关键在于为具身智能创造一种「肌肉记忆」的形式逻辑。然,而的局限在于,一方面,支持机器人动作的重定向(retargeting)数据往往稀缺或质量低下,难以扩展到庞大的技能库。另一方面,它们依赖于跟踪预先定义的动作参考,而不是根据感知和高层任务指定来生成行为。

人类示范中包含了丰富的操作经验,但这些经验首先属于人的身体。换一个手臂更短、关节活动范围不同的机器人,同样的姿势未必还能碰到箱子。同一段动作需要根据机器人的身体重新调整,这一过程被称为「动作重定向」。

「我们需要把所谓的人类动作数据,变成一个机器人可以用的状态。」

ULTRA 所提出的是一个统一框架,这包含神经重定向算法与多模态控制器两个关键组成部分。物理驱动的神经重定向算法能够将大规模动作捕捉数据迁移到机器人本体上,同时在丰富的接触交互中保持合理性。统一的多模态控制器则既支持稠密参考,也支持稀疏的任务指定,感知条件扩展至 Ego 数据输入。

这种方式能够使 ULTRA 将一个通用的运动跟踪策略蒸馏到该控制器中,把运动技能压缩到一个紧凑的潜空间,并通过强化学习来提升机器人的泛化能力。

困难在于,即使把姿势调整得很像,动作仍可能出问题。人的手掌在示范中接触着箱子,换到机器人身上,却可能留下空隙;脚的位置看似正确,运动起来仍可能沿地面滑动。搬箱子需要手持续接触物体,这些偏差会直接影响任务能否完成。

更深层次的问题在哪?

虽然「基础模型式」的控制发展让大规模动作数据蒸馏为可复用的经验,但是仅靠大规模、异构的移动操作数据集来扩展能力始终难见成效。同时,由于离线蒸馏受限于教师模型轨迹展开的状态覆盖范围,在高维的机器人 — 物体交互中,问题总是变得突出。

ULTRA 因此把动作转换放进了一个遵循物理规律的虚拟练习场,也就是物理仿真环境。机 器人在仿真环境内反复尝试,训练系统根据身体动作、箱子的位置、手掌接触等情况给出评分,引导模型逐步改进。这种通过尝试和反馈学习的方法,就是强化学习。

在这个过程中,动作要经过仿真中的物理计算。手是否碰到了箱子,脚是否接触地面,都会影响下一刻发生的事情。

团队还允许机器人适当改变部分姿态,优先照顾手掌、双脚这些关键部位。换了一副身体,有时就得调整站位和伸手的方式,才能把同一个箱子搬起来。

徐思睿强调,在物理仿真里学习是为了减少接触不到位,以及虚拟画面中身体与物体之间的「穿模」问题。把这些问题处理好,得到的动作才适合用于下一步训练。

「人类数据是以人类身体为基础的,而机器人的身体结构与人有差别,所以需要把人类动作数据转换成机器人可以使用的状态。我们的方法有两个特点,第一,用神经网络完成这种映射;第二,在物理仿真环境中训练这个网络,完成动作重定向。通过仿真环境,我们希望重定向得到的动作在物理上可行,避免物体穿模、接触不到位等情况。」

研究中的比较也围绕这些问题展开。在大箱子和旅行箱两类对象上,ULTRA 生成的动作与其他方法相比更稳健,脚底滑动更少,搬运时手与物体脱离接触的情况也更少。

这套方法还可以增加训练素材。通过把箱子变大或变小,调整原有动作在空间中的幅度,已经训练好的模型仍可以尝试把示范转换成新动作,无须每次都从头训练。通过这些操作,论文所用的数据规模扩大至原来的约六倍。一段搬箱子的示范,由此可以衍生出更多练习,让机器人接触不同大小的物体,以及不同的身体位置。

模型之间,必有我「师」

有了机器人可用的示范,如何让它成为机器人的技能?

ULTRA 首先训练一个「教师」模型,其次再有 「学生」模型 。这里的「教师」和「学生」决定了模型之间的关系。虽然它们都是决定机器人下一步如何行动的控制模型,但彼此之间最重要的区别在于它们接收到的信息与目标各异。徐思睿认为,「教师」模型在仿真中拥有更充分的信息,比「学生」模型更加了解机器人和物体的状态,也能看到详细的动作参考,可以集中做好跟随示范这件事,「学生」则需要在提示更少、观察不那么完整的情况下,组织出适合当前任务的动作。

怎样把教师的本领传递给学生?「蒸馏」。

团队通过训练教师模型,让它模仿重定向后的人体动作。训练时,团队通过随机改变仿真环境中的物理参数,并对机器人施加外力,让教师模型也可以学会如何从干扰中恢复动作。当缺乏完整动作参考时,团队通过蒸馏把这些技能迁移到一个共享的表示状态中,被称为「运动潜在空间」。

这种「运动潜在空间」可以被理解为一套压缩后变得更加紧凑的动作经验。无论发送的是详细示范,还是箱子应该到达的目标,模型将结合机器人的本体状态,尝试利用这套经验来自主决定接下来的运动策略。而如果换一种指挥内容,机器人也能继续使用此前学会的经验,就像可以重复调用的「肌肉记忆」。

期间,学生策略则会接收机器人的本体状态信息、历史,以及一些可选的输入。比如,用于动作跟踪的短期参考姿态、长期物体目标、机载深度相机生成的点云,或动作捕捉系统提供的物体状态等等,这些状态的参考输入将综合支撑机器人在分布内场景的更好动作表现。

为了使学生模型在没有这些参考的分布外场景下也能够展现泛化能力,训练时,团队会设计随机屏蔽部分信号的输入,让模型策略练习在信息不完整时执行工作,形成遮掩。有时,机器人不会被给予完整的动作参考,或者不被提供物体的某些信息,让学生模型利用剩下的线索完成动作,不断精进。期间,教师模型给出指导,帮助它保留已经学会的能力。期间,团队还会改变仿真中的物理条件,或者推机器人一把,让教师模型练习受到干扰后如何恢复。它由此积累的经验,既包括如何跟随动作,也包括动作偏离之后如何修正。

即便如此,真实世界中机器被给定的信息往往没有这么充分。操作者可能只指定箱子的目标位置,并不提供中间每一步。机器人对物体的了解,也可能只能来自自身携带、能够测量距离的深度相机。

所谓「统一多模态」,在这里变得具体。

ULTRA 设计了一种全新多模态控制器,何夏麟、徐思睿将其概括为感知和控制两个维度。

「从感知角度看,一种方式是通过机器人本体上的相机观察世界;另一种方式是通过额外的数据采集设备,获得更精确的运动信息;从任务和控制角度看,一种方式是给出全身示范,让机器人跟随示范;另一种方式是只提供比较稀疏的条件和观测,让它完成全身操作。感知方式和控制方式可以两两组合,形成不同的使用形式。」

一方面,ULTRA 通过详细指定身体动作、物体或机器人要到达的位置、朝向,来告诉机器人该做什么。另一方面,外部动作捕捉设备可以告诉 ULTRA 物体的位置,也可以让它用自己的相机观察,使得机器人对所处空间产生更好的理解。这些方式可以组合,交由同一个模型处理。详细指引存在时,机器人跟着做;只给出目的地时,它则需要自己补上中间的动作。

「在演示中,你只要像玩电子游戏一样,点击想要移动的箱子,再选择它要去的位置。」

训练 ULTRA 青出于蓝

「教师」的经验支持「学生」越走越远,但模仿还不够。一个优秀的「学生」应当通过练习青出于蓝。机器人也是如此。

「教师」模型所提供的一段示范记录是一种过往经验,是从某个起点走向某个终点的过程。具体地说,以搬运场景为例,如果箱子摆放的位置与示范记录相较产生变化,或者目的地不再与「记忆」一致,那么即便在这类分布外场景下, 「学生 」模型 也不应手足无措。

怎么做?训练。

好比在跟着老师学过之后,再给学生安排一批额外练习。在这里,ULTRA 团队改变起点和目标,当机器人朝目标取得进展,或最终完成任务时,就给予奖励。此外,学生仍继续接受一部分教师指导,温故而知新,尽量避免学了新情况、忘了旧本领。

这些练习还充分考虑了光照、遮挡等阻碍因素,将「看不清」也囊括在内。团队会给模拟的视觉信息加入误差、缺失和遮挡,让模型适应不那么理想的观察条件。这些额外练习带来的改变,在那些偏离原有训练目标的测试中尤其明显。

团队把在一套仿真环境里训练好的 ULTRA 模型,放到另一套仿真环境中测试。面对加入随机偏移的新目标,使用模拟机载视觉信息时,额外训练前完成了 20 个测试中的 5 个,训练后为 9 个;直接提供物体位置时,成功次数则从 4 个增至 12 个。

结果表明,ULTRA 不仅在几乎所有指标/类别上都优于基线,穿模问题也得到缓解。团队将此归因于物理重定向的有效性,它支撑脚稳稳着地,并在抬举时保持手与物体的接触。此外,在教师模型的持续训练下,ULTRA 在分布外场景下的运动跟踪成功率显著高于在其原始数据集上训练的版本,泛化能力相较于 OmniRetarget 亦得到显著提升。

这组结果支持了团队的判断。从「教师」向「学生」的蒸馏,实现了模型的性能迁移,ULTRA 利用特权状态和稠密参考学到的、具备接触感知的纠正能里,确实获得了更高的成功率。无需重新训练,ULTRA 的重定向器即可使动作多样化,并且作用于整条轨迹,从而产生时间上一致的变化。

不过,实验数据也表明,ULTRA 面对分布外的新情况时,成功率还不够稳定。与此同时,让策略接收更多种类、更多组合的输入,会不会带来什么代价?例如延迟增加,或其他性能降低?

IROS 大会现场,有观众就此对何夏麟提问。他表示,在训练范围内的动作跟踪测试中,统一模型的表现有所下降。尽管如此,不同的控制模式似乎没有损害模型对分布外情况的泛化能力。

「我们认为,共享潜在空间一旦学好,策略就能在不同输入组合下保持相应的行为。这是论文的关键思想之一。」

最难的还是感知

团队在宇树 G1 机器人上进行部署测试,并尝试了多种控制方法。机器人在有完整参考时跟着参考执行,撤去参考后,再根据物体的目标位置自主行动,操作者也可以通过键盘逐步调整目标。期间,ULTRA 既可以使用外部动捕设备,也可以在控制时依靠自己的深度相机来感知物体信息。

根据项目演示,ULTRA 可执行的任务包括双手抬箱、搬运箱子与旅行箱,也涉及踢箱子等不同动作。这些训练得到的运动技能可以在不同目标与指挥方式下继续使用。通过细粒度键盘控制与动作捕捉,使用方向键即可逐步微调目标位置,同时控制器会让整体动作保持协调。

大会报告上,团队揭示了感知条件的影响。

试验中,机器人跟着完整动作参考做,任务成功率约为 73%,即在 26 次测试中成功 19 次。撤去动作参考后,改为由外部设备提供物体状态,机器人进行垂直和横向移动两类目标测试,每 10 次分别成功 8 次和 9 次。而让机器人依靠自己的相机观察时,成功率则在 50 - 60%。结果验证,即便没有逐帧指引,机器人也能在 ULTRA 指挥下根据目标完成动作。不过,能否可靠地看清环境,仍会明显影响机器人对任务的执行结果。

从仿真跨到真机,最难的部分还是感知与控制接口。

作为眼睛和小脑,相机观察和身体控制有各自的节奏。视觉系统需要时间处理画面,而用两条腿站立、行走的机器人,需要不断更新动作来保持稳定。身体不能等到下一次画面处理完成,才开始考虑如何站稳。

团队因此需要进行滤波、插值等处理。这些操作帮助减小观测中的抖动和噪声,并衔接更新频率不同的信息。此外,机器人还得应对手臂或物体遮挡视线的情况。这些看起来细碎的处理,影响着已经学会的动作能否在真机上稳定完成。

徐思睿回忆,项目早期出现过不少仿真中能够成功、真实环境中却失败的情况。随着研发推进,团队一面把控制模型训练得更稳定,一面改善真机上感知与控制的配合。他主要负责算法和模型开发,合作作者则更侧重真机部署。

「目前我们能做到的是把收集到的人类数据压缩成一个可以复用的隐空间,再通过这个隐空间构建和复用各种技能,去做通用操作。但这里还涉及一个问题。怎样把这些技能与对世界的观测联系起来?例如,观察到这里有一个杯子,然后伸手去抓,这仍然是值得探索的。在一个复杂环境里,我们需要调用不同模块,进行目标检测、分割和物体识别,再把这些结果接入动作接口,调用合适的动作。我觉得我们目前仍处于比较初期的阶段。」

部分场景下的失败原因也很具体。真实的摩擦条件与仿真不同,可能让箱子从手中滑动;相机测量不准,或视线被遮挡,可能让机器人误判物体;外力干扰过大,也可能超出它已经练会的恢复能力。总而言之,确实有不达预期的地方。

「没有达到预期的地方,是它还缺少一些灵巧操作技能,例如通过灵巧手抓握更复杂的几何体。目前它主要还是搬运箱子,或者旅行箱这类形状与箱子接近的物体,可以操作的物体种类相对单一。原因首先是任务缺少足够精确的数据,供整套方法使用;从整套方法来看,也缺少更精确的观测。目前我们使用比较简单的 PointNet,对深度图生成的点云进行编码。但灵巧操作可能涉及更多遮挡,以及更复杂的位置关系。我们可能需要更强的模型提供相应信息,再接入运动控制接口。」

事实上,物体的位置是否可靠,手掌能否维持接触,身体受到扰动后能否继续保持稳定,都会影响下一步任务能否完成。这些问题把「自主」拉回到每一次观测与动作更新中,有待团队未来解决。

构造未来「小脑」

如果继续向前,ULTRA 最需要补足的是什么?

徐思睿提及了灵巧操作的局限。他坦言,目前 ULTRA 系统可以操作的物体种类仍较单一,主要是箱子、旅行箱登接近箱体形态的对象。使用灵巧手抓握更复杂几何体的能力,还没有达到团队的期待。

在他看来,这既涉及数据,也涉及机器人能看清什么。更精细的任务需要更精确的示范,供模型学习;复杂操作中更多的遮挡、更细致的位置关系,又对视觉能力提出了更高要求。

目前,ULTRA 把深度相机得到的信息变成「点云」,用以描述物体的形状和位置。处理过程会选取机器人前方的区域,排除地面,再把其中主要的一团点作为箱体识别出来。这套办法可以支持当前实验,但要进入摆满不同物品的复杂环境,还需要更强的识别能力。

「比如你看到一个杯子,然后就可以去伸手抓取。机器人首先得从其他东西中找到杯子,弄清它的位置,再把这些信息交给运动控制模型,调用合适的动作。」

在徐思睿看来,这个过程仍有很多值得探索的部分。

机器人还可以从「感觉」中获得更多帮助,例如,手掌受到多大的力,接触物体后应该怎样调整用力和动作等。虽然研究尚未纳入力觉感知和柔顺控制,但何夏麟认为,未来可以探索如何把这些能力接进来。

这项涵盖数据、算法和部署的工作,也是一个厚积薄发的过程。徐思睿目前在 UIUC 攻读博士,研究涉及计算机视觉、机器学习与机器人。他表示,自己已经在这个方向上做了数年,ULTRA 的多个部分都能看到此前工作的延续。

「这篇工作其实有很多我之前工作的影子。」

当话题转到创业和职业选择时,他提到,创业、教职等路径都在考虑之中,但单篇论文并不必然意味着商业价值,他更期待团队在一个方向上持续产出。让外界看到一步步变好的工作,才更能说明团队的能力。

谈及未来定位,徐思睿称, 给机器人提供一个先进的「小脑」非常重要。 在他的设想里,ULTRA 可以连接更强的视觉和任务规划系统,上层系统理解任务,安排运动目标,底层运动模块则负责具体动作中的身体配合。这意味着,搬起箱子只是其中一步。如何根据任务需要,把已经学会的动作依次组织起来,并在环境变化时继续调整,还需要在上层系统与运动能力之间实现更好的配合。未来,团队将尝试接入 Agent 或 VLM 模型,让已有技能服务于更长、更复杂的任务。

「我们希望提供一个小脑,或者说底层运动模块,再结合更多高层的审慎思考、系统能力,完成更长时间跨度的任务规划。ULTRA 建立了一个接口,可以接入不同的感知模块和控制方式。同样,我们也可以尝试接入更强的 Agent 或 VLA 模块,让它完成更长的任务,在时间上把不同技能组织起来。通过这样的接口,我们希望这套方法能够在更复杂的场景里使用。」

回到最初的搬箱子,ULTRA 让人看到,一种本体应用的真实可能正在迫近。撤去动作参考,机器人学到的协调能力仍然能够发挥作用。ULTRA 描绘的全身自主移动蓝图,也许就在未来不远。