机器人学新忘旧?港大、原力无限等团队用真机给 VLA 做了一场压力测试

机器人的神经网络中,有个由来已久的问题:灾难性遗忘。

今天机器人学会了整理餐具,明天又学会了叠毛巾,后天学会了打包纸箱。等多个任务都学完之后,再回到第一个任务,它可能就退化到像没学过一样,不知道如何处理。对于家庭、工厂这些场景而言,学新忘旧就意味着机器人的维护成本非常高。

那么如何解决这个问题呢?7 月 28 日,来自香港大学、原力无限、宁波东方理工大学等机构的团队更新一篇最新论文 Can Vision-Language-Action Models Learn from Real-World Data Continually without Forgetting?(VLA 模型能否持续从真实世界数据中学习,同时不遗忘?)

这项研究没有再设计一个新的 VLA 基础模型,而是把现有的 π0.5 放进一条真实机器人任务流,让它依次学习单臂和双臂操作,再观察此前掌握的技能如何变化。

作者的实验显示,如果只是逐项微调,旧能力会大幅下降;保留少量历史示范、以合适的频率穿插回放,同时维持统一的动作坐标系,则可以让模型在学习新任务时继续保留旧技能。

这里的「持续学习」也需要先划清范围。它不是机器人一边工作、一边自主发现任务并在线更新;而是每获得一批新任务的遥操作示范后,在 GPU 集群上继续做监督微调,再把更新后的策略放回真机评测。这套流程把数据采集、模型更新和技能评测连接起来,为机器人上线后持续增加新能力提供了一条更清晰的工程路径。

机器人也会学新忘旧

文章显示,研究团队搭建了一套 10 项操作的自建基准。五项单臂任务包括叠碗、挂杯、按按钮、折毛巾和推箱子;五项双臂任务包括把面包放进锅中、把两罐可乐装箱、按顺序装水果、折 T 恤和打包纸袋,覆盖刚体抓放、接触操作和柔性物体折叠。

实验平台由两台 PiPER-X 六自由度机械臂、平行夹爪和四台 RealSense D435 相机构成。每项单臂任务采集 500 条轨迹,每项双臂任务 300 条,共计 4000 条遥操作示范、约 35GB 数据。

论文没有只用「成功或失败」给长任务打分,而是把任务拆成若干可观察的中间步骤。例如,把两罐可乐放进纸箱被拆成右手抓起、右手放入、左手抓起、左手放入四步;完成三步就是 75 分,全部完成才是 100 分。因此,文中的 97.2 是「归一化任务进度平均分」,不能直接写成 97.2% 的完整成功率。

基础策略使用约 27 亿参数的 π0.5,全部模块参与更新。若每个任务独立微调,单臂和双臂任务的平均基线分数分别为 86.9 和 88.0;如果不做记忆保护,按顺序每学一项就继续微调,完成第五项后,平均分只剩 31.4 和 38.3。单臂序列中,叠碗从 100 分降到 20 分,挂杯从 97.5 分降到 0;衡量旧任务退化的 BWT 指标也分别降至 -81.0 和 -68.6。越早学到的技能,越容易被后来的梯度更新覆盖。

这组结果反驳了一个过于乐观的想象:预训练规模足够大的 VLA,自然就能抵抗遗忘。作者认为,以往仿真基准中的任务和动作空间更接近,也可能与基础模型的预训练数据重合;真实任务之间的分布变化更大,问题也随之暴露。

一套「回忆机制」

团队采用的主要方法并不新奇:经验回放(Experience Replay)。每学完一项任务,系统从示范数据中留下一小部分完整轨迹;学习下一项任务时,多数训练步骤读取新数据,少数步骤抽取历史轨迹,让模型在吸收新技能的同时定期「复习」。它没有增加任务专属模块,也不需要为每种技能保存一套完整模型。

真正决定效果的是回放怎样配置。缓冲比例从 0.2% 提高到 2% 时,单臂任务流的 BWT 从 -8.95 升至 +0.25,遗忘已接近消失。回放频率则不能一味加大:从 5% 提高到 20% 会明显改善旧技能保留,但推到 50% 后,模型开始为了复习而牺牲学习新任务的能力。

采用 20% 缓冲比例和 20% 回放频率后,单臂与双臂两条五任务流的最终平均分都达到 97.2,BWT 分别为 +1.5 和 +1.9。把五项任务从一开始混在一起联合训练,并把总更新次数同样控制在 2.4 万步,平均分则为 82.6 和 83.2。至少在这套任务和计算预算下,按阶段学习并穿插旧样本,比同时优化所有任务更有效。作者将其归因于多任务训练时的梯度冲突,但尚未给出完整因果验证。

另一个更容易被忽略的变量,是动作归一化。机械臂关节、末端和夹爪的动作值跨度不同,VLA 训练前通常会把它们缩放到相近范围。若每来一项任务就重新计算这套统计量,同一个网络输出在不同任务里可能对应不同的真实动作,相当于模型刚学会一种坐标语言,下一阶段词义又变了。

三种方案中,效果最好的是冻结第一项任务的动作统计,并在之后所有训练和测试中共用,十项得分均不低于 95。若训练时各用一套统计量、测试时却统一使用第一项统计量,双臂序列除第一项外全部掉到 0 分。这不意味着「永远使用第一项统计量」是通用答案;它成立的前提,是第一项任务的动作范围能够覆盖后续任务。更普遍的启示是,持续学习不仅要保护参数,还要保护动作接口的语义一致性。

VLA 开始积累自己的经验

分别跑通两条五任务流后,团队又把全部 10 项任务交错排列:单臂、双臂、单臂、双臂。对模型来说,这不只是任务数量翻倍,而是要在完全不同的动作维度、协调方式和接触模式之间反复切换。团队据此设计了非对称回放计划:将总回放频率提高到 30%,同时让双臂示范在缓冲区中的采样权重达到单臂的两倍,为协调难度更高的技能保留更多“复习时间”。

完成全部十项学习后,终点矩阵中的十项归一化得分介于 80 和 100 之间,平均约为 92.9;平均 BWT 为 -2.7,平均前向迁移 FWT 为 +8.7。早期学到的叠碗、挂杯,与后期加入的按按钮、装水果等技能,被保留在同一个持续更新的策略中。论文由此展示了一种更接近长期使用的训练方式:机器人不必每增加一项能力,就把此前所有任务重新从头学习一遍。

这组结果也把“记忆”变成了 VLA 系统中一个可以主动管理的工程对象。不同技能对参数覆盖的敏感程度并不相同,训练系统可以根据任务结构分配回放预算,让复杂技能得到更多保护。经验回放由此不再只是一个通用训练技巧,而开始承担机器人能力资产管理的角色——哪些经历值得留下、哪些技能需要更多复习,都可以进入同一套持续迭代流程。

这对具身智能的意义相当直接。现实中的机器人不会永远面对固定工位和固定物体:产线会更换产品,仓库会上新商品,服务机器人也会不断接到新的操作要求。如果新任务可以按顺序加入已有策略,而旧任务通过精选历史示范得到维持,机器人软件就有机会从周期性的整体重训,转向更灵活的增量升级。数据采集也不再只服务于一次训练,而会逐渐沉淀为可重复调用的经验库。

目前,论文和官方代码仓库已经上线,训练、联合学习与经验回放等核心流程均可查看,为后续研究在更多任务和机器人平台上继续扩展提供了基础。这项工作的价值不在于发明经验回放,而在于把它放进真实机器人任务流,梳理出回放频率、记忆分配和动作坐标一致性如何共同决定持续学习的效果。

通用机器人的能力边界,未来或许不只取决于出厂时会多少项任务,更取决于上线之后能否不断积累新的经验。机器人想要持续成长,不仅要会学,也要会记。