中美韩三篇具身智能体力作,串起机器人 Agent 的现在与未来
近期,随着 Anthropic 发布报告,具身智能的牌桌上坐满了所有能叫出名字的大语言模型巨头。
Anthropic 在 2026 年 7 月发布了一份独特的实验报告《Claude plays robotics》。他们直接把 Claude 接到四类机器人身体上,分别是仿真里的宇树人形机器人 G1 和四足机器狗 Go2、Franka 机械臂,以及真实世界在办公室走廊里遛弯的宇树机器狗 Go2。实验的核心发现之一是同一个模型,换一个接口抽象层,表现天差地别。
事实上,从硅谷到北京,从大模型厂商到机器人公司,所有人都试图让「LLM 和 VLM 成为机器人的大脑」这件事变成现实,从而做出真正的机器人 Agent。
但机器人 Agent 这件事有多难?该怎么做?近期三篇分别来自 Meta / 南洋理工 / 华盛顿大学、韩国成均馆大学、清华 / 普渡等机构的工作,刚好组成关于具身智能体的完整线索。
Meta FAIR 联合南洋理工大学、华盛顿大学、布朗大学、西北大学等机构发布了论文《HumanCLAW: Can Vision-Language Models Act Through a Body?》,该工作构建了一套三层解耦框架,让冻结的 VLM 在物理模拟中驱动人形身体,并在 41 个家庭场景的 1,218 个寻找-导航-交互回合上对 9 个前沿 VLM 进行了基准测试。
另一篇,来自韩国成均馆大学的研究者发布的论文《RoboBRIDGE: A Modular Framework for Bridging Policies to Robust Real-World Robotic Agents》,旨在通过一个五模块编排框架,将任意动作生成策略封装为具备故障恢复、长时序一致性和跨领域鲁棒性的机器人智能体。
第三篇是清华大学联合普渡大学、中科院自动化所、无问芯穹等机构发布的论文《Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents》,核心在于将冻结的 VLA 降级为一个可重试的接触密集原语,与 6 个解析原语组合,配合双记忆系统,在不微调模型的情况下实现了跨具身操控的显著提升。
HumanCLAW 负责把问题说清楚,RoboBRIDGE 和 HarnessVLA 分别从「下层 VLA 的模块化适配」和「上层规划器的记忆优化」各给出一个解法。
与此同时,三篇论文共同说明了无论是 VLM 还是 VLA,直接部署到机器人上或许都不够。
模型负责动作预测,但要让机器人可靠地完成任务,还需要在模型外面加一层编排,用于监控有没有出错、失败了怎么恢复、场景变了要不要重新规划。
这意味着具身智能的下一个突破口可能在模型与机器人本体之间的那一层抽象。
VLM 几乎不能驱动身体
HumanCLAW 的研究者提出,要测试一个大模型或者说具身智能体能不能「通过身体行动」,得先解决一个两难问题。
如果把运动执行交给一个训练好的控制器,万一是控制器出错了,通常说不清楚失败到底是因为 VLM 决策烂,还是身体不听话。但反过来,如果把运动抽象成「往前走三步、左转 90 度」的脚本动画,那物理后果就消失了。
一个代码 Agent 左转后立刻右转没问题,但真实的人体需要减速、转移重心、在意图之间产生过渡动作。这些看似「不完美」的动作恰恰是具身行动的核心。
对此,HumanCLAW 的方案是三层解耦。

第一层是驾驭系统。VLM 被引导进了一条推理管线,最高层先外化「看到什么、距离多远」,再推导中层目标「接下来几秒干什么」,然后从 8 个原子技能中选一个并给出参数,最后由技能特定验证器做空间安全性校验。

别小看验证器,验证器是决定性组件。消融实验中移除它后,导航成功率从 27% 崩到 2%。
第二层是技能条件运动生成器。生成器用一个共享的基础运动 DiT(3,800 万参数,在 AMASS 人体运动数据上训练)提供自然人体运动先验,每个原子技能各配一个即插即用的 ControlNet 适配器。

关键在于零样本保真度极高,命令步幅跟踪率 0.97,转弯角度 0.99,坐下高度 0.98。也就是说。执行端不会出错,失败就是决策的问题。
第三层是半物理模拟。这层在纯运动学(无物理后果)和完全动力学(失败被平衡问题混淆)之间找到了精巧的中间态,通过保留碰撞、重力、物体位移,排除平衡丧失,让每次失败都可读、可归因。
值得一提的是,研究团队还设计了 HumanCLAW-Bench 评估指标,从高层任务成功率、低层行动质量、身体意识和物理干扰、计算成本四个维度评估 VLM。
具体来看,研究者把 GPT-5.5、Gemini-3.1、Claude-4.8 等 9 个最强 VLM 放进蓝色人形身体,扔进 41 个陌生家庭场景,一句话指令:「找到一个沙发,走过去,坐在上面」。这就是 HumanCLAW-Bench:1,218 个寻找-导航-交互回合。

结果上,这些前沿 VLM 找到沙发的一半以上没能走到旁边,走到旁边的三分之二以上坐不下去,完整任务成功率仅 16.8%。比较沮丧的是「着陆率」, Gemini-3.1 找到沙发后只有 65% 真正到达,InternVL3.5-38B 是 2%。另外,识别率与客观可见率仅差 5 个百分点,这也说明感知不是瓶颈。所以说,崩溃发生在「认出之后」。
自动化根因给出结论,导航失败 64% 是身体感知相关错误,包括 30% 离得老远就声称「到了」(距离幻觉),20% 已到 0.2m 内不停止继续撞,14% 腿被卡住却继续发前进指令;交互失败 81% 是身体安置错误,其中 58% 坐进空气,14% 坐错物体和 9% 短暂坐下后又自己走开。

而且碰撞集中在不被「注视」的部位,腿脚 28-45%,手臂 20-35%,头部 小于 7%。VLM 能描述看到的椅子,但不知道那正是自己手臂刚刚撞倒的。
作者团队在论文中提到,可泛化的行动智能来自推理,而非拟合行动数据**。所以说,HumanCLAW 像是一个方法论贡献**。它证明了「冻结 VLM + 固定运动先验 + 半物理闭环」这条技术路线可行。
尝试让身体更听话
上文的 HumanCLAW 证明 VLM/VLA 不缺更强的动作预测,更需要闭环智能体的核心能力,核心能力包括知道自己什么时候失败了、能从失败中恢复、能在场景变化时调整计划。
RoboBRIDGE 的思路是,这些能力,用中间框架解决,而非重新训练模型。
在 LLM Agent 领域,众所周知,裸 LLM 虽然生成能力强,但无法验证自己的输出、不能可靠执行多步任务、遇到未知领域就退化。社区的解法是构建通用编排框架,例如 LangChain、AutoGen,即给任意 LLM 装上工具调用、规划和验证模块,把基础模型变成 Agent。
RoboBRIDGE 的定位就是 VLA 版的 LangChain:给任意动作策略装上五件「外骨骼」,尝试让身体更听话。
RoboBRIDGE 把机器人智能体的运行拆成五个各司其职的模块,围绕中间的 Controller 形成闭环。

Monitor 是质检员。它分两阶段工作:先用一个轻量模型以 5Hz 常驻监测「当前动作成功了还是失败了」,只在检测到高置信度失败时才唤醒大模型做深度根因诊断。
一旦确认失败,按代价从低到高逐级尝试恢复:先重试当前动作(retry),不行就重新生成轨迹(regenerate),还不行就重规划子任务(replan),最后强制重新感知整个场景(re-perceive)。这套四级递进机制的核心哲学是够用就好,不一上来就全局重规划。
Perceptor 是眼睛。它独立于执行线程异步运行,不停地刷新场景理解,以物体为中心追踪位置变化。
Planner 是调度员。它把高层任务分解为技能序列,同时监听 Perceptor 传来的场景变化,当物体位置偏移或物体出现或消失超过阈值时,触发重规划。这让机器人不会死守一份过期的计划。
Robot Interface 是手脚。它负责将 Controller 输出的动作指令翻译为具体的机器人坐标、逆运动学求解和安全校验,对接真实或仿真硬件。
关键的 Controller 是躯干。它封装了任意动作生成策略(VLA、IK 控制器或其他),对上层模块暴露统一接口,可插拔替换。
当使用 VLA 作为 Controller 时,RoboBridge 额外引入基本技能微调,即将操纵任务拆成 MOVE、GRIP 等跨领域不变的基本动作单元,每个单元训练专用 LoRA 适配器,执行时按需切换,这便降低 VLA 对领域偏移的敏感性。
RoboBRIDGE 在仿真和真实世界都做了验证。

仿真上,LIBERO 是语言条件的桌面操控套件,任务相对短、场景变化可控,独立 VLA 已有一定基础,GR00T-N1.5 达 35.5%,RoboBridge 封装后将其提到 39.7%。RoboCasa 是 24 个长时序厨房任务,场景大、步骤多、执行漂移频繁,独立 VLA 几乎全线崩溃,平均仅 3.7%,封装后翻倍到 7.5%,排除相对简单的取放任务后从 6.2% 跃至 11.4%。
真实世界迁移上,在 Franka 和 UR7e 两个机器人平台中,相同的监控和恢复行为无需额外适配就迁移到了未知环境中,对视觉变化和驱动不确定性保持鲁棒。另外,研究者主要残余故障来自遮挡下的感知误识别,以及接触密集交互中不可逆的操控失败。

消融实验则发现, RoboBRIDGE 对 LoRA 微调、全微调、经典 IK 控制器甚至 CycleVLA 都有正向提升。除此之外,Claude Opus 做监控带来 8.1% 提升,换成 Claude Haiku 或 Gemini Flash 等小模型几乎无效。编排框架的上限,取决于「大脑」的推理质量,说明监控模块仍需要强推理 LLM**。**
RoboBRIDGE 表明,给 VLA 加一层编排逻辑,即使不换模型,也能让机器人在真实环境中更稳地完成任务。
再试着让大脑越用越聪明
如果说 RoboBRIDGE 主要给 VLA 装了 5 个模块,使其能更聪明地接收大脑指令并优化动作,那 HarnessVLA 走了另一条更激进的路,VLA 完全冻结、原语库固定不变、不训练不动刀,只教规划器怎么「用好已有工具」,让大脑更加聪明、更适合机器人运动。

「已有工具」包括 6 个解析原语(基于 IK 运动学,零训练):MOVE TO(移动到空间目标)、MOVE POSE(调整末端位姿)、ROTATE WRIST / ROTATE PITCH(手腕/俯仰旋转)、SET GRIPPER(开合夹爪)、RELEASE(释放物体);以及 1 个 VLA 原语: VLA ACT ,仅在规划器指定的局部窗口内被调用,只做接触密集的事(抓取、放置、按钮按压、水龙头旋转)。有固定尝试次数限制,失败后规划器决定「重试还是换方案」。
其中包含一个关键设计,和 HumanCLAW 的「原子技能」思路类似,VLA ACT 没有做传统的连续控制,只是稀疏、可重试的局部尝试。即规划器用解析原语把机器人运送到 VLA 兼容的局部区域,再调用 VLA ACT ,接着观察结果 ,最后决定下一步。VLA 从「全程开车的人」变成了「只在最难停车位帮一把的代驾」。
值得一提的是,HarnessVLA 区别于其他 VLA 编排方案的最独特设计是双记忆系统。
其一是任务特定记忆,在单个参考场景上做一次探索,成功后把整个原语调用序列存成结构化轨迹,例如用「离目标最近的椅子」替代坐标 [1.23, 0.45] 。到新场景时,模型检索这个结构骨架,用实时 RGB-D 感知重新接受所有空间参数。
其二是全局记忆,跨任务积累可复用的「失败模式」和「成功规则」。这些是规划器反复踩坑后总结出来的元知识,一旦入库就不再重犯。例如「空抓取时别浪费时间重试」、「检测到物体没跟手走说明抓取失败」等。
效果上,HarnessVLA 在三个基准上都有不同幅度的提升。

LIBERO-Pro 受语义和空间双重扰动,HarnessVLA 达到 82.4%,比最强基线 RATS 高 38.6 个百分点。RoboCasa365 是长时序厨房场景,从 RLDX-1 的 30.0% 拉到 55.4%,涨了 25.4 个百分点。RoboTwin C2R 测双臂迁移能力,从 LingBot-VLA 的 50.4% 提到 58.4%,而且还都冻结了 VLA 权重。
研究者还发现了三个机制层面的现象。第一,规划器级语义重新接地恢复了任务条件行为,让 VLA ACT 只需在被带到正确位置后执行局部操作。
第二,稀疏但可重试的 VLA 调用。1 次调用 VLA 就已经超过基线,调用 5-8 次后改善达到饱和,即关键在调用前的部署和观察。
第三,解析原语隔离非接触执行。规划器只在面对 RoboCasa365 等密集接触任务时才会提高使用 VLA 的比例。
也就是说,同样的 VLA 能从 43.8% 跑到 82.4%,说明不需要往 VLA 的训练集上再加一个数量级,关键是给规划器一本笔记本、一个固定的工具箱、和「试试看→记下来→下次别犯」的循环,让大脑越用越聪明。
写在最后
把这三篇较新的具身智能体放在一起读,容易得出一个叙事「编排比扩展更紧迫,框架才是瓶颈」。
但若回到 LLM 领域的参照系,这个判断需要打一个问号。总有人说 AI 进入下半场,下半场的关键在于应用、Agent 等偏向「用户体验」的大厂叙事。
可事实是,Kimi、GLM、DeepSeek、Anthropic、OpenAI 仍在密集发布新模型,预训练的回报远未见顶。Agent 和编排框架确实让现有模型做了更多事,但每次基础模型代际升级带来的能力跃迁,往往比所有框架优化加起来都大,谈及 AI 进入下半场为时尚早。
具身智能只会更早。VLA 模型本身还没收敛,GR00T、π0.5、Gemini Robotics 都在快速迭代,一年前的 SOTA 放到今天可能已经被基础能力的提升自然覆盖了。
HarnessVLA 把冻结 VLA 从 43.8% 拉到 82.4% 确实漂亮,但如果下一版 VLA 本身就把基线提到了 70%,编排的增量还剩多少?
这并非在否定编排的价值,只是说编排的收益高度依赖模型底座,模型底座能力随着架构改变提升了,编排要解决的具体问题也同样在变化。
当然,有一个东西不太会被模型升级覆盖掉,那就是 HumanCLAW 点出的「身体感」,RoboBRIDGE 和 HarnessVLA 的价值也在这里。如果模型始终不知道自己的手臂刚刚撞倒了什么、不知道抓空了之后该重
试还是继续执行下一步,那「通过身体行动」这件事就还是缺一环。
因此,怎么让模型知道自己有一个身体这件事,会比具体的任务成功率等数字更值得讨论。
