一次开源三大模型,腾讯机器人正在「超车」
继 2025 年 WAIC 腾讯 Robotics X 实验室发布首个模块化具身智能开放平台 Tairos,在今年 WAIC 上,腾讯 Robotics X 实验室、福田实验室联合腾讯混元发布具身智能系列新成果。
新成果包括发布并开源基于混元大模型的 Hy-Embodied-VLM-1.0, Hy-Embodied-RxBrain-1.0 和 Hy-Embodied-VLA-0.5 三大具身基座模型。

如上图,VLM-1.0 作为腾讯新一代具身 VLM 基座模型,充当右脑角色,面向真实物理递进式感知物理世界;RxBrain 则可以看成是腾讯自主研发的世界模型,作为具身大脑,它可以完成从认知、预测到子任务规划的全链路推理;VLA-0.5 作为负责控制的小脑,让机器人真正做到失败中学习,将认知转化为真正的物理动作。
三个模型分别对应感知、认知和行动三个环节,试图搭建一套完整的具身智能基础模型体系。
这套体系有望解决具身智能模型长期「碎片化」状态,即做 VLM 的团队不管动作、 VLA 团队的感知能力要等通用模型的发展。
同时,体系的三个模型全部开源。放眼全球具身智能,Google RT 系列和 Physical Intelligence 的 π 系列虽然性能强悍,但模型权重和训练细节并不完全开放。腾讯选择以开源姿态入场,等于为国内数十家机器人本体厂商提供了一个「即插即用」的智能基座。
关键是,三个模型依靠共享混元大模型底座,让彼此之间的输入输出对齐拥有天然优势,真正把一个机器人从「看懂世界→理解物理因果→预测动作后果→规划任务步骤→生成具体动作」的完整链路做成了一套可交付、可部署、可跨本体迁移的标准化方案。
机器人不只需要「会看图」就行
众所周知,当前机器人领域的大量工作,仍然依赖通用视觉语言模型(VLM)作为感知层。Qwen-VL 系列、Gemini 系列等,这些模型在端侧部署时,已在图像理解、场景问答和简单推理上展现出令人印象深刻的能力。
如果这类 VLM 只负责让机器人知道「桌子上有什么」,那确实够了。然而,机器人面对的环境,对理解深度的要求远高于通用场景。即腾讯团队认为,具身智能体模型不仅需要有多模态感知和理解能力,还需要把能力扩展到真实物理世界交互。
对此,Hy-Embodied-VLM-1.0 构建了一个以行动为中心的能力分类体系,并用该体系反向指导数据的收集、组织和训练。

如上图,该体系将具身智能所需的能力系统分成三层递进结构。动作相关状态理解,侧重于理解包括物理属性、三维空间结构和具身相关属性在内的智能体及环境状态;动作状态转移理解,侧重于理解动作与智能体、环境的交互,推理后果及底层物理原理;序列与自适应推理,则是将能力进一步扩展到更长的时间维度。

值得注意的是,如上图,SFT(监督微调)和 RL(强化学习)两个阶段的数据按照同一套三层能力分类体系组织,但数据分布上各有侧重。
SFT 在继承 Hy-Embodied-0.5 混合数据的基础上,强调了覆盖更多层次,包括深度推理、任务条件定位与可供性定位、社交交互、物体与机器人中心的轨迹监督、物理因果推理、故障感知推理和视觉-语言导航。
RL 的数据分布则侧重可以验证的推理任务,例如状态推理、定位、规划、反思和导航,这些任务方便验证和后续奖励优化。

上图是 Hy-Embodied-VLM-1.0 的训练流水线。有别于传统「预训练→SFT→RL」三段式,该模型在训练阶段引入了一个「自演化循环」。通过 RL(elicit)将浅层推理引入深层具身推理,拒绝采样(Rejection Sampling)筛选高质量推理数据, RFT(拒绝采样微调)将推理能力内化到干净模型,RL(Specialize)进一步精炼。
这个训练闭环的意义在于,推理能力可以从较少的思维样本中自我演化,不需要大量人工标注推理数据。
值得一提的是,Hy-Embodied-VLM-1.0 采用了 Hy3-A3B 语言模型、Hy-ViT2 视觉编码器和 MoE 架构的组合。MoE 让模型在保持「大模型能力」的同时,实现了「小模型的推理成本」,这就使得 Hy-Embodied-VLM-1.0 不仅通过训练提高了推理能力,也通过架构优化提升了推理速度,有较高的工程价值。
具体实验则能说明 Hy-Embodied-VLM-1.0 比其他 VLM 模型强在哪些地方。

如上图,Hy-Embodied-VLM-1.0 在理解世界、预测动作、长时序适应能力上全面领先同等参数规模的模型,且仅激活 3B 参数就超越了 8B 参数规模的 Cosmos3-Nano 和 Embodied-R1.5。而在三个层次中,差距最大的恰恰是最难的「动作-状态转移推理」(领先第二名 5.3 分),这说明模型的能力优势集中在机器人最需要的因果推理层面。
另外,在难度最高的序列与自适应推理层,所有模型的表现都明显下降,这算是当前具身智能的硬天花板。

Hy-Embodied-VLM-1.0 的表现如上表,在长时程规划能力上领先其他模型,并且在 RoboFAC(故障分析与纠正)上领先第二名 7.1 个百分点。

如上图,HyVLM-1.0 在 Matterport3D 环境中的完整导航轨迹。模型先语言定位地标,之后再从历史中重新规划,最后验证目标并停止。通过这个闭环导航实验,HyVLM-1.0 展现了其强大的系统级能力。
事实上,更令人印象深刻的是下表,以往大部分工作都使用 Qwen 系列 VLM 作为给几何数据标定物理属性的工具。如今,MP3D 零样本物体目标导航上,Hy-Embodied-VLM-1.0 以 38.3% 成功率超过了 35B 参数规模的 Qwen3.6-35B-A3B,说明了 HyVLM 有不输 QwenVLM 的物理世界理解和智能体推理能力。

Hy-Embodied-VLM 将能帮助机器人真正地去理解世界,并且「以行动为中心」的能力体系也能一定程度上指导机器人的运动,而非传统的「只有看图感知」。
文本-视觉交互生成,真正规划下一步
Hy-Embodied-VLM-1.0 成功建立了以行动为中心的世界理解,接下来 Hy-Embodied-RxBrain-1.0 可以充当世界模型的角色,进一步通过预测的方式来规划机器人的下一步行动。
论文指出,对于规划等复杂任务,仅靠文本推理或仅靠视觉想象都无法完全指定一个可执行的意图。原因也好理解,文本推理容易丢失关键的状态或空间细节,而靠视觉描绘的期望场景容易隐藏底层物理因果和中间决策。

对此,如上图,RxBrain 拥有三大能力,分别是通过具身推理来判断任务是否完成;利用世界状态预测,根据一张图和描述,输出四帧连续的未来视觉状态;以及独有的在同一序列中交替生成文本规划和视觉目标状态。
为了实现三大能力,RxBrain 是通过模态感知混合的 Transformer(MoT)架构实现,骨干包含语言和视觉两个模态特化的注意力分支,以及包含文本、视觉理解、视觉生成的三个模态特定的前馈专家。
具体来看,文本理解类和视觉生成类 token 虽共享注意力投影层,但文本 token 通过标准前馈网络,视觉 token 却通过扩宽维度的前馈网络。这样,在注意力层,文本和视觉可以通过对方信息来彼此指导和验证,又可以在计算层,通过不同的前馈网络选择各自最合适的参数路径。
有了架构,接着通过数据先验来「预测未来」。RxBrain 搭了一套自动化的三阶段流水线,把原始的机器人操作视频转化为结构化的训练样本。数据来源覆盖了四类场景:真实机器人操作(1.7 万小时)、手持设备人类演示(1.7 万小时)、仿真环境(1 千多小时)、人类日常活动(1.4 万小时),合计超过5万小时。

如上图,该流水线第一步是时间片段标注,简单说就是将长的、未经修剪的具身任务视频转化为局部化的规划步骤,每个局部化步骤包含短的步骤名称、详细的文本描述和两个视觉锚点:起始帧和结束帧。
第二步是用基于MLLM的验证器,检查:语义质量、视觉定位以及文本与视觉转移之间的一致性,决定数据是否可以训练。

根据上图具体来看,第三步则把片段更细分地组织成 4 级联合文本-视觉规划地样本。分别是学习单个规划步骤内部的视觉状态变化;连接连续的步骤并进行步骤级联合规划;将相邻步骤分组为高层的子目标;建模整个任务的最终结果。
RxBrain 根据以上数据和架构,再经过使用大规模图像-文本对的预训练、具身场景监督微调的两阶段训练,得到模型。同时,以下重点观察 RxBrain 在三个较关键的实验上的表现。

如上图,研究人员分别把 RxBrain 与 Qwen、Cosmos 在几个评价指标作了对比。在从文本到图像生成的 GenEval 任务上,RxBrain 得分为 82.4 远超 Cosmos,证明联合训练没有牺牲生成能力。同时,在轨迹预测和 3D 空间理解上,RxBrain 相比其他模型也有较大优势。

如上表,该实验考察的是 RxBrain 的联合规划能力。其中 Plan(规划)和 GoalImg(目标图像正确性)上,RxBrain 都要超过 Qwen-Agent 和 Cosmos,说明当文字规划和视觉想象在同一个模型中交替生成时,两者会起到相互校准的作用。

最后,如上图,在摆放餐桌、折叠收纳眼镜、捡拾垃圾三个真实机器人操作任务中,RxBrain 平均任务成功率 87%,优于 π0(68%)和 π0.5(82%)。这一切只靠预训练阶段学到的世界知识和状态预测能力,通过门控融合迁移到动作分支实现的,并没有通过大规模动作预训练数据。
所以说,RxBrain 更像机器人的大脑,起到一个 Agent 的作用。这也暗示着可以预测未来的世界模型,本身就可以成为一个好的动作策略的基础。
从数采硬件到部署的完整学习栈
在 Hy-Embodied 体系的三层架构中,VLM 负责以行动为中心理解世界,RxBrain 负责预测和规划任务,但机器人始终需要具体的动作来落地。Hy-Embodied-0.5-VLA 就是起到将 VLM、RxBrain 的认知转化为正确行动的作用。

如上图,**Hy-Embodied-0.5-VLA 最大的特点在于,它的技术路线本身就是一条完整的机器学习栈。**左上角是定制的 UMI 数据采集硬件,包括指尖贴附式夹爪、外部光学动捕系统、亚毫米精度跟踪。中间是训练流程,包括 HY-Embodied-0.5 VLM 骨干、流匹配动作专家、Delta-Chunk 动作表示。
同时,在至关重要的部署层,同一个模型可以驱动 Dobot X-Trainer、JAKA K1、AGIBOT G2、Astribot S1、Unitree G1,五种形态完全不同的机器人,该阶段包含了 sim-to-real 迁移和跨具身映射,让模型能够从仿真环境平滑迁移到真实硬件、从一个机器人平台迁移到另一个。最右侧的 RL(强化学习)教会机器人在错误后如何纠正。

具体来看,如上图,对于 VLA 模型,数据基础决定上层建筑。Hy-Embodied-0.5-VLA 的训练数据集由 10K 小时 UMI 语料库的构成。由 (a) 小图,数据场景占前四的分别是洗衣房(28.5%)、厨房(19.2%)、个人护理与杂项(13.8%)和灵巧/工具使用(10.4%),这些场景都对精度要求高、对动作误差敏感。
由(b)小图,在技能方面,最多的两个类别是双臂折叠与堆叠(3,945 小时)和空间组织(3,065 小时),这类操作对力控制和轨迹精度要求极高,恰好是动捕级精度数据最能发挥价值的地方。
有了数据基础,我们还要知道是什么真正让 Hy-Embodied-0.5-VLA 具有跨多个具身本体部署的能力。

如上图, 在模型的完整架构中,除了标准的 VLM 组件,HyVLA-0.5 还新增了动作 MoT、紧凑记忆编码器和
块状因果注意力掩码,建立视觉、语言、状态和动作 token 之间的注意力模式。另外,通过 Delta-Chunk 动作表示设计,相比于预测末端执行器的绝对位置,HyVLA-0.5 则是预测执行器的移动增量。
关键在于,这个增量在末端执行器框架(EEF)中定义,与机器人的底座位置、关节构型完全解耦。在部署时,只需要增加一个轻量的平台映射层,这个映射层可以对于固定基座臂,用前向运动学将 EEF 增量合成到世界坐标,对人形机器人先推断底盘坐标系再执行。
值得注意的是,文中还注意到了推理速度与控制频率之间的问题。研究者为 HyVLA-0.5 设计了巧妙的异步执行方案,即推理完成后把动作块放入线程安全的缓冲区,执行线程以控制频率从缓冲区取指令。
接下来,我们从仿真到真机,看看 HyVLA-0.5 与其他策略的表现对比。

在 RoboTwin 2.0 的 50 个仿真任务上,HyVLA-0.5 在 Clean(干净)设置和 Randomized(随机化)设置下均取得第一。底下还细节的添加了消融实验对比,说明了记忆编码器和 UMI 数据预训练的重要性。
另外, HyVLA-0.5 的真机表现也很有说服力。如下图,实验设置了六个双臂操作任务、五种机器人平台、两个部署路线(Track-A 同具身、Track-B 跨具身)。

其中,HyVLA-0.5 在所有六个任务上均领先 π0 和 π0.5。Track-B(跨具身迁移)是最大的亮点,JAKA K1 和 Astribot S1 在训练阶段从未见过自己的遥操作数据,策略仅靠 UMI 人类演示微调,并直接部署到形态完全不同的机器人上,而且明显优于同样仅在UMI数据上后训练的 π0 和 π0.5。
令人印象深刻的是,在第三方 RoboDojo 评测中(泛化、记忆、精细操作、长程操作、开放语义理解),HyVLA-0.5 拿下仿真综合排名第一,并且 RoboDojo 评测是在 HyVLA-0.5 正式发布后才出现的,充分说明了 HyVLA-0.5 的硬实力。
HyVLA-0.5 可以说是,建立在 VLM 的感知能力和 RxBrain 的预测能力之上的行动层。三者协同,才构成了从看到世界、到理解世界、到预测未来和规划任务、到执行动作的完整链路。
写于最后:从缺席、落后到追赶
回看腾讯在机器人领域的发展轨迹,不难发现一条从缺席到长期蓄力,最后集中爆发的叙事弧线。
Robotics X 实验室自 2018 年成立以来,虽然陆续拿出了 Max、Ollie、TRX-Hand、「小五」等令人眼前一亮的 demo,但实验室规模不大,长期被视为腾讯内部一个「前沿探索」性质的小团队,鲜少参与产业竞争,几乎隐身于外界视野。
然而,今时不同往日。
2025 年 Tairos 平台发布,腾讯首次以「具身智能开放平台」的角色站到台前;2026 年混元大模型完成重构,登顶 OpenRouter 全球调用量榜首,为具身基座模型提供了真正能打的底座。
再到本届 WAIC,三大具身基座模型一次性开源、智能体框架 TairosAgent 把端到端响应压缩到 2-3 秒、跨五种机器人平台部署、工厂生产线上 95% 以上的成功率。这些是已经开始落地的生产力。

更关键的是战略上的清醒。张正友反复强调「不做硬件、做安卓」,定位 Tairos 为连接生态的「钛螺丝」。事实上,这一定位避开了与宇树、智元等本体厂商的正面对抗,反而让腾讯得以将全部资源投入到模型、平台和工具链上。
从缺席,到追赶,再到以「平台化开源」的姿态试图定义游戏规则,说到底,腾讯还是那个腾讯,在具身智能赛道,与小程序、腾讯云等类似,它仍习惯在基础设施层下注,用更长周期等待生态价值的释放。
