不止于预测,小米将世界模型打造成数据引擎

7 月 14 日,小米放出其自研机器人在工厂中连续作业的任务视频,视频中可以看到机器人在面对不同尺寸工件依然可以长时间稳定作业。

然而,机器人在工厂里的稳定作业,只是最终呈现出来的结果。真正支撑这一结果的,是机器人背后的模型能力。模型能力决定的感知、决策,以及最后的动作生成,每一个环节都会影响机器人能否持续完成任务。

随着机器人走向真实产线,小米团队也在同步推进模型研发和开源生态构建。

与此相关的是,近日,小米机器人团队发布并开源了 Xiaomi-Robotics-U0 (简称 U0),一个参数量达到 380 亿的多模态自回归模型,用于具身合成。

作为首个将「基础图像生成、图像编辑、具身场景生成、具身迁移和具身视频生成」五大功能无缝整合的统一具身合成模型,U0 能在保留世界模型原有的视觉生成能力的同时,有效地将世界模型的泛化能力迁移到具身生成。

同时,U0 通过**首个统一的多视图具身生成框架,**将工作空间、背景、前景无关物体、目标物体和光照解耦为独立的维度,在保持几何一致性和交互动力学的同时,实现可扩展的具身视频增强。

而大量仿真和真机实验证明, U0 生成的这些具身视频数据可以作为下游策略训练的数据来源,帮助机器人更好地适应复杂多变的真实世界场景。

事实上,这是世界模型继策略评估、轨迹预测和动作生成之后,进一步把其应用边界拓展到数据引擎领域,为具身智能提供了自主合成数据的闭环能力。

具身能力是「自然扩展」,不是「领域特化」

当前,主流具身世界模型大都走「拿基础生成模型在机器人数据上微调」这条路。

这条路看起来行得通,但代价却是预训练阶段从互联网海量数据中学到的视觉知识和泛化能力,在领域特化过程中将被大量抹除。

这便引出了 U0 的核心设计哲学:把具身生成视为基础图像和视频生成的自然延伸,而非一个需要单独处理的专业任务

如上图,U0 把通用域和具身域的数据混合在一起,并在统一的自回归框架下做持续训练。整个模型架构建立在开源的 EMU3.5 之上,一个基于 Qwen-3-32B 的解码器专用 Transformer。可以看到,U0 把 next-token prediction 作为唯一训练目标,模型的输入与输出都包括了视觉 token、文本 token、控制 token,融合了多模态信息。

具体的训练任务设计也值得关注,U0 把训练样本分为了「单步」和「序列」两大类。

第一类,单步训练覆盖了四个核心功能。作为模型基本能力的文生图(T2I);支持 1–3 张参考图和文本指令控制的混合生图(X2I);作为核心的,给定机器人类型和场景描述,生成几何一致的机器人多视图初始观测;关键的,给定源场景多视图深度以及目标场景的结构化描述,生成保留机器人交互状态的多视图 RGB。

第二类是负责时间维度建模的序列训练,训练样本主要包括图文交错的子任务-子目标序列和多帧率具身操作视频。前者通过文本指令和执行后的多视图观测(指令->执行后图像->指令->执行后图像),让模型学会因果推理;后者通过对同一段操作视频以三种速度采样(FPS 1/3/5),模型利用跨分辨率联合训练既能学会规划,又能捕捉细节,学会动力学。

值得注意的是,U0 在具身迁移数据上学习如何保持多视图的几何一致性时,这种 3D 感知能力会反过来增强它的通用图像编辑质量。同时,通用文生图数据里丰富的视觉概念,也帮助具身场景生成不会坍缩到训练集里的几种固定桌面场景。

训练做完了,但让 380 亿参数的自回归模型真正做一次图像生成,其中真正的生死线是推理加速。

U0 的推理加速方案是「FlashAR+ 扩展 」和 vLLM 集成。传统的自回归生成慢就慢在出图片时,要一格一格地画一行,画完第一行再画第二行,中间会浪费计算资源。FlashAR+ 的思路是按斜对角线上画,原来要串行画完「行数×列数 」次的事,变成了只需要「行数+列数 」次。单卡 H20 上,每张图从 450 秒压到 16.6 秒,快了 27 倍。

再结合 vLLM 的连续批处理和 KV 缓存管理,实现 82.9 倍图像生成加速,让 U0 的具身数据生成从能用到好用。

作为数据引擎,U0 把场景生成当作「搭积木」

380 亿参数的模型,数据是底座。U0 的训练数据横跨六个领域:通用图文、具身操作、自动驾驶、自我中心、3D 重建和游戏,总计 950 万单步样本加 260 万视频片段。

所以说,U0 的四分支解耦标注管线才真正体现小米的工程功力。

如上图,上半部分展示场景描述生成,下半部分突出轨迹级子任务分解。整条数据处理管线以 Qwen3-VL-235B 作为标注引擎,四条分支各司其职、独立运行:

  • 通用场景标注。不分领域地对所有视频数据采样,选取高清晰度关键帧,由 VLM 生成整体场景描述,覆盖场景布局、物体交互和空间关系。从而构建通用的视觉常识。

  • 结构化具身场景标注。作为数据处理管线中最具有原创性的设计,该分支把具身场景沿五个语义维度做切割:工作空间、任务物体、无关物体、光照、背景。五个维度各自生成独立描述,互不依赖。如下图,由于这种切割解耦,后续可以用 Qwen3-VL 为背景、工作空间、光照三个维度生成随机替换。

  • 几何模态提取。 通过 Video Depth Anything 对所有帧提取时间一致的逆深度图(较亮像素说明较近表面,较暗说明较远)。通过深度图,模型能学到真实的 3D 结构。

  • 轨迹级子任务分解。 用末端执行器位姿和夹爪信号做 HDBSCAN 聚类,自动识别运动转换和抓取转换的边界信号。根据该信号,在物理交互密集的地方采样,发给 VLM 生成统一时间下的子任务计划。转换帧则走分支二的场景标注流程,最终得到具身场景生成和具身迁移任务的训练样本。

需要关注的是,数据管线的四条分支完成标注后,标注的训练数据仍需按三种训练目标重新分组。具身迁移样本将系统指令、场景描述、多视角深度图作为输入;场景生成样本则把系统指令和场景描述配对;视频生成样本包含系统指令、任务指令和初始观测帧,以及初始观测帧附加的机器人动作及图像序列,共同作为视频生成的引导。

事实上,在数据筛选中,由于 U0 优先保留新颖视觉布局、操作技能或时间阶段的样本,让训练分布在消除冗余重复的同时,保证了操作技能的全面覆盖。

既赢了视频生成,也不失物理操作

U0 的实验覆盖了视频生成、具身迁移、场景生成、真实世界策略增强四个维度,结果体现了模型既达到了主流视频模型的视频生成能力,也通过具体的具身操作任务体现模型的物理可靠性,实验总体有很高说服力。

首先是视频生成能力,如上图,在 World Arena 基准上,U0(UNIS)总体 EWMScore 73.64,在 100+ 模型中排名第一。

具体来看,如上表, U0 在可控性(指令遵循 93.86)、物理遵循(交互质量 87.30)、3D 准确性(透视性 98.84)、运动平滑度 95.51)四个子指标上均拿下最高分,说明 U0 的突出优势不仅是视频生成,更在于机器人运动控制。

另外,在具身能力评估上,小米团队构建了一个 300 样本的具身迁移基准(150 Easy + 150 Hard),从深度一致性、结构保真度和语义对齐三个角度评估,直接对标 GPT-Image-2.0。

如上表,U0 在所有八个指标上全面超越 GPT-Image-2,且在 Easy 和 Hard 两个子集上优势一致。这种差异的根源在于 GPT-Image 没有多视图几何约束,本质上是独立生成三张看似「合理」的图像,而 U0 通过统一目标的多模态联合训练,把几何条件嵌入了生成过程。

看上图,U0 的架构与训练方式使得模型输出严格遵循每个视图的深度几何条件,保持了物体身份、位置、外观一致。所以,无论是具身场景生成还是具身迁移表现,都大幅超远视频生成模型 GPT-Image。

最后也是最有说服力的实验,U0 在真实世界中的表现。小米团队给 U0 设置了存放耳机、折叠毛巾、打包盒子三个任务,每个任务按下图分成不同数量的各个阶段。更巧妙的是,小米团队给 U0 在原本的基础实验组上再添加了干扰实验组(引入未出现的桌布、改变光影等),形成了双层评估。

原本策略基于 π0.5,在 ARX 双臂平台上部署,每个任务采集约 40 小时真实世界演示。实验结果如下图所示,基础组(虚线填充)与原来策略基本持平,说明模型设计在于策略的「自然扩展」而非「领域特化」。但在干扰组(实线填充)上, 增强策略则全面碾压原本策略,总体 OOD (泛化能力)完成度 63.2%,净提升 26.3 个百分点。

这背后的关键在于,调用 Qwen3-VL,在保留任务物体不变的前提下,仅对工作空间、背景、光照三个要素各生成 1,000 种描述。经随机组合后,利用 U0 的具身迁移能力,根据原深度图生成多视角 RGB 数据。最终 U0 将这批具身迁移数据与原数据混合,用于策略训练,大幅提升泛化能力。

更有意思且直观的是,如下图,模型展示了其闭环的具身数据生成能力。U0 先利用场景生成能力打造了一个具身场景,再利用该场景的初始画面和一段语言指令,便能直接展开为一段操作视频。 U0 这种被称为智能体式的具身数据生成能力,意味着基础世界模型可以通过自主交互展开,持续产出日益多样化的机器人经验数据。

从这些实验不难看出,U0 不仅将世界基础模型用作「世界模拟器」,更将其定位为「可扩展数据引擎」。

写在最后

事实上,除了以上几条重要基线的超越和真实世界的表现外,小米 U0 所走的技术路线和展现出来的工程落地能力同样值得关注。

小米 U0 不走「基础模型->任务场景微调」的老路。它把具身生成定义为基础生成的自然延伸,通用文生图、图像编辑、具身场景生成、具身迁移、具身视频生成,五项任务共享一套参数、一个优化目标,通用域的视觉知识和具身域的几何理解在训练中自然融合,谁也没有牺牲谁。

另外,U0 用四层解耦标注管线和五维场景解耦,不仅直接催生了多样性的数据组合,而且证明了用「解耦」这个以「更好的数据组织方式换取数据」的方法是行得通的,是有可能缓解传统的以「更多工时换数据」带来的成本压力。

当然,小米团队研发 U0 这款 380 亿参数模型的底气在于其过硬的工程优化能力。

原文提到,380 亿参数的自回归模型,一张 1,024×1,024 的图在单 H20 上要跑大约 7 分半,按这个速度根本无法部署在产线。但团队硬是通过「 FlashAR+ 的后训练」和 vLLM 工程优化,把延迟压到了 5.44 秒,82.9 倍加速,重要的是质量基本不降。

从算法创新到推理栈的整合利用,U0 中体现出来小米团队的这种「把论文跑到能用」的工程能力,在具身模型领域其实并不多见。

不过,小米的制造场景,恰恰又是这种工程能力最好的生长土壤。

从造手机到小米家用产品,再到造车,小米工厂产线上不同批次物料的外观差异、光照随时间的变化、新工位的布局调整,每一个都几乎是纯靠人工采集填不完的坑,却又正好是机器人能力最好的试炼场。

这或许也是 U0 执着于走生成路线的原因,相比于主流用于预测和指导机器人运控的世界模型,U0 更像一个能把有限真实数据放大到近乎无限训练样本的数据引擎。而就在 7 月 16 日,小米同步开源的 Robotics-1,则进一步补齐了从数据生成到机器人控制的模型版图。

两者一前一后,分别对应数据与策略,也为具身智能的数据闭环提供了一种新的实现路径。