50 万小时第一视角视频,如何给具身世界模型补上「触觉」

一只机械手把葡萄从一串果实中摘下来,难点不在于「看见」葡萄,而在于何时接触、哪根手指承力、力道多大才不会把果肉捏坏。挤牙膏、从软袋里摸出被遮住的物品、用软笔写字,都是同一类问题:视觉能描述物体和姿态,却很难直接给出接触已经发生了没有、接下来该收力还是加力。

7 月 28 日,通用具身基础模型公司智在无界发布技术报告《Being-H0.8: A Latent Tactile World-Action Model at Scale》,并宣布已经汇集了超过 50 万小时的原始第一视角人类视频。

这套模型延续了其世界-动作模型路线,但把训练重点从「预测画面会怎样变化」推进到「接触会怎样发生、动作该怎样随反馈调整」,团队将其定位为首个在这一规模第一视角人类视频上引入触觉预训练的模型。

Being-H0.8 的新闻点不只是新增了一路触觉输入。真正值得关注的是,它试图把原本没有触觉传感器的海量第一视角视频,转成能够服务机器人动作学习的「伪触觉」监督,再把人手、灵巧手与夹爪放进同一套状态—动作表示中。对具身模型而言,这等于尝试把最稀缺的接触经验从昂贵的真机采集,部分前移到视频数据处理阶段。

50 万小时不是终点

报告称,Being-H0.8 的数据底座 UniHand 3.0 汇集了超过 50 万小时的原始第一视角人类视频,来源包括公开数据集、合作伙伴数据与自建数据。官方页面还点名感谢了 13 家核心数据提供方。这里的价值不只在体量:团队强调每个样本可追溯到来源,并用半自动、人机协同流程处理格式、元数据、重复片段和质量问题。

这条数据线回应的是具身预训练里一个很现实的矛盾。公开视频可以很多,但其中的大段内容与操作无关;同一场景、同一动作的重复片段会虚高数据规模;手部被遮挡、快速运动或相机晃动,又会让后续的三维手部轨迹失真。报告将「采了多少视频」的问题,改写为「筛出了多少可靠的具身经验」。

它给出的量化证据也主要落在这一步。在 5,000 条随机抽样视频的人工评估中,其手部运动重建与质检流程把严重跟踪失败比例降至 39%,低于 HaWoR 的 67% 和 Dyn-HaMR 的 57%;手形畸变比例为 11%,两项对照分别为 28% 和 17%;完整处理链路的失败比例为 11%,对照为 73% 和 61%。自动质检在该评估中还能识别超过 92% 的错误片段。这证明的是数据重建与过滤链路更可用,并不等同于机器人任务成功率提升。

「触觉」从哪里来?Being-H0.8 没有把普通 RGB 视频当成真实压力传感器读数。其 TactoHand 模块先在带有几何监督的手—物交互数据上学习:对一只被追踪的手,在统一的 MANO 手部表面预测两张密集图——接触区域的二值图,以及离接触面还有多近的连续场。前者回答「碰到了哪里」,后者描述「接触正在逼近还是远离」。

然后,系统把这个模型应用到未标注的第一视角视频上,生成与手部拓扑对齐的伪触觉标签;不可靠的手部重建会被遮蔽,而不是被粗暴地标成「没有接触」。当真实机器人或戴手套的人类数据确有接触、压力等传感器读数时,系统再把这些不同密度、不同位置的信号投到同一只「标准手」表面。也就是说,视频提供的是可扩展的接触和接近监督,传感器数据提供的是稀缺但更直接的物理观测,两者不能混为一谈。

这套数据体系并不只由人类视频构成。报告还将来自不同本体、相机与控制接口的机器人数据校准到共享的运动学和坐标规范;把受文本或图像条件控制生成的人类操作视频,经过三维手部重建、动作重定向与深度感知合成,变成含 RGB、深度和动作轨迹的配对机器人示范;另行收集与下游任务匹配的双手人类示范,作为从通用预训练过渡到机器人适配的中间层。前两者解决数据异构和规模问题,后一层则把模型拉回真实任务所需的操作语义与接触行为。

世界模型学习接触后的动作

模型层面,Being-H0.8 保留了前代的先验—后验训练思路。部署时可用的先验分支读取当前指令和视觉观察;训练阶段的后验分支还会看到未来的视觉与触觉证据。两个分支使用相同的潜变量位置,后验据此教先验从当前信息预判与动作有关的后果。真正运行时,后验分支和未来信息都会被拿掉,因此它不是把未来画面逐像素生成出来,而是利用训练中学到的潜在状态为动作生成提供条件。

接触丰富的操作还有一个问题:一次规划很长的动作,再开环执行到底,常常来不及应对手指已碰到物体、物体软硬度变化或抓取滑动。为此,模型设置了「慢—快」动作专家:慢通道在一个动作片段开始时计算并缓存视觉、语言与世界状态,给出完整规划;快通道则在每个更短的执行片段前,读取最新的本体状态和触觉反馈,重生成接下来一小段动作。团队希望用这种分工同时保留长时规划和更高频的反应能力。

另一个工程难点是,触觉并没有统一格式。有人只有全局接触标签,有人只有少量指尖传感器,也有人拥有逐顶点接触、接近度或压力测量。Being-H0.8 用统一手部拓扑上的粗到细「触觉金字塔」接纳这些信号,并在缺少触觉传感器时使用一个「缺失触觉」表示,避免因传感器布局不同而换一套模型接口。

同样的统一思路也落在动作上。TopoHand 将手腕位姿、手部形态和 20 个规范关节角拆开表示,再用适配器映射回人手、灵巧手或平行夹爪各自的控制命令。它并没有让不同硬件天然具备相同操作能力;它解决的是训练数据里「同一个动作槽位在不同手上含义不同」的对齐问题。对于需要跨人类视频、不同灵巧手和夹爪迁移的基础模型,这比再为每种手单独接一个策略头更具扩展性。

已进入真实任务场景

在真机侧,项目页展示了两套双臂平台上的接触丰富操作:包括挤压牙膏、软袋内盲取、毛笔书写、摘葡萄、抓取薯片、应对清洁过程中的人为干预等。硬件涵盖带 12×6 压阻式压力阵列的 LinkerHand L25、带指尖视触觉传感器的 DexHand 021,以及触觉夹爪等组合。这些演示覆盖了形变物体、遮挡、精细工具使用、双手协作和快速反应等场景,说明团队正在把模型放到真实接触任务中测试,而不只停留在视频指标。

Being-H0.8 的重点,在于把「触觉数据不够」的难题拆成一套可扩展的数据工程:先从人类视频里恢复接触线索,再把不同传感器密度与不同机器人本体的观测接入统一接口,最后让这些经验回到实时动作修正中。50 万小时第一视角视频、TactoHand 的伪触觉标注、Slow-Fast 的反应式动作机制,以及 TopoHand 的跨本体动作表示,构成了这条路线彼此咬合的四个环节。

对具身智能而言,真正稀缺的从来不只是「看过多少物体」,而是知道手碰到物体之后,下一步该如何变化。摄像头让机器人获得了大规模视觉经验;Being-H0.8 想推进的,是让接触、接近、压力与动作调整也进入同一个可规模化学习的世界模型。随着人类视频、机器人数据与真实触觉观测被放到同一条训练链路里,具身模型的训练目标正在从「看见世界如何变化」,向「理解接触如何改变下一步动作」移动。