视频预测

共 5 篇相关内容

中科院自动化所与高德团队提出 DreamTrue,将机器人动作统一渲染为画面条件,实现高精度未来视频预测

中科院自动化所与高德团队提出 DreamTrue,将机器人动作统一渲染为画面条件,实现高精度未来视频预测

DreamTrue 将机器人动作渲染为画面内的机器人作为训练条件,为世界模型补充示范数据中缺失的失败动作,并依托人工标注训练得到的奖励模型开展强化学习。当动作执行失败时,模型能够如实预测对应的结果,它在 AgiBot 平台上将交互缺陷率从 …

港大、港科广、北大等五校团队联合发布 AffordanceWAM,靠可供性激活真人训练视频

港大、港科广、北大等五校团队联合发布 AffordanceWAM,靠可供性激活真人训练视频

AffordanceWAM 的核心突破,是将「物体可交互位置与方式」的可供性,纳入世界动作模型的显式预测目标,彻底解决真人第一视角视频难以适配机器人训练的行业痛点,让原本容易造成负迁移的真人数据,转变为可规模化扩展的有效监督信号。 9 月 …

首次!北大、南洋理工等 30 位研究者联手厘清具身数据金字塔

首次!北大、南洋理工等 30 位研究者联手厘清具身数据金字塔

7 月 28 日,来自北京大学、南洋理工、港科大、新加坡国立、港大、上海交大等十余所机构的近 30 位研究者联合发布了一篇 72 页长文综述《Data Pyramid for Embodied Manipulation》。该综述通过一个五层…

和王啸峰聊聊 Gigaworld-1:当世界模型成为具身智能的物理裁判

和王啸峰聊聊 Gigaworld-1:当世界模型成为具身智能的物理裁判

语言模型的评测几乎是即时的。训练一停,把测试集丢给 GPU,几秒钟就能拿到一串分数,好还是不好,一眼就能看出来。 换成机器人的「大脑」就完全是另一回事了。一个 VLA 模型刚迭代出新版本,研究员没法在屏幕前把它评完——他们得把新策略刷进真机…

百亿估值后,这家机器人公司推出「最快」世界模型

百亿估值后,这家机器人公司推出「最快」世界模型

在机器人落地干活这条路上,世界模型(WM)被很多人认为是上限更高的技术路径,不过在行业逐渐对其范式形成共识之际。星海图团队发布的世界模型研究成果 Fast WAM,让机器人的反应速度大幅提升的同时,也提出了一个非常直接的问题: 「WAM(世…

视频预测 相关内容 | 42号电波