
视觉语言动作模型
共 2 篇相关内容

上交卢策吾、浙大等团队提出 Track4Action:把「动作后的 3D 世界」蒸馏进 VLA
VLA 模型可以把图像和语言指令转换成机器人动作,训练的过程中,研究人员通常只评价机器人的动作像不像专家。至于机器人的动作会怎样改变物体、空间关系和任务状态,通常没有被明确交给模型学习。短任务可能掩盖这个缺口;一旦任务变长,或者视角、背景和…

日均 1 起融资,具身智能的疯狂 7 月,背后藏着这些信号
在 7 月过去的上半月,国内具身智能领域的融资共有 16 起,也就是日均 1 起,频率之高,令人咋舌。 而且,融资总金额超过 30 亿元。对比 2024 年全年,具身领域总共 90 起融资,融资总金额 89.33 亿元。那么钱都去了哪里?4…