多模态

45 篇相关内容

谷歌一出手就是王炸,这次给机器人安上了「新大脑」

谷歌放大招,Gemini Robotics 1.5 系列模型让通用具身智能又迈出了坚实的一步。 当地时间 9 月 25 日,谷歌核心 AI 研发部门 DeepMind 发布了为机器人打造的 Gemini Robotics 1.5 系列模型,…

外滩大会上,王兴兴对机器人有了新看法

9 月 11 日,在 2025 外滩大会上,宇树科技创始人兼首席执行官王兴兴发表了最新观点。针对机器人模型、数据和硬件等问题提出了自己的看法。 王兴兴认为,让 AI 干活整个领域目前都是荒漠,只是长了几棵小草,爆发性增长的前夜还没有到来。而…

独家探访停摆机器人数采场,具身智能正在重算数据这笔账?

9 月 1 日下午,42 号电波来到位于北京石景山区的一家人形机器人数据训练中心。当时正值工作日的下午,这里却四下无人,在训练中心的参观区、农业种植区以及特种区等多个区域也没有正在工作的机器人。 据多家媒体报道,该人形机器人数据训练中心已停…

星海图赵行:机器人的下一次 Scaling,不只发生在预训练

机器人抓起一个商品,只能说明它会做一个动作。展台上的机器人完成一次抓取,与它进入前置仓持续接单、拣选和打包,是两种不同的考验。 前者可以被压缩成一条成功轨迹,后者却要求机器人理解订单、定位货架、自主导航、处理随机摆放的商品,还要在多机协同时…

独家对话周顺波:就算没有 AGI,也能做一台大家喜欢的机器人

在创立欧拉万象以前,周顺波已经做了近 12 年机器人。 2015 年,他进入香港中文大学徐扬生院士的实验室,才真正开始做机器人。他参与研发过一只熊猫形态的疗愈机器人,后来被送进香港沙田医院,陪伴自闭症儿童和阿尔茨海默病老人。那时,这类机器人…

ACE-Data-0 开源背后:我们和大晓机器人聊了聊具身数据的下一步

机器人看视频就能学会一切?那你就太高估它了。 比如生活中最简单的场景,从桌面拿起水杯。这件事人类几乎不需要思考;对机器人而言,却是一条由感知、移动、抓握、接触、物体状态变化和任务记忆共同组成的长链条。 视频可以告诉模型「拿起水杯」,但手指在…

上交卢策吾、浙大等团队提出 Track4Action:把「动作后的 3D 世界」蒸馏进 VLA

VLA 模型可以把图像和语言指令转换成机器人动作,训练的过程中,研究人员通常只评价机器人的动作像不像专家。至于机器人的动作会怎样改变物体、空间关系和任务状态,通常没有被明确交给模型学习。短任务可能掩盖这个缺口;一旦任务变长,或者视角、背景和…

首次!北大、南洋理工等 30 位研究者联手厘清具身数据金字塔

7 月 28 日,来自北京大学、南洋理工、港科大、新加坡国立、港大、上海交大等十余所机构的近 30 位研究者联合发布了一篇 72 页长文综述《Data Pyramid for Embodied Manipulation》。该综述通过一个五层…

一次开源三大模型,腾讯机器人正在「超车」

继 2025 年 WAIC 腾讯 Robotics X 实验室发布首个模块化具身智能开放平台 Tairos,在今年 WAIC 上,腾讯 Robotics X 实验室、福田实验室联合腾讯混元发布具身智能系列新成果。 新成果包括发布并开源基于混…

宇树新大脑首秀,全身智能从概念走向真机

7 月 20 日,宇树科技正式发布 面向家居康养多任务 的具身大模型宇树 UnifoLM OminiA 0.3,并且该模型原生搭载于宇树 G1 机器人,标志着宇树机器人在民用服务赛道进入实质性落地阶段。 从官方描述来看,宇树 UnifoLM…

和王啸峰聊聊 Gigaworld-1:当世界模型成为具身智能的物理裁判

语言模型的评测几乎是即时的。训练一停,把测试集丢给 GPU,几秒钟就能拿到一串分数,好还是不好,一眼就能看出来。 换成机器人的「大脑」就完全是另一回事了。一个 VLA 模型刚迭代出新版本,研究员没法在屏幕前把它评完——他们得把新策略刷进真机…

不止于预测,小米将世界模型打造成数据引擎

7 月 14 日,小米放出其自研机器人在工厂中连续作业的任务视频,视频中可以看到机器人在面对不同尺寸工件依然可以长时间稳定作业。 然而,机器人在工厂里的稳定作业,只是最终呈现出来的结果。真正支撑这一结果的,是机器人背后的模型能力。模型能力决…