智元为什么突然成了机器人运动会的「奖牌收割机」?

8 月 26 日晚间,为期五天的第二届世界人形机器人运动会在北京闭幕,来自 16 个国家的 666 支队伍、2,056 台机器人参加了本届运动会。

究竟哪一支队伍更强?奖牌榜说了算。本届人形机器人运动会上,共诞生了 50 枚金牌、49 枚银牌和 46 枚铜牌。

其中,仅智元一家就斩获了 18 金、16 银、12 铜,共 46 枚奖牌,成为金牌榜、奖牌榜双第一。紧接其后的是天工队,以 15 金、12 银、18 铜,共 45 枚奖牌位列金牌榜、奖牌榜第二位。而在上一届人形机器人运动会上霸榜的宇树科技,这回仅拿下 3 金、4 银、3 铜,共 10 枚奖牌位列第三。

实际上从 2025 年开始,人们对机器人的期待就已经不局限于能跑步、会跳舞,而在于机器人到底多久能真正开始干活。这分别对应的是机器人的运动能力和部署能力。

从第二届世界人形机器人运动会的赛事项目上看,就分为竞技赛和场景赛两个类别。其中竞技赛包含了田径、足球、体操、举重等项目,专门考察机器人的运动能力;场景赛则囊括了商超、餐饮、工业、家庭等场景,并设立了灵巧手专项比赛,考察的就是机器人在不同场景之下的部署能力。

可以说,本届运动会就是验证机器人运动能力和部署能力的一次大考。

而在工业场景的实践上,智元同样走在行业前沿。今年以来,智元精灵 G2 已经进入龙旗科技南昌工厂、上汽通用奥特能超级工厂进行常态化作业。

从工厂到赛场,智元展现的是两种相互印证的能力:既能在生产线上稳定工作,也能在赛场登顶金牌榜和奖牌榜,智元已经成为机器人行业的一名优等生。

拿下运动与部署两张高分答卷

智元这名机器人「优等生」的高分究竟从何而来,还要拆开具体赛项来看。

其中,智元有 5 枚金牌来自竞技赛,6 枚金牌来自场景赛中的作业任务。表现最佳的是灵巧手专项,总共 8 个项目智元拿下了 7 枚金牌。

在竞技赛一侧,智元远征 A3 完成了太极拳、国际标准舞等高动态、强节奏的成套动作,考验的是全身协调、动态平衡和动作控制能力;灵犀 X2 则在 100 米、400 米障碍赛中合计获得 1 金、1 银、1 铜。智元还在舞蹈、武术、乒乓球等项目中持续拿分,最终在竞技赛中收获 5 枚金牌。

进入场景赛,考题变了。图书馆理书、消防灭火、酒店服务等赛项,是对真实工作流程的压缩复现。机器人不仅要完成某一个动作,还要在非结构化、高扰动的环境中连续完成感知、规划、移动和操作。对于已经进入「部署态」落地的智元来说,赛场就是商业化落地的考场。

以图书馆场景为例,任务包含图书出库与运输、上架归位、错放图书识别与纠正三个连续环节,任一环节失败都可能导致流程中断。智元与清华大学、上海交通大学组成的联合赛队,通过地图定位与导航、书脊标签识别和任务决策完成整套流程,最终获得该项目的金牌和铜牌。

消防应急场景则进一步考验机器人的全身作业能力。机器人需要依次完成危险品识别、异常阀门关断、灭火器抓取与灭火,其中灭火器重量达到 4.5—5 公斤。精灵 G2 通过腕部结构、全身控制和超视距遥操完成任务,智元在该项目中拿下金牌和银牌。随着赛事收官,智元最终在 12 项作业任务中获得 6 枚金牌。据介绍,精灵 G2 的同一套能力体系还被复用于园林、酒店等不同项目,以减少针对单一场景的重复开发和专项适配。

此外,这些项目还对机器人的自主执行能力设置了明确权重:全自主完成任务的权重系数为 1,依靠遥控完成则只有 0.5。对于参赛队伍而言,纯靠遥控机器人虽然风险更低,但同时得分也会更低。而能够自主理解环境、规划流程并完成任务的机器人,才会获得更高的分数。

在更强调精细操作的灵巧手专项中,智元临界点 OmniHand 参加了全部 8 个赛项,最终获得 7 金、4 银、3 铜的优异成绩。这 8 个赛项包括电动工具装配、粉末称量、积木搭建、钉钉固定、开瓶揭盖、拆箱拆包、镊子夹豆和线缆连接。粉末称量要求机器人将重量控制在 20±0.5 克,考验手眼协同和闭环控制;电动工具装配需要在光照、桌面高度等条件变化下准确对准螺丝孔;积木搭建则要求双臂协同,并避免双手相互干涉。其中,OmniHand 在 3 个赛项中以全自主方式夺得金牌。

更关键的一点,此次参赛的精灵 G2、远征 A3、灵犀 X2 和临界点 OmniHand 均为量产版本,并非为了比赛临时打造的定制样机。也就是说,赛场上展现出来的能力,都是开发者和用户买到即可复现的。

但量产本体只是能力的载体。机器人能运动、会干活的背后,考验的是 AI 能否将感知、决策和动作连成闭环。这也把问题推进到了更深一层:支撑不同本体完成这些任务的具身 AI 大脑,究竟由什么组成?

奖牌背后是全栈具身 AI 大脑

智元将这套全栈技术概括为「三智一体」。

在这套技术架构中,运动智能解决机器人如何站稳、行走并控制全身,作业智能负责理解环境、拆解任务和完成操作,交互智能则让机器人能够看见、听见并理解身边的人。三种智能并非彼此孤立,而是共同运行在机器人本体之上,形成从感知、决策到执行的完整闭环。而智元,恰好是业内少有的拥有全产品组合、全场景布局的机器人企业。

运动会上的表现,首先对应了其中两种能力:远征 A3 和灵犀 X2 展示的是运动控制,精灵 G2 和 OmniHand 检验的是作业与操作能力。但如果机器人要进一步进入酒店、商超、公共服务等开放环境,仅仅「会动」「会干活」还不够,它还需要看见人、听懂人,并在合适的时机作出回应。

在运动智能方面,智元拥有 BFM-2 运动基座模型。它能够根据机器人当前的全身动力学状态和目标姿态,自主推演并生成完整运动轨迹;即使面对失衡、外力干扰或指令突变,也能动态重新规划动作。这类能力直接关系到机器人能否在跑跳、舞蹈、武术等高动态任务中保持平衡与动作连贯。

今年 4 月,智元先后发布 GO-2 与 Genie Envisioner World Simulator 2.0(GE-Sim 2.0),进一步补强作业智能。其中 GO-2 大模型,通过动作思维链先在动作空间生成任务的高层行动计划,再由异步双系统以低频规划、高频执行的方式,将计划稳定转化为具体动作,解决机器人「想得明白,却做不稳定」的问题。根据规划,今年三季度,智元还将推出 GO-3 模型。

GE-Sim 2.0 是为机器人搭建一个可运行的「模型世界」。它可以根据机器人发出的动作信号,推演环境和机器人自身状态随后会发生怎样的变化,让作业策略在进入真实场景前,先在虚拟世界中完成测试、评估与迭代,降低真机反复试错的成本。

在交互智能上,智元自研的具身原生全模态大模型 WITA-Omni Preview 提供了一个观察窗口。公开信息显示,WITA-Omni Preview 模型以 85.21 分的平均准确率位列 DailyOmni 音视频全模态理解榜单第一,并且八项指标中,有六项取得第一或并列第一,超过千问、Gemini、豆包和英伟达的参评模型。

至此,智元「三智」的模型底座已经清晰:BFM-2 支撑运动智能,负责控制身体;WITA-Omni Preview 支撑交互智能,负责理解人与环境;GO-2 与 GE-Sim 2.0 则共同支撑作业智能,负责推演并执行任务。智元的四大模型与量产本体结合,形成了从控制身体、理解环境,到推演任务、稳定执行的完整能力链,也就是「三智一体」的完整闭环。

率先迈入部署态

模型能力的最终价值,在于能否装进量产产品、进入真实工作流,转化为稳定的生产力。

今年 4 月 17 日,邓泰华在 2026 智元合作伙伴大会上提出具身智能产业的 XYZ 曲线:X 曲线对应开发尝鲜期,首先解决机器人能否「像人一样动起来」;Y 曲线对应 2026—2030 年的部署成长期,机器人要进一步「像人一样干活」,进入真实场景创造价值;Z 曲线则指向 2030 年之后的部署普及期,依靠规模部署和数据积累推动智能涌现。

从 X 曲线跨入 Y 曲线,衡量标准也随之改变。机器人偶尔完成一个高难度动作还不够,还要以量产产品为基础,在真实环境中稳定、连续地工作,并让同一套能力在不同客户和场景中复制。为此,智元提出「本体—智能—部署—生态—数据飞轮」五层实现体系,并发布覆盖产线上下料、工业搬运拆码垛、物流分拣、门店导引、零售服务、安防巡检和工商业清洁的七大标准化生产力解决方案。目前,智元已经率先进入部署态。

就在今年 6 月,8 台精灵 G2 机器人集群进入龙旗科技南昌工厂,独立承担了包括多媒体界面测试、音频测试、辐射杂散发射测试和耦合测试在内的多道高精度检测任务。并且,此次工作还进行了为期 6 天的现场直播,最终任务成功率 99.99%,累计产量达到 17,625 件。

这也对应邓泰华在大会上提出的「358 宏图」:前三年完成 X 曲线的本体与运动智能筑基,接下来两年进入 Y 曲线,推动生产力从 0 到 1 并扩大场景部署;再用三年依托生态伙伴和部署态数据飞轮,将生产力从 1 推向 N,迈向 Z 曲线。每一台进入真实岗位的机器人都会产生新的场景数据,数据再反向推动模型、产品和解决方案迭代,这才是 Y 曲线能够持续向上生长的关键。

因此,46 枚奖牌并不是一项孤立的赛事成绩。赛场上的跨场景夺牌与工厂里的长周期作业,分别验证了智元能力的广度和运行的稳定性。从量产本体、模型算法到场景适配,再到多机协同和持续运维,智元已经打通了机器人进入真实工作流的关键环节。这才是双榜第一背后更值得关注的能力——把量产机器人真正部署下去,并让它稳定干活。