对话日冕钟元鑫:工业场景更适合验证 Physical RSI
最近,RSI 正重新成为 AI 行业的高频词,而在具身智能领域,它已经开始被推向一个更具体的问题:机器能不能在真实世界里自我改进?
RSI,即 Recursive Self-Improvement,指系统能够参与改进自身的代码、工具或训练流程,并利用这些改进持续提升后续迭代的能力或效率。随着大模型开始写代码、跑实验、辅助训练下一代模型,这个过去偏理论的问题正在变得越来越现实。
到了物理世界,这套闭环却复杂得多。机器人面对的是持续变化、无法完全重置的真实环境,每一次行动都有真实成本,也会留下真实后果。Physical RSI 想解决的,就是如何让机器人不只是执行任务,而是能够从真实交互中持续获得经验、更新能力,再把这些能力带回现实世界。
一家成立半年左右的机器人公司,正在试着第一时间把这件事搬进工厂。
日冕开物成立于 2026 年 3 月。此后几个月,公司连续完成两轮种子轮融资,合计金额达数亿元人民币,投资方包括鼎峰科创、远图未来、百度风投、沃衍资本、武岳峰科创和万林国际。按照当时披露的信息,这些资金将主要用于自研世界模型 LaMPA、强化学习体系、数据闭环以及产品交付能力的建设。
融资披露前后,日冕也开始陆续对外发布一系列技术工作,其技术体系逐渐清晰。

7 月 1 日,公司发布 WRM 世界奖励模型(World Reward Model)与WPM 世界策略模型(World Policy Model)框架:世界策略模型负责生成初始动作,世界奖励模型负责判断任务处于成功、进行中还是失败,让机器人可以根据真实反馈继续训练。7 月 8 日,团队进一步解释了底层的 LaMPA 世界模型,以及 Environment、Ego、Experience 三重表征;7 月 14 日,又公布了一套 VLA 推理优化方案,将延迟从 130 毫秒降低到 32 毫秒。
到这一步,日冕描述的仍然是一套相对典型的物理基础模型系统:世界模型负责理解和预测,策略模型负责行动,奖励模型负责判断结果,再用真实世界强化学习继续修正策略,同时通过推理 Infra 把整套系统真正跑在机器人上。
到了 8 月以后,问题开始发生变化。重点不再只是「怎样把一个模型训练得更好」,而是「机器人部署出去以后,能不能持续学习、越学越快」。
这意味着产品交付也获得了另一层意义。 机器人进入真实现场,不只是为了完成一个项目,也可以成为不断产生交互、失败和反馈数据的入口。
9 月 15 日,日冕正式发布《Physical RSI: Learning to Improve, in the Physical World》,将此前围绕世界模型、评价、后训练和 Infra 的技术工作纳入同一框架,并提出 AL0—AL3 与 EL0—EL3 两套自定义分级。
在这套框架里,学习被拆成两个嵌套闭环:Skill Learning Loop 负责把示范和试错转化为具体技能,Deployment Loop 则把真实部署中暴露的问题重新送回评价和训练环境。RimPilot、RimCritic 和 RimGround 分别承担策略执行、结果评价和训练环境构建等角色。日冕希望最终让被更新的不只是机器人的动作策略,也包括评价器、训练环境乃至学习流程本身。
第二天,这套刚刚完成命名的技术叙事进入了东莞远图未来的一条 ICT 测试产线。
现场,一套机器人刚刚操作完一种板卡,工作人员随即换上另一种。团队重新采集少量数据,完成训练和部署,大约 15 分钟后,机器人开始处理新的物料。
换一块板,对人来说几乎不构成一个新的问题。但对于依赖固定轨迹的传统自动化设备,新板卡往往意味着重新编程、对点和调试,一名工程师可能因此花掉几个小时。日冕把这套软硬一体系统称为「超级工站」,并用「一学就会」概括它的快速换型能力。按照公司披露的数据,这套系统此前已经在远图 ICT 测试产线上完成 POC,成功率超过 99.5%。
但「一学就会」和「自己就会」,仍然是两件不同的事。
我们在现场看到,工作人员依然站在工位旁,参与数据采集、训练以及任务切换。日冕开物联合创始人、技术平台负责人钟元鑫也没有回避这一点:「 还不是完全无人,所以我们距离真正的 RSI 终点还有一段距离。 」
钟元鑫 1997 年出生,本科就读于清华大学车辆工程专业,随后在密歇根大学获得博士学位。读博期间,他曾先后在 Waymo 和苹果 Vision Pro 团队实习;回国后进入华为诺亚方舟实验室,经历了端到端、VLA 和世界模型几代智能驾驶技术路线,并主导了华为 ADS 5.0 智驾世界模型。2025 年底离开华为后,他在 2026 年联合创办了日冕开物。
按照日冕自己的分级,这次在远图展示的能力仍然属于 AL1:任务、奖励和训练环境由人设定,系统负责在其中采集交互、更新策略并完成新任务适配。更进一步的 AL2,才要求策略、评价器和训练环境本身也开始协同更新,并且通过连续的新任务证明:在相近的数据和训练预算下,机器人达到目标所需要的时间正在越来越短。
也就是说,Physical RSI 真正关心的并不是机器人能不能在 15 分钟里重新学会一块板卡,而是学过第一块、第二块、第三块以后,它学习下一块板卡的成本是否真的在下降。
这背后对应着机器人基础模型正在探索的两种路径:一种尽可能通过大规模预训练,让机器人第一次进入新环境时就拥有足够强的先验和泛化能力;另一种则允许机器人进入具体环境后,再利用真实反馈快速学习。Figure 的 Helix 2.5 更强调前者,而 Physical Intelligence 已经在精细操作中展示了后者——利用真实操作结果进行在线强化学习。
日冕选择的是一个更靠近真实交付的切口。它没有把全部希望押在 Zero-shot 泛化上,而是接受一个现实:至少在今天,机器人进入新工位后仍然经常需要重新学习。它真正想改变的是,这次学习能不能留下数据、评价方法和训练基础设施,继续服务下一次部署。
这也解释了远图的重要性。相比拥有大规模真实道路数据的自动驾驶,机器人行业还缺少足够大的硬件网络。远图向日冕开放真实工位、生产工艺和内部任务场景,让真实任务和失败能够持续进入训练系统。
这也是日冕试图与传统自动化集成商拉开的区别:传统项目通过验收,往往意味着交付接近结束; 在它设想的闭环里,交付反而是学习开始的地方。新的物料和工装暴露失败,评价模型判断结果,失败数据回到训练系统,再形成新的策略。
如果这个循环成立,一家机器人公司的资产,就不再只是交付过多少工位,也包括这些工位共同积累下来的学习能力。
钟元鑫在采访里把这一点说得更直接:「 算法不是护城河。真正带不走的是数据和集成化的基础设施。 」
以下是 42 号电波与日冕开物联合创始人、技术平台负责人钟元鑫的对话,略经编辑。
大模型负责思考,具身公司先把「小脑」做好
42 号电波: 你上一次接受采访是在 7 月,当时你说,具身公司一定要训练自己的大模型。最近 GPT-6 Astra 发布后,大家关注到上层基模能力又有明显变化,你现在的判断变了吗?
钟元鑫: 更明确了。我们一开始设想的就是分层架构,只是 7 月没有详细展开。
高层偏通识、常识理解的任务,应该交给 GPT-6,或者至少 30B、100B 以上的视觉语言模型。比如在家庭里理解应该抓什么东西,不只是识别物体和材质,还需要非常广的知识以及大量语义数据。具身公司没有必要为了接入这些能力,重新训练一个模型、重复造轮子。
顶层模型应该来自基模公司。除非你本身就是阿里,可以使用自己的模型;像我们这样的公司会接入其他基模,最多在外层做 Harness。我们重点做的是具身直觉的 System 1:机器人与物体接触、交互时,及时产生反馈并调整。再往下是偏运控的 System 0。
System 0 和 System 1 才是具身公司现阶段应该重点攻克的方向。
42 号电波: 你觉得大模型进展符合你的预期吗?
钟元鑫: 比我预期得要快。我原本以为明年才会达到这样的能力,没想到今年就到了。哪天基模公司接一个本体去做操作任务,我也不会觉得奇怪。
但它们应该不会放下那么大体量的模型,所以实时、高频闭环未必是它们的目标。在工业场景里,最后精细操作的瞬间,大模型往往看不清。大模型的 Encoder 更偏语义理解,对精细对齐学得没有那么好,这正是我们需要解决的部分。
我以前还想过,在下面一层做好以后,上层任务拆解也可以稍微微调一下。现在觉得没有必要,上层直接使用大模型,外接 Harness 就可以。
42 号电波: 如果你们只做 System 0 和 System 1,还能称为基座模型公司吗?
钟元鑫: 当然。System 1、System 2 都可以有基座模型。
我们 7 月讲的 LaMPA,或者物理原生世界模型,仍然处在 System 1。它要构建一种物理本能:看到一个物体,知道大概是什么形状、应该怎样抓;抓取出现问题时,又能够立刻反馈和调整。之所以称作 「小脑 」 ,就是因为反应必须很快。但这同样需要用大量数据预训练,才能形成通用能力。
42 号电波: System 1 最终需要多大的模型和多少算力?很多人会认为端侧模型不需要很大。
钟元鑫: 因为需要部署到端侧,按我们现在的判断,模型不会超过 10B,超过 10B 就很难部署。
10B 级模型,即使训练 30 万小时数据,训练资源大概也就是一千到几千张卡,具体还取决于训练周期。我们的目标也是这个量级。
42 号电波: 也就是说,具身公司不必去训练一个与云端基模同等规模的模型。
钟元鑫: 对。 最终的形态可能是给上层大脑提供一组 Skill。 这些 Skill 本身很复杂,也非常依赖对物理交互的理解。
我们以前做自动驾驶时探索过类似方法。车辆需要同时看到广角和长焦:广角负责理解周围车辆及其关系,长焦要看清一百米外的交通牌。一个模型很难同时处理好两者,所以可以让大模型调用一个 「放大器 」 ,发现远处可能有交通牌后,再把那部分图像裁出来放大。
具身智能也会出现类似分工。抓取物体、操作微波炉按钮,都可以成为需要精细交互的 Skill;长程任务没有必要交给底层小模型完成。
42 号电波: 这会改变具身「大脑公司」的估值逻辑吗?投资人给模型公司高估值,通常期待它最终一家通吃。
钟元鑫: 未来的蛋糕至少会分成两部分:一部分是 System 2 的上层大脑,另一部分是 System 1 的小脑。
小脑能不能赢家通吃?我觉得也有可能。 如果我的 Skill 比别人更强,而且迭代速度更快,就有机会做到。
42 号电波: OpenAI 和国内基模团队都在采购 ego 机器人数据。大家买的数据接近、模型架构也接近,具身公司的差异还会在哪里?
钟元鑫: 关键是你到底要训练什么,是训练关节角,还是虚拟空间表征;按单帧图像训练,还是按连续视频训练,或者转成矢量表示?这些问题都还没有答案。
具身公司仍然可以探索更贴合本体的表征。我们也试过 Ego、UMI 等数据形式,现在看来,没有一种方案能够覆盖所有需求。数据方案要与最终交付方式绑定:你是追求 Zero-shot,直接部署到客户本体上就能用,还是像我们一样,允许分钟级、小时级的微调,或者主要依靠现场精调?交付形式不同,预训练数据的配比也会不同。
如果追求跨本体 Zero-shot,预训练里可能需要更多与本体紧密结合的数据,尽量缩小本体 Gap。如果允许 Few-shot,预训练数据里未必需要那么多特定本体数据,ego 数据也可以发挥作用。
42 号电波: 你们把自己的表征体系称为 E/E/E。现在已经确定操作层究竟需要训练什么数据了吗?
钟元鑫: 具体方案还不方便透露,也没有公开论文。我们看到了一些行业目前关注不多的细节,想先做出来再公开。
大方向还是精细操作:究竟需要哪些模态、多高的输入频率,数据应该用 Ego、UMI,还是其他形式?我们还在分析,最后可能采用一种介于 Ego 和 UMI 之间的方案。
最近我们与新加坡的老师讨论合作,也越来越明确地感觉到,服务器这类精细操作需要很强的力反馈。家庭里的一些任务未必如此,但在工业现场,力反馈大概率是刚需。因此我们也在构思带力反馈的数据采集器。
42 号电波: 你们和远图提出从百台部署走向万台。你们希望只沿着服务器制造这条路线规模化吗?
钟元鑫: 这是一个误解。万台不是只与远图合作。
我们与远图建立联合实验室,是一起打造解决方案,再把方案交付给更多客户。远图内部可以提供很多场景,让我们验证方法论;验证完成后,打包出去的不应该只是一套面向 AI 服务器的方案,而是一套能够泛化到不同场景的体系。未来的客户不会只有远图。
失败比成功更容易跨本体
42 号电波: 你刚才说,数据应该由交付方式反推。但基座模型如果最终要形成行业共识,理论上需要通用数据。以交付为起点,会不会只是第一阶段?
钟元鑫: 我先区分 To B 和 To C。
To C 数据天然具有更强的多样性。但按目前采集方式,To B 数据的泛化性通常不够。无论高度标准化的工业场景,还是酒店保洁,都会有统一 SOP。人按照标准稳定完成同一件事,动作多样性自然消失。如果只采正确行为,换一个工业场景继续采,带来的增益可能也不大。
我们现在更想收集失败数据。成功动作往往相似,失败却各有各的「不幸」,同一个场景里也可能出现很多种失败。
而且我们认为,在评价层面实现泛化,比在 Policy 层面实现泛化容易。看一段操作视频,不管执行者是人手、灵巧手还是夹爪,都可以根据物体有没有掉落、有没有异常形变,判断动作是否正确。但要让同一个策略同时控制灵巧手和夹爪,难度会大很多。
所以 我们的范式是:Policy 不一定一开始就做到 Zero-shot,可以接受 Few-shot,但负责评价的模型要尽可能 Zero-shot,覆盖更多任务。 只要它能稳定判断动作好坏,接进来的 Policy 即使还不够成熟,也能很快被训练起来。
42 号电波: 也就是说,你们不是先强求底层动作表征统一,而是先增加一个可以跨任务、跨本体的评价体系?
钟元鑫: 对。 有了评价体系以后,底层究竟训练关节角,还是其他特征,重要性就下降了。 这些选择会影响「运动员」的起点和素质,但负责评价的「教练」可以先具备更强的泛化能力。
42 号电波: 这套方法最终能把 To B 和 To C 统一起来吗?
钟元鑫: 我现在还没有想好。它当然可以用于 To C,但它是不是最适合家庭、最能跨家庭泛化的范式,我还不能确定。
42 号电波: 失败数据从哪里来?让人专门表演失败,很难覆盖机器人真正会犯的错误。
钟元鑫: 如果我们去做交付,失败数据并不难获得。一个场景做到较高成功率以后,进入下一个场景,新的失败会自然回流。即使是同场景、同任务,换一个地方部署,也会产生很多失败。
对于只训练基模的公司,失败数据很难获得,但对贴近实际场景的团队,这恰恰是一种优势。
42 号电波: 你们原本一直在做世界模型,为什么后来发展出 World Reward Model 和 World Policy Model?
钟元鑫: 我们最初做世界模型,是不希望高度依赖标注。只要有未来帧,就可以训练世界模型。现在看,可能仍然需要加入一些简单标注,但它至少能降低标注成本,不是每来一批数据都重新做大量人工标注。
继续往下做,我们发现 Reward Model 更容易泛化,也更容易跨本体、跨模型迁移。World Model 可以降低标注成本,但如果直接训练 Policy,仍然要求操作范式、末端表征等数据比较一致。World Reward Model 更纯粹,它只负责理解和评价,输出一个分数或一段简单描述,不需要关心末端究竟是什么形状、处在什么关节位置。
当然,世界模型对 Reward 到底能产生多大帮助,我们还在探索。
42 号电波: 你做过自动驾驶世界模型。自动驾驶与机器人的 World Model,最根本的差别是什么?
钟元鑫: 往小了说,大家使用的 Backbone 很接近,很多团队底层都在用 Wan。但两个领域真正面对的问题不一样。
自动驾驶首先要解决多视角一致性:怎样让多个相机生成一致的未来。Wan 原本主要训练单视角,加入多视角是第一道题。具身智能上来甚至先要解决怎样输出 Action。
我认为具身 World Model 更难。车辆行进轨迹相对受限,直行视频里,模型把远处像素逐渐放大,也可能学到看起来不错的结果,这是一种捷径。机器人外部相机的变化幅度大,操作时又会不断看到过去没有出现的区域,直接照搬视频模型会有问题。
它可能需要有选择地建模。当前视角看不到的区域要做一定推测,但与任务无关的一面墙是什么颜色、什么材质,并不重要。模型应该把更多能力放在操作对象及其周边,而不是平均地生成整个画面。
42 号电波: 世界模型是更接近终局的解法,还是现阶段从其他领域借来的可用工具?
钟元鑫: 自动驾驶其实很务实。其他领域出现一个新方法,大家就拿过来试;能解决问题就用,解决不了就放下。元学习、因果推断、神经符号网络都有人试过,端到端、VLA 和世界模型则是试过以后觉得有用。
具身领域也会逐渐进入这种状态。ACT、Action Chunking、Action Tokenizer 里有不少为机器人专门提出的原创方法,但一项技术进入交付以后,最终会变成工程问题。为了把问题解决掉,必须持续尝试新的工具,不会因为它是否足够 Fancy 决定用不用。
42 号电波: 所以你们不是先提出 Physical RSI,再把产品往这个概念里装?
钟元鑫: 不是。我们也不是一开始就奔着 Physical RSI 去的。
我们先做 Reward,发现它有价值,应该继续延伸;与远图一起落地以后,又发现上层 VLM 应该交给基模,我们给它提供 Skill 和 Harness。Reward 可以评价,Policy 部署后产生新的 Corner Case,再用这些数据优化评价与策略。几块拼图逐渐放到一起,我们才意识到,它们形成的就是 RSI。
是做着做着,发现前面有这样一条路。
42 号电波: 现在很多人谈 RSI,定义却不一样。你怎样理解它?
钟元鑫: RSI 至少有很多层级。让 AI 自己做研究、写论文,可以叫 RSI;让 AI 编写算子、优化 Harness,也可以叫 RSI;更远的终局,是 AI 设计自己的架构、数据来源和训练方式。
按我的理解, 今天比较现实的一条路径,是把模型与 Harness 集成起来。一方面模型通过数据和结果持续提高,另一方面 Harness 也随着模型迭代。 具身领域也是如此。怎样评估,怎样让评估越来越好,是闭环的起点。评价更准,才能产生更好的 Policy。Policy 部署后又产生更前沿的 Corner Case,再反过来优化评价。
Physical RSI 进入工位,人还没有离开

42 号电波: 我刚才看了你们在远图产线上的演示。同一个工位更换了不同板卡,但现场仍然有工作人员配合。现在还没有做到完全无人,对吗?
钟元鑫: 还不是完全无人,所以距离真正的 RSI 终点还有一段距离。
如果 Reward Model 足够好,第一步至少可以替代人判断动作成功还是失败。做到这一步,就能先实现一种低效率的无人化:发现失败,任务终止,然后重新尝试。
如果再有一个模型能够在失败后接管,把动作继续完成,整个闭环才真正转起来。那时我们才能更快地训练和迭代。
42 号电波: 现场只采集、训练了十几分钟。你们不再把 Zero-shot 成功率当作最重要的指标了吗?
钟元鑫: 不能说不追求。初始成功率仍然重要,因为它决定后续训练效率。
失败有很多种。差一米是失败,最后只差一毫米也是失败。 模型很差时产生的失败,动作本身可能很愚蠢,这类数据不需要太多。真正有价值的是成功率已经很高以后,只差一毫米、一厘米的失败。 这类失败发生概率低,却更接近能力边界。
不能为了收集失败而刻意让机器人失败。应该像一个聪明人一样工作,只是聪明人也会犯错,而聪明人的错误更有价值。这和自动驾驶里的 Corner Case 是一回事:五年前的 Corner,今天可能已经不再是 Corner。最有价值的数据一直在能力 Frontier 上移动。
42 号电波: 但自动驾驶积累 Corner Case,依赖大规模车队。机器人一个工位一个工位部署,失败数据仍然很稀疏。
钟元鑫: 肯定不会像自动驾驶那么快,但每条数据的价值可能更高。工业场景没有捷径,必须到现场部署才能获得。大家不应该预期机器人会像自动驾驶一样快速积累 Case,但所有公司最终都要走这一步。
42 号电波: 未来几个月,你们怎样判断 Physical RSI 是真实方法,还是暂时成立的概念?
钟元鑫: 首先要验证它能不能让系统「越学越好」或者「越学越快」。我们做了初步验证,但还不足以把它确立成一个非常 Solid 的战略。
第一步是让 Critic 自动判断是否需要接管;下一步是让接管动作也由模型生成;再往后,面对一个新 Skill,可以把机器人直接放进环境里探索,最后自己把任务学会。这是最理想的状态。

42 号电波: 在这个过程中,哪些能力应该由基模带来,哪些必须在现场学?
钟元鑫: 摩擦、重力方向、物体大概有多重,以及金属、橡胶、木材的差异,这些底层物理规律没有必要全部在现场学习。
但具体到一块 PCB 板,怎样抓重心最合适,怎样避免损伤上面的元器件,这种知识在基模里很难直接获得,只能让机器人在具体场景里调整。底层物理规律来自预训练,特定物料和工装工具的能力来自部署现场。
42 号电波: 达到什么标准,你才会认为 Physical RSI 的闭环开始发挥作用?
钟元鑫: 假设训练过十个任务,到第十一个任务时,后训练周期比现在显著缩短,就能说明闭环开始发挥作用。
我觉得这个节点应该在百台部署之前出现。
42 号电波: 为什么与百台部署解耦?部署越多,不是越容易积累数据吗?
钟元鑫: 百台可以只是同一个工位、少数几种动作,复制到一百台设备上;那不一定需要 RSI。只有一百台分别对应很多不同工位时,才更依赖 RSI。
按照现在的规划,明年不会覆盖非常多种工位,而是每类工位部署一定数量,合计达到百台。这两个指标不能混在一起。
42 号电波: 远图为什么愿意和你们一起做这件事?它原来的痛点是部署时间,还是缺人?
钟元鑫: 都有。以板卡换料为例,人几乎不需要学习,很快就能适应;传统机械臂和工业自动化方案,调试一次可能就需要半天,会占用产线时间。
他们也确实很难招工。除了今天看到的大板测试,还有其他板卡和服务器测试工序,一些工作环境比较差。产能持续扩张,但人难招、也难留,所以替换人工的动力很强。
42 号电波: 很多机器人公司绕开工业场景,因为客户要求高、容错率低。你们是后发公司,为什么仍然选择工业?
钟元鑫: 我不认为行业已经得出了「工业最难,其他场景更容易」的结论。每家公司只是拥有不同的合作伙伴。
我们还是从算法需求出发。单纯依靠模仿学习,用大量 ego 数据或遥操作数据,就能在家庭里把洗碗、擦盘子长期做到高成功率——我还没有看到完整验证,也没有足够信心。但引入强化学习和后训练后,一些任务可以先落地。我们在远图已经看到,后训练能够把成功率继续向上推。
后训练需要一个评价清晰、成功和失败边界明确的环境。沿着这个条件寻找,工业场景仍然最合适。
42 号电波: 另一条路线是先进入包容性更强的场景,不要求很高成功率。比如商业服务、人机协同或者部分家庭任务。
钟元鑫: 我认可包容性场景的价值。物流分拣同时具备明确评价标准和一定包容性,确实是比较合适的场景。
42 号电波: 那你们为什么不做分拣?
钟元鑫: 分拣太卷了。(笑)
对于后发公司,已经有很多团队在做、也正在快速交付的问题,就没有必要再做。我们更关注小批量、多批次的柔性生产,以及传统自动化不容易解决的任务,比如线束等非刚性物体。
如果一条产线完全不需要柔性,传统机械臂就能解决,也没有必要使用具身智能。
42 号电波: 家庭场景对失败的包容度不是更高吗?
钟元鑫: 家庭也不一定简单。真正面向消费者,还要考虑退货、售后和用户满意度。大型机器人出现问题,很可能需要本地工程师处理。工业和家庭各有各的困难,我不认为工业一定做不了,也不认为家庭一定更容易。
我们的终局仍然是适用于更多环境的机器人,也会考虑家庭。 但现阶段从工业开始,因为这里更适合验证 Physical RSI。 它将来能不能成为家庭场景的最优范式,我现在还不能确定。
42 号电波: 你们对外公布 POC 成功率超过 99%,但从一次 POC 走到产线并线,还缺什么?
钟元鑫: POC 相当于完成了一个 MVP。规模化阶段除了成功率,还要看稳定性。进入产线之前必须做足够多的压力测试,硬件和模型都要稳定;还要与工厂流程真正结合,完成安全兜底和并线。
明年百台意味着开始向规模化推进,但百台本身不等于已经证明跨工位泛化,也不等于 RSI 闭环已经成立。
「算法不是护城河」
42 号电波: Physical RSI 对工程要求很高。你们团队不能只有算法人员吧?
钟元鑫: 对,目前公司一半以上的人都在做工程。
我们不是纯算法公司,更关注整体迭代效率。本体不稳定,或者存在一些小问题,都会严重影响训练与部署。
42 号电波: 如果核心是工程闭环,而不是一种别人无法复现的算法,日冕的护城河是什么?其他公司拥有相同资源,是不是也能做到?
钟元鑫: 其实就是这样。
我们从一开始就想清楚了,护城河只有两块:数据和 Infra。算法不是护城河。掌握算法的人换一家公司,算法能力也跟着过去;论文方法发表后,学术界和同行也会很快复现。
真正带不走的是数据和集成化基础设施。 Infra 包括云端训练体系、数据管道,也包括机器人本体。本体本身就是基础设施的一部分。本体稳定的公司,模型迭代以及适配新市场的速度都会更快。
42 号电波: 你们说 Physical RSI 不只改进算法,未来还可能改进末端硬件。这个思路怎样实现?
钟元鑫: 这仍然是早期设想,没有经过大规模验证。
我们跑过很多工业场景后发现,不存在一个能够覆盖所有任务、对所有任务都高效的通用末端。末端最终会有一定程度的定制。问题是,定制后基模能不能适应,以及交付成本会不会过高。
比如网线插接,Demo 里可能只插一根;客户设备上可能有十根网线并排,末端首先要能够伸进去。不能每个场景都由工程师从头设计。理想状态是系统先判断有没有现成末端;没有的话,再设计或选择一个新的末端。算法自己尝试,效果不好就更换,再继续训练,直到性能足够好。
只有把这种循环自动化,定制末端才有可能规模化。但这离完成还很远。
42 号电波: 在远图这种精细操作场景里,你们会选择灵巧手,还是夹爪?
钟元鑫: 我们试过很多灵巧手,但真正能做 Serious Work 的产品很少。低自由度灵巧手与一个大夹爪没有本质区别;高自由度手又很难长期稳定干活。所以工业场景里,我们现阶段会先把夹爪做好。
但触觉和力反馈仍然要做,夹爪也可以加入传感器。服务器等精细场景对力反馈的要求很高,这会影响我们未来的数据采集方式。
42 号电波: 触觉已经成为很多团队的新方向。现在最大的问题是硬件,还是模型?
钟元鑫: 两边都有,而且可能互相耦合。
触觉与力怎样泛化,模型怎样跨传感器学习知识,现在远没有探索清楚。人看到压力数值,大概能理解物体处于什么状态;模型今天仍主要依赖视觉,比如看东西有没有掉下来。但没有掉下来,不代表模型知道施加的力是大还是小。
可能是触觉硬件没有归一化,导致软件无法 Scale;也可能是模型架构还不成熟,反过来让团队不敢大规模使用触觉硬件。我们已经尝试把视觉、触觉和本体状态放进 Ego 表征,但目前融合训练的效果还不如保留独立分支。
42 号电波: Reward Model 可以降低一部分本体差异,但按照你们目前的体系,跨本体究竟还有多难?
钟元鑫: 仍然很难。Reward Model 只是降低了其中一部分难度。要实现跨本体,首先得有跨本体数据,而这种数据本身就不容易获得。
42 号电波: 跨本体是你们的长期目标吧?今天现场展示的是双机械臂,也没有展示移动能力。远图的工位不需要移动吗?
钟元鑫: 还是需要移动,移动底盘很快就会上。
42 号电波: 只是这次没有展示?
钟元鑫: 对,这次没有展示移动能力。明年百台部署的机器人肯定会带底盘。
42 号电波: 你们会在什么阶段验证跨本体?
钟元鑫: 还是要从客户需求出发。什么时候现有本体无法满足任务,客户确实需要另一种本体,我们就必须解决。按照当前范式,跨本体在方法上可以做,不等于数据和交付已经准备好了。
42 号电波: 你觉得以后做部署的团队会形成共识,都开始做 Physical RSI 吗?
钟元鑫: Physical RSI 是提供给大家的一种工具。
如果这套工具做得足够好,以后部署工程师只需要盯住最终结果是否正确,中间通过 Reward 做训练和调整。如果没有 Physical RSI,就会像今天现场演示的同学一样,需要一直在现场示教。所以本质上,这是部署工程师需要为一次交付投入多少精力和时间的问题。
42 号电波: 随着现场部署所需的人越来越少,工程师的角色会变成什么?
钟元鑫: 前期仍然需要人,但部署所需的人会逐渐减少。这恰恰意味着能够部署的场景会变多:以前一个人可能要花一个月部署一条产线,以后一个人花一个月可以部署十条,甚至一百条。
这并不意味着人的需求会消失。如果再往后真能做到无人化部署,或者无人训练新 Skill 并完成交付,工程师可以转向基础设施本身或其他更有价值的问题。
42 号电波: 你认为现阶段行业最值得解决的问题是什么?
钟元鑫: 短期最宏观的问题,是怎样把物理原生模态放进模型。 视觉、力和触觉怎样真正融合并且 Scale,还缺少成熟方案。
长期问题则是怎样平衡 Scaling 与定制。 如果跨本体,就要训练更多数据,Scaling 会变难;如果不跨本体,又会有很多客户任务无法完成。能不能通过自动化设计减少本体改动,同时保留足够的场景适应性,是一个很大的问题。
42 号电波: 你们没有像一些公司那样大规模采购数据?
钟元鑫: 我们也踩过坑,买过一些数据,很快发现数据范式与交付方式对不上。
如果交付依赖大量 ego 数据,就应该采购 ego 数据;如果依赖 UMI 加少量真机数据,就应该采购 UMI。 公司没有想清楚交付范式,买回来的数据可能没有用。 所以我们没有直接投入很大规模的数据采购。
现在我们想探索非侵入式、伴随式采集:不影响工厂操作员正常生产,把他们工作过程中自然产生的数据收集回来。 可以在头部佩戴设备,但手上尽量不增加东西,核心不是消除遮挡,而是不干扰作业。它需要设备和算法一起设计,目前仍在研究阶段。
42 号电波: 现在很多机器人公司的数据负责人来自自动驾驶。自动驾驶团队和大语言模型团队,谁更擅长建立具身数据闭环?
钟元鑫: 各有优势。
自动驾驶的数据管线从一开始就处理大量视觉和时序数据,更擅长多模态数据存储、格式转换、帧对齐和时间对齐。大语言模型的数据格式相对简单,过去更多是图文对,但在数据清洗、去重和质量控制上通常做得更深。
具身数据同时需要这两种能力。它既是多模态、时序的,也面临数据质量、重复和配比问题。不能简单把自动驾驶的数据管线搬过来,也不能只沿用语言模型的清洗方式。
42 号电波: 今天现场一共使用了多少数据?
钟元鑫: 这次不能算专门的数据采集,更准确地说,是现场完成采、训、推一体化演示,数据量很少,只有十几分钟。
如果进入一条全新产线,任务与现有模型能力差距比较大,可能需要额外采集几小时数据。大概是这个量级。
42 号电波: 你从自动驾驶转向机器人,是因为自动驾驶的问题已经基本解决了吗?
钟元鑫: 不是。我认为自动驾驶仍然处在 L3 阶段,距离真正的 L4 还有一段距离。
我离开的主要原因,是这个领域已经很少有人探索新的范式。现在自动驾驶做一个实验,需要的数据和算力规模很大,高校实验室越来越难参与。高校无法参与以后,行业对模型架构的讨论变少,大家主要在解决工程问题。我想继续探索新的方向和问题,所以转向机器人。
机器人今天还允许一所高校、一个博士生用相对有限的资源做出有价值的模型。数据、表征和交付范式都没有收敛,这对行业是困难,对研究者也是机会。
42 号电波: 作为一家后发公司,你们对行业是乐观还是悲观?
钟元鑫: 对交付,我是乐观的。机器人能够创造实际价值,也能够进入产线。
但对于机器人距离 AGI 还有多远,距离一台真正什么都能做的机器人还有多远,我相对悲观。新技术发布不会让我更悲观,它只是给了我们更多可以使用的工具。
我们能做的是从一开始就不用大量规则维持系统,也不在数据范式没有收敛时盲目买数据。先把模型、数据、硬件和部署闭环放到真实场景里,看哪些部分真的能够随着使用不断积累。
42 号电波: 你们过去对外讲 WPM 和 WRM 比较多,Real-world RL 在 Physical RSI 的闭环里究竟起什么作用?
钟元鑫: 用强化学习做后训练,真机与仿真之间一直存在 Trade-off。真机能够处理精细操作,因为真实环境的物理尺寸一定准确;但真机训练效率低,至少要占用一台机器人和一套真实环境。想把效率提高一倍,就要再增加机器人和工位,成本很高。
仿真的问题则是怎样足够准确地复刻现场。GPT-6 发布后——当然不只是 GPT-6,7 月份就已经有人尝试用代码做仿真重建——这件事出现了变化。用一张现场照片,再补充少量信息,模型就能比较准确地重建一个仿真环境。我们再把关键尺寸校准得更精确,就有机会把一部分学习过程转移到仿真中。
以前如果完全依赖真机后训练,每次交付可能都要占用多台整机。 现在我们的设想是:真实现场负责提供任务、误差和反馈,仿真负责放大训练效率,再回到真机验证。这样 Real-world RL 才更可能成为可以规模化的交付环节。
Physical RSI 是否成立,最终也不应由这个名字是否流行来判断。更直接的检验是:今天仍站在工位旁的工程师,下一次能不能更早离开;同一套系统做过十个任务以后,第十一个任务能不能少用一些数据、少花一些时间,并且在没有降低安全性和稳定性的前提下完成部署。
如果这些指标没有持续改善,所谓递归进化仍然只是更复杂的现场调试。如果它们开始随着部署数量稳定下降,日冕与远图眼前这个仍需人工配合的工位,才可能成为物理智能闭环真正开始转动的地方。
