对话清华大学教授曹婷,物理自进化的「因果」与突破
9 月 21 日, 「 ICCL 自进化 · 物理智能 Open Day」 在清华大学无锡研究院智能产业创新中心举行 。 中国工程院外籍院士、清华大学智能产业研究院创始院长张亚勤罕见亮相并致辞,首创「物理自进化(PSI, Physical Self Improvement)」概念。

张亚勤院士认为,当前的智能分为三大种类,数学智能、物理智能和生物智能。目前,具身智能存在的瓶颈在于扩展定律应用阶段的数据标准不统一,以及数据在 Scaling 中的不收敛。要实现更高层级的物理智能,物理自进化(PSI)将是下一个重点。

ICCL 是实现这种自进化、推动机器能力跃迁的关键路径。 为跨越 Demo 到真实场景的应用鸿沟,清华大学智能产业研究院曹婷教授及其团队构建了由 Model、Harness 和 Infra 共同组成的具身自进化体系。
ICCL(In-Context Causal Learning,因果上下文学习)是 Model 层的核心机制:机器人从自身物理交互中提取动作与状态变化之间的因果关系,并将经验注入后续决策;Zetta Harness 则负责执行过程中的在线监督、即时恢复,以及执行后的离线归因、经验优化和技能沉淀;Z-Infra 为模型与 Harness 提供数据管线、环境 Rollout 和高效部署推理等全周期支撑。这种物理自进化并非由 ICCL 或某一个模块单独实现,而是 Zeva Model、Zetta Harness 与 Z-Infra 协同形成的完整闭环。

会上,曹婷教授及其团队正式发布了新一代自进化模型 Zeva-Ego ,并为域变换的未来版图划定了清晰路线。据悉,Zeva-Ego 首次实现了无标注 Ego 数据提取物理因果先验,此举标志着离线「因果先验」(向人类学习)与在线「上下文因果学习」(ICCL)双技术体系正式成型。
为什么因果如此重要?自进化与「因果」的关系是什么?有没有更高明的方式将它们结合起来?
通过一场重磅发布会,「域变换」给出了答案。42号电波为此专访清华大学智能产业研究院(AIR)曹婷教授,揭开 ICCL 与物理自进化的更多细节。
从瓶颈说起
「因果性」是描述物理世界纷繁变化的永恒命题。从现实的混沌中,人类抽取出一条描述这种变化的路径,并以此为基础,在时间尺度上理解、学习。没有对「因果性」的描述,知识和经验很难变得可持续、可传承。同样,对于人工智能而言,要迈向物理世界,开发出更高层级的通用智能大脑,设计一种因果学习的范式尤为重要。
然而,我们今天所看到的大模型,许多仍是概率分布的载体。Aether AI 创始人黄碧薇就将 AI 的演进概括为相关性小模型、因果小模型、相关性大模型和因果大模型四类范式,而前两类在当前仍占多数。从状态轨迹、视觉重建转向根因追溯,让 AI 理解世界的因果规律,这种思路或许意味着机器学习范式的深层变迁。
曹婷教授认为,仅靠概率关联的机器学习,对具身模型显然不够。
当前主流的具身学习范式仍然通过离线数据采集来训练模型,这只能复现预训练中见过的数据。于是不难发现,通过视觉重建进行训练本质上是一种动作的概率分布。通过学习这种概率的关联去揣测人的真实目的,并不能使机器最大程度地将人的本领「学到家」。由于真实世界中存在大量预训练阶段未曾见过的物理条件,仅靠预训练无法实现可泛化的具身操作。在 Demo 场景相对固定的情况下,具身模型可以表现得相对完美,但真实世界的背景、光照、任务目标都可能在短时间内发生极大改变,这种学习方式远无法应对毫秒级的变化。这样一来,泛化性便只有无穷逼近真实分布,而无法看到收敛的尽头。
与人的成长相似,蹒跚学步是在真实世界站立的第一阶段,这也是为什么因果交互必须在机器学习中成立。她坦言,具身模型的演进目前还很难看到上限。如果以分数评价,这类模型的能力很有可能会局限在「60 分」水平。要达到 100 分,任重道远。
具身自进化的「因与果」
聚焦具身自进化,曹婷团队首次跑通了物理智能体的完整框架。更早以前,业内普遍处于大量采集数据、建立数据工厂,希望依靠预训练增加数据来扩大智能表现。尽管如此,曹婷团队的初心始终不变。
「于是,当行业突然意识到具身自进化非常重要的时候,我们已经有连续不断的成果发出来了。大家开始重视这点,有好有坏。不太好的一面是,各种各样所谓的具身自进化都冒出来了,但其实可能和我们理解的不太一样。所以我们今天也很明确地定义了,我们指的具身自进化是什么。」
具身自进化,指的是让机器人自己在物理世界里不断地和物体接触、和环境接触,从自我经验里提炼出对的和错的、好的和坏的因果结果,然后逐渐沉淀它的能力;在真实世界里部署得越多,它的自进化就越来越好。
而如果要将这一概念与业界广泛讨论的 RSI (Recursive Self Improvement)相提并论,则物理自进化的最大特点在于强调本体。以无人驾驶为例,物理 AI 以交通场景和汽车载具为结合,已形成了深度学习范式。下一步要做的,是为物理 AI 构建一个提升机器劳动力的底层设施,让具身大脑既能够在不同应用中快速建立数据飞轮,发挥核心价值,又能够通过「一脑多形」的具身智能平台,加速各类机器人替代人类响应抢险救灾、高机动作业等场景需求。

同时,PSI 的层次更加深刻。 物理智能的自我进化要求的不仅仅是大模型的自动优化与正反馈循环,还要求在真实与仿真、大脑与本体、系统与硬件之间,形成由上而下的效率闭环。以 Anthropic 的最新报告为例,围绕下一代智能模型的研发工作,机器的工作占比随着时间推移而上升,改进内容也从优化提示词、修改外围代码等浅层工作,逐步深入至优化注意力算子、硬件架构和基准设计。
由此发现,张亚勤院士在会上阐释的 PSI 是一个颇为生动的概念。然而要抵达这一愿景,物理 AI 的技术纵深与横向拓展都不可或缺。
上下文因果学习是技术理念的另一大创新。
稍早之前,Skild AI、Generalist、蚂蚁灵波密集发布了各自的具身模型,我们看到了业界对于 ICL 的技术共识。但 ICCL(In-Context Causal Learning)与 ICL 有着不尽相同之处,它指的是机器人应当在执行过程中即时地从自身的物理交互经验中学习,即学习其动作与所引发的状态变化之间的因果关系,并把这些因果关系应用到后续动作上。对此,曹婷团队已于本月初发表了相关论文,提出一种基于上下文因果学习训练而成的 Zeva 模型。

为什么这很独特?
在做因果之前,训练具身模型的默认路线普遍采用的是关联学习。通过输入一张图片,输出一个动作,来让机器人理解视频与动作之间的关联。如果让它拉开一个抽屉,给机器人的输入也是一个抽屉,那么机器人只会停留于这个训练而来的机械动作,并不会理解动作对物体本身的影响。相比之下,ICCL 告诉机器人的是物体的显式结果变化:一个拉的动作,可以让抽屉被抽出 5 厘米、10 厘米,机器学习的效果更落到实处。
模型对上下文的吸收能力同样重要。在 ICL 的范式下,要让模型在每一次执行中提升能力,就要充分利用上下文。不仅包括人类演示,更重要的是机器人自己操作产生的经验。机器人自己与物理物体、环境接触之后学到的东西,会被记忆下来。这就让物理世界的自进化(PSI)与上下文因果学习串联了起来。

从模型架构上,不难看到上下文学习范式的前沿应用。它通过因果交互提取、双时间尺度因果记忆和上下文注入策略三个阶段实现物理自进化。
其核心之一便在于编码器的不同。为实现因果交互提取(Causal Interaction Extraction)阶段,团队设计了一种因果转移编码器(Causal Transition Encoder, CTE)。模型在执行任务时,其参数将会冻结,只把提取出的 「 动作—状态变化 」 因果加入上下文,这种做法非常考验参数限制下模型自主学习的能力。
曹婷教授回忆,这是个真正从 0 到 1 的过程。
最开始,挑战诸多。团队认为,视觉重建编码器虽然为模型的预训练带来了较好的效果,但始终无法真正实现泛化。彼时虽已确定以「因果」为模型理念的基石,但团队并未完全想好该怎么设计这种形式体系。更重要的是,在这一问题上,业内没有现成的答案。历经数月,尝试不同的路线后,才完成对因果编码器的设计。

Zeva 的因果编码器是一种全然创新,不在传统范式的编码器之列。这种编码器与传统的视觉重建编码器有着很大不同,能将视觉隐变量、动作编码与观测到的效果整合为一个因果交互状态(Causal Interaction State),再映射为一个任务阶段标记(Phase Token)和一个因果交互信号(Causal Interaction Signal),形成供模型训练使用的信号组合。
随后,双时间尺度因果记忆(Dual-timescale Causal Memory)把这些信号组织起来以支持部署时适配,短时交互轨迹(Brief Interaction Trace, BIT)捕捉单次尝试内部动态,而持久交互记忆(Persistent Interaction Memory, PIM)则在同一回合的多次尝试之间积累有用的证据。完成之后,上下文策略注入(In-Context Policy Injection)检索与当前阶段匹配的交互证据,为冻结的基础策略构造一个因果提示(Causal Prompt)。部署期间,所有模型参数保持冻结,只有交互记忆在线更新。

随着交互经验在重复尝试中累积,Zeva 的任务成功率跃进式上升。以化学实验室为场景,在真机 ChemLab-Evo 基准上,Zeva 在每一个复杂度等级上都取得了最佳平均成功率。相对于每个等级中最强的基线,它在原子级、短序列级和复杂级的平均值上分别提升了 6.6、5.0 和 5.0 个百分点,其平均分 57.32 比最佳基线的平均值高出 12.59 分,总体超越 FastWAM、Cosmos3-Nano 等模型。

不仅部署后的 Zeva 确实在持续学习中扩大了自身能力,其单样本学习和跨任务泛化能力也表现强劲。测评显示,在 ChemLab-Evo 上同样使用单独选取的固定回合,Zeva 经 四轮连续学习, 不断改善了任务的执行效果:「拾取试管」从 65% 升至 100%,「放置烧杯」从 25% 升至 70%,「倾倒液体」从 30% 升至 80%。不同任务下,Zeva 能够表现出较好的跨任务泛化能力。这进一步佐证,观测到的状态变化有助于提升因果交互记忆的任务判别。
物理智能体,「血肉」生长
要抵达真实,具身自进化的学习方式不能只停留在预训练中,让机器人在不断自我交互中迭代学习非常重要。曹婷团队首次打通的自进化框架分为三部分,除了模型之外,还有基础设施与 Harness。

作为 Zetta 的训推基础设施,Z-Infra 支撑着整个自进化流程,包括端侧实时执行和服务器端的响应提升。
它要在两个方面完整地支撑整个自进化周期。其一,在端侧方面,在机器人部署端做到实时推理;其二,云端则需要负责 Scaling 的具体效果。通过在云侧统一利用 CPU、GPU、真机与物理仿真环境等各类工具,Z-Infra 能够把上层模型和底层各种异构硬件解耦开来。如此,上层模型只负责提交请求,而底层各类硬件资源另作统一管理。
这并非易事。物理智能体与数字智能体存在着很大的不同。面向游戏、信息交互等场景的数字智能体,仅需代码、技能库和知识文档便可实现,但物理智能体是一项横跨模型、算法、Agent、硬件的系统性工程。面对物理智能体,复杂计算资源的管理是最大挑战。

启动任务时,物理智能体通常会大规模并行地调用交互轨迹(Rollout) ,而这种方式会需要多种计算资源的高效组合。对于以 CPU 为中心的仿真,MuJoCo/Robosuite 环境维护每个会话的仿真状态,宿主机的 CPU 与内存会消耗。与此同时,另一部分功能分散在了 GPU,对状态布局、渲染与显存都有不同要求。由于策略模型使用 GPU 加速器来做自回归或扩散式的动作生成,并需要显存来存放计算特征,这些负载导致对工作器与调度的要求各不相同。因此,没有任何单一的资源池或调度策略能适配所有这些负载类型。
这对团队执行的动态、协调提出要求。与具有可预测数据并行模式的训练流水线不同,智能体会根据观测动态选择调用哪些工具:某一个动作可能只需要一次策略调用,而下一步则可能串联感知、规划与多个原语操作,因而轨迹调用难以预测。随着智能体探索、反思并以修改后的策略重试,会话会在不规则的时间点被创建、暂停与销毁。这导致 GPU 推理需求呈突发性,批大小与到达间隔方差很大,使得静态资源分配与请求调度效率低下。
「当时我们的算法团队、Infra 和 Agent 团队拉了好几次会,在这个问题上大家有争论。其实只是大家考虑的点并不在一个层次上。系统和算法之间虽然沟通较频繁,但因各自职能,大家想的是各自部分的效率最大化,思维方式有的时候不是特别一样。」
好在,这是曹婷团队的老本行。
「我们先前已在这方面有了非常多的技术积累,比如低比特量化模型部署、KV Cache 统一管理、任务并发中的设备调度等问题。原先在微软,我们组也是负责让微软大模型在手机、PC 这种端侧设备上,在有限的硬件资源下达成高速执行。在系统优化上,我们会把它们全部放进去,所以最后这些技术全部得到很好的应用。」

最后,团队选择把上层算法和下层硬件解耦开来。算法团队仅关注 Rollout 完成率,而无需顾及 GPU 计算资源分布;系统团队整体处理、下发机器人请求,协调计算资源。负责环境的 Worker 主要管理仿真环境、会话和物理状态,另一部分 Rollout Worker 则负责 VLA/WAM 的模型推理、异步调度,底层则以各种各样的硬件为支撑。各司其职之后,Z-Infra 的架构也变得清晰。
机器人,何以反思闭环
有了底层设施与大脑之后,联通二者的工程「脚手架」亦不可忽视。Harness 的职责,是监控模型能否正确、持续地执行任务。从 Claude Plays Robots,到如今 ,GPT-6 Astra 也可以指挥具身载体进行操作,大模型与 Harness 工程之间的联系越发紧密,也更贴近应用场景。
然而,要进入物理世界的具身交互,却不那么容易。近期的物理智能研究中,其中一条路径是训练用于通用机器人控制的端到端策略模型,该路径虽然前景可观,但真实部署暴露出了数据昂贵、物理分布会漂移、微小的执行误差在长时程任务中会级联放大等缺口,限制了端到端模型从示范走向真实世界的进程。
第二条路径则探索具身智能体能力,即在基础策略周围使用 LLM、代码、工具、记忆、规划、验证与恢复来填补这一缺口。早期系统如 PaLM-E 与 Code as Policies 展示了语言模型在具身推理与规划方面的潜力,而 RoboCat 则表明智能体可以通过跨任务、跨本体地收集自身尝试所产生的数据来扩展其操作能力。近期包括 Claude Plays Robotics、CaP-X、HarnessVLA 与 Guava 在内的系统演示进一步表明,编码智能体与执行框架可以让冻结或预训练的机器人策略变得更可靠,而不必等待端到端策略被彻底解决。由此发现,当前的技术前沿正从只依赖单一端到端策略,转向协调策略与规划、记忆、工具、验证、恢复的脚手架系统。
具身智能体的设计难度则进一步增大。由于它们在连续世界中运行,Harness 必须同时评估机器人状态与世界状态,决定何时调用策略、工具、评判器或恢复模块,并防止早期错误演变为难以恢复的物理失败。此外,考虑到当前 VLA 在其原生数字领域中的能力与可靠性都远弱于前沿 LLM,具身智能体不可避免地需要更多的外部工具来支撑任务的稳健执行。于是,许多具身智能体仍然是「回合式」的:它们可能在一次试验内完成恢复,却很少把执行轨迹转化为受治理的长期改进。
局限还来自于硬件方面。由于大模型本身的参数过大,无法以高效的方式完整地塞入端侧,具身层面的推理延迟非常大。既然无法实时调用云端大模型进行毫秒级响应,便只能做有限的事后归因,即把任务执行的完整轨迹发给大模型,并让它分析复盘。

突破口在哪?
Zetta 物理智能体反其道而行之。它在保持基础策略模型冻结的同时,在线进化基于代码的运行时评判器与恢复技能,从而弥合了静态开环智能体支架与物理执行所要求的高频治理之间的鸿沟。通过动作级纠错、批量经验优化和验证门控更新三重闭环,该智能体能实现长程任务中的在线纠错与技能沉淀,让机器人在复杂场景中持续纠偏并积累经验。
曹婷团队首次提出的 Code-based Experience, 能让 Zetta 智能体以纯代码方式执行动作级别的监督。执行完的数据回收到服务器端,进一步用于 Harness 和模型自身的提升。当模型执行出错时,Zetta 智能体将会主动介入、分析 Harness 出错的原因,并生成非常轻量、适合本地运行的 Critic 代码。这些代码将和上下文一起被存储为记忆,一旦卡住,就会触发监管功能,快速容错,并将任务完成。

以夹水杯为例,最开始,Z0 机器人并没有成功地夹起水杯,反而由于用力过猛,水杯被捏爆了。随后,模型进入失败反馈 ReAct Loop,重新调整抓取位置、夹持力度与动作轨迹。经过多轮的因果反思和动作验证,Z0 机器人已经可以在不损坏载体的情况下完成任务,并将该经验通过 Scene Memory 写入工具记忆库。

将 Zetta 物理智能体部署在 LIBERO-Pro 执行任务,成功率提升明显。与其他 SOTA 相较,在 LIBERO-Pro 上,Zetta 在不同类别任务中取得 92.5% 与 89.0% 的平均成功率,在对应的 LIBERO-10 设置上,成绩为 63.0% 与 40.0%。较 π 0.5 模型,Zetta 具有更加优越的表现。
对 Zetta 而言,学会「反思」是其特点。 任务执行中,Zetta 非但没有出现动作漂移,反而精度能随着学习轮次上升而有所「顿悟」,迎来「Aha Moment」。智能体会对作出的每一步动作中有可能出错的地方去反思,从而让机器在过程中不断地调适、理解任务应以怎样的动作、精度执行。 突破事后归因的既有思路是 Zetta 成形的关键。
「之前也有很多人尝试让机器人自己做很多成功或失败的轨迹,把它丢给大模型,通过反思自我改进,效果不尽如人意。」
实际上,这种事后归因的方法对机器学习而言无异于刻舟求剑。由于事后分析普遍很难对失败场景和行为进行完整的重建,大模型通常只能依靠猜测的方式去进行学习,效率大大降低。而目前在 Z0 机器人上部署的模型则更多强调在线自学习,智能体会反思每一步动作中可能出错的地方,从而让机器在过程中不断地调适、理解任务应以怎样的动作、精度执行。
曹婷团队对错误的归因分析过程与上述方法很不一样。对于模型来说,它可以更新梯度,在优化空间里接近最优解。Zetta 学到的监督信号是一个函数或技能,它把全过程通过模拟还原出来, 这种方式能保证成功率持续上升。
「拿到执行轨迹之后,我们首先会把它分组。分组的目的,是能够把错误的原因分类,至少不会因为一些小的区别,就让大模型在分析归因的时候产生一些误解。随后排序,看哪些问题是共性的、很严重的,会导致后边也出错的。然后我们再提出纠正的方法。这些方法提出之后,我们又会返回去评测,看提出的方法是否有效。」
经过多次纠错、迭代之后,这个方法将会录入监督库,作为永久记忆保留在智能体中。同时,对技能库的常态更新维持着非常严格的标准,并不会因为某一轮机器人的随机表现便导致技能库被污染。
「就像我们人自己去做错一件事,要去分析今天哪里错了,我们还要去尝试一下——哦,有可能这里有个 Bug、那里有个 Bug。直到它学习、推演了一段之后,才终于顿悟式地发现:哦,原来问题是在这里,这是最核心的问题。机器意识到根因在哪,成功率就会飙升。这就跟大语言模型当时为什么叫 Aha Moment 一样——它突然意识到,之前做错好像是这个原因导致的。」
全新 Zeva-Ego 模型背后

在这次会上正式发布的 Zeva-Ego 模型,其最突出的特点是首次使用无标注 Ego 数据来提取物理经验。 曹婷团队使用了 1 万小时无标注的第一视角数据来提升泛化能力,把离线因果经验和在线上下文这两条学习路径,正式合并为自进化的双轨体系。

Zeva-Ego 采用 π0.5 作为视觉 — 语言 — 动作基础模型。VLM 负责理解场景、理解任务、预测下一步子任务;动作专家负责生成模型具体的连续动作。曹婷团队首次实现了在数据无标注的前提下,从 Ego 数据中高效地抽取因果。
「我们针对新模型前面加了一个 Action-Centric Encoder —— 它不仅能从机器人自己的动作里学,还能从 Ego 的第一视角操作里去学因果。通过这套方法,才能够把异构数据的数据效率充分发挥出来。」
与上一代 Zeva 模型的最大区别是训练数据的丰富。实际执行中,来自人类的 Ego 数据会与其他已标注数据、分析数据一起做中训练,基于现有的预训练语言模型或 VLA 模型,通过中训练做因果增强。随后,再用任务数据做后训练。推理阶段,Zeva-Ego 只被允许用机器人自己的真实接触去学上下文因果。
这种方式让 Zeva 的数据吸取效率非常惊人。4 – 5 小时的异构数据约等于 1 小时真机数据,首次验证了 Ego 数据的学习效率。这不仅使得模型在自有真机实验中的成功率从 0% 涨到 60%,还因 Ego 数据可作为中后期训练数据、无需标注,使真机数据的采集成本大幅下降。
曹婷教授透露,在 Zeva 模型验证了上下文因果学习的可行性之后,Zeva-Ego 的开发工作很快就在内部提上日程,二者开发工作一度并行。Zeva-Ego 不仅进一步提升 Zeva 对物理因果的推理能力,把更宽泛易得的数据类型纳入训练后,智能表现还大幅提升。在 Ego 数据量从 0 到 1 万小时的区间内,RoboTwin 的成功率就从 63.8% 增长至 75.3%;与 π 0.5 模型相较,Ego 后训练的真机成功率也呈断层式领先。以人类数据与机器数据相结合,Zeva-Ego 从中吸取到了失败与成功背后最本质的原因。这表明,模型在数据增长中提炼经验,形成有效的智能涌现。
「如果只用 10 条真机数据,它的成功率是 0;但我们再加 40 条 Ego 数据进去之后,成功率一下就可以到 60%、70%。学习效率是非常高的。」
效率之外,Zeva-Ego 的路线验证让数据成本也可大幅降低。从人的第一视角视频入手,单人就可以随着日常工作带着摄像头不断采数据,相比于需要本体参与、配备遥操作设备的方式,花销明显降低。
「我们实际做下来也知道,人的操作是非常快的;但只要一涉及遥操作,就涉及要去买本体、要有各种遥操作设备,花销非常大。所以我们把机器人数据的用量很大程度地降低,把人的操作数据提升上来,结果发现效果还更好。」
曹婷教授表示,团队已为 Zeva 准备了较长的未来路线,相关成果都在预期内获得理想结果。
「跑通 Zeva 后,Zeva-Ego 就快了很多,因为我们这套自进化的范式已经打通了。后面遇到的是一些小问题,比如让我们的编码器在 Ego 这种真人操作的数据里面能更有效。」
为了更好地抗干扰,团队在 Zeva-Ego 的训练中采用了两阶段的学习方式。 第一阶段 ,团队用标注过的动作数据显式地将动作和环境干扰的成分区分开。当摄像头受到本人操作(如点头、摇头)干扰时,这些干扰数据会被单独隔离开、放到环境通道,显式地把「行为」和「人无意识地移动摄像头」分隔开。进入 第二阶段 ,团队再把无标注的 Ego 数据,通过第一阶段训练好的编码器,把人的无关动作和真实的手部、手臂产生的动作分割开,排除干扰。
「让人类 Ego 数据中的干扰被剔除、有效容纳进来,这是我们在推进 Zeva-Ego 时遇到的最大挑战。」

实际测评中,Zeva-Ego 在 RoboTwin 2.0(Hard)多项任务指标中的表现普遍优于 π0.5、Fast-WAM 等其他模型。

扩展 Ego 数据使得模型的性能变得更加强大,加强了泛化能力。以化学实验室场景为例,目前的 Zeva-Ego 已经可以完成添加试管溶液、滴定测试 pH 值等长程任务。这让域变换的具身模型规模化落地又加快了一步。
要做机器劳动力时代的 Infra
域变换(Z-Trans)的技术愿景明确。作为清华大学智能产业研究院(AIR)面向物理智能自进化时代孵化的前沿科技创业公司,域变换致力于打造「具身自进化」的底层技术,让机器人在真实物理世界中越用越强,推动具身智能从「能做 Demo」向「能持续可靠完成任务」的产业落地。
而随着 Zeva-Ego 模型的发布,域变换仍在解决当前具身智能在跨本体、长程任务执行、经验回流、真实闭环等方面的问题,以进一步提升物理 AI 的自进化。在 ICCL 的范式下,Zeva 模型仍有长足的进化空间。

曹婷认为,长程任务最主要的难点不光是时间的持续,还在于原子操作组合的成功率需要随着监督信号的增强而逐步提高。为此,未来域变换还将发布针对特定落地局限的优化模型,以及更多相关技术成果。
「最近业界也慢慢有声音出来了。随着数据量增加,本体之间的差异展现出来的并没有那么大。这也是我们把 Ego 数据放在中训练阶段的原因。原来大家讲的是具身的数据金字塔:先训人类操作的这些 Ego 视频,再去训机器人的操作数据,然后再去训针对当前场景的遥操作机器人数据。越到金字塔顶端,数据的有效性越高。但最近大家才发现,其实当机器人本身的数据已经足够多的时候,它慢慢学到的更多是一些通用的操作。至于本体本身,在这里其实已经不重要了。」

谈及域变换的首要任务,曹婷教授认为,域变换的技术链路验证当前已完成,公司整体走在明确的长程路线上。以实验室为例,域变换的自进化要先在一个场景内端到端地单点跑通,在高价值场景中形成全案闭环,完成标杆性的落地。随后,模型跨应用的算法能力要在不同场景中保证泛化性,最后再通过增加机器人的部署台数,让具身智能在一整套基础设施中长期、稳定地运行。
技术之外,域变换真正要打造的是完备的商业壁垒。从模型、Agent 到 Infra,机器人的大脑、技能经验库与跨场景泛化能力将形成以机器劳动力为核心的商业模式。未来,依靠 PSI 物理智能自进化体系,借助清华大学 AIR 的生态伙伴与新建的 Apollo 社区支持,域变换将在真机部署与场景扩展中积累强大数据资产,同模型厂商、本体厂商之间形成协调互补,占据业内有利生态位。
通过与清华大学化学系的最新合作,域变换正把 Auto Research 推向真实的科研场景,让机器人替代学生执行移液、称量、萃取等操作,将人从繁琐的工作里解放出来,实现科研过程的自动化。
「这也是我们更高的愿景 —— 加速科学实验的发展,去取得更高的科学突破。」
面向机器劳动力时代的基础设施,域变换的因果与未来皆值得期待。
