60分靠数据,100分靠自进化:清华曹婷和「域变换」攻向机器人可部署
具身智能讨论的核心问题正在改变:从谁有更多数据能做出更强基础模型,转向谁能把机器人真正部署到现场,并让它持续做成任务。
具身智能的风向,变了。
过去两年,行业最热烈的争论围绕基础模型展开:VLA还是世界模型?端到端还是分层架构?谁拥有更多参数、更多数据和更强的zero-shot能力?
如今,当模型开始走出实验室,新的问题压过了路线之争:机器人能不能在真实现场稳定工作?
硅谷刚达成共识
清华已经动手了
在硅谷,这种变化已经成为一批研究者和投资人的共同感受。
投资人Georgi Koreli近期转述了Physical Intelligence联合创始人兼CEO Karol Hausman在一场闭门晚宴上的判断:机器人数据稀缺正在缓解,真正没有被解决的是从「能做」到「可靠完成任务」的最后一段路。
模型学的是复现数据集中的动作,企业要的却是任务成功。
从0到60%的zero-shot能力主要是数据问题,从60%走向可部署,还没人能解决。

而在国内,有一支团队更早押注了同一个问题。

2026年,从z0到Zetta ζ,再到Zeva,清华大学智能产业研究院(AIR)教授曹婷与她发起的域变换(Z-Trans)密集开源上下文因果学习世界模型、闭环在线学习Agent和支持全部署周期的训推基础设施,把研究焦点从「机器人出厂时会什么」,推向「机器人部署后还能学会什么」,并率先将这套面向真实物理部署的完整范式定义为:具身自进化。
为此与曹婷进行了一次深入交流。从微软亚洲研究院到清华AIR,再到发起域变换,她始终在追问同一个问题:如何让AI不只在论文和Benchmark里成立,而能在真实世界中创造价值?
答案藏在一次真实交互里。一只机械臂伸向透明塑料水杯,第一次用力过猛,第二次位置不对,第三次却调整动作,拿起了水杯,之后类似的杯子都可以成功抓起。
几次尝试之间,模型没有重新训练,权重也没有更新,却从与物理世界的交互中学会了下一次该怎么做。
一段在小红书播放数万次的机器人自进化视频:不更新模型权重,机器人凭与物理世界的连续交互,学会下一次做得更好。
这正是域变换试图攻下「可部署鸿沟」的方式:让机器人从「部署即定型」走向「部署后进化」,在真实工作中越用越强。
60分之后,决战部署
大模型的成功建立在一个极具吸引力的逻辑上:更多数据、更大参数量与更多算力,可以带来能力的持续涌现。于是,早期具身智能也开始复制这条路径:采集更多操作数据,训练更大的VLA和WAM模型,再通过微调适配不同任务。
这条路能够显著提高机器人的初始能力,却在走向真实部署时遭遇瓶颈。模型优化的是对数据中动作的复现,企业需要的却是任务稳定成功。于是,具身模型越来越多、Demo越来越惊艳,真正能够进入工厂、实验室和家庭长期工作的机器人却依然很少。
开篇所说的「60分」,不是适用于所有任务的精确及格线,而是对产业阶段的概括:预训练解决机器人基础操作能力,部署要求解决的却是它能否在环境变化、执行误差和长尾情况中「持续做成」。前者可以主要依靠离线数据提升,后者不能靠继续离线堆叠数据自然得到。
根本原因在于,物理世界持续变化无法被离线数据穷举。机器人面对的摩擦、碰撞、位置变化和执行失败,只会在行动中真实发生。每换一个环境就重新采集、fine-tune和部署,不仅成本高,也无法形成规模效应。
因此,从60分到可部署,缺的不是再做一次离线训练,而是一种新的能力:机器人能够在部署中利用真实反馈持续纠偏,把每次成功和失败转化为下一次行动的经验。下一阶段的竞争,也将从谁拥有更多离线样本,转向谁能率先建立这套部署后的学习闭环。
「自进化」在数字世界并不是一个新概念,软件Agent、博弈智能和大模型领域已经讨论多年。域变换率先明确提出和定义的,是具身智能在真实物理世界中的自进化范式:物理智能体在部署环境中持续交互,通过反馈与经验沉淀自主修正策略,并不断提升任务成功率。
域变换关注的从来不是机器人偶然成功一两次,而是它能否随着交互持续变强。因此,几乎在域变换发布的每项工作中,都会看到一条随交互次数增长的成功率Scaling曲线。

域变换具身自进化系统:Zeva与Zetta实现在线和离线模型及Harness学习闭环,Z-Infra以端云协同支撑全周期进化
它不是否定预训练,也不是不要数据,而是重新划定二者的位置:预训练是能力起点,部署是进化起点,真实交互则成为持续增长的数据来源。具身智能真正的「部署元年」,也不应只由出货量定义,而应由机器人能否在现场越用越强来定义。
曹婷的三次选择
理解域变换为什么会选择这条路线,需要回到曹婷过去十多年的研究轨迹。
她的第一次关键选择,是进入微软亚洲研究院,曹婷担任首席研究主管,长期研究边缘智能与神经网络训推系统。当时的核心矛盾是,模型能力快速增长,手机、PC和IoT设备的算力与存储却极为有限。曹婷带领团队攻克极低比特模型量化、基于查表的大模型高效推理等技术,使复杂神经网络得以进入微软Office、Windows、Bing等产品。据团队资料,相关技术服务了数百万用户,其研究也多次获得顶级会议最佳论文奖与ACM Research Highlights。
这段经历塑造了曹婷一个持续至今的判断:算法指标不是终点。只有当模型能够在真实硬件、真实成本和真实业务约束下运行,技术才完成了从论文到产业的跃迁。
她的第二次选择,是在2025年夏天加入张亚勤院士创建的清华大学智能产业研究院(AIR),研究对象也从有限硬件中的AI,转向不断变化的物理世界。大模型、VLA与机器人硬件的成熟,让具身智能从「可以想象」进入「可以做」。
但团队很快发现,模型在固定设置下能够完成动作,环境稍有变化就可能失败,失败中包含的宝贵信息又被传统系统直接丢弃。具身智能已经能做Demo,却仍难以真正部署。

刘云新和曹婷在清华AIR科研小组合照
曹婷的第三次选择,由此出现:与清华AIR副院长刘云新教授共同发起域变换(Z-Trans),把关于物理智能自进化的研究推向产业。
刘云新长期从事AIoT和端侧智能研究,IEEE Fellow,也曾任微软亚洲研究院首席研究主管。两位发起人的共同底色,是对「算法—系统—硬件」协同的长期积累。他们关心的不只是做出分数更高的模型,而是如何把模型变成能够部署、学习并长期运行的系统。
这也解释了「域变换」这个名字背后的野心:让智能不再被锁定在训练数据所定义的域内,而是在进入新任务、新环境和新载体后,能够通过交互完成适应与迁移。
从交互中,学会进化
域变换自进化闭环的内核是Zeva:不更新参数,也能从机器人的每一次交互中学习真实物理条件,并把学到的用于后续动作。
最近,Generalist G1.5、Skild S1等工作带火具身领域上下文学习:让机器人直接利用上下文中的示范与经验完成适应,拓展了模型对新任务的泛化性。
但现有上下文学习主要依赖人类示范。Zeva创新提出的是上下文因果学习(In-Context Causal Learning,ICCL):**让机器人从自己的交互轨迹中,提取其动作与状态变化之间的因果关系,同时过滤背景、光照等无关相关性。**机器人不是模仿别人做过什么,而是在当下部署物理条件下,理解自己的动作为什么成功或失败,并应用到下一次改进。

Zeva核心机制可以拆为三个阶段。
第一阶段是因果交互提取。Causal Transition Encoder(CTE)把视觉状态、执行动作和观察到的效果组合为「因果交互状态」,并进一步编码为任务阶段与交互信号。简单地说,系统不会只记住「夹爪移动了一段距离」,而是试图识别:机器人处在任务的哪一步,这个动作使物体发生了什么变化,这种变化是否推动任务向目标前进。
第二阶段是双时标因果记忆。Brief Interaction Trace(BIT)保留近期尝试中的动态信息,帮助机器人理解刚刚发生了什么;Persistent Interaction Memory(PIM)则在同一episode的多次尝试之间,按照相似度合并和巩固有用证据。前者像工作记忆,后者更接近可持续积累的经验。机器人既不会被一次偶然失败带偏,也不会在开始新尝试后把此前线索全部清空。
第三阶段是上下文策略注入。系统从记忆中检索与当前任务阶段相匹配的交互证据,为冻结的基础策略构造Causal Prompt。模型参数没有改变,但它每一次做决策时所依据的上下文已经不同。过去的交互被压缩成可供下一次推理调用的因果经验。
这条路线最反直觉的地方正在于此:模型不更新,能力却可以持续增长。
它把推理上下文变成了学习的通道,也把机器人真实发生的失败从「无效样本」变成可利用的学习信号。在Zeva公开的实验中,冻结模型在多个典型具身基准任务上的累计成功率从26%提升到73%;在RoboCasa365-Atomic5和真实化学实验室ChemLab-Evo评估中都在其他前沿VLA/WAM模型中取得SOTA。
从放置称量纸的误操作中提取因果关系,完成上下文内学习,提升任务精度。
更值得关注的是,人类演示也可以进入同一套上下文,进一步将成功率提升~10%。这意味着未来部署机器人时,「教会它一个新操作」有机会从漫长的数据采集和训练工程,变成更接近人类带教的过程:示范一次,让它尝试,在执行中纠偏,再把经验留下。
边执行,边纠错
Zeva让模型能够从交互中学习,但会学习还不等于能把任务稳定做完。真实任务是一条长链路:机器人要理解目标、拆解步骤、执行动作、观察结果,并在偏差出现时立即恢复。如果杯子第一步就没抓稳,后续「把杯子放进水槽」的计划再正确也没有意义。
近期Claude Plays Robotics、Aspire、Cap-X等工作开始探索用大模型监督具身任务,Agentic AI也把「规划—执行—反思」带入机器人领域。但真实世界不会停下来等待推理:每一步都调用大模型,几秒延迟就可能让环境状态发生变化;只在任务结束后复盘,又来不及挽救已经偏离的执行过程。
Zetta ζ瞄准的正是这个缺口。它以具身Harness连接基础模型、机器人本体和环境反馈,首次提出可演进的轻量critic,通过三重闭环,让在线闭环学习成为可能。

第一重是动作级纠错闭环。运行时critic持续监测机器人的物理状态,一旦发现抓取滑落、接触丢失或运输停滞,便立即触发恢复;只有故障解除、状态重新稳定,控制权才会交还模型继续执行。机器人不必等到整个任务失败,才能知道哪一步出了问题。
第二重是批量经验优化闭环。完成一批rollout后,Zetta ζ会聚类失败轨迹,定位最早偏离正常状态的时刻,再从评估、状态表征、规划控制到恢复策略逐层诊断根因,并自动生成critic、recovery与tool的候选更新。
第三重是验证门控更新闭环。候选技能不会直接上线,而要先通过历史回归测试和隔离数据验证。只有真正提升成功率、并能泛化到新场景的更新,才会进入技能记忆库,避免机器人只是「背下」某个失败样本。
这三重循环让每次rollout不再是用完即弃的执行记录,而能沉淀为经过验证、可以复用的技能。在团队公开结果中,Zetta ζ在有限rollout budget下,于LIBERO PRO和RoboCasa分别取得90.8%和93.6%的任务成功率,远超现有其他方法,且成功率随rollout持续增长。
更兴奋的是,增长并不总是均匀发生。机器人可能连续多次失败,却在一次关键探索后掌握恢复策略,随后稳定成功。团队将这种学习曲线上的能力跃迁称为机器人的「Aha Moment」。
如果说Zeva解决的是「如何从交互中学到因果经验」,Zetta解决的就是「如何在长程执行中监督、纠错,并把经验沉淀成技能」。Model与Agent由此协同起来,让自进化不仅发生在一次推理中,也发生在机器人持续工作的过程中。
Model、Agent、Infra闭环了
但用户并不关心机器人背后究竟用了VLA、WAM还是ICCL,也不会为某个更先进的技术名词买单。用户只关心结果:任务能否稳定完成,人工接管能否减少,部署成本能否下降,产出能否持续提高。用户最终愿意付费的,是真正的生产力。
要把模型能力变成这种生产力,仅有Zeva和Zetta还不够,还需要一套支撑规模化部署与持续进化的基础设施。具身智能行业经常谈数据飞轮,但不是所有数据回流都能形成飞轮。
如果机器人在现场产生数据,仍需要人工拷贝、清洗、标注、训练和逐台更新,那么数据越多,运维负担也越大。这更像数据流水线,而不是可以自我加速的闭环。真正的数据飞轮要求系统能够知道哪些数据有价值,低成本完成rollout与评估,把经验注入模型或上下文,再快速部署到设备上验证。
这就是Z-Infra存在的原因。按照域变换的技术版图,Z-Infra覆盖机器人从部署到持续学习的全周期,包括数据管线、环境rollout管线以及高效部署推理管线。它一端连接真实场景中的机器人,另一端连接模型与Agent,使「交互—判断—记忆—调用—再交互」能够持续运转。
三层能力由此形成一套完整架构:
Zeva Model负责把物理交互编码为因果经验,并在上下文中调用;
Zetta Harness负责在线执行、步骤监督、错误恢复和经验沉淀;
Z-Infra负责规模化数据流转、rollout和高效部署推理。
这套架构也解释了为什么域变换强调端云结合的能力。机器人与物理世界的交互对延迟极为敏感,关键决策不可能永远等待云端返回。自进化若要成为默认能力,就必须在有限算力、功耗和存储条件下高效运行。
曹婷过去在模型量化、查表计算与高效推理上的积累,在这里形成了一条连续的技术逻辑:过去是把更强模型装进有限硬件,现在是让持续学习与推理闭环也能进入机器人本体。T-MAC、BitDistiller、Pregated-MoE、LUT Tensor Core等系列工作,构成了团队从算法到底层系统协同优化的技术基础。
当Model、Agent与Infra同时存在,数据飞轮才可能真正开始转动:机器人部署越多,遇到的真实长尾问题越多;有效交互越多,形成的因果经验与技能越丰富;经验越丰富,新任务的适应成本越低;适应成本降低,又推动机器人进入更多场景。
这是一条与纯预训练不同的Scaling路径。前者主要在训练之前扩大数据与参数,后者在部署之后扩大有效经验。两者并不冲突,但后者更有可能决定机器人能否从标准产品进入千差万别的真实岗位。
从用户视角看,Model、Agent和Infra最终都应隐入后台。留在前台的只有一条持续向上的生产力曲线:机器人工作越久,成功率越高,需要的人类干预越少,单位任务成本越低。这才是具身自进化从技术概念走向商业价值的关键一步。
自进化赛道的四重壁垒
对投资人而言,技术方向成立只是第一步。更关键的问题是:为什么是这支团队?如果自进化成为行业共识,壁垒又在哪里?
域变换把机器人部署变成数据生产,把数据生产变成能力进化,最终形成随规模持续加深的护城河。
第一重是团队与生态壁垒。域变换由清华AIR孵化,继承了Apollo生态与产业资源,团队横跨前沿研究、系统实现与产业交付。这让域变换既能持续定义技术问题,也能将技术快速验证并推进到真实场景。
第二重是全栈技术壁垒。 Model负责学习,Agent负责执行与纠错,Infra负责把闭环规模化。三者缺一不可:没有Model,经验无法转化为能力;没有Agent,能力无法在真实环境中持续验证;没有Infra,真实交互无法规模化沉淀。
第三重是真实交互数据壁垒。 公开数据可以训练初始能力,却难以覆盖真实场景中的工艺、长尾和失败。我们将部署自进化过程中的「状态—动作—结果—纠偏」持续转化为可验证、可复用的因果经验,形成类似大模型 Thinking Data 的「具身 Experience Data」,成为传统轨迹数据难以复制的经验资产。
第四重是场景复利壁垒。传统机器人项目往往呈线性扩张:每增加一个客户,都需要重新进行大量工程适配。自进化则让每一次部署同时成为下一次部署的训练场。部署越多,交互越多,经验越丰富,同类任务的适应成本越低,形成能力复用带来的边际成本下降。

2026年6月6日,张宏江、张亚勤、Rahim Tafazolli、芮勇四位院士,以及清华AIR院长刘洋等共同发布z0,首次系统呈现域变换的具身自进化技术路线。对一家早期公司而言,这意味着两件事:一方面,域变换的技术路线拥有来自学术前沿与产业实践的共同支撑;另一方面,清华AIR与Apollo等生态能够帮助技术更快进入真实场景,在部署中获得最关键的交互数据。团队与生态因此不只是「背书」,也是启动自进化数据飞轮的第一批场景入口。
从z0到Zetta ζ再到Zeva,域变换在约三个月内连续补齐概念、Agent与模型框架。密集发布不是最终壁垒,却证明这支团队正在把「具身自进化」从一个名称推进为完整技术体系。
一个新赛道的定义者,往往不是最早喊出口号的人,而是最早给出完整技术语言、验证路径和工程系统的人。就此而言,域变换对「具身自进化」的争夺已经从概念进入产品与生态层面。
预训练之后,具身智能进入自进化时代
过去两年,具身智能完成了最重要的基础建设:VLA、世界模型与大规模机器人数据,让机器从「不会做」走向「基本会做」。正如Karol Hausman所判断的,数据稀缺正在缓解,模型和硬件也在到来。行业的核心问题因而发生了变化:下一阶段不再只是把预训练做得更大,而是把60分的基础能力变成可以长期工作的生产力。
这也是为什么2026年的「机器人部署元年」,不能只用出货量衡量。用户不关心背后究竟使用VLA、WAM还是哪一种Agent架构,只关心机器人能否稳定完成任务、减少人工接管、降低单位成本,并在工作中持续提高产出。用户不会为技术名词买单,只会为真正的生产力买单。

无锡复兴产业园部署搭载域变换z0智能体的导览机器人、送餐小车和巡检机器狗
就像Karol所说,具身智能的机会正在部署层:ROI、工作流集成、远程干预,以及从真实反馈中继续学习。它也可能不会迎来一个突然降临的「ChatGPT时刻」,而更像Waymo走过的路径——没有某一天所有问题同时解决,但随着可靠性和部署能力逐步跨过临界点,机器人会悄然进入越来越多真实岗位。
曹婷押注的,正是这一阶段。从Zeva的上下文因果学习,到Zetta的在线执行与技能进化,再到Z-Infra支撑部署全周期,团队已经跑通「交互产生数据—数据沉淀经验—经验提升能力—能力推动更多部署」的完整闭环。
这个闭环也自建了数据壁垒。机器人部署越多,积累的真实因果数据越多;经验越多,成功率越高,新任务的适应成本越低;成本越低,又能推动更大规模的部署。域变换由此把部署变成数据生产,把数据生产变成能力进化,并让护城河随着规模持续加深。
当域变换让具身智能的数据飞轮真正转起来,机器人产业也将从「交付机器」迈向「交付持续增长的生产力」。
关于清华AIR与域变换
清华大学智能产业研究院 AIR(Institute for AI Industry Research)由张亚勤院士创立,是清华大学面向第四次工业革命的国际化、智能化、产业化的研究机构,被视为中国AI产学研结合的第一梯队。
域变换(Z-Trans)是全球首家系统定义并落地「具身自进化」范式的物理智能公司,由清华大学智能产业研究院(AIR)孵化,曹婷教授与刘云新教授联合发起。公司直击行业「60分到可部署」的核心鸿沟——预训练让机器人「会做」,但真实世界需要的是「持续做成」。
域变换以Zeva上下文因果学习模型、Zetta在线执行与纠错闭环、Z-Infra训推基础设施三大模块,构建了完整的Model-Agent-Infra体系,让机器人在不更新权重的情况下,从每一次真实交互中自主学习、持续进化。
实验数据显示,Zeva将累计成功率从26%提升至73%,Zetta在LIBERO PRO上达90.8%成功率,且随交互持续增长。团队兼具微软亚洲研究院顶尖研究与清华Apollo产业生态双重基因,已形成全栈技术、真实因果数据、场景复利与生态入口四重护城河。域变换正将机器人从「交付机器」推向「交付持续增长的生产力」。

刘云新
清华大学智能产业研究院副院长、博导、万国数据冠名教授、首席研究员,国家级高层次人才、IEEE Fellow。前微软亚洲研究院首席研究主管,长期从事AIoT、端侧智能研究。
获得了MobiCom、MobiSys、SenSys等多个国际顶级学术会议奖励,以及CCF科技进步一等奖等奖项。

曹婷
清华大学教授,北京市高层次引进人才
前微软亚洲研究院首席研究主管,研究方向为边缘智能、具身智能等
获顶级会议最佳论文奖四次,工作入选ACM/Microsoft研究亮点等,其中ACM研究亮点由图灵奖获得者David Patterson亲自撰文推荐。
参考资料:
Zeva项目主页:https://air-embodied-brain.github.io/Zeva/
Zetta项目主页:https://air-embodied-brain.github.io/zetta/
曹婷个人主页:https://tingcao952.github.io/ Z-Trans
小红书链接: https://xhslink.cn/o/AKAgcCTCLqV
编辑:桃子
声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!