全球首个,连续时间具身世界模型!任意帧率自由生成

浏览26次 点赞0次 收藏0次

让机器人把一只虾夹起来,再放进锅里。

真正困难的,可能不是认出虾,也不是找到锅,而是把握夹爪闭合的那个瞬间:早一点,夹爪会落空;晚一点,虾可能已经被推走。夹住之后,机械臂还要连续调整力度、方向和速度。整个过程没有暂停键,也不会等摄像头拍完「下一帧」再继续。

但许多视觉世界模型认识时间的方式,恰恰来自这些被摄像头截取的画面。它们看到第1帧、第2帧、第3帧,并学习如何从一张图跳到下一张图。至于两帧之间发生了什么、换一种帧率后该如何预测,甚至某个关键瞬间缺失后如何还原,模型通常没有一条可以直接查询的连续轨迹。

问题也由此变得具体:

如果机器人对世界的理解只存在于一格格画面里,它要怎样抓住发生在两帧之间的那一瞬间?

来自清华大学智能产业研究院(AIR)与UC Berkeley BAIR的研究团队提出了ODEWorld——全球首个连续时间具身世界模型。它不再只问「下一帧是什么」,而是直接学习世界在每个时刻朝什么方向、以多快的速度变化,并由此还原一条随真实物理时间连续演化的潜空间轨迹。


论文链接:https://arxiv.org/abs/2607.27924

项目主页:https://dstate.github.io/odeworld_website/

这项工作的关键,并不是单独增加了一项「补帧」功能。只要模型掌握的是一条连续的变化轨迹,就可以在任意时刻读取状态:需要更高帧率时,从轨迹上增加采样点;观测缺失时,查询中间时刻;需要回看变化来源时,则沿轨迹反向求解。原本分散的生成能力,因此被统一成了同一个连续时间问题。

团队将这套预测范式称为Physical-Time Flow,简称PT-Flow;基于PT-Flow构建的连续时间潜空间世界模型,则被命名为ODEWorld。


离散预测的时间边界

设机器人在时刻t的状态表征为。传统离散模型通常学习一个状态转移函数:

其中c可以是目标图像或任务指令。

这种建模方式并非无效,但它将预测能力绑定在预先设定的时间步长上。训练视频按照固定频率采样,模型学习的也是相邻采样点之间的跳转。当查询时刻落在两个训练帧之间,或者输入序列缺少部分观测时,离散模型本身并没有一条显式的连续轨迹可供查询。

PT-Flow改为学习潜状态关于真实物理时间的导数:

这里的是潜空间速度场,输出当前状态在下一瞬间的变化方向和速度。给定参考状态z0后,未来状态可以通过常微分方程求解器积分得到:



静动态解耦

为速度场构造干净的潜空间

把视频变成连续方程,首先需要找到一个适合由ODE描述的状态空间。

在机器人视频中,大量视觉内容没有发生变化。桌面、墙壁和物体纹理可能连续数秒保持静止,真正推动任务进程的只有机械臂、夹爪、目标物体以及接触关系。若让速度网络同时拟合静态背景与少量运动区域,动态信号会被大量零变化或噪声特征淹没。

ODEWorld因此没有直接在像素空间中建立速度场。它首先使用冻结的DINOv2编码器,将图像压缩为视觉特征;随后再通过一组以初始状态为条件的动态编码器与解码器,提取真正负责描述变化的潜变量:


编码器和解码器都能直接看到s0。静态场景信息因此可以从参考状态中取得,zt没有必要重复保存背景,只需概括当前状态相对s0发生了什么变化。

这种解耦带来了非常激进的压缩:原始DINO特征大小为16×16×768,而ODEWorld的动态潜变量只使用一个1×768token。基于这个单token,速度场只需由一个轻量的三层MLP参数化,时间信息通过FiLM注入;zt、z0和目标条件c则共同决定速度网络的输出。


直接监督「状态怎么变」

拥有紧凑潜空间,并不意味着模型一定能学到稳定的连续动力学。潜空间世界模型长期面临的一个问题是表征坍缩:如果编码器把不同画面都映射到相似向量,预测器就很容易得到较低损失,但这些向量不再包含足够的状态信息。

ODEWorld的关键设计,是不只比较预测状态与目标状态是否一致,而是直接监督潜状态的一阶时间导数。

由于动态编码器满足,根据链式法则:


s0在一次预测过程中保持不变,因此它关于时间的导数为零。训练数据虽然只提供离散帧,却可以利用相邻特征估算。

再通过雅可比向量积(Jacobian-vector product,JVP),模型无需显式构造巨大的雅可比矩阵,就能把视觉特征空间中的变化速度投影到动态潜空间,得到。

速度网络的训练目标由此写成:


其中sg⁡表示停止梯度,用于稳定速度场优化。论文中的进一步实验显示,即使移除停止梯度,模型仍然能够有效训练,说明一阶速度约束本身已经为潜空间提供了较强的结构性约束。

这与典型JEPA式训练存在明显区别。后者通常要求预测潜变量接近目标编码器产生的潜变量,并依赖EMA、停止梯度或额外的方差与协方差约束来避免坍缩。

ODEWorld则把「状态如何沿时间移动」直接写进监督目标:如果所有状态都坍缩到相同表示,模型便无法解释非零的真实变化速度。

论文采用RankMe衡量表征的有效秩。在相同采样协议下,ODEWorld的768维动态潜变量平均有效秩为425.2;DINOv2 CLS特征为376.1;V-JEPA 2的1024维表征为203.7。

更高的有效秩意味着潜空间保留了更多彼此独立的变化维度,也表明单token并不等于信息贫乏。


Savitzky–Golay滤波

理论上,最简单的状态速度可以由相邻帧差分得到:


但ODEWorld使用的是冻结的DINOv2图像编码器。DINOv2主要为单帧视觉表征设计,并没有专门保证连续视频中的时间一致性。即便像素只发生轻微变化,相邻帧特征也可能包含高频抖动;直接将这些差分当作物理速度,会把视觉编码噪声一并交给速度场。

团队因此使用Savitzky–Golay导数滤波器估计。

它在局部窗口内进行多项式平滑和求导,在抑制高频噪声的同时,尽量保留接触、抓取和物体移动等关键变化。论文的潜轨迹可视化显示,ODEWorld生成的轨迹比原始DINO特征以及离散下一步预测基线更加平滑,同时仍保留原特征空间的主要几何结构。

这也揭示了PT-Flow的一个重要边界:模型学习的不是已知解析物理方程,而是在数据中寻找一个适合连续积分、又能保留任务语义的潜空间动力系统。它追求的是可用于未来预测的连续表征,并不是从视频中恢复唯一的真实控制方程。

一条速度场

统一三类生成能力

完成训练后,未来预测不再依赖重复调用固定步长的下一帧模型,而是使用RK4等现成ODE求解器沿速度场积分。查询时间点可以自由选择,由此自然产生三类能力。

第一是任意时间分辨率生成。希望动作更慢,就在轨迹上查询更多、更密集的时刻;希望快速推进,则减少采样点。模型无需为不同播放速度单独训练。


第二是时间补全。论文将训练序列降采样到原始帧率的三分之一,ODEWorld仍能查询训练数据未提供的中间时刻并生成连贯状态。这里的「补帧」并非简单的像素插值,而是从学习到的潜空间动力学轨迹中解码对应时刻。


第三是反向生成。将积分方向反转,即令,同一速度场就能生成物理上合理的反向序列。这并不意味着模型能够还原任意系统唯一、真实的历史,也不意味着所有现实过程严格可逆;它说明模型学习到的潜空间流可以在相反方向上进行稳定数值积分。


64帧预测更快

长程画面也更稳定

ODEWorld的效率首先来自表征空间的压缩。

它没有在高维像素或完整视觉特征上反复预测,而是将与运动有关的信息集中到一个动态token中,在这个紧凑潜空间里求解状态随时间的变化。大量与当前运动无关、在相邻帧中基本保持不变的背景和外观信息,因此不必在每一步预测中重复计算。

第二层效率来自速度场本身。

由于动态状态已经被压缩,负责描述潜状态变化率的网络只需要一套三层MLP,而不必依赖庞大的逐帧生成网络。ODE求解器先在低维潜空间中完成整条轨迹的积分,只有需要输出具体画面时,模型才通过动态解码器和图像解码器恢复视觉结果。

换句话说,ODEWorld把主要计算用在「世界如何变化」上,而不是在每个时间点重新生成一遍完整世界。

在LIBERO视频预测实验中,各方法的短时与长时预测结果如下。PSNR衡量预测画面与真实画面在像素层面的接近程度,数值越高越好;LPIPS更关注人眼感知到的结构与语义差异,数值越低越好。


短时的16帧预测中,ODEWorld达到20.53PSNR和0.109LPIPS;当预测范围延长到64帧后,两项指标仍保持在19.46和0.134,均优于LDP与V-JEPA 2。速度上的差距更直观。

生成64帧时,LDP的延迟为3.953秒,V-JEPA2为0.619秒,而ODEWorld只需0.072秒——约为LDP的1/55、V-JEPA2的1/8.6。

将动态表示压缩到单token,并用轻量速度场完成连续积分,不只是减少了模型内部的表示规模,也确实转化成了端到端预测效率。

从预测下一帧

到建模变化本身

ODEWorld最重要的意义,不只是极致压缩带来的性能提示,而是把世界模型的学习对象从「离散状态之间的映射」转向「状态随物理时间的变化率」。

静动态解耦为连续动力学清理了表征空间;JVP把离散视频中的变化速度投影为可监督的潜空间导数;单token和轻量速度网络则让ODE积分能够低成本运行。任意时间采样、缺帧恢复和反向生成,由此不再是彼此独立的功能,而成为同一条潜空间速度场的不同使用方式。

对具身智能而言,这种变化或许比「多预测几帧」更值得关注。机器人真正需要理解的,并不是静态世界由哪些像素组成,而是当它接近、接触并移动一个物体时,世界正在怎样变化,以及这种变化接下来会把它带到哪里。

当世界模型开始直接学习这种变化,预测未来才可能从逐帧模仿,进一步走向连续的动态推演。

参考资料:

https://arxiv.org/abs/2607.27924

编辑:LRST

声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯