马斯克点赞的APP来了!刚下场视频世界模型,就拿下评测第一

浏览47次 点赞0次 收藏0次

模型吃掉应用的故事反了,「可以玩的抖音」开源视频世界模型。

过去几个月,实时视频世界模型突然成为一张拥挤的牌桌。

PixVerse、LingBot、阿里「快乐生蚝」、智象未来等团队,先后发布实时视频世界模型、Demo,并不约而同地把第一站指向互动内容/互动娱乐/ AI游戏。

它们讲述的故事高度相似:当视频能够持续生成、实时响应,人就不再只是观看一段内容,而是可以进入一个由模型生成的世界。

一个强烈的行业预期正在形成:视频模型正在越过AI短剧的边界,向互动娱乐腹地推进。

熟悉的味道,像是又一次「模型吃掉应用」的前奏。

不过,了解到一个特别的玩家打破了这个局面:

Loopit发布了实时互动世界模型Zing-0.5,在美团LongCat与复旦大学联合推出的可交互视频世界模型评测WBench中拿到第一。目前已经开源,并计划在2周内在Loopit APP(海外版)上线对应产品功能。


没有看错,就是那个以「可以玩的抖音」被外界熟知的Loopit,其产品上线后曾获马斯克点赞,两个月登顶欧美娱乐榜,累计融资1亿美元。

这家擅长做C端产品和全球增长的应用公司,反过来做出了自己的实时互动世界模型,并在公开评测中拿下第一。

模型吃掉应用的故事,似乎被反了过来。

但这次发布真正值得关注的,还不只是一个应用公司下场做模型拿到第一。

Loopit还提出了三个颇具争议的判断:

第一,空间探索与实时语义生成的联合控制,只是实时视频世界模型进入互动内容的入门门槛。

第二,纯实时视频流无法直接走到世界模型终局。多人、持续、可互动的数字世界,需要先由Code维护状态、规则和因果,再由 Pixel 完成开放的生成式渲染。这也是本次模型命名为Zing-0.5的原因。

第三,模应一体不是商业模式选择,而是走向端到端互动世界模型和构建互动内容产品的必经阶段,只有先把模型放进真实产品,积累「意图—行动—世界变化—用户反馈」的完整轨迹,未来才可能进一步把状态、规则和渲染统一进一个模型。

Loopit一边开源实时视频世界模型,一边戳破实时视频模型的「世界梦」。

它并不否认端到端的终局,而是提出了另一条抵达终局的路径:

先用Coding × Pixel把世界运行起来,再让端到端模型从这个世界里长出来。

开源github地址:https://github.com/seedleap/zing-world-model modelscope

模型下载地址: https://modelscope.cn/models/seedleap/Zing-0.5 huggingface

模型下载地址:https://huggingface.co/seedleap/zing-0.5

以下是了解和实测的详细内容。

Zing-0.5在公开评测WBench中拿到第一

一个可互动的世界,既要允许用户控制「去哪里」,也要允许用户决定「发生什么」。

Zing-0.5通过两条同时运行的控制链路,让用户一边用键盘或手柄探索空间,一边用自然语言改写接下来发生的事情。

Loopit将这项能力概括为「联合控制」:

空间操作决定用户去哪里;

语义输入决定世界发生什么;

两种控制共同作用于同一段持续生成;

新指令进入当前世界,而不是用一段新视频替换当前世界。

围绕这条控制链路,体验了五个逐步加深的 Case。

Case 1:飞行没有中断,巨龙开始喷火

在骑龙飞行约43秒后,输入「龙嘴巴喷火」。

火焰与烟雾随即出现,但巨龙仍沿原方向飞行,洞穴、瀑布和远处光源没有被重置。喷火结束后,飞行继续,前后仍是一段完整的世界演化。

骑龙飞行43秒后输入「龙嘴巴喷火」

Case 2:一句指令,同时改变人物和多座雕像

第二个Case把难度提高了一层。

在石像场景的第 14 秒,输入:

祈祷:主控人物跪地祈祷,所有人脸雕像睁开眼睛。

人物随即跪地,雕像睁眼并发光。角色继续移动时,原有人物和雕像仍保持各自的位置,玩家也可以继续观察结果。

这要求模型不仅理解「发生什么」,还要区分「谁发生变化」以及「哪些对象同时变化」。

主控人物祈祷,多座雕像同时睁眼

Case 3:第一条改写仍在生效,第二条指令已经到来

第三个Case从相同初始画面、相同操作轨迹和相同Prompt出发,将 Zing-0.5 与同类模型进行对比:

  • 第4秒输入「暴风雪」,改变全局天气;

  • 第22秒输入「远方人像睁眼」,改变局部对象。

难点在于,第二条指令必须发生在已经被暴风雪改变的世界里,而不是重新生成场景。

结果显示,在连续改写任务中,Zing-0.5 能够更稳定地把新指令写入当前世界。

相同起点下的「暴风雪—远方人像睁眼」连续改写对比,左侧为Zing-0.5,右侧为另一开源模型

Case 4:一直向前走,主角和通道还能保持原样吗

连续生成的难点,并不只是多生成几秒,而是不要越走越偏。

连续生成的难点不只是多生成几秒,而是不要越走越偏。

从相同画面出发持续前进时,Zing-0.5中老鼠的耳朵、体型和黄色背包基本保持稳定。同类模型则逐渐出现角色颜色、比例和形态变化,通道墙面和方向也明显偏移。

同起点、同操作下的持续前进对比,左侧为Zing-0.5,右侧为另一开源模型

Case 5:加入一朵蘑菇,不能顺手换掉整个世界

第五个Case选择了一个像素风格的游戏世界。

第7秒,输入:

一个蘑菇出现在前方。

两边都生成了蘑菇,但Zing-0.5延续了原有像素风格,角色、道路和远处建筑仍属于同一个世界。

响应Prompt和保持一致性是两种不同的能力。实时生成不仅要知道增加什么,也要知道什么不该改变。

像素世界中途生成蘑菇,左侧为Zing-0.5,右侧为另一开源模型

新指令如何进入一个正在运行的世界

五个Case测试的其实是同一个问题:新指令能否进入当前世界,而不是替换当前世界。

为此,Zing-0.5设计了两条独立、但共同进入Causal DiT的控制链路。


语言和操作两条链路共同进入 Causal DiT

移动、转向和视角变化等连续信号经过sin/cos编码与因果时序卷积,形成逐帧 action residual,并与对应视频token对齐。文本条件改变时,动作链路仍然连续运行,所以巨龙能够一边飞行一边喷火,人物也能一边移动一边观察环境变化。

训练时,Zing-0.5会在自回归生成中途切换Prompt:保留已经生成的视觉历史和操作历史,再用新的文本条件预测后续内容。

因此,「中途改写」不是在线推理时额外拼接的功能,而是模型从训练阶段就开始学习的能力。

action residual让世界继续运动,cross-attention把新指令写入当前生成;两者共同决定接下来发生什么。

连续生成,难的不是更长,而是接住自己的错误

很多视频世界模型最开始的几秒都足够惊艳,但角色持续移动、反复转动视角,再加入新的动作和事件后,误差会逐渐累积。

原因在于,模型后面看到的「历史」不再是真实视频,而是自己刚刚生成的结果。

为此,Zing-0.5会在训练中主动扰动部分历史画面,加入噪声、轻微模糊、颜色偏移和视角变化,模拟连续生成中的误差;训练目标则始终保持干净、正确。

模型需要从不完美的历史中判断:哪些是世界真正的状态,哪些只是生成偏差,并预测出更稳定的未来。

这套方法主要发生在训练阶段,不需要在线增加额外的纠错模型。它改善的不只是单帧观感,更是世界持续运行后的角色、结构和视觉一致性。


带扰动历史、当前扩散块与干净训练目标

5B、消费级显卡和六分钱:互动必须先过经济性这一关

一个世界即使能够被控制、能够连续生成,如果每次操作都要等待,交互体验仍然无法成立;如果每一分钟都需要昂贵算力,它也无法成为大规模消费内容。

在内部测试中,Zing-0.5使用单张RTX 5090生成视频可以超过24 FPS;按照线上服务对应的推理配置,一分钟流式视频的推理成本约为人民币6分钱。

为了实现上述极致的成本控制,Zing-0.5通过DMD将原本需要多轮计算的视频生成蒸馏至4步;推理时使用增量KV Cache复用视觉历史,只有用户更换指令时才更新文本条件。

5B 的模型规模同样是产品导向的选择。Loopit没有单纯依靠增加参数换取效果,而是把联合控制、一致性、实时性和成本放进同一个约束中。

模型不仅要生成Demo,还要进入真实产品,被用户持续使用。

然而,恰恰是在把实时视频能力做出来之后,Loopit团队更加笃定此前的判断——

实时视频不是世界。

戳破实时视频的「世界梦」:先让Code 维护世界状态

Loopit 技术联创Henry曾担任Seedance后训练负责人,他对实时视频路线的判断很直接:

「多人、持续、可互动的数字世界,需要稳定的状态、规则、记忆和多人一致性。这些不能在今天全部交给视觉模型完成。现阶段,需要由 Code 承载世界状态、Pixel 负责生成式渲染,先让世界真正运行起来。」

一座桥在画面中坍塌,并不代表系统知道桥已经不存在。一千个用户分别看到合理的画面,也不代表他们生活在同一个世界里。

画面只需要看起来合理,世界的事实却必须持续正确。

世界不是一串连续像素,而是一条连续的后果链

一个长期运行的世界必须知道:此刻有哪些实体存在,每个实体处于什么状态,什么事情已经发生,哪些规则仍然有效,一次行动改变了什么,以及不同用户是否共享同一套结果。

如果这些信息全部隐含在视频上下文中,模型每生成下一帧,都在重新推断「接下来最可能出现什么」。短时间内,它可以制造极强的世界感;但时间越长、实体越多、交互越复杂,视觉上的合理就越难等同于事实上的成立。

视频模型仅能预测下一帧,而Code能维护并执行下一世界状态。

AI Coding负责把人的意图转化为可以运行的实体、状态、关系、规则、事件和逻辑,并在用户持续行动后更新这些世界事实;生成式渲染器负责把世界事实转化为连续画面、声音、运动、材质和光照。

确定性来自可执行状态,想象力来自视频生成。AI Coding让世界成立,视频模型让世界被看见。

Zing-0.5当前完成的,正是后面这一半,这是「0.5」这个名字真正想表达的技术边界。

完整的Zing-1.0,将是AI Coding × 视频生成:行动不只改变接下来看到的画面,也改变世界事实;一次改变不只在当下出现,还会进入规则、角色、事件和其他参与者共同生活的世界。

为什么互动世界模型必须「模应一体」

为什么Loopit不直接采购外部模型,而要自己训练模型、搭建产品闭环?

Loopit CEO陈炜鹏曾是百川智能联合创始人和大模型技术负责人,他的判断是:

有成熟数据的领域,例如文本模型和文生视频模型,纯模型路线大概率胜出;

没有成熟数据的领域,例如自动驾驶和互动世界模型,模应一体路线大概率胜出。

大语言模型有海量网页,文生视频模型有海量视频。但互动世界模型需要的不只是画面,而是「用户想让世界怎样改变—系统如何响应—用户是否满意—接下来又做了什么」的完整轨迹。

这种数据不存在于现成数据集中,也很难靠人工标注获得。模型必须先进入真实产品,让用户用继续、退出、分享和Remix,定义什么样的互动真正有趣。

这可能催生一种介于短视频、游戏和社区之间的新内容形态:用户不只观看或选择分支,还能在体验过程中继续改变内容;一个人的行动和创造,也会成为其他人体验和Remix的起点。

新的内容形态既没有现成的好坏标准,也没有规模化训练数据。必须先有一个产品容器,让用户真正玩起来。

这就是Loopit所说的「模应一体」:

产品出题,模型解题,用户判卷。

产品把真实需求和失败转化成模型任务,模型迭代改善体验,再吸引更多用户创造和反馈。应用与模型共同生长,才能逐渐积累「意图—行动—反馈—后续选择」的独有数据。

为何Loopit如此笃定这条非共识路线?

梳理Loopit此前的访谈、产品迭代和公开信息发现,AI Coding × 多模态生成的Co-Design路线,以及「模应一体」的判断,并不是Zing-0.5发布后临时补上的叙事,而是团队此前反复提出并持续实践的方向。

这种笃定,很可能来自Loopit同时拥有两种很难出现在同一支初创团队里的视角。

第一种,是横跨Coding模型与视频生成模型的技术架构视角。

陈炜鹏和李施政来自百川智能,Henry曾负责Seedance后训练。这样的团队组合,天然能够同时看到两类模型各自擅长什么。

第二种,是来自大规模真实用户的新型互动内容需求视角。

截至发稿前,Loopit内部数据显示,平台已经拥有超过500万注册用户,用户创作了近1500万份互动内容,累计游玩超过20亿次,并产生近500亿次交互轨迹。

模型能力、产品场景和真实数据闭环,同时出现在同一个组织中。

这可能才是Loopit践行「模应一体」路线最大的底气。

是模型吃掉应用,还是从应用长出模型?

回头看,Zing-0.5的信息价值从来不在于Loopit又发布了一个实时互动世界模型。

真正值得讨论的是,这家公司正在对行业最流行的直觉提出反问。

当实时视频越来越逼真、越来越长,它就会自然成为世界吗?

还是必须先让Code维护状态和因果,让Pixel负责开放渲染,在真实产品中把世界运行起来?

Loopit并不否认端到端的终局。它的判断是:纯Pixel无法凭空抵达端到端。必须先有Coding × Pixel,先有真实运行的世界和用户交互闭环,才可能把状态、规则、因果与渲染进一步统一进一个模型。

因此,模型与应用的关系也被反了过来:不是先训练好一个世界模型,再寻找应用;而是模型先进入应用,从真实世界的运行和反馈中,逐渐长成更完整的模型。

从下一帧到下一状态,再从混合架构走向端到端,互动世界模型的路线之争才刚刚开始。

声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯