Meta大牛带清北00后天团!下一代Seedance长这样?
你想象过,你的行为能如何改变这个世界吗?
过去两年,AI爆发出了惊人的创造力。下一步,我们该如何与所创造的世界交互?
这正是Noiz团队成员们持续想象、持续创造的命题。
新团队,1/100成本
与他们的实时交互模型
2024年以来,AI内容生成迎来了真正的商业爆发。
OpenAI用ChatGPT打开了生成式AI时代;Midjourney、Runway、Pika、Luma、Seedance、PixVerse、Minimax H3、Wan3.0等一批生成模型快速崛起,AI视频、AI图片、AI音频相继完成商业验证。
随着AI内容生成进入商业化增长的快车道,资本也开始押注下一代AI。
李飞飞创办的World Labs完成10亿美元融资,几乎同时,杨立昆的AMI Labs也完成了10.3亿美元融资。
Google DeepMind、Meta、NVIDIA等科技巨头纷纷布局,行业的焦点,逐渐从「生成内容」转向「理解世界」。
然而,当这些模型真正进入产品时,AI领域迎来全新的挑战:
今天的大多数多模态模型,依然擅长生成(Generate),却无法实现沉浸式交互(Interact)。
它们可以按照指令生成一段视频、一张图片、一段语音,却无法持续理解环境变化,也无法随着用户行为实时响应。AI更像一个内容生成器,而不是一个能够持续参与世界的智能体。
更重要的是,交互远比生成昂贵得多。
一次内容生成,只需要完成一次推理;而实时交互意味着模型需要持续感知、持续推理,并在几十毫秒内不断响应。
GPU不再工作几秒,而是持续在线运行,推理成本往往比传统生成高出一个数量级。
这也是为什么,实时可交互多模态至今仍然很少真正进入产品。
就在这块空白里,一家成立数月的神秘团队Noiz,选择了一条几乎完全不同的路线——
他们训练出了新一代实时可交互多模态模型,推理成本仅为当前主流音视频模型百分之一。

技术新挑战
实时交互的AI生成
挑战
从创作到交互,这一步看似是音视频生成探索的自然延伸,在技术上却是另一个命题。
传统多模态模型回答的问题是:几到十几秒内,画面应该长什么样?一个任务,模型只需要交付一个结果。
但是,一旦内容可以被进入和改变,模型就必须同时回答更多问题:我刚刚做了什么,当前场景处于什么状态,这次操作改变了哪些条件,下一秒应该如何反馈,以及所有变化怎样以足够低的延迟连续发生?
运行一段可交互内容,模型要在每一次操作之后重新计算结果。用户向前一步、改变方向或碰到一个物体,后续画面声音都不能沿着原来的轨迹继续。系统既要记住此前发生过什么,又要让这次选择真正改变后续内容。
因此,实时交互的难点不只是速度。延迟再低,如果模型不能理解动作、维持状态、组织反馈,用户得到的仍然只是一段更快生成的成片。
Noiz要弥合的,正是单次生成与实时运行之间的gap。

解法
他们为此做了三个反常识的操作。
第一,不把内容看作一串文本的映射,而是看作一组持续更新的状态。
传统音视频在生成完成时,开头和结尾就已经确定。可交互内容则没有预先封闭的终点:人的每一次输入,都会改变接下来的运动、镜头、空间关系和内容分支。
这要求系统在同一条链路上完成动作理解、状态维护、生成调度和低延迟推理。任何一环跟不上,所谓「交互」就会退化成等待下一次生成。
第二,不再让语言充当所有信息的总翻译。
绝大多数多模态模型仍然先把画面写成Caption,把动作拆成Token,再交给语言中枢处理。这样便于统一训练,却也会压扁材质、距离、力度、方向和时间关系。
Noiz选择直接围绕事件建立表征:谁在移动,处于什么位置,作用于什么对象,又引发了哪些连续变化。
这一步很关键。因为实时内容无法等模型先写出一段解释,再决定怎样反馈。它必须在动作发生的同时,抓住最影响后续结果的关系。
第三,不与大型实验室正面争夺音视频基座,而是在基础模型之上构建实时交互层。

不同音视频模型负责生成视觉结果,Noiz的模型和工程系统则负责理解用户输入、保持状态连续、调度生成过程,并把一次操作转化为即时、可控制的反馈和空间沉浸感。
这意味着,Noiz不必提前押注哪一家音视频基础模型最终胜出。行业每一次画质提升、推理加速和成本下降,都会成为它的直接红利。
它真正要建立壁垒的,是基础模型普遍没有解决的部分:怎样把一次性生成改造成持续运行,怎样让内容记住此前状态,又怎样在条件改变后给出合理的新分支。
而这层能力还会产生一种互联网上极其稀缺的数据。
传统音视频数据只有「提示词—成片」;交互数据则包含完整过程:人向哪里移动,何时改变方向,在哪个位置停留,听到和看到什么,一次操作之后期待怎样的变化。
这些轨迹记录的不是人喜欢看什么,而是人希望内容如何回应自己。
模型由此学习的,也不再只是怎样生成一个结果,而是怎样根据连续行为不断修正结果。
成本控制背后
NOIZ的判断与创新
Noiz这里的判断是:随着Seedance、可灵、海螺等闭源和开源音视频模型继续提高质量、降低价格,多模态生成会逐渐成为一种标准化能力。只做出一段更漂亮的成片,长期很难构成独立壁垒。
所以他们想搭建的,是一层介于基础模型与最终体验之间的系统。
向下,它可以接入不同的音视频模型和内容资产,不被某一条技术路线锁死;向上,它把复杂的推理、状态和调度能力封装起来,让开发者直接构建可控制、可持续运行的内容。
这套路线可以概括为「感知—生成—交互—推演」。

感知,是判断用户做了什么、当前环境发生了什么;
生成,是调用合适的模型补全内容;
交互,是让每次输入都得到即时且连贯的响应;
推演,则是在条件改变后,计算多个可能分支。
前两步解决内容怎样出现,后两步决定内容能否被进入、操控和反复体验。
而要让这套系统不只停留在演示阶段,关键是对成本的极致控制。Noiz从训练数据和推理多端分别拆解成本。
训练数据上,针对最稀缺的空间音视频数据,团队自建了覆盖空间、材质与距离变量的采集管线,同时将物理仿真数据的成本压到极低。
真实采集负责保真,物理仿真负责穷举,一个锚定现实,一个补齐现实中无法遍历的组合,从数据源头降低专用模型的训练成本。
某种程度上,Noiz对音视频数据采集实现了仿佛取用自来水一般的、唾手可及的低成本。

更亮眼的差距出现在推理侧。
目前,Noiz的新一代实时可交互音视频模型推理成本约为当前主流音视频模型的百分之一。
这条路径已经被完整验证过。
上半年,从AudioX到AudioX-Turbo,团队把一个高质量的多模态输入音频基座压成了可实时运行的版本,计算量下降近两个数量级,效果不降反升。

横跨文本、图像、音视频到音频与音乐的十余项公开基准上,AudioX一个模型打满全场,部分基准刷新SOTA,领先第二名近一倍
这不是一次边际优化,而是来自技术架构本身的创新。
通过多模态之间的高效对齐、极致的蒸馏加速能力、最新的推理优化技术等等,系统能以更低的计算开销维持连贯、同步的实时生成。
只有成本降到这个量级,实时生成才能被反复调用、持续运行,从技术演示走向规模化产品。
沉浸式交互模型
与真实需求共生
当视觉、空间与声音终于能在同一个模型里共同演化,一个新的沉浸式交互内容基座也随之出现。
它不再只是为既有画面补上一条音轨,而是能让人进入一个可感知、可交互、会实时响应的世界。这正是Noiz团队成员一直以来的愿景。
Noiz团队组建于2025年底。
创始人陈伟嘉(Vega)曾在Meta Video team主导了杨立昆团队(FAIR)的ASR模型落地;后来回国以CTO身份创业,数年后公司被收购之后,此后,他先后在和TikTok开始带领Agent方向的技术探索,也是Github斩获37k Stars开源音频产品Mockingbird的作者。
联合创始人陈前来自北大元培整合科学实验班,曾是北大乐团的指挥、声部长与首席,上一段创业通过PLG将产品做到近千万付费用户、数亿元人民币年收入。
首席科学家Zeyue Tian是港科大音频方向博士、清华原创摇滚乐队贝斯手,他的开源音乐模型ChatMusician曾被杨立昆转发,他也是最早系统研究音视频联合生成的研究员之一。


团队成员来自Google、Dolby、清华、北大、港科大、CMU等机构,也包括Meta Llama多模态预训练项目的前核心成员;团队累计已发布超20篇顶会文章,引用数过万,多个开源项目累计数万GitHub Stars。

和许多研究型实验室不同,Noiz从第一天起就在创造收入。
这件事在Vega那里近乎执念,源头是上一段创业留下的遗憾:技术足够好,却没有从第一天就把商业化跑起来,最终被收购——世俗意义上的成功,但不是他想要的终点。
那段经历留给他一个判断:技术再好,如果不能进入高价值的真实使用,最后只能等着被别人定价。「收入是验证。闭门造车,才是真正的风险。」
所以这一次,产品从第一天就被推向市场。
目前,产品noiz.ai已聚集约两百万创作者,以音视频创作者为主——他们有专业诉求,也愿意为效果付费。
没有大规模的投放,产品收入仍连续数月保持高双位数环比增长,年化收入已到数百万美元规模;在开发者生态里,他们的Voice Skill长期占据Skills.sh上TTS同类第一。

创作者产品之外,同一套模型还以API与集成的形式,进入多家大型内容平台的生产管线。消费端与企业端两条通道,验证的是同一个底座。
更能说明问题的是下游:市场上已经有两家估值数十亿元人民币的3D生成平台,在生产环境接入他们的多模态能力,任意3D场景可以直接产出与几何、材质、距离相匹配的空间声场。
在Noiz,这已经是一套开始闭合的循环:超两百万创作者的真实使用沉淀出高质量偏好信号,专有采集管线和低成本仿真补齐数据的另一半;数据进入研究,研究又让产品变得更好。
商业化和研究在这里从来不是此消彼长,而是同一个循环的两段——用今天可以规模化的产品,供养一个十年尺度的目标。
下一代Seedance?
今天,大多数多模态模型仍然生活在Prompt里:用户输入一句话,模型完成一次音视频生成,任务随之结束。
但真实世界从来不会停止。
环境不断变化,人物不断移动,新的事件不断发生。真正的AI,不应该只是等待下一次Prompt,而应该能够持续理解环境,并对每一次变化实时作出回应。
所以,实时可交互多模态模型,真正改变的或许不是生成速度,也不是生成质量。
而是AI在内容里的角色。
它第一次不再只是内容的创造者,而成为内容的参与者。
从游戏,到AI Companion;从数字人,到互动影视;从教育,到未来几乎所有实时互动内容。
当AI能够持续理解事件、推演变化,并在几十毫秒内完成响应,它与人的关系也将发生改变——从旁观世界,到参与世界。
编辑:摩西
声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!
AI 中文社