清华校友出手!视频界首个千亿MoE开源,6B激活挤进全球第6
上个月,中国AI,让全球失眠。
先是Kimi K3雷霆出击,正面硬刚Claude Fable 5与GPT-5.6 Sol,成本却断崖式下降约40%。一夜之间,美股蒸发一万亿!
紧接着,DeepSeek-V4-Flash正式版掐点上线。整体性能虽不敌Claude Opus 4.8,但凭借极致性价比,直接斩杀美国一众大模型。

它们背后的MoE架构,早在35年前,就被「AI教父」Hinton和他的合作者提出了。
3年前,全球顶尖AI几乎集体转向这一架构。
但视频生成,始终被挡在门外。
现在,这道门被踢开了。
由清华特奖得主、Marr奖得主曹越领衔的Sand.ai团队,正式发布并开源——MAGI-2 Preview。

Github仓库:https://github.com/SandAI-org/MAGI-2-preview
总参数量高达1140亿,单次前向计算却只激活60亿参数。
这是全球首个开源的千亿级MoE统一音视频生成模型,但价格可以做到主流模型的1/10。
不只是「让图片动起来」
这次的MAGI-2 Preview更大,自然也更智能更强。
先看一段动感十足的中景demo:
阳光下的印度街头,女子身着红白金纹纱丽轻盈旋转,裙摆如花绽放。中景环绕跟拍捕捉流动身姿,舞步、衣摆与环境声精准咬合;从热烈起舞到俯身牵手,眼神与情绪转换自然,感染力十足。
再来看一段人物特写:
窗边冷白柔光下,极近特写缓慢推进,焦点始终锁定女子双眼。她从垂眸、抬眼到轻声开口、浅浅微笑,口型、呼吸与微表情协调。
这角色表演十分细腻。
最后,再看一段电影质感的视频。
雨中街头,低机位掠过水洼涟漪,镜头缓缓移向伞下女子,最终落在车灯映亮的侧脸。雨滴、倒影与环境声细腻同步,冷暖光影交织,克制的眼神变化营造出怀旧而真实的电影氛围。
从高保真音画同步、电影级运镜到细腻的角色表演,MAGI-2 Preview 精准对齐每一次开口、每一个动作与每一段镜头。声音、画面与情绪统一生成,让想象真正成为有节奏、有表演、有感染力的电影画面。

这到底怎么做到的?
114B的容量,6B的账单
过去,视频模型想继续变强,最直接的办法是把Dense模型做得更大。
但Dense有个问题,模型每加一层、每宽一点,每个视频Token都得从更多参数里穿过去一遍。
而视频偏偏是Token密度最高的模态之一。
一张图要拆成大量空间Token,一段视频还要再乘上时间维度;把音频加进来,序列只会更长。
所以视频模型一旦放大,先撞上算力、显存和多机通信的账单。
这就是他们从Dense掉头的直接背景。
曹越在此前采访中透露,团队做完Gaga-1发现,继续放大Dense视频模型,成本涨得越来越凶。

2025年11月,他们决定换条路。
在外界看来,sand.ai每一代模型都在押一个「非共识」。这一次押的是:面对视频生成里效果、速度与成本的三方拉扯,MoE可能是更合理的那条Scaling路径。
MoE会先判断当前Token需要哪些专家,需要谁,才叫醒谁。于是模型容量可以继续增长,单次计算量却不必同步膨胀。
这就是MAGI-2 Preview拥有114B总参数、每次只激活约6B的原因。但它没有止步于此。
一般的MoE,是从一组专家里挑出少数几个,处理当前Token的完整表示。少数专家需要同时处理这个Token的多类特征。

而MAGI-2 Preview则是把3072维表示拆成12个256维子空间,每个head独立从256个专家中选择6个。
因此,一个MoE层共有12×256=3072个head-local专家单元,每个Token实际调用12×6=72个。

Sand.ai把这种结构称为Ultra-fine-grained MoE,也就是超细粒度MoE。
这种设计的意义,是把「选哪个专家」变成一个更细的组合问题。
同一个视频Token,在不同表示维度上可以走完全不同的处理路径。模型不必在「调用一个大专家」和「不调用」之间做单选,而是能拼出更丰富的能力组合。
但专家拆得越细,下一个问题就越棘手——通信。
千亿级MoE到底怎么跑起来?
传统专家并行采用「先路由、再通信」。
模型先决定每个Token该去哪些专家,再把Token复制到专家所在的GPU。Top-k越大,跨卡搬运的数据越多;路由结果又随输入变化,通信量很难保持稳定。
视频序列本来就比文本长得多,MAGI-2 Preview又把路由细化到12个head、每个head选择6个专家。照传统方式继续扩张,瓶颈很快会从计算转移到网络。
Sand.ai设计的Head Parallel把顺序倒了过来:先通信,再路由。

在路由发生之前,模型就按头把固定形状的表示分发到各个设备。每个设备拿到自己负责的那个头之后,在本地完成路由和专家计算。
跨设备传输的数据量因此变得固定,不再随着Top-k激活专家数线性增长,也不会因为输入不同而剧烈波动。
Head Parallel把跨卡通信移到了路由之前。每个Token只需传输一次固定形状的head表示,通信量不再随着Top-k激活专家数线性增长,也不会因为路由结果变化而剧烈波动。
这解释了MAGI-2 Preview为什么敢把专家颗粒度继续拆细:专家可以更多、分工可以更细,但通信开销不必跟着同步膨胀。
围绕Head Parallel,Sand.ai还有两张牌。
MagiMoE,高性能MoE算子库,覆盖路由、专家排序和专家计算的完整链路,把原本分散的步骤合并执行,减少中间buffer和显存搬运。当前采用的是经过大规模训练验证的Triton/BF16路径。
MagiMuon,自研分布式优化器,用Muon处理主体矩阵参数,用AdamW处理更适合常规更新的参数,并针对数千个细粒度专家重新适配了参数组织和跨设备计算,让训练能从中小规模实验平稳扩展到千亿参数。
三者的分工很清楚:模型结构决定调用哪些专家,Head Parallel和MagiMoE负责通信与计算,MagiMuon负责大规模参数更新。
MAGI-2 Preview开源的因此不只是一个114B checkpoint,而是一条把模型、通信、算子和优化器共同推到千亿规模的系统路线。
细粒度MoE最怕的,是名义上拥有几千个专家,最后大家学得却差不多——真正决定专家分工的,不是数量,而是数据。
MAGI-2 Preview的数据管线从简单过滤转向广覆盖与细粒度标注,让不同类型的视频信息都能变成路由器可以学习的信号。
基础模型在预训练阶段覆盖得越完整,后训练就越不需要忙着修补运动、细节和组合能力,而能更多用于偏好对齐与产品适配。
3072个专家单元提供的是容量,数据决定这些容量能不能变成真正不同的能力。
到这里,模型容量、计算系统和数据管线才算真正接上。
画面和声音,是一起长出来的
省钱之外,MAGI-2 Preview还干了另一件事:统一音视频生成。
行业里不少「音画同步」方案,实际是两套模型串起来跑,先出视频,再配声音,后期缝在一起。声画两张皮,硬粘。
MAGI-2 Preview把文本、视频和音频放进同一个上下文,在每一层self-attention中直接交换信息;共享专家学习三种模态的共性,模态专属专家处理各自的差异。

口型、动作重音、表情和镜头节奏,从生成第一步就在被共同建模,而不是先出画面、再把声音缝上去。
这套单流音视频架构此前已在daVinci-MagiHuman中采用,MAGI-2 Preview又把它扩展到了千亿参数规模。
效果就是,口型跟台词对得上,动作重音和声音踩在同一拍,镜头切换时环境声跟着变。全程模型自己算出来的,没有后期拼接。
榜单和账单,一起算
聊了这么多架构,最终还是要回答两件事:有多强,有多贵。
能力上,MAGI-2 Preview在Artificial Analysis图生视频(含音频)榜单中拿下第六,Elo得分1106。
也就是说,一个只激活约6B参数的开源模型,挤进了一群几十上百B激活参数的闭源模型中间。

按8卡H100的月租金折算,蒸馏模型生成10秒视频约0.5元,约为行业主流模型的十分之一。
从几块钱降到几毛钱,对视频产品团队来说,已经是另一门生意。

35年前,MoE还只是Hinton等人论文中的一种设想。
35年后,它变成了一个拥有114B参数、每次只激活约6B,并且完全开源的视频生成模型。
语言模型走过的路,终于轮到了视频。
编辑:摩西 大卫
声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!
AI 中文社