600倍加速,720p视频实时生成!单卡也能带的动14B模型
生成一段5秒720p分辨率视频,为什么要等数十分钟?
对14B级视频生成模型来说,高分辨率、长时序和强运动一致性提升了画质,也同步拉长Token序列,放大注意力计算和显存峰值。消费级GPU必须同时面对速度与显存两道门槛。
LightX2V团队面向Wan2.2-A14B推出LightWan2.2-A14B,以步数蒸馏、NVFP4量化感知训练和动态稀疏注意力压缩计算量,再用高效算子、细粒度卸载和多卡通信优化打通整条推理链路。
最终,14B模型可以在单张RTX 5090上高效运行。
8卡生成5秒720p视频时,T2V(文生视频)仅需3.8秒、I2V(图生视频)仅需4.5秒。相较原始40步模型,最高加速分别达到705.8倍和599.3倍。
5秒视频,最快3.8秒生成。T2V与I2V双双实现720p实时生成。
787秒→2.4秒
I2V 8卡 480p
2668秒→3.8秒
T2V 8卡 720p
705.8×
8卡最高加速
787秒→10.7秒
I2V 单卡 480p
2668秒→22.5秒
T2V 单卡 720p
118.7×
单卡最高加速

项目地址:https://github.com/ModelTC/LightX2V
模型地址:https://huggingface.co/lightx2v/LightWan2.2-A14B
博客地址:https://light-ai.top/LightX2V-BLOG/posts/LightWan22-A14B/
14B视频生成的两道硬门槛
速度与显存
随着视频生成模型的能力不断增强,画面质量、运动一致性和分辨率持续提升,用户的等待时间也越来越长。以14B级视频DiT为例,生成一段5秒720p视频可能需要数十分钟。对普通用户来说,这类模型也很难直接在消费级显卡上运行。问题集中在两点:一是生成慢,二是显存装不下。
1.为什么生成慢?
去噪步数多。Wan2.2通常需要40步去噪,相当于为一条视频重复执行40次完整DiT前向,等待时间也随之累积。
单步计算重。每一步都要执行大规模矩阵乘法。随着分辨率和帧数增加,视频Token序列迅速变长,而自注意力开销随序列长度平方增长。序列长度约120K时,自注意力可占Wan2.2-A14B单次DiT延迟的80%以上。
2.为什么跑不了?
显存峰值高。14B模型权重、长视频Token、注意力缓冲区和中间激活同时占用显存,峰值容易超过约30GB消费级GPU的容量,程序会直接出现OOM。
从40步到4步
最直接的提速方式,是减少必须执行的去噪步数。LightX2V采用Phased DMD,将完整信噪比区间拆分为多个阶段,让不同专家学习不同噪声区间内的去噪行为。
训练时,每个阶段只为一个采样步保留梯度,既避免完整多步反向带来的巨大显存开销,也缓解激进一阶蒸馏容易出现的多样性下降和运动弱化。
此外,LightX2V还引入了SGMD来加快训练速度,SGMD直接推动fake score向teacher score对齐,并用teacher stop-gradient Fisher构建稳定的分布匹配目标。随后通过NR/RC双势能分别进行外循环修正和内循环跟踪,让fake score跟上持续更新的生成器。
40步压到4步,意味着最重的DiT骨干少跑36次。Wan2.2最终形成“两步高噪声专家 + 两步低噪声专家”的4步推理流程。分阶段训练同时保留视频生成所需的运动动态、视觉细节与输出多样性。

Phased DMD与直接多步蒸馏、随机梯度截断方案对比
单卡路径:把14B模型装进一张RTX 5090
4步只是第一步。
要让14B模型真正跑在单卡上,LightX2V还要继续压缩每一步的计算量、访存流量和显存峰值。
NVFP4量化感知训练。
NVFP4采用E2M1 4比特数值,并以每16个连续元素共享FP8 E4M3块级缩放、全张量再配合FP32全局缩放,在接近FP4的存储与带宽成本下保留更强动态范围。LightX2V将量化感知训练直接融入步数蒸馏,让学生模型在训练阶段就适应4比特误差,再通过CUTLASS内核映射到Blackwell Tensor Core执行,降低线性层的显存流量与GEMM延迟。
动态稀疏量化注意力。
LightX2V先用Query/Key块级均值快速估计注意力重要性,再在运行时选择关键块,仅计算被激活的注意力Tile。
典型稀疏率达到80%—90%,即只保留最重要的10%—20%块。被选中的块内部仍保持稠密计算,兼顾稀疏收益与GPU吞吐。稀疏注意力算子进一步接入SageAttention2,形成更快的FP8稀疏注意力路径。
高效推理算子。
一方面,LightX2V面向 Blackwell 架构协同优化视频DiT的两大计算热点:在线性层、MLP和MoE中,采用权重与激活双NVFP4的Block-Scaled Tensor Core GEMM,以FP32累加和BF16输出兼顾吞吐与数值稳定性,并在 CUTLASS Epilogue 中融合列偏置,显著降低显存占用和带宽开销,同时减少额外 Kernel 启动。
在长序列自注意力中,Dynamic Sparse SageAttention 根据当前 Q/K 动态评估块级相关性,仅保留约 10% 的关键注意力块,并结合Q/K INT8、V FP8低精度计算,从而同时削减密集矩阵乘和注意力计算开销,实现视频生成端到端加速。
另一方面,将3D RoPE、RMSNorm等操作替换为高效并行或融合内核,减少Python调度、临时张量和内存往返,让“主干变快之后的外围开销”不再拖慢整条链路。
异步折叠Offload。
除模型级卸载外,LightX2V进一步提供Block级卸载,按Transformer块细粒度搬运权重,并通过计算与权重搬运的异步折叠(overlap),将数据传输开销隐藏在计算过程中,以更低的峰值显存承载14B模型和长视频序列。
单卡结果:T2V 720p由2668.0秒降至22.5秒,提速118.7倍。I2V 720p由2685.0秒降至26.7秒,提速100.5倍。
相同单卡条件下,I2V 480p与720p分别约为TurboWan2.2的3.5倍和2.4倍速度。14B视频生成由此进入消费级GPU的单卡可运行范围。
多卡路径:让720p端到端实时生成
实时生成的标准很简单:生成一段5秒视频,端到端时间必须短于5秒。
LightX2V在单卡优化栈之上采用Ulysses风格序列并行,并围绕All-to-All通信、QKV布局和Head级流水继续做系统级优化,让T2V和I2V共同跨过这条线。
Light-Ulysses:面向视频生成的高效并行方案。
基础Ulysses先把长视频Token序列切分到8张GPU,再通过All-to-All在序列维和Head维之间完成数据重排,让每张卡只计算部分注意力。
LightX2V围绕这条主链路做了四层优化:通信数据直接采用FP8,同时压缩QKV交换和注意力输出回传的数据量。QKV张量融合将Q、K、V打包成一个All-to-All载荷,减少Collective调用和重复布局变换。
Triton前后处理融合内核把QKV打包、布局转换、FP8量化/反量化和输出重排放到一组高效GPU内核中。
Head Parallel则按本地Head异步发起All-to-All,在当前Head计算注意力时并行传输后续Head,并在输出阶段继续流水化回传。
这些优化被整合到同一条Ulysses执行路径中,共同减少通信量、算子启动和同步等待,把基础序列并行改造成面向视频长序列的高吞吐执行路径。
8卡结果:T2V 720p端到端延迟降至3.8秒,最高加速705.8倍。I2V 720p降至4.5秒,最高加速599.3倍。两类任务的5秒视频生成时间均短于播放时间。
性能结果

T2V方面,单卡480p与720p分别实现80.7倍和118.7倍加速,8卡720p进一步达到3.8秒与705.8倍加速。I2V方面,单卡480p与720p分别为10.7秒和26.7秒。与同为4步、同为单卡的TurboWan2.2-I2V-A14B相比,分别约快3.5倍和2.4倍。8卡I2V在720p下达到4.5秒,跨过实时生成线。
T2V与I2V可视化
T2V 可视化
I2V 可视化
快速上手官方镜像
想直接复现上述单卡与多卡性能,建议从LightX2V官方Docker镜像开始。镜像提供更稳定的依赖环境。进入LightX2V工程后,可运行以下T2V/I2V脚本:
拉取官方镜像
docker pull lightx2v/lightx2v:26052801-cu130-5090单卡:文生视频 / 图生视频
bash scripts/wan22/extreme/run_wan22_moe_i2v_extreme.sh多卡SP:文生视频 / 图生视频
bash scripts/wan22/extreme/run_wan22_moe_i2v_extreme_sp_parallel.sh多GPU脚本已启用前述序列并行配置,并可按实际GPU数量设置seq_p_size。手动安装用户也可从LightX2V源码构建,并基于NVIDIA CUTLASS编译NVFP4 Kernel。
单卡T2V脚本:https://github.com/ModelTC/LightX2V/blob/main/scripts/wan22/extreme/run_wan22_moe_t2v_extreme.sh
单卡I2V脚本:https://github.com/ModelTC/LightX2V/blob/main/scripts/wan22/extreme/run_wan22_moe_i2v_extreme.sh
多卡T2V脚本:https://github.com/ModelTC/LightX2V/blob/main/scripts/wan22/extreme/run_wan22_moe_t2v_extreme_sp_parallel.sh
多卡I2V脚本:https://github.com/ModelTC/LightX2V/blob/main/scripts/wan22/extreme/run_wan22_moe_i2v_extreme_sp_parallel.sh
总结
LightX2V把14B视频生成的优化目标归纳为三个关键词:少算、少占、少等。
Phased DMD结合SGMD把Wan2.2的去噪过程从40步压缩至4步,NVFP4量化感知训练和动态稀疏注意力继续降低每一步的计算量。
CUTLASS/Triton融合内核和Block级异步Offload减少算子开销与显存峰值,使14B模型可以在单张RTX 5090上运行。多卡推理以Ulysses为主线,将FP8通信、QKV张量融合、Triton前后处理融合和Head级异步流水整合到同一执行路径,进一步降低长序列注意力的通信量和同步等待。
最终的性能表现如下:在8张RTX 5090上,5秒720p视频的端到端生成延迟降至T2V 3.8秒、I2V 4.5秒,均短于视频播放时长。相较原始40步模型,最高加速分别达到705.8倍和599.3倍。
单卡I2V在480p和720p下也分别达到TurboWan2.2约3.5倍和2.4倍的速度。720p实时生成已经成为可复现的工程结果。
参考资料:
[1] https://light-ai.top/LightX2V-BLOG/posts/LightWan22-A14B/
[2] Fan X, Qiu Z, Wu Z, et al. Phased dmd: Few-step distribution matching distillation via score matching within subintervals[C]. CVPR 2026.
[3] Wu Z, Gong R, Yong Y, et al. SGMD: Score Gradient Matching Distillation for Few-Step Video Diffusion Distillation[J]. ICML 2026.
编辑:LRST
声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!
AI 中文社