英特尔:为开源多模态视频模型 MiniMax H3 提供 Day 0 支持,实现基于多卡 GPU 的部署方案

浏览23次 点赞0次 收藏0次

8 月 3 日消息,英特尔今日宣布,为新一代开源多模态视频模型 MiniMax H3 提供 Day 0 首发支持。

据介绍,英特尔锐炫 Pro B70 第一时间完成对 MiniMax H3 的适配,英特尔团队实现了一种基于多卡 GPU 的部署方案。该方案采用 Encoder 8 卡张量并行(8TP)、DiT 8 卡 USP(Ulysses Sequence Parallel,并结合 Layer-wise Offloading),以及 VAE 部署于 B70 GPU 的整体架构,实现了视频生成全流程的 GPU 加速

其中,Encoder 采用 8 卡张量并行完成文本编码;作为推理过程中计算量最大的模块,DiT 采用 8 卡 USP 并结合 Layer-wise Offloading 技术,使模型参数按层动态加载到 GPU,在突破单卡显存限制、降低模型常驻显存需求的同时,支持更大规模 DiT 模型的部署;VAE 则部署于 B70 GPU 上完成最终的视频解码。该方案兼顾了模型容量与计算效率,为大规模视频生成模型提供了更具扩展性的部署方式。

在此基础上,团队进一步结合张量并行(Tensor Parallel,TP)与 USP 的优势,开发了 2TP×4USP 的混合并行方案。相较于纯 8 卡 USP,该方案将 USP 并行度由 8 降至 4,并引入 2 路张量并行对计算进行协同加速,在保持模型扩展能力的同时,减少 USP 带来的通信开销,实现计算负载与通信开销之间更优的平衡,从而进一步提升整体推理性能。

获悉,团队还结合 llm-scaler-omni 项目的 XPU Kernel 优化,对矩阵乘法、注意力等关键算子进行了持续优化,进一步提升 GPU 的计算效率,持续降低端到端推理时延,取得了良好的优化效果。

相关阅读:

声明:本文转载自IT 之家,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯