返回信息流
新闻事件
A重点81
DeepTech深科技
1 个来源

Sand.ai 开源全球首个千亿 MoE 视频模型 MAGI-2,成本大幅降低

Sand.ai 于 8 月 5 日发布并开源了 MAGI-2 Preview,这是全球首个千亿级 MoE 视频生成模型,总参数约 114B,激活参数仅 6B。该模型采用 Ultra-fine-grained MoE 架构,将文本、视频和音频统一在同一 Transformer 中生成,旨在降低视频生成成本并推动开源视频模型的发展。

SynthePulse Insight · AI 深度解读

Sand.ai 开源千亿 MoE 视频模型:成本降至十分之一,但挑战仍在

版本 1 · 1 个来源

8 月 5 日,Sand.ai 发布并开源 MAGI-2 Preview,总参数 114B、激活 6B,成为全球首个开源千亿级 MoE 视频生成模型。通过细粒度专家和 Head Parallel 架构,将 10 秒视频生成成本降至约 0.5 元,约为行业主流模型的十分之一。

  • MAGI-2 Preview 总参数约 114B,每次生成激活约 6B,是全球首个开源千亿级 MoE 视频生成模型。
  • 模型采用 Ultra-fine-grained MoE:将 3,072 维隐藏表示拆成 12 个 256 维子空间,每层 3,072 个专家,每个 token 激活 72 个。
  • 引入 Head Parallel 改变通信与路由顺序,先分发 token 表示再本地选专家,避免通信成本抵消稀疏计算收益。
  • 据 Sand.ai 内部测算,8 卡 H100 下生成 10 秒视频成本约 0.5 元,折算每秒约为行业主流模型的十分之一。
  • 在 Artificial Analysis 图生视频榜单上,MAGI-2 Preview 排第 6 位,进入第一梯队。
  • 开源使千亿级视频模型首次进入研究机构和企业视野,但部署仍需硬件和工程门槛。
展开章节目录视频模型为何难以扩大参数规模

视频模型为何难以扩大参数规模

视频生成模型的参数规模长期停留在十几 B 以内,最大不过二三十 B,而语言模型早已进入千亿甚至万亿参数。差距的根源在于视频序列远比文本长:一帧画面对应大量空间 patch,连续数秒的视频叠加文本和音频后,token 数量远超普通语言任务。

稠密模型中,每个 token 都要经过全部参数,参数增加会同步推高单 token 计算量,再乘上超长序列,训练和推理成本难以承受。2026 年 3 月 OpenAI 停止运营 Sora,很大一部分原因就是当时的架构和推理成本使大规模商用不具备经济可行性。

语言模型通过 MoE 将总体容量和单次计算拆开,但视频模型采用 MoE 时,传统专家并行需要先路由再通信,激活专家越多、序列越长,跨卡通信数据量越大,容易抵消稀疏计算节省的算力。

MAGI-2 Preview 的架构解法

MAGI-2 Preview 采用 Ultra-fine-grained MoE:将 3,072 维隐藏表示拆成 12 个 256 维子空间(head),每个 head 有 256 个专家并选出 6 个,因此每层共 3,072 个独立小专家,每个 token 每层激活 72 个。整个模型总参数约 114B,激活约 6B。

作为参照,DeepSeek-V4-Pro-Preview 每层 384 个路由专家、每个 token 选 6 个;Kimi K3 有 896 个专家、每个 token 选 16 个。虽然专家定义和任务不同,但对比显示 MAGI-2 的路由粒度更细,让动作、外观、声音和语义分别寻找适合的专家。

模型将文本、视频和音频放入同一上下文,共享专家与专属专家并存,从生成开始就相互影响,减少画面与声音串联时的接口和对齐问题。

工程系统与成本

数千个细粒度专家带来高频路由、数据重排和小矩阵计算,Sand.ai 开发了计算内核库 MagiMoE,将路由、排序和专家计算合并执行;训练由分布式优化器 MagiMuon 支撑,使用 Muon 处理主体矩阵参数、AdamW 更新其余参数,使训练稳定扩展到千亿规模。

据 Sand.ai 团队内部测算,在 8 卡 H100、按当前月租价格折算,不同推理配置生成一段 10 秒视频的成本约 0.5 元(蒸馏后模型),折算到每秒约为行业主流模型的十分之一。

成本下降一个数量级,使批量生成素材、多版本迭代等过去不经济的用法可能进入常规生产流程。

效果与开源意义

在 Artificial Analysis 的图生视频榜单上,MAGI-2 Preview 排第 6 位,一个激活参数仅 6B 的开源模型已进入第一梯队。Sand.ai 承认与最顶尖模型仍有差距,但证明了架构和系统优化能提升卡的利用效率。

开源使研究机构可以拆解细粒度专家分工,推理框架与芯片厂商获得新的公开工作负载;企业可将模型部署到自有环境,处理保密、版权受限的素材,并围绕特定人物和商品继续训练。

应用公司可在外部 API、本地部署和定制模型之间重新计算成本。但 114B 模型部署仍有硬件、通信、工程和运维门槛,开源改变的是参与边界,而非降低门槛。

行业格局展望

语言模型路径显示,开源模型只要进入可用区间,企业就会比较部署成本、数据控制、定制空间和供应商风险,闭源厂商也会面临降价和开放能力的压力。视频生成可能形成相近格局。

未来竞争将从生成质量延伸到价格、数据和开发工具,性能天花板不再单独决定胜负。MAGI-2 Preview 不会立即改写排名,但提供了千亿参数级的公开样本,供更多人拆解和验证。

可信度边界

本文主要基于 Sand.ai 官方发布信息及 DeepTech 的报道。成本数据(0.5 元/10 秒)为 Sand.ai 内部测算,未经独立验证;榜单排名来自 Artificial Analysis,但未提供具体评测细节。OpenAI 停止 Sora 的原因属于报道中的归因,非官方确认。

核心结论

MAGI-2 Preview 通过细粒度 MoE 和 Head Parallel 架构,首次将开源视频模型推上千亿参数,并将生成成本降至行业十分之一,可能改变视频生成行业的竞争维度。

主报道

DeepTech深科技

主报道来源