智东西(公众号:zhidxcom)


作者 | 王涵


编辑 | 漠影



8月的第一周,国内视频生成赛道格外热闹。



7月31日,MiniMax发布首款开源多模态生成模型H3;同一天,字节跳动推出Seedance 2.5,将单次生成时长从15秒拉长至30秒。



根据国际咨询公司Grand View Research估算,全球AI视频市场规模预计将从2025年的


45.5亿美元


迅速增长至2030年的


422.9亿美元


,复合年均增长率(CAGR)达


32.2%


,显示出极高的成长潜力。



新模型的轮番轰炸、千亿级市场的想象空间,AI视频生成赛道迎来了前所未有的高光时刻。



就在这个窗口期,北京AI视频生成创企Sand.ai悄然扔下了一枚深水炸弹——全


球首个千亿级MoE视频生成模型MAGI-2 Preview正式发布并开源








该模型总参数约


114B


,单次前向激活约


6B


参数。在最关心更新的Artificial Analysis的Image to Video榜单上,MAGI-2 Preview进入全球前十,排在第六位。



全球首个千亿级MoE视频模型开源!Sand.ai给视频生成Scaling找了条新路



优秀的榜单成绩和酷炫的使用案例是最容易呈现给市场的东西,但这个模型最大的价值,是其验证出了大规模MoE视频模型扩展的一条明路:


统一单流负责音画联合建模,细粒度MoE负责扩大容量,自研系统负责让千亿参数稳定运转。




而其中的奥妙,就藏在


模型层、架构层和系统层


的三层系统里。



一、视频生成赛道火热,技术却撞上两堵墙



2026年前5个月,国内AI短剧市场规模突破


220亿元


,全年有望冲击


400亿元


,用户超过


6亿


。视频生成赛道正在经历从“能不能做”到“能不能做好、做便宜”的关键转折。



需求端的爆发式增长,正在将基础模型的承载能力逼至极限,但视频生成模型的进化撞上了”


两堵墙“







一堵是容量。


模型要处理的人物、动作、镜头和场景越来越复杂,还要把对白、环境声和音乐放进同一次生成,需要容纳的信息快速增加。



以最直观的Token数为例,大语言模型中,一段1000字的英文短文大约对应1000多个token,中文的token消耗还要略高。



但视频完全是另一个量级。一张720P的图片在视觉编码器下会被切分成近千个patch tokens,而一秒视频包含24帧。



模型在处理一段几秒钟的视频时,需要同时面对几十万甚至上百万个视觉token,再叠加音频波形和文本指令,序列长度轻松达到纯文本任务的


数百倍







另一堵是成本。


面对如此庞大的token规模,也意味着每一次前向计算都要处理远超文本的数据量。并且,模型规模越大,训练所需的算力、跨机器通信量和推理费用通常越高。



继续放大稠密模型,单次生成调用的参数量也会同步增长。机器可能先被拖慢,效果却未必按比例提升。



面对同样的容量和成本问题,大语言模型已经用MoE探索出一条Scaling路径,这一方式是否能迁移到视频模型上呢?



早在2025年11月,Sand.ai就做了一个在当时看来“非共识”的决定——


将模型架构从Dense转向MoE


,8个月后,MAGI-2 Preview给出了答案。



MAGI-2 Preview 是一款统一音视频生成模型,即由一个模型共同生成画面与声音。该模型采用


Multi-Head MoE


架构,文本、视频和音频进入同一个Transformer,在每一层self-attention中持续交换信息,口型、表情、动作、对白、环境声和镜头节奏从生成开始便相互影响。






二、模型层:统一单流,音画同出



现有统一音视频模型常见两种路径,一类采用


多流架构


,让视频和音频进入不同的网络分支,再通过cross-attention或专用融合模块交换信息;另一类采用


级联方案


,分别生成画面和声音,再完成同步处理。



多流模型可以端到端联合训练,但独立分支、融合模块和模态专属计算路径会增加架构复杂度,产生更不规则的计算与通信。级联方案还要维护额外的接口与同步模块,音画关系需要经过多段链路才能建立。



在模型层,MAGI-2 Preview采用的是


单流架构


,即文本、视频和音频被放进同一个上下文,在每一层self-attention中直接交互。



也就是说,MAGI-2 Preview让声音、口型、表情、动作和镜头节奏


从生成开始便被共同建模


,更适合处理细微的音画对应关系。






统一主干还减少了多套模型串联带来的接口、延迟与维护成本。模型内部设有


共享专家


处理三种模态的共性特征(如场景语义、运动趋势),同时为文本、视频和音频保留了各自的


专属专家


,用不同分工处理三种模态的共性与差异。



文本、视频和音频在同一条生成链路中联合处理,无需维护彼此独立的生成主干和额外的跨模态融合模块。架构更简单,端到端延迟远低于多流串联方案。



三、架构层:把专家粒度做到极致



将MoE直接应用于视频场景,并非没有代价。



传统Expert Parallel先为token选出Top-K专家,再将token复制分发到专家所在设备,通信量随激活专家数线性增长,负载不均进一步加剧调度开销,序列长度达到视频量级时,稀疏计算带来的收益很容易被侵蚀殆尽。



更深层的问题在于路由对象本身。传统MoE为一个token的完整表示选择一组专家,相当于要求少数专家同时理解语义、动作、外观、声音等所有维度的特征,限制了模型对不同信息类型的分化处理能力。



这两个问题驱动Sand.ai重新思考MoE在视频模型中的实现方式,先前Multi-Head LatentMoE and Head Parallel这项工作给出了解决路径。



在通信层面,


Head Parallel


将跨设备通信前置到路由之前,按head分发数据,设备间传输的是形状固定的head表示,而非动态变化的专家token,主要通信量只取决于输入表示本身。



全球首个千亿级MoE视频模型开源!Sand.ai给视频生成Scaling找了条新路



在路由层面,Multi-Head MoE改变了选择对象。它将同一个token的


3072维


隐藏表示拆成


12个256维


的子空间,每个子空间


独立路由、各自选择专家





全球首个千亿级MoE视频模型开源!Sand.ai给视频生成Scaling找了条新路



MAGI-2 Preview正是沿这条思路,在36层主体网络中使用


Multi-Head MoE


,并围绕统一音视频扩散补齐了共享与模态专属专家、路由策略、跨节点Head Parallel、融合计算内核、混合精度和激活重计算,并将其推进为千亿参数统一音视频模型的可训练系统。



四、系统层:让几千个专家别堵在路上



Multi-Head MoE与Head Parallel解决了路由粒度和通信效率的问题,但从架构设计到大规模稳定训练之间仍有距离。



数千个细粒度专家在训练中产生的频繁路由决策、数据重排和显存搬运,对底层算子的执行效率提出了苛刻要求;海量专家的参数更新,也对优化器的稳定性构成了新的挑战。



为解决这一难题,Sand.ai在底层算子计算和训练稳定性两个层面自研了一套infra。



算子层面,Sand.ai开发了


高性能MoE kernel库MagiMoE


,覆盖路由、专家排序与专家计算的完整链路,将原本分散的步骤合并执行,减少中间结果与显存搬运,并针对Multi-Head MoE的计算形态优化前向与反向过程。MAGI-2 Preview当前采用其中经过大规模训练验证的Triton/BF16路径。



训练优化层面,MAGI-2 Preview采用


分布式优化器MagiMuon


,以Muon处理主体矩阵参数,以AdamW处理更适合常规更新的参数,并针对海量细粒度专家重新适配了参数组织与跨设备计算。这种混合设计让优化方法能够从中小规模实验稳定扩展至千亿参数MoE。



五、数据:预训练要看到真实世界,后训练才谈对齐



Scaling定律有一个经常被忽略的前提:


参数量增大,数据的信息密度也需要同步提高。




但提高信息密度不等于缩小数据集,过度清洗会让模型失去对复杂运动、特殊镜头、罕见主体和非典型声音的覆盖能力,最终参数规模的增长可能无法转化为真实场景中的生成能力。



因此,Sand.ai更强调


数据的规模、多样性与分布覆盖


。数据工作的重点从删减转向组织——通过更准确、细粒度的标注,让模型理解主体、动作、场景、镜头、时序以及音频与文本之间的对应关系。



保留更广泛的有效数据,比追求一个狭窄的“完美数据集”更符合Scaling阶段的需求。



相应地,预训练与后训练的分工也被重新定义。预训练负责尽可能


完整地覆盖数据分布


,后训练聚焦于


偏好对齐、可控性与产品适配





基础模型在预训练阶段学到的能力越完整,产品端依赖后处理去修补运动一致性、细节表现和组合能力的需求就越少。



结论:视频生成的Scaling Law,从此有了新写法



Sand.ai对Scaling的认知是:规模本身并不等于能力。模型参数的增长只是起点,真正的挑战在于——更大的专家池能否被足够丰富的真实数据所填充,更细粒度的路由结构能否被精确的标注所引导,更密集的计算需求能否被稳定高效的底层系统所支撑。



三者同时推进,参数规模的增长才具备实质性意义。



从这个思路出发,MAGI-2 Preview验证了一整条路线:统一单流负责音画联合建模,细粒度MoE负责扩大容量,自研系统负责让千亿参数稳定运转。Artificial Analysis的Image to Video榜单第六名就是这一路线最好的证明。



更可喜的是,MAGI-2 Preview全面开源,后续模型可以沿着这条路线继续扩大参数与数据规模,探索更长的生成时长,无需每次从头搭建训练系统。



视频生成的Scaling Law,从此有了新写法。