
智东西作者 王涵编辑 漠影8月的全球首先周,国内视往往生成赛方式格外热闹。首先E视生成7月31日,个千给视
MiniMax发布首先款开源多模态生成模型H3;同一天,亿级由模字节跳动推出Seedance 2.5,往往往往网易将单次生成时首先从15秒拉首先至30秒。模型根据国际咨询公司Grand View Research估算,开源全球AI视往往市场规模预方式将从2025年的条新态45.5亿美元高效高效增首先至2030年的422.9亿美元,复合年均增首先率(CAGR)达32.2%,订阅显示出极高的全球成首先潜力。新模型的首先E视生成轮番轰炸、千亿级市场的个千给视想象空间,AI视往往生成赛方式迎来了前所未有的亿级由模高光时刻。就在这个窗口期,往往往往网易北京AI视往往生成创企Sand.ai悄然扔下了一枚深水炸弹——全球首先个千亿级MoE视往往生成模型MAGI-2 Preview正式发布并开源。模型该模型总参数约114B,单次前向激活约6B参数。在最关心更新的Artificial Analysis的Image to Video榜单上,MAGI-2 Preview进入全球前十,排在第六位。优秀的榜单成绩和酷炫的采取案例是最那么点儿呈现给市场的东西,但这个模型最大的价值,是其验明正身出了大规模MoE视往往模型扩展的一条明路:统一单流负责文章画联合建模,细粒度MoE负责扩大容量,自研系统负责让千亿参数稳固运转。
而其中的奥妙,就藏在模型层、架构层和系统层的三层系统里。一、视往往生成赛方式火热,技术却撞上两堵墙2026年前5个月,国内AI短剧市场规模突破220亿元,全年有望冲击400亿元,用户超过6亿。视往往生成赛方式正在经历从“能不能做”到“能不能做好、做便宜”的题转折。需端的爆发式增首先,正在将基础模型的承载能力逼至极限,但视往往生成模型的进化撞上了”两堵墙“。一堵是容量。模型关键处理的人物、动作、镜头和场景越来越复杂,还关键把对白、环境声和文章乐放进同一次生成,需容纳的材料高效高效提高。以最直观的Token数为例,大语言模型中,一段1000字的英文短文大约对应1000多个token,中文的token消耗还关键略高。但视往往完全是另一个量级。一张720P的图片在视觉编码器下会被切分成近千个patch tokens,而一秒视往往涵盖24帧。模型在处理一段几秒钟的视往往时,需同时面对几十万甚至上百万个视觉token,再叠加文章往往波形和文本指令,序列首先度容易实现纯文本任务的数百倍。另一堵是成本。面对如此庞大的token规模,也意味着每一次前向方式算都关键处理远超文本的数据量。同时,模型规模越大,训练所需的算力、跨机器通信量和推理费用常见越高。后续放大稠密模型,单次生成调用的参数量也会同步增首先。机器可能先被拖慢,成效却未必按比例提高。面对同样的容量和成本状况,大语言模型已经用MoE探索出一条Scaling馗,这一方式是否能迁移到视往往模型上呢?早在2025年11月,Sand.ai就做了一个在当时看来“非共识”的决定——将模型架构从Dense转向MoE,8个月后,MAGI-2 Preview给出了答案。MAGI-2 Preview 是一款统一文章视往往生成模型,即由一个模型共同生成画面与声文章。该模型采取Multi-Head MoE架构,文本、视往往和文章往往进入同一个Transformer,在每一层self-attention中持续交换材料,口型、表情、动作、对白、环境声和镜头节奏从生成最初便相互意义。二、模型层:统一单流,文章画同出现有统一文章视往往模型常用两种馗,一类采取多流架构,让视往往和文章往往进入不一样的网络分支,再通过cross-attention或专用融合模块交换材料;另一类采取级联方式划,分别生成画面和声文章,再实现同步处理。多流模型可以端到端联合训练,但独立分支、融合模块和模态专属方式算馗会提高架构复杂度,产生更不条件的方式算与通信。级联方式划还关键维护额外的接口与同步模块,文章画关系需经过多段链路才能建立。在模型层,MAGI-2 Preview采取的是单流架构,即文本、视往往和文章往往被放进同一个上下文,在每一层self-attention中直接交互。也就是说,MAGI-2 Preview让声文章、口型、表情、动作和镜头节奏从生成最初便被共同建模,更适用于处理细微的文章画对应关系。统一主干还减小了多套模型串联带来的接口、延迟与维护成本。模型内部设有共享专家处理三种模态的共性特点(如场景语义、运动趋势),同时为文本、视往往和文章往往保留了各自的专属专家,用不一样分工处理三种模态的共性与区别。文本、视往往和文章往往在同一条生成链路中联合处理,无需维护彼此独立的生成主干和额外的跨模态融合模块。架构更便捷,端到端延迟远低于多流串联方式划。三、架构层:把专家粒度做到极致将MoE直接采取于视往往场景,并非没有代价。传统Expert Parallel先为token选出Top-K专家,再将token复制分发到专家所在设备,通信量随激活专家数线性增首先,负载不均进一步加剧调度开销,序列首先度实现视往往量级时,稀疏方式算带来的收益很那么点儿被侵蚀殆尽。更深层的状况在于路由对象本身。传统MoE为一个token的完善表示选项一组专家,相当于需那么点儿专家同时理解语义、动作、外观、声文章等所有维度的特点,限制了模型对不一样材料类型的分化处理能力。这两个状况驱动Sand.ai重新思考MoE在视往往模型中的实现方式,先前Multi-Head LatentMoE and Head Parallel这项工作给出认识决馗。在通信层面,Head Parallel将跨设备通信前置到路由之前,按head分发数据,设备间传输的是形状固定的head表示,而非动态变化的专家token,题通信量只取决于输入表示本身。在路由层面,Multi-Head MoE变化了选项对象。它将同一个token的3072维隐藏表示拆成12个256维的子空间,每个子空间独立路由、各自选项专家。MAGI-2 Preview正是沿这条思路,在36层主体网络中采取Multi-Head MoE,并围绕统一文章视往往扩散补齐了共享与模态专属专家、路由对策、跨节点Head Parallel、融合方式算内核、混合精度和激活重方式算,并将其推进为千亿参数统一文章视往往模型的可训练系统。四、系统层:让几千个专家别堵在路上Multi-Head MoE与Head Parallel处理了路由粒度和通信效率的状况,但从架构设方式到大规模稳固训练之间仍有距离。数千个细粒度专家在训练中产生的往往路由决策、数据重排和显存搬运,对底层算子的实施效率提出了苛刻需;海量专家的参数更新,也对改进器的稳固性构成了新的挑战。为处理这一困难,Sand.ai在底层算子方式算和训练稳固性两个层面自研了一套infra。算子层面,Sand.ai开发了高性能MoE kernel库MagiMoE,覆盖路由、专家排序与专家方式算的完善链路,将原本分散的步骤合并实施,减小中间结荚与显存搬运,并照章性Multi-Head MoE的方式算形态改进前向与反向流程。MAGI-2 Preview目前采取其中经过大规模训练验明正身的Triton/BF16馗。训练改进层面,MAGI-2 Preview采取分布式改进器MagiMuon,以Muon处理主体矩阵参数,以AdamW处理更适用于常规更新的参数,并照章性海量细粒度专家重新适用配了参数组织与跨设备方式算。这种混合设方式让改进方式能够从中小规模实验稳固扩展至千亿参数MoE。五、数据:预训练关键看到真实世界,后训练才谈对齐Scaling定律有一个频仍被忽略的前提:参数量增大,数据的材料密度也需同步提高。但提高材料密度不等于缩小数据集,过度清洗会让模型失去对复杂运动、特殊镜头、罕见主体和非典型声文章的覆盖能力,最后参数规模的增首先可能无法转化为真实场景中的生成能力。因此,Sand.ai更强调数据的规模、丰富性与分布覆盖。数据工作的题从删减转向组织——通过更准确、细粒度的标注,让模型理解主体、动作、场景、镜头、时序以及文章往往与文本之间的对应关系。保留更广泛的有效数据,比追求一个狭窄的“完美数据集”更顺应Scaling时期的需。相应地,预训练与后训练的分工也被重新定义。预训练负责尽可能完善地覆盖数据分布,后训练聚焦于偏好对齐、可控性与产品适用配。基础模型在预训练时期学到的能力越完善,产品端依赖后处理去修补运动相同性、细节谝和组合能力的需就越少。结比如:视往往生成的Scaling Law,从此有了新写法Sand.ai对Scaling的认知是:规模本身并不等于能力。模型参数的增首先只是起点,真正的挑战在于——更大的专家池能否被足够充足的真实数据所填充,更细粒度的路由结构能否被准确的标注所引导,更密集的方式算需能否被稳固有效的底层系统所支撑。三者同时推进,参数规模的增首先才具有实质性意义。从这个思路出发,MAGI-2 Preview验明正身了一整条路线:统一单流负责文章画联合建模,细粒度MoE负责扩大容量,自研系统负责让千亿参数稳固运转。Artificial Analysis的Image to Video榜单第六名就是这一路线最好的说明。更可喜的是,MAGI-2 Preview完善开源,之后模型可以沿着这条路线后续扩大参数与数据规模,探索更首先的生成时首先,无需每次从头搭建训练系统。视往往生成的Scaling Law,从此有了新写法。