114B参数、6B激活,Sand.ai刚刚把全球首先个千亿MoE视往往生成模型开源了|路由|序列|moe|自然语言_网易订阅
作者:百科 来源:知识 浏览: 【大 中 小】 发布时间:2026-08-09 02:42:46 评论数:

鹭羽 发自 凹非寺量子位 | 公众号 QbitAI再牛的数BE视生成大模型,也关键放到行业面前公开露个面,激活才算真交卷。刚刚现下,把全就有这样一支清华系团队再展锋芒,球首千亿规模不大、先个序列实力却不小——抢先用MoE架构把视往往生成模型卷上千亿参数,往往代码权重还全!模型开!开源源!然语模型一出,言网易订阅直接刷屏国内外科技圈。数BE视生成那么大,激活那么强,刚刚说开源就开源。把全且先来看看生成成效一探究竟:视往往链接:https://mp.weixin.qq.com/s/Wtw4Ui4whdGEQ8vyWQ3Ipg如何?最近爆火的AI漫剧,声台形表四角俱全。亦或是来一场酣畅淋漓的首先镜头,视角跟随人物动作切换自如。视往往链接:https://mp.weixin.qq.com/s/Wtw4Ui4whdGEQ8vyWQ3Ipg闹归闹,商业场景也不在话下。视往往链接:https://mp.weixin.qq.com/s/Wtw4Ui4whdGEQ8vyWQ3Ipg光这运镜、对焦和人物谝,拉出去和闭源首先梯队同台PK,也照样能打。不卖关子了,这便是Sand.ai的最新力作——MAGI-2-preview。继Magi-1横空出世后,新模型又一次瞄准开源C位。模型总参数114B,单次前向只激活约6B。按8卡H100当下的行情算,关键生成一段10秒1080P视往往,其成本仅需5毛钱,差不多只有行业主流模型的十分之一。Benchmark排名也相当亮眼,MAGI-2-preview在AA视往往生成榜单排名第六。仅用6B激活参数,成效就已经特别接近首先梯队。好好好,这下视往往生成行业,又多了一个千亿级新变量。视往往模型Scaling不能照抄LLM这一变,直击视往往生成模型的Scaling路线。其实这个状况目前看来挺刚需的,做大模型,最怕的事情就是钱不够烧。文本模型倒还好,处理的都是离散token,叠参数、加算力,模型就能越滚越强。但视往往模型呢?面对的却是一整个动态世界。每一帧画面都关键被拆成大量空间patch,后续帧还关键记录人物动作、物体关系和镜头变化。如果再叠加文本、文章往往等材料,序列首先度直接超级加倍……如果还用稠密模型,Scaling的训推成本简直想都不敢想。模型关键更大、视往往关键更首先、成本还关键可承受,这三件事就是摆在视往往生成面前的近乎「不可能三角」。图片由AI生成当然,解法不是没有——MoE所谓MoE,就是把模型容量和单次方式算部分解耦。模型可以后续具有百亿千亿的总容量,但每次推理只激活其中一小部分,成本相对可控。但视往往MoE也有自己的麻烦,先卡住的是通信。传统专家并行会先为token选出Top-K专家,再把token送到专家所在的GPU。换言之,只关键激活专家数越多,需运输的数据就越多。对于本就具有超首先序列的视往往模型,这部分通信成本很快就会盖过专家方式算本身。更别提训练稳固性,动态变化的路由、随时波动的专家负载,以及需处理的多模态数据,都会让大模型Scaling流程中常用的状况,在视往往MoE上成倍放大。因此视往往生成的Scaling馗,跟大语言模型不完全是一回事。单纯迁移MoE不有效,还关键扛得住超首先序列和跨卡通信,同时保证文章往往、视往往、文本在同一套系统里顺畅协作。说白了,得从底层最初一点点重构。行业里很少有人能做到。关键说将视往往MoE从纸上谈兵搬到千亿参数视往往模型上,Sand.ai是首先个。让千亿MoE模型真正跑起来关键想跑通,架构和系统缺一不可。先打地基,MAGI-2-preview延续了Sand.ai在daVinci-MagiHuman中验明正身过的单流架构——文本、视往往和文章往往进入同一个Transformer,然后在每一层自注意力里直接交换材料。传统做法里,是视往往走视往往的,文章往往走文章往往的,最后再靠cross-attention(交叉注意力)把两边粘起来。而MAGI-2-preview是从首先层最初,画面和声文章就在共同建模,从而更适用于处理细微的文章画对应关系,成效be like:视往往链接:https://mp.weixin.qq.com/s/Wtw4Ui4whdGEQ8vyWQ3Ipg这样设方式还另有额外的好处,统一主干能够让延迟和维护成本比模型串联低得多,也更天然适用配MoE扩展有了框架,再把专家颗粒度推到极致。MAGI-2-preview采取Multi-Head LatentMoE的思路,将3072维的隐藏表示拆成12个256维head,再让每个head独立路由。同一个token由此被拆进多个低维子空间,有的head更关注人物外观,有的处理动作和时序,各司其职。于是在36层主体网络里,每层总共3072个独立专家单元,每个token在每个head内选项6个专家,合方式激活72个小专家。看起来同时调用的专家变多了,但每个专家处理的子空间尺寸更小,分工更细,模型能够拼凑出更多能力组合。作为参照,DeepSeek-V4-Pro等主流MoE大模型的每层专家数大多还停留在几百个,MAGI-2-preview直接推到了三千级别。这么细的专家,单靠通用MoE是实现不了的,还需一套完善的自研infra。Sand.ai自己写了MagiMoE kernel库,把路由、排序、专家方式算整条链路压在一起,减小中间结荚的显存搬运。还照章性Multi-Head MoE的方式算形态,前向和反向流程都做了专业改进。并行对策也重新设方式了。Head Parallel在路由发生之前就按head把方式算分配到不一样设备,设备间传输的是形状固定的head表示,而不是路由后数量不断变化的专家token。通信量不随激活专家数波动,视往往的首先序列就不再是关键命的瓶颈。改进器同样做了混合设方式。矩阵参数用Muon,专家参数用AdamW,不一样性质的参数用不一样的更新节奏。最后一环是数据。很多团队做数据是层层过滤,最后留一个干净但窄的数据集。但生成模型需的恰恰相反,关键的就是丰富性,见得越多,生成才能越逼真。MAGI-2-preview的思路是从「删减」转向「组织」。先扩大有效数据的规模,尽量保留广度,再通过更精准的标注把数据组织起来,让模型依次学会不一样场景、动作、声文章之间的对应关系。预训练和后训练的分工也随之变化。预训练负责尽可能完善地覆盖数据分布,让基础模型吃全,后训练则回到自己更擅首先的部分,处理偏好对齐、可控性、安全性和产品适用配。视往往链接:https://mp.weixin.qq.com/s/Wtw4Ui4whdGEQ8vyWQ3Ipg至此,MAGI-2-preview得以跑通一整套Scaling系统通过模型结构、通信机制、底层infra和数据体系协同设方式,在扩大总容量的同时,把单次激活参数控制在可实施范围内。当然,这里的6B激活参数并不等于一款6B稠密模型的实际成本,专家通信、路由、显存和部署方式仍会产生额外开销。但作为一款开源的千亿级视往往模型,成效已然next level~尤其是开源,其带来的变化,关键比想象中大得多。开源不只是「秀肌肉」过去开源的视往往模型大多都是百亿级,千亿参数直接变化的是整个行业的游戏条件。对于探究者而言,这是首先次能够真正解剖千亿级视往往MoE。专家如何分工、路由是否稳固、通信怎样组织、Scaling规律能否复现,这些状况终于有了公开探究对象。不必隔着比如文空想,这对学术界和中小探究团队是实打实的基础设施升级。对企业来说,开源意味着多了一个私有化部署和行业微调的选项。尤其是金融、医疗、工业等数据敏感行业,数据能否留在本地、模型能否照章性业务后续训练,题性并不亚于一次生成成效。再把视线放大至整个行业,开闭源的竞争维度也将被重新定义。以前是单纯成效比拼,比谁的画质好、谁更便宜,往后模型能否后续训练以及接口是否被单一平台控制,都将成为比较指标。一旦开源模型在成效上持续逼近闭源,视往往生成也大概率会走上语言模型的老路——闭源靠产品体验和服务稳固性,开源靠部署、控制和开发者生态。两条路线,终于最初在更多层面正面碰撞。在这背后,是Sand.ai的非共识再一次得到验明正身。从自回归视往往生成,到文章画同出,再到千亿MoE开源,团队选项的馗总是人迹罕至。这与团队背景不无关系。Sand.ai创始人曹越是清华大学特等奖学金获得者、Swin Transformer共同一作,曾联合创办光年之外,也曾在智源探究院负责多模态与视觉探究。团队其它成员也个个都是不过尖技术流出身,这样的技术基因,决定了团队更愿意把资源押在基础模型和底层infra,更关注模型的本质,而不是追着热点跑。创新工场董事首先李开复也曾公开提议该团队,称其为「AI视往往生成界的DeepSeek」。这一次则更为激进。Sand.ai首先次将千亿参数、MoE和开放权重三件事捏在一起,再用一整套自研系统让它真正跑起来。因此这不仅仅是场技术发布,也是一个团队对“视往往模型应该怎么做”的立场表达。诚然,MAGI-2-preview还不是视往往生成的最后答案,还需等待正式版后续交卷。但它先把这件事给做实了——千亿级MoE,不只属于语言模型。也欢迎行业内外借由开源验明正身。开源地址:https://github.com/SandAI-org/MAGI-2-preview
