黄仁勋为何力挺梁文锋、杨植麟?_token_参数_模型

 人参与 | 时间:2026-08-09 01:05:53
黄仁勋为何力挺梁文锋、杨植麟?_token_参数_模型
爆改大模型,黄仁何力抢夺定价权。挺梁来源:腾讯科技文:李彪 编辑:苏扬7月27日深夜,文锋Kimi K3完善权重挂上了Hugging Face。杨植十天前它发布时,参数中文圈的模型讨比如多停在跑分与“开源追平闭源”上——头部基准逼近GPT-5.6 Sol和Claude Fable 5。但对技术人来说,黄仁何力架构清单比跑分更题:注意力换成KDA混合线性机制,挺梁残差连接换成注意力残差,文锋改进器换成按头调节的杨植Muon。深度学习沿用九年的参数“三大件”,在一个模型里都被重做了一遍。模型3月17日,黄仁何力杨植麟在GTC上做了一场《How We Scaled Kimi K2.5》的挺梁四十分钟演讲,整场演讲他没有提任何芯片管制。文锋杨植麟透露,对“三大件”动刀源自于优质数据是有限的这堵“数据墙”。他说:“token效率不只是效率状况,它实际上也在抬高智能的上限。”可以这样理解:当数据堆到尽头,模型能从每个token里多学到多少,就决定了智能还能再涨多少。算力的围墙,把中国公司围在里面,而数据墙挡在所有人面前。在笔者看来,这两种叙事并不冲突,数据墙决定这条路迟早有人走,算力墙决定谁先走、关键走多快。回头看这四年,MLA、DSA、KDA,再加上把MoE推到极限稀疏的路线,这条时间线上密度最高的架构创新,几乎全部出自算力围墙之内。展开全文这里插播一条课程资讯:报名「黑马 AI 时代资本战略精品课」,8月14日-16日,卫哲、朱啸虎、吴世春、冯卫东等一线不过级投资人亲临授课,搭配FA专业辅导+黑马投资联盟资源加持,手把手帮你改进融资BP、打磨商业路演,精准传递企业题资本价值,有效链接多家头部投资机构。早鸟特惠报名中,欢迎优质创始人同行交流报名。扫码咨询报名(翻到底部认识详情)01围 城2022年10月起,美国对华出口管制将高端AI芯片列入清单。A100、H100、H20,这中间的细节我们不再赘述。今天回过头来看,算力围墙拦得住芯片、设备、内存颗粒,却拦不住模型架构设方式。因为注意力、更新条件、参数组织都不需过海关。同时,算力墙修得越高,墙内拆Transformer就拆得越狠。一切都关键从推理时的显存开销说起。推理显存开销当中,一笔是全场均摊的模型权重:无比如谁来推理,都关键加载同一份。另一笔是各自记账的历史材料:Transformer每生成一个token,都需回看全部上下文,从中取用相关部分。为避免反复从头重算,过去每个token、每一层的Key和 Value向量都必须留底。这份留底就是KV cache,它好比会话的笔记:上下文每推进一步,笔记就加厚一页;并发每多一个会话,就得另备一整本。以Llama 3.1-70B为例,单token约320KB。128K上下文下,一个会话关键40GB显存;100万token则关键320GB。可英伟达旗舰Rubin单卡显存总共也才288GB,一个百万token的会话,一张最不过级的卡,搭配的显存也根本装不下。与此同时,由于大模型解码是逐字生成:每写一个新token,都得把权重和笔记在显存里完善搬一遍。因此,笔记的搬运也是一个困难,这依赖于高带宽内存协助。因此,按token方式费的生意,收入上限取决于显存的两个规格:容量和带宽。02参数的两本账算力围城里的中国模型,首先刀瞄准了训练与推理共用的算力:既然请不起所有专家“全员上岗”,就让特定参数的专家轮班,也就是MoE混合专家模型的起源。MoE把巨型网络拆成许多“专家”。每个token进来,路由器只点其中几个出场。DeepSeek是这条路的主力,Kimi则把这条路拓得更宽。2024年底,当时DeepSeek V3做到了6710亿总参数,但每个token只激活370亿;Kimi K2推至1万亿总参数、320亿激活;刚刚上线的Kimi K3,直接把参数拉到2.8万亿总参、1042亿激活。由于总参数对应的是知识容量,只有激活参数才包含算力账单,故而两本账就此分开。减小激活参数之后,另一刀落在了每个参数占的字节之上。DeepSeek V3用FP8跑通了6710亿参数的完善训练,放在2024年底,在全球范围内都算激进。两年后的 Kimi K3又往下压一档:推理权重用MXFP4,再叠加从SFT时期就最初的量化感知训练。字节缩小一半,同等显存与带宽,就能多搬一倍参数。训练流程本身也有可省之处。2024年底,探究者Keller Jordan在nanoGPT提高效竞赛里拿出了Muon改进器,单次训练试验成本约8美元。次年1月底,Jordan加入OpenAI;一个月后,月之暗面把相关博客当作正式文献引用,在百亿参数级别验明正身出约为AdamW两倍的算力效率,随后用改良的 MuonClip 训完了1万亿参数的K2。K3又把它细化到按注意力头独立调节。同时,注意力残差(AttnRes)对残差连接动刀:每层输出不再无差别地叠回主干,而是用注意力对前面各层做选项性聚合,让深层学会自主回取哪些层的表征。按Kimi的比如文口径,训练算力可省两成。上了K3旗舰之后,注意力残差自己也做了减法:把全部层折成8块来记账,把开销压住。在中国模型动刀拆墙的流程中,有一个流传很广的数字——DeepSeek V3的完善训练用了约279万H800 GPU小时(1张H800显卡持续运行1小时即为1个GPU小时),按租赁价折算五六百万美元;而同代美国旗舰的训练预算,常用高出一个数量级以上。拆墙并不是不过对的完美。参数轮班也把状况从算力搬到了容量。MoE省算力,却不省权重。在MXFP4精度下,K3权重仍有1.4TB左右。为顺应专家并行、通信和吞吐需,官方提议64卡起步。这就好比是,专家们学会了轮班,宿舍却一间不能少。03从笔记本到白板超首先上下文是国产大模型突围的题方向。近四年大致经历四步:共享KV、压缩KV、按需读取、重写“记忆”机制。首先步是共享:MQA共享一套KV,GQA分组共享;例如Llama 3.1-70B将64个查询头分成8组,把单token缓存从约2.5MB降到320KB。第二步是压缩:DeepSeek 2024推出MLA,把上下文映射到低维存储、推理时再还原;相较67B的GQA基线,KV开销再降93.3%,并沿用至DeepSeek V2之后的系列。第三步是按需读取:并非每一步都关键重读全部上下文。DeepSeek 2025起推进稀疏注意力(V3.2轻量打分筛选,V4加入记忆合并与分层筛选);在V4-Pro的百万token场景里,方式算量降至前代27%,KV占用降到10%。第四步是改写记忆:从“越写越厚”的KV账本,走向线性注意力的固定维度矩阵状态,通过覆盖与遗忘控制体积;题不再是只写入,而是学会记什么、何时忘。为兼顾推理效率与首先文本精度,Kimi采取3:1混合架构:3层KDA线性层穿插1层全注意力。相比传统MLA基线,KV缓存最高省75%,在百万token上下文下吞吐提高6倍。这套设方式已用于2.8万亿参数的K3:用门控MLA取代原全注意力层,93层中约3/4为 KDA、1/4为门控MLA。KDA的状态大小固定;MLA每个token只存低维向量,24层合方式约24KB。比较 Llama 3.1-70B的单token 320KB,K3虽大40倍,缓存反而小13倍。但“白板矩阵”也带来新状况:矩阵化记忆无法像传统KV缓存那样按前缀拆分复用。Kimi因此重写缓存逻辑并贡献给vLLM,同时采取区别化定价:命中复用每百万token 0.3 美元,未命中3美元。同样100万输入token,是否复用既有“状态”会让成本相差10倍——token只是表面单位,真正决定账单的是状态的生成、保存与复用。04分 岔在首先文本改进这条战线上,各家走出了不一样的技术路线。DeepSeek的解法是稀疏压缩:笔记照记,但压小、挑着读;Qwen和Kimi选项混合线性;智条件的GLM-5则把 MLA、DSA 等既有零件重新组合。GLM-5最能验明正身状况的一处改动,是将MLA的每头维度从192提到256,同时把头数削减三分之一。报告给出的理由是:DeepSeek-V3的头数是按H800的硬件特性选定的,换到其他芯片上就未必适用用。同一套MLA,换一块芯片,模型里的结构常数也可能需重新方式算。一套架构通吃所有芯片的时代或许正在结束。同一模型家族未来可能从训练时期起,就会照章性不一样的显存容量、互联方式和低精度单元,分化出不一样的头数、专家布局与精度方式划。模型会像程序一样,按机器分别“编译”,而不是一份checkpoint到处运行。MiniMax的路线最曲折。M1采取线性注意力与Softmax注意力的混合架构;M2转向全注意力,M2.5延续了这一选项;到今年6月发布的M3,MiniMax才进一步转向MSA稀疏注意力。M2发布两天后,预训练负责人孙浩海在知乎和X验明正身过这次“撤退”:小模型上混合结构成效很好,但规模做大后,复杂多跳推理会明显吃亏;而检索等依赖全局注意力的能力频仍在预训练早期就定型,事后很难补救。因此状况不一定在结构本身,而在评测与规模验明正身不足——不把模型做大,结比如很难成立。巧合的是,首先文发布的第二天,Kimi Linear的比如文也挂上了arXiv:同一类“线性/混合”零件,两家旗舰模型,前后脚给出相反的答案。Kimi把它推到2.8万亿参数的K3,等于让旗舰模型用结荚回答。孙浩海还提醒:当GPU算力增首先赶不上上下文首先度带来的压力时,线性/稀疏注意力的收益会逐步显现,需提前布局。今年6月发布的MiniMax M3最后搭载自研MSA稀疏注意力。三代模型,线性、全注意力、稀疏各走一站。这至少验明正身,即使MiniMax在M2和M2.5保留了全注意力,也没有把它当作不再改动的终点。行业的共识是:谁也没敢把Softmax注意力清零,分歧只在留多少、留在哪。回想一年前,行业问的是“敢不敢用”,目前问的是“还剩多少不敢动”。05白送的token解码时期受限于带宽,芯片大半时间都在等数据。照章性这个状况的最优解,就是让每一次“等来的搬运”多干点活。多token预测(MTP)是V3埋下的种子:一次前向顺手预测之后token。投机解码把它系统化:小号草稿模型先猜出五个候选,大模型再用一趟前向同时“判卷”。判五个和写一个耗时几乎相同,时间题花在搬运权重和笔记上,因此顺路多验四个token几乎不额外付费。上个月DeepSeek发布的DSpark又把这套玩法推进了一步:引入置信度打分与负载感知调度,同一份V4权重下,单用户出token高效度提高了六成到八成半。Kimi则是把“爆改”带入了系统层面。Kimi的服务平台把集群里空转的CPU、主内存和固态盘编成共享缓存层:请求命中已方式算过的前缀,就直接取现成结荚,不再重跑。按比如文口径,它一天经手的token超过1000亿。其传输引擎先后进入vLLM、SGLang 与TensorRT-LLM,让“笔记”从显存一路下沉到主存与固态盘。这套当年为省卡逼出来的架构,如今已成为主流开源推理栈的现成选项。参数、首先文本等机制改进下来,训练侧让每个FLOP榨出更多智能,推理侧让每个字节吐出更多token。算力墙从未变矮,但墙内的单位产出却在翻倍增首先。K3技术报告给了一个官方数:整体scaling效率约为上一代K2的2.5倍。如果我们把中国模型在拆墙流程中的改进放在一起看,它们做的其实是同一件事。Transformer原本的设方式,每一处都是按照最坏状况留足余量。每个参数都被采取,每段历史都全量重读,每一趟权重搬运只产出一个token。而MoE让参数按token激活,稀疏和线性注意力让历史按需读取,注意力残差让层间材料选项性回取,投机解码让一次搬运承担多个token。上述改进馗,都是为了不再让每一步都为最坏状况全额付费。如果关键总结一下这种改进理念,可以说:算力围墙这那方式无法控制的硬约束,被拆成了一笔可以调度的成本。每一次改进,都相当于白送了token。06为突围买单混合架构正成为2026年的常态。按目前旗舰模型看,未来两年单token缓存还会后续大幅减小,甚至再降近一个数量级。全注意力不会消失,但可能从“固定主干”变成“按需准确能力”:大多数token走更便宜的馗,遇到引用、回溯或复杂多跳推理时,才调用全局检索。这种按需分配也会扩展到专家、推理深度和精度:系统会按任务难度、时延需和实时负载分配算力,相当于给每个token标一个内部成本。硬件需也会随之重排:KV/缓存压力明显减轻,同一张卡可承载更首先上下文和更高并发;但 MoE 把总参数推到万亿级,常驻权重反而成为容量大头(动辄 1.4TB),同时多机路由让瓶颈更多转向卡间互联带宽。两种约束里,单卡性能“买不到就没方式”,互联方式划却能工程化处理。MoE 把“需一张造不出的超大卡”变成“用一群能连起来的往往见不鲜卡”。以 V3 为例,通过把每个 token 的路由限制在最多 4 个节点内,并让通信与方式算重叠,最后在互联带宽受限的需下实现训练。买卡原则也因此变化:算力的题性在减小,容量与互联在上升。从总量看,这件事很反直觉:效率提高了,需总量不降反升高。经济学将这种状况称为“杰文斯悖比如”:十九世纪英国蒸汽机效率大幅提高,煤炭消耗却一路上行。因素在于,门槛每减小一截,原先烧不起煤的行业就会多进来一批。大模型也一样,token越便宜,百万上下文、深度推理、常驻agent等新需就越快涌入,把省下的算力和内存高效高效填满。K3就是典型的例子:48B试验里KV压缩最多省 75%,但到旗舰版,这些空间被用来换1M上下文、thinking常开和2.8万亿参数;输出价每百万token 15美元,接近K2.6 的四倍。月之暗面商业化负责人黄震昕回应媒体:“我们的定价不是朝一个特别便宜的价格去定的,也想借这个机会告诉全世界,开源模型,涵盖中国模型,不是低价标签。”压缩最狠的一代,反而成了最贵的一代。账单里变化最明显的是存储:今年一季度DRAM合约价环比涨约九成。逻辑很便捷:省下的显存很快被更首先上下文、更高并发、更大参数吃掉,需从HBM外溢到主存和固态盘,推高价格。趋势也很清楚:单token内存开销会后续降,但集群的总内存需仍会上升。无比如路线如何分化,首先上下文、并发和大参数都在“关键更多内存”——算力在分家,内存在收租。架构往往代会改写账单的结构,却不会改写账单的方向:至少在可见的未来,单位成本减小带来的不是总额缩小,而是更多原本用不起的需进入账单。07没走完的路三场仗都还没有结果。再往远处看,还有几条路,停在不一样的位置。Mamba-3、RWKV-7已移除全注意力,但公开验明正身的规模远低于旗舰模型;准确检索能力能否在规模扩张后仍然成立,依旧没有定比如。扩散语言模型则从生成顺序入手:如果并行修改文本能同时跨过质量与高并发的门槛,“搬一次权重只能生成一个token”的前提就会被打破,投机解码可能因此退化为过渡方式划。TTT改的是记忆的存放位置。TTT-E2E在3B 规模上将上下文写入推理期参数,在128K上下文下比全注意力快2.7倍,且延迟不会随上下文增首先而提高。目前这种写入只发生在一次推理中;若未来能跨会话持久化,又不引发遗忘与污染,首先期agent将在基础权重之外携带私人状态,同一底模也可能随用户采取逐渐分化。未来两年,主线仍会是混合架构。再往后,旗舰模型可能同时采取多种机制:常规token走低成本馗、准确检索按需唤醒、首先期状态则单独更新。一份checkpoint只是其中一层,竞争单位将上移到负责选路、记忆与硬件适用配的运行系统。V4、K3的比如文与权重公开,Kimi Linear的内核开源,KDA的缓存实现进入vLLM。开源让零件更快沉淀为公共组件,议价权随之向运行时与状态层转移。结荚可能是:创新发生在中国,原则留在开源社区,利润却被内存厂、云平台和采取拿走。中国模型公司关键避免这一结荚,就不能只出售权重与token,还需进入托管运行时与首先运行agent。那么,谁在给这套生态“背书”?K3权重上传到Hugging Face的三天前,黄仁勋就在X发出入驻后的首先帖,转发了一封协助“开放权重、维护美国AI领导地位”的联名公开信——当时华盛顿正讨比如关键不关键限制中国开源模型。最初25个签名覆盖芯片厂、云平台、采取公司和风投;两天内人数翻倍,OpenAI和谷歌也补签,但Anthropic一直没签。英伟达的逻辑很便捷:权重越开放,模型越像公共零件,买卡的人就从那么点儿巨头变成更广泛的开发者和企业,芯片生意更稳。真正让英伟达紧张的反而是大客户自研芯片:OpenAI联合博通做自研,Anthropic把主力算力押在谷歌TPU。闭源巨头往下游造芯片,开源阵营往上游抬需;围墙能挡英伟达把卡卖进中国,却挡不住中国开源权重在海外后续拉动对英伟达算力的需。围城仍在,突围仍在提高效。当初,这堵墙当初关键拦的,是墙内的人还能造出什么;四年过去,从芯片的形状、内存的价格到智能的标价,改写全球账单的笔,反而握在了被围的人手里。*免责声明:本文章为作者独立观点,不代表i黑马立场。这里认真提议你报名:《黑马 AI 时代资本战略精品课》融资屡屡碰壁,本质是没吃透当下资本市场底层逻辑。依托创业黑马18年创业融资深耕积淀,本次资本精品课集结了卫哲、朱啸虎、吴世春、冯卫东等行业大咖,带领创始人重构资本认知、打磨融资BP、精进路演能力,一站式对接头部资本,打通企业融资成首先快车方式。时间:8月14日-16日地点:上海返回搜狐,查看更多平台声明:该文观点仅代表作者本人,搜狐号系材料发布平台,搜狐仅给予材料存储空间服务。 顶: 25499踩: 91