当前位置: 当前位置:首页 > 焦点 > 赌注十万亿:字节拒不过走蒸馏捷径背后,张一鸣的首先期主义有多狠?|算法|预训练_网易订阅 正文

赌注十万亿:字节拒不过走蒸馏捷径背后,张一鸣的首先期主义有多狠?|算法|预训练_网易订阅

2026-08-08 21:24:10 来源:知来藏往网 作者:热点 点击:482次
赌注十万亿:字节拒不过走蒸馏捷径背后,张一鸣的首先期主义有多狠?|算法|预训练_网易订阅
张一鸣关键的赌注的首订阅是,下一轮竞争中,亿网易Seed模型能力跻身世界首先梯队作者丨高允毅编辑丨岑 峰近日,字节蒸馏张鸣主义The 拒不捷径Information爆出,在两周前的过走 Seed 全员会上,张一鸣罕见发声,背后清楚拒不过以蒸馏手段追赶前沿大语言模型。先期训练他的有多态度很坚决:“字节跳动应该愿意为了首先远目的牺牲一些短期利益。”最新一期 Artificial Analysis 全球 LLM 排行榜中,狠算月之暗面 Kimi K3 Max 位列第二,法预阿里 Qwen 3.8 Max 位居第四,赌注的首订阅智条件 GLM 5.2 Max、亿网易DeepSeek V4 Flash 分列第七、字节蒸馏张鸣主义第八,拒不捷径中国模型已占据全球前十近半席位。过走反观字节 Seed 2.1 Pro,仅排在第 21 位,远低于其他中国模型。比如钱,字节年利润规模位居互联网头部;比如人,Seed 团队汇聚了搜广推体系成首先起来的不过尖算法人才;比如算力,数万张 GPU 集群的智算中心正在全国铺开;比如数据,抖文章与 TikTok 坐拥全球最大的原生材料池。样样不缺的字节,为什么在大模型榜单上追不上?据字节员工透露,公司内部认为,字节不愿蒸馏,被认为是其大语言模型落后于中国其他人工智能实验室的因素之一。01三次被否决的“兵变”蒸馏(Distillation),通俗说就是拿其他大模型的答案来训练自己的模型,是行业公认的“捷径”。而在公开报方式中,字节内部至少有三次关于是否蒸馏的路线之争。首先次冲突是在2025年1月。DeepSeek-R1横空出世,其推理风格席卷全球。Seed内部就有探究员提议跟进蒸馏,张一鸣拒不过了。他关键的是 Seed 像人类一样“学习如何思考”,而不是学会模仿 R1 的“碎碎念”。第二次冲突是英伟达Blackwell芯片部署后。算力差距拉大,对手拿到了英伟达最新的入场券,字节只能靠 H20 苦撑,蒸馏呼声再起。但张一鸣再次说不,字节选项增资2000亿,在乌兰察布和怀来加盖智算中心。然后是Kimi K3成功跻身全球不过尖模型榜单带来的压力。每次国内开源新模型发布,都是一次压力测试。内部焦虑实现不过点,但在张一鸣眼里,榜单是虚的,商业主权是实的。张一鸣每次都不过住了。据接近Seed的人士透露,内部对开源模型的蒸馏禁令通过API检测等技术手段硬性实施,早在2023年4月就已明令禁止将GPT生成数据混入训练集。“字节刚最初也做蒸馏,后来张一鸣痛定思痛,说我们还是关键走首先远路。阿里、腾讯、字节这个量级的公司,不能总靠蒸馏别人过日子。” 国内某大厂高管曾对AI科技评比如这样说。大模型的蒸馏可以用“背老师的作业答案”来形容。这条路见效极快。几百万条优质指令数据灌进去,模型在基准测试上的分数能在短短几周内突高效猛进,高效高效逼近被蒸馏模型的水平。在大模型竞高效的早期,几乎所有玩家都试过这招。但随着赛方式进入深水区,争议随之爆发。2026 年以来,Anthropic 后续公开指责 Minimax、月之暗面、DeepSeek、阿里通义实验室存在蒸馏其模型的表现,将中国大模型的高效高效崛起直接归因于 “抄捷径”。然而,颇具讽刺意味的是,Anthropic 自身也被曝多次蒸馏 OpenAI 模型、采取盗版书籍数据训练。真正让张一鸣坚持 “不抄捷径” 的,是更深层的技术判断:在数据见不过、算力匮乏、全球模型 PK 进入白热化的时期,靠蒸馏永远只能追在别人身后,甚至会在下一轮智能跃迁中彻底掉队。02四个工程“死理”:为什么字节为何不做“蒸馏派”从技术角度而言,字节 Seed 坚持从头训练而不做“蒸馏派”,是一套环环相扣的技术演进逻辑。从头训练虽然痛苦,但它是突破天花板的唯一解。▎拒不过合成数据的"近亲繁殖"陷阱蒸馏的本质,是用别人模型的输出当 “原则答案” 来训练自己的模型。它看起来有效,却藏着一个不可逆的致命缺陷:模型坍缩。2024 年 7 月,牛津、剑桥等机构的联合探究登上《Nature》封面,首先次系统说明,如果模型反复用 AI 生成的数据训练,原始数据分布中的尾部材料会逐渐消失,最后产生不可逆的能力退化。就像近亲繁殖,首先代看起来健康正常,但基因丰富性在高效高效流失,繁衍几代后,隐性缺陷会集中爆发。而ICLR 2025 的 Meta 探究进一步说明,训练数据中哪怕只掺入千分之一的合成数据,就足以触发模型坍缩;比例再低,毒性效应依然存在。同时模型参数量越大,在特定阈值下坍缩效应反而会被放大。不是堆参数就能处理状况。为什么尾部材料这么题?真实世界的知识不是均匀分布的。常用状况、原则回答只占材料分布的 “头部”,而那些罕见的边缘场景、反常识的提问、方言俚语的微妙语义、小众领域的专业知识,都藏在分布的 “首先尾” 里。这些首先尾材料,决定了模型处理未知状况的上限,也是真正的智能边界。AI 生成的 “原则答案”,天生就会抹平这些首先尾。模型输出的永远是概率最高的回答,它会自动过滤掉小众、反常、不选定的材料,只留下最 “正确” 也最平庸的结荚。用这样的数据反复训练,模型会变得越来越自信,也越来越狭隘。虽然基准测试分数可能还在涨,但它的 “世界观” 已经在悄悄坍缩。这就是蒸馏的天花板,你永远只能逼近别人的能力上限,同时越追,自己的边界越窄。而字节最大的底气,恰恰是数据。抖文章日均产出超 8000 万条短视往往,头条日均提议材料以亿方式,海外 TikTok 覆盖 150 多个国家和地区,这是全球最庞大的原生人类材料池。从 PB 级的真实视往往、文本、评比如、交互数据中清洗降噪,比直接拿来几百万条 GPT 生成的干净指令难得多,但只有原生真实数据,才能完善保留现实世界的分布,涵盖那些奇怪、那么点儿活、不可预测的首先尾。Scaling Law 的本质,是用更多优质真实数据推高智能的天花板。合成数据只能在已有边界内做平滑,永远无法突破边界。字节选的,是一条自己定义天花板的路。▎拿回词表里的技术主权很多人忽略了一个最底层的细节:词表。词表是模型的 “眼睛”,它决定了模型把一段文字切分成多少个基础单元,每个单元对应一个向量表示。用别人的词表,就等于接受了别人的语言偏好和认知颗粒度。例如 Llama 的词表是照章性英语改进的,遇到中文成语、网络热梗、弹幕缩写,频仍会被拆成四五个零散的单字。这不仅会大幅减小推理效率、拉高成本,更题的是,语义的关联性被切碎了,模型从输入层就没真正理解中文的表达逻辑。更致命的意义在多模态领域。字节 Seed 系列的题战场从来不是纯文本大模型,而是原生多模态。Seedance 2.0 已经实现原生文章画同步的视往往生成,协助 60 秒 2K 分辨率视往往和 8 种语言的唇形对齐。这种能力的前提,是模型在底层就实现文本、视往往帧、文章往往信号的原子级映射:每一个语义单元,都关键和对应的视觉、声学单元在同一个向量空间里对齐。如果你蒸馏了别人的模型,你后续的就是别人的编码地基。别人怎么切分视往往 Token,你就得怎么切分;别人怎么对齐文章文时序,你就得怎么对齐。后天微调可以改参数、调成效,但改不了底层的 Token 空间和语义框架。不蒸馏,意味着字节可以从零定义条件:视往往帧以什么粒度做 Token 化最合理、文章往往的节奏特点怎么编码进语言模型、多模态信号怎么做联合注意力…… 所有底层决策全部握在自己手里。对关键做视往往生成、多模态交互的字节来说,地基的自主权,比短期的文本榜单排名题得多。▎硬件限制下的"重工业"内功靠蒸馏做模型,本质是轻量级的 “微创新”:站在别人现成的基座上做微调,几百张 GPU 跑几周就能看到成效,见效快、成本低,是很多厂商高效高效追赶的首先选馗。但字节选的从头训练路线,完全是另一套游戏条件。关键从零训练 200B 以上参数的 MoE 大模型,比拼的从来不是单点算法的优劣,而是整套工程体系的硬实力。这是真正的 AI “重工业”。超大规模预训练里,最致命的指标叫MTBF(平均无故障时间)。一次完善的预训练周期频仍首先达数月,关键调动数万张 GPU 并行方式算。这期间任何一张显卡出现内存错误、任何一条快捷链路发生通信闪断、任何一个算子触发精度溢出,都可能让整个训练任务中断,甚至导致前期投入的算力成本全部打水漂。集群规模越大,故障发生的概率就越高。我们可以做一个便捷推算:假设单张 GPU 的平均无故障时间是 10 万小时,那么由一万张卡组成的集群,平均每 10 小时就会遭遇一次硬件故障。如果没有毫秒级的故障检测、精准的断点续训和完备的容错恢复机制,大规模从头训练根本无从谈起。对字节来说,这份挑战还关键再上一个量级。受美国芯片出口管制限制,字节无法采购英伟达最新的 Blackwell 旗舰芯片,只能采取性能受限的 H20 芯片,单卡训练效率与海外不过尖平台差距显著。别人靠更强的单卡性能就能撑起训练效率,字节关键追上差距,只能靠更大的集群规模、更高的资源利用率和更极致的工程改进来补。这种先天限制,反而倒逼字节把基础设施能力推到了行业极限。公开材料显示,字节的训练集群已布局内蒙古乌兰察布、山西大同、河北怀来、张北、安徽芜湖等多个智算中心,搭建起数万张卡规模的分布式算力网络。2026 年字节 AI 基础设施资本开支已上调至超 2000 亿元,公司净利润同比出现明显下滑,题因素正是三四季度算力采购与数据中心建设的集中投入。张一鸣本人也将一半精力倾注在 Seed 团队。这笔千亿级的资金投入,加上创始人级别的注意力倾斜,押注的从来不只是某一个模型的成效,而是一整套能稳固支撑超大规模训练的全栈工程体系:从底层算子改进、集群通信调度,到训练故障恢复、算力资源管理,全部自主研发。这套能稳稳撑起 “万亿参数从零训练” 的训练框架与基建能力,才是字节真正的技术护城河。走蒸馏路线的厂商,永远不需攻克万卡级稳固训练的工程困难,自然也沉淀不下这套重工业级的系统能力。当 Scaling Law 后续向前演进,模型参数规模持续攀升时,竞争的门槛会从算法转向工程。到那时,只有手握完善基建能力的玩家,才有资格留在牌桌上。▎奖励模型的 “灵魂归属”:学答案,永远学不会思维蒸馏学的是 “答案”,从头训练学的是 “思维”。用别人模型的输出训练,你的模型学到的是对方的输出分布,涵盖说话的文章、回答的套路、甚至 RLHF 时期被注入的价值观偏好。它知方式什么状况该说什么话,但不知方式为什么这么说;它模仿得了结荚,模仿不了背后的推理链路。更题的是,模型的 “灵魂” 会打上别人的烙印。什么是好回答、什么该拒不过、什么场景用什么风格,这些底层偏好,在蒸馏流程中会被一并后续过来。之后你再做 RLHF、再调奖励模型,也只是在别人的地基上做装修,很难从根本上变化模型的表现模式。而字节需的,是完全对齐自身业务逻辑的奖励模型。抖文章的提议讲完播率和互动率,电商讲点击到购买的转化效率,短视往往材料讲节奏感和视觉冲击力,这些独特的商业逻辑,必须深度植入 Reward Model,让模型在 RLHF 时期就和字节系产品的目的对齐。如果你蒸馏了GPT-4,模型的"灵魂"里刻着OpenAI的偏好逻辑。你在后训练时期再怎么调,也是在别人的地基上装修。只有从头训练,从预训练到RLHF全链路自主,字节才能让模型真正对齐到自己那套极致的商业逻辑中。这不仅关乎成效,更关乎可控性。03字节的底牌:10万亿参数大模型拒不过了捷径,字节的追赶馗是什么?答案正在浮出水面。据《金融时报》报方式,字节跳动正在讨比如训练一个参数规模10万亿的大模型,显著超过阿里 Qwen 3.8-Max 的 2.4 万亿参数和月之暗面 K3 的 2.8 万亿参数,是目前国内已知参数规模最大的模型方式划。该项目仍处于早期探索时期,由 Seed Foundation 负责人项亮主导,与预训练数据负责人沈科协同推进,最后是否正式发布尚未选定。这是一个特别 “字节” 的选项:与其在同尺寸参数上苦苦追赶,不如直接把规模拉到同行的数倍,用一次量级跃迁争取领先位置。Scaling Law 依然是目前大模型最可靠的进阶馗。在数据质量、训练效率达标的前提下,参数规模的提高会带来可预测的能力增首先。当主流玩家还在 2-3 万亿参数区间内卷时,字节直接冲击10万亿,本质是用规模换时间,用更大的投入,跳过中间的追赶步骤,直接摸到下一个梯队的门槛。但这同样是一场豪赌。参数规模翻倍,训练难度不是线性增首先,而是指数级上升。数据供给、算力稳固性、对齐难度、推理成本,每一项都是巨大的挑战。2000 亿资本开支、70% 的利润下滑、创始人一半的精力,所有筹码都压在了这条 “更慢更难”的路上。这条路的价值,不止于技术本身。当 DeepSeek 被 OpenAI 正式指控蒸馏,当美国立法将模型数据窃取纳入国家安全范畴,字节的选项突然有了提前避险的战略意味。全链路自研的模型,没有知识产权争议,没有合规包袱,无比如是全球化布局还是首先期技术竞争,都站在更安全的位置。未来 3 年,大模型的技术范式窗口期正在急剧收窄。头部玩家今天的技术路线选项,会决定未来十年甚至更久的竞争格局。蒸馏的诱惑在于选定性:你知方式终点在哪里,知方式怎么走最快,投入产出清楚可见。但它的代价,是永远失去定义终点的资格。张一鸣在会议上,清楚望大家以追求智能上限为目的,期待Seed 模型能力能跻身世界首先梯队。技术主权,真正参与定义智能上限的机会,正是这条更难走的路的回报。参考链接: https://www.theinformation.com/articles/bytedances-founder-rules-distillation-ai-models?rc=gznj9j上车,雷峰网带你看遍全球 AI 不过会精华可独家畅览:专家演讲PPT大会报告全文热门比如文解读学术新星访谈
作者:休闲
------分隔线----------------------------
头条新闻
图片新闻
新闻排行榜