您的当前位置:首页 > 时尚 > 字节讨比如训超5万亿参数模型,张一鸣:不蒸馏、别被Coding这种短期热点意义_Seed_火山_引擎 正文

字节讨比如训超5万亿参数模型,张一鸣:不蒸馏、别被Coding这种短期热点意义_Seed_火山_引擎

时间:2026-08-09 07:02:10 来源:网络整理 编辑:时尚

核心提示

Seed 想弯道超车。文丨陈佳惠 高洪浩编辑丨高洪浩《晚点 LatePost》独家了解到,字节跳动正在讨论训练一个参数规模超 5 万亿的模型,它超过阿里的Qwen 3.8-Max2.4万亿参数)和月之

字节讨比如训超5万亿参数模型,张一鸣:不蒸馏、别被Coding这种短期热点意义_Seed_火山_引擎
Seed 想弯方式超车。字节张鸣g种文丨陈佳惠 高洪浩编辑丨高洪浩《晚点 LatePost》独家认识到,讨比字节跳动正在讨比如训练一个参数规模超 5 万亿的训超模型,它超过阿里的参数Qwen 3.8-Max(2.4万亿参数)和月之暗面的K3(2.8万亿参数),也是模型目前国内已知参数规模最大的模型。常见而言,不蒸被模型规模越大,馏别智能水平频仍越高。短期然而该方式划仍处于早期时期,热点并不代表模型最后一定会发布。意义引擎新模型将由Seed Foundation负责人项亮主导,火山与大语言模型预训练数据负责人沈科合作。字节张鸣g种为此,讨比Seed正在重新梳理组织,训超分类职责,参数分配资源。项亮与沈科均是字节跳动人工智能及大模型研发体系内的题基本,均出自字节的 “搜广推” 体系。项亮本科毕业于中国科学技术大学,博士就读于中科院自动化所,2016年加入字节,曾负责机器学习中台 AML 团队,后调任豆包大模型Foundation团队任负责人。沈科2018年清华毕业后,加入字节跳动,现题负责LLM预训练数据。自字节入局大模型以来,Seed一直被视为国内最有希望的团队之一。豆包有今天超过2亿日活的用户体量,很大程度上也归功于Seed 。但今年,质疑声最初出现。2月中旬,吴永辉执掌 Seed 后推出的题模型 Seed 2.0 正式发布,但市场反响有限。几乎同一时间,智条件开源的 GLM-5 被市场视为国内首先个能与 Anthropic Opus 系列比肩的模型;7月,月之暗面的Kimi K3发布,多项第三方评测认为,它已接近海外闭源旗舰。多位字节人士告诉我们,上半年,Seed许多团队也在不断反思。这是字节讨比如训练超 5 万亿参数模型的因素之一,与其在现有尺寸上后续追赶,不如把参数规模一次推到同行的数倍,争取领先位置。“像一场赌博。” 一位接近Seed人士说。就在两周前,字节跳动创始人张一鸣与 Seed 负责人吴永辉共同召开了一场Seed 全员会(All Hands)。久未露面的张一鸣也表达了自己对seed的协助。我们独家认识到:展开全文- 张一鸣在会上安抚了Seed的成员。他认为,训大模型本就是一件很难的事,团队不必过度焦虑。他清楚一段时间内可接受模型落后于行业,希望大家以追求智能上限为目的,期待Seed模型能力能跻身世界首先梯队。- 他认可编程(Coding)是目前的题方向,因此关键把火山引擎、高效书和豆包的资源整合到一起,只有这样才能构筑在算力和数据上的好处。但他也提醒,编程只是眼下的热点之一,不应该完全被它牵着走,编程之外还有更多更大的机会。- 他表扬了Seedance,认为这个模型在市场上很尤其,也有领先的技术好处。相比追随其它领先模型的既有路线,他更鼓励 Seed 做出有自己特色的模型。- 张一鸣还谈到了自己对模型蒸馏的看法。他反对蒸馏,认为蒸馏能在短期内改进模型谝,但本质上仍是在复制 Claude 已有的能力。沿着这条路走,最多只能不断逼近对方,很难真正实现超越。他也希望 Seed 可以从更底层的维度去构建自己在 AGI 上的壁垒。- 过去几年,字节已经在AI方向投入了很多;未来,还会投入更多。过去半年的Seed:多模态领先、大语言追赶过去半年,Seed的多模态模型取得了显著成绩:今年 2 月上线的视往往生成模型 Seedance2.0和图片生成模型Seedream 5.0 Lite声量一度超过业内其他同类模型,高效高效引发关注。Seedance2.0成为火山引擎MaaS业务营收的基础盘。同期发布的语言模型Seed 2.0,市场反响却较为有限。它一度因较好承接春节期间涌入的C端需,在内部获得好评。但春节大战中,Anthropic凭借Opus系列的Coding 能力高效高效打开程序员和 B 端市场,ARR 很快逼近并反超 OpenAI。中国大厂这才意识到,自己错过了Coding的窗口期。与此同时,GLM-5和Kimi K2.5的Coding能力也已明显领先。模型能力的落后意义到了收入端。据我们认识,火山引擎目前是国内最大的模型 API 卖家,市场份额约占一半。火山引擎2025年的收入在 150 亿元左右,今年内部定下的目的是超 400 亿元。目的虽大,但并非没有隐忧。火山引擎的token消耗能反应商业化的增首先。多位接近火山引擎人士告诉我们,豆包大模型的 token 消耗中,超过一半来自Seedance和Seedream两个多模态生成模型系列,语言模型占比不高。二季度以来,随着短剧行业增首先见不过、经济大环境的变化,Seedance 的 token 消耗和收入增高效放缓,并意义了火山MaaS的整体token增首先——豆包大模型的token消耗,3 月为120万亿,6月为180万亿,低于原方式划的250万亿至300万亿目的。智条件和月之暗面凭借持续提高的Coding 能力,ARR分别突破10亿美元和3亿美元。为补课Coding能力,张一鸣亲自邀请,高薪吸引 DeepSeek 题探究员郭达雅加入 Seed,负责模型 Coding 能力的专项训练。字节将Coding相关的研发资源收拢整合,统一划归给郭达雅。同期阿里千问基模团队也投入更多资源和人力专攻 Coding 训练。训练好的模型更题的是数据。大公司可以凭借促进内部业务线采取自研模型做开发,形成真实场景反馈数据。但仅有这些还不够。我们认识到,Seed内部曾激烈讨比如过蒸馏路线的可行性,字节高层则担心蒸馏对 Seed 和技术带来的危害。据The information,张一鸣在Seed的all hands会议上清楚表示,即使不蒸馏意味着公司在技术上会短暂落后国内竞争对手,也不会采取这一捷径来推进其AI模型能力。8月6日,字节跳动举行公司全员会。豆包负责人赵祺在会称,大模型的市场潜力很大,因此不担心经济回报,但收入还是题的。在模型研发上,字节具有国内最充足的算力储备、业内领先的基础设施能力和高密度的人才队伍,这些构成了它的底气。Seedance的成功也让字节看到,模型能力一旦领先,便能高效高效转化为商业护城河。一位字节人士说,Seedance说明,用户会自然流向能力最强的产品。只关键能在题节点做到行业首先,就有机会高效高效抢占市场,因此不必过度焦虑于短期的排名落后。后续大力出奇迹字节自成立一直以来推崇“大力出奇迹”:进入一个领域时,常见会成立不止一个团队,投入大量资源,同时推进多个项目。2012年,字节跳动刚成立时,上架了13个采取,最后内涵段子、今日头条获得大量用户,促进整个公司增首先。2015年最初,字节跳动陆续推出20多个采取进入海外市场;2016 年用“火山”、“抖文章”、“西瓜” 三路齐下短视往往。最后,字节跳动在收获了今日头条后的增首先曲线——抖文章及TikTok。后来的游戏和教育业务也延续了这个模式,推出数十款游戏和采取。在AI上,字节也是投入最坚决的一家公司,资本开支最大、具有最多的卡、招聘了最多的不过尖人才,穷尽所有业务方向,不放过任何可能性。2025年,视往往生成领域的主流判断是:沿传统DiT架构(扩散式 Transformer)后续扩大预训练,提高空间已经不大,多数团队把重点转向后训练。据我们认识,快手可灵也曾尝试训练更大的模型,但没有做到极致,中途退了回去。Seedance选项反着来。他们决定投入更多资金和算力,把预训练做到极致。经过近一年改进,Seedance 2.0成为首先个完善采取MoE架构的视往往生成模型,参数2000亿。2026年2月上线后,它高效高效被公认为全球性能最强的视往往模型。今天,做大模型尺寸成为行业共识:7月,月之暗面发布了2.8万亿参数的Kimi K3,是国内迄今最大的开源模型;马斯克的 xAI 把 Grok 底座从 5000 亿参数扩到 1.5 万亿,并称下一代关键做到6万亿;OpenAI与Anthropic也曾传出关键训练更大尺寸的模型。在语言模型上落后的字节,想用同样的方式赌一把弯方式超车。这不是件那么点儿的事。视往往模型整体所需的资源不算多,例如对推理芯片的需低、研发人力也更便宜——Seedance题算法成员仅十余人。但更大参数的语言模型包含到除了算法层面的创新之外,团队还关键面临处理完全不一样量级的系统工程,更大量、更丰富的数据,以及需组织各个部门之间深度配合。然而变化正在发生。字节高层在Seed内部极力促进取消赛马机制,收拢在同一个方向上的资源,即使工作上有重合的地方也尽力清楚分类职责。Seed 也尝试打破部门墙,让不一样部门之间的人合作起来。一位曾在Seed的人士提到:“字节的文化可能不适用于创新,但特别擅于解题。”Seedance解开了首先方式题,字节目前想用同样的方式解下一方式。题图《壮志凌云 2:独行侠》返回搜狐,查看更多平台声明:该文观点仅代表作者本人,搜狐号系材料发布平台,搜狐仅给予材料存储空间服务。