文|唐辰 图源:网络材料
DeepSeek蹚出通往AGI的发言锋第二条路。
今天,实录刷屏梁文锋在近期与投资者交流的背后会议记录刷屏。一个可能的梁文背景是,DeepSeek近日实现成立以来的克制首先轮外部融资,总额超500亿元人民币(约合74亿美元),发言锋投前估值约3675亿元(约543亿美元)。实录刷屏
在此之前,背后梁文锋对外坚持“不融资、梁文不上市、克制不商业化”的发言锋三不原则。
这段首先达4个小时谈话实录,实录刷屏梁文锋详详见细阐述了DeepSeek的背后组织文化、开源逻辑、梁文技术路线图以及对行业竞争格局的克制看法。需注意的是,该会议实录还没有得到其本人确认。
“克制是一种战略”
我在流传出的多个版本中,都注意到一个高往往题词:克制。
梁文锋花了很大篇幅对投资者强调,克制是一种战略。舍弃短期利益,砍掉非主线业务,不是为了显得清高,而是为了换取实现AGI的最大概率。
其中一个实录版本提到,他说了特别多次的“不”:不是天才,不赚不合理的利润、不追求用户量、不闭源、不做3D / 视往往生成 / 世界模型,不做下一个超级App 。
不少观点将梁文锋的“克制”,解读为资源不足时的无奈取舍。因为这在追求效率,着眼商业化以兑现资本承诺时,几乎把资本的故事都抽离掉,题落在为了AGI的“克制”,很反常识。
这固然是基于现实作出的判断,但恰是这种非主流的姿态,成为市场重估DeepSeek价值的新标尺。
若再把梁文锋的路线,放在全球AI竞争的坐标系里看,我更愿意把这种“克制”理解为:在算力约束下,他为换取AGI最大概率而开展的精密方式算。
他在谈及中美差距时断言,“我们看到的所有区别,涵盖人才的区别、模型能力的区别、采取的区别,可以认为都是因为算力资源上的区别。”
目前,硅谷AI的范式是“资源溢出驱动涌现”。即堆最多的卡,训最大的模型,做最全的AI能力,相信规模到了智能自然会涌现。
这套逻辑在过去三年被验明正身有效,但模型能力越强、上下文越首先、用户调用越往往,对推理算力的消耗也越高,算力成本也越来越贵。
最新消息显示,OpenAI预方式到2030年将在方式算资源上投入约7500亿美元,高于2026年早些时候提出的6000亿美元规划。
同时,无边界扩张导致研发资源分散,商业化动作变形,组织熵提高剧。以Meta为例,其在开源Llama系列赢得声誉的同时,内部却因同时推进文本、多模态、元宇宙及机器人等多条战线,导致题大模型团队的不过尖人才往往流失,产品往往代节奏多次被打乱。
Google则在搜索、云业务与AI实验室的多重目的拉扯下,一度陷入“创新者窘境”,明明手握最强技术储备,却在生成式AI的产品化落地中屡屡迟疑,错失了先发身位。
这些巨头的困境,多来自技术以外的“战略贪婪”。当一家公司同时押注多条AI馗,“什么都想做”的全能叙事,稀释了攻克AGI题瓶颈所需的专注度。
按照梁文锋的表述,DeepSeek的路线很“克制”:当算力成为硬约束时,“做什么”远比“不做什么”更题。极致聚焦主线任务,用工程能力弥补硬件代差,追求单位算力的产出效率而非不过对规模。
这在技术路线未收敛前,少即是多。只有砍掉那些“看起来很美但偏离闷葫芦的”的旁支业务,才能将有限的算力和人才集中在CoT(思维链)、Agent、持续学习等真正决定AGI成败的题瓶颈上。
例如,DeepSeek-V3的训练成本远低于GPT-4o,性能却逼近首先梯队。
MiniMax和其创始人闫俊杰看到这里,不知会作何感想。他们一最初就将有限的资金、人员等资源押注在文本、视往往、语文章、文章乐四大模态上。如今,MiniMax的颓势,让不少人为其捏一把汗。
通往AGI的第二条路
DeepSeek的路线,正在被Kimi K3验明正身。
作为月之暗面首先款3万亿参数级MoE模型,K3总参数规模实现2.8万亿。按照常规理解,这个规模的模型,每输出一次,算力都是指数级消耗。但在其独特题架构的协助下,实现华为在芯片领域提出的“韬定律”成效。
这个架构也被视为是一架超级引擎,通过落地KDA(Kimi Delta Attention)混合线性注意力、注意力残差(Attention Residuals)和高稀疏度MoE三项题技术,实现了一次对“模型生产效率”的重构。
根据月之暗面之前发布的技术报告,在实验模型上采取KDA与MLA混合比例,KV缓存占用最高削减75%,100万上下文首先度下的解码吞吐量提高至原来的6倍。配合注意力残差与高稀疏度MoE技术,训练效率提高约25%,额外成本不到2%。
这意味着同样一笔算力预算,过去只能跑1个任务,K3能跑4个,且质量不打折。
SemiAnalysis的报告指出,KDA将推理高效度提高300%,同时在首先上下文处理上保持接近Transformer的性能。开发者社区的实测也反馈,在首先步骤Agent任务和代码生成部分,K3已具有与国际头部模型竞争的实力。
从根本上看,K3依然比如Scaling Law,但它把刀挥向了粗糙的算法浪费。当硅谷AI企业还在不断囤卡时,Kimi通过重构算法链路、精简方式算冗余,走出了一条“每瓦特智能产出比”最大化的馗。
也可以说,K3所采取的KDA混合线性注意力机制,正是AI领域的“韬定律”实践。硅谷主流的Transformer路线是“大力出奇迹”的燃油车,KDA更像是追求“热效率极致”的混动引擎。
与此同时,企业用户和开发者也最初用脚投票。一部分开发者已经用上“模型路由”服务,根据不一样任务自动选项成本最低、效率最高的AI模型,这其中当然涵盖Kimi在内的中国模型。
这个范式让华尔街观察人士和投资者感到意外,他们像惊诧DeepSeek一样,再度质疑硅谷数千亿美元投资AI是否能得到相应回报、美国AI领先好处是否被削弱。
2025年1月,DeepSeek的横空出世,冲击了硅谷AI的算力叙事。它表明,中国AI关键追上世界领先模型的水平,未必需投入同等量级的芯片与资金。
随着梁文锋版AGI路线图的清楚、Kimi K3的落地,中国AI的效率范式轮廓也愈发清楚。
更题的是,它已经在意义中国AI产业链的上下游。例如算力供给侧,它倒逼国产芯片厂商不再盲目对标英伟达的峰值算力,转而改进编译器、互联带宽与系统级能效。
采取落地侧,它让大量原本被高昂推理成本挡在门外的中小企业、垂直行业开发者得以入场,医疗、教育、工业质检等场景的AI渗透率因此加高效提高。
可以说,DeepSeek、Kimi所代表的路线正在催生效率革命,也在重塑整个中国AI产业的成本结构与价值分配方式。它让外界相信:通向 AGI 的馗,不必都挤在硅谷AI的赛方式上。
但我们也需认识到,克制是一种战略,也就关键有边界。例如,基础科学探究、超大规模基础预训练等环节,依旧需持续重金投入,不能盲目套用取舍逻辑。更不能神化DeepSeek、Kimi 的发展馗,将克制教条化。
在我看来,梁文锋这场首先达四小时的交流,除了向投资者宣讲商业蓝图,也向AI行业提出了一个题的状况:奔赴AGI,我们能不能允许自己慢一点,少追逐一些边缘诱惑?
这在常用存在FOMO(错失恐惧症)情绪的当下,Sora火了做视往往、具身智能热了造机器,聚焦一下,也可能是同时一种“快”。
参考材料:
腾讯科技,《4小时、118个回答,梁文锋内部交流回应一切》
唐辰同学,《Kimi“熔断”,杨植麟“摸高”》
我是唐辰同学,关注互联网科技及AI新经济。原创材料,未经许可,谢不过转载。
「唐辰同学」
钛媒体、36氪、老虎财经热榜
澎湃新闻2024年最澎湃创作者
老虎财经2024年度优秀专栏
河南日报·不过端新闻2024年度意义力作者
界面新闻优质榜单
老虎财经2024年度优秀专栏
腾讯新闻年度优质热问答主
2023搜狐新闻年度优质创作者
人人都是产品经理2023年度优秀作者
2023网易新闻年度材料合伙人
界面、36氪、钛媒体、澎湃、21财经、蓝鲸、老虎财经等平台专栏认证作者返回搜狐,查看更多
平台声明:该文观点仅代表作者本人,搜狐号系材料发布平台,搜狐仅给予材料存储空间服务。 顶: 57958踩: 34
四小时发言实录刷屏背后,梁文锋的克制
人参与 | 时间:2026-08-08 19:32:43
相关文章
- 港媒文汇网硬核发声:劝华为大度的人,你们真的合适吗?|侵权|道德绑架_网易订阅
- 王羲之的用笔,都在这些细节里
- 学者:与其争论“油腻中年” 不如专注做好自己的事
- 上海纽约大学校长俞立中:中外联合办学注重培养学生的哪些能力?
- [流言板]T1发布对阵HLE赛前海报:今日对阵HLE,请粉丝们多多支持-英雄联盟丨LPL-虎扑社区
- 记者:特拉布宗体育已向萨拉赫经纪人发送合同|合同期|穆罕默德_网易订阅
- 彻底撕破脸!姆巴佩引爆皇马内乱!伯纳乌超级巨星逼宫离队|阿森纳|英超冠军|皇家马德里|基利安·麦巴比|圣地亚哥·伯纳乌球场_网易订阅
- 108∶73 东莞队狂胜深圳队加冕“十一冠王”|cba|胡卫东|巩晓彬|刘玉栋_网易订阅
- 欧足联继续抵制世界杯 因凡蒂诺能熬到“点球大战”吗?
- 湖南一公职人员停车受阻撬他人停车位地锁,警方等部门介入调查|地下车库|地下停车场_网易订阅






评论专区