您现在的位置是:知来藏往网 > 娱乐
成本拉低100倍,梁文锋把Claude拉进“斩杀线”_DeepSeek_tokens_-Flash
知来藏往网2026-08-08 23:10:29【娱乐】3人已围观
简介据《财经》独家报道,DeepSeek已重启第二轮融资,计划募资500亿元,投前估值约5000亿元,预计8月下旬完成签约。今年6月,DeepSeek才刚刚完成首轮500亿元融资,创下国内大模型首轮融资规

据《财经》独家报方式,斩杀线DeepSeek已重启第二轮融资,成本方式划募资500亿元,拉低e拉投前估值约5000亿元,倍梁把预方式8月下旬实现签约。文锋今年6月,斩杀线DeepSeek才刚刚实现首先轮500亿元融资,成本创下国内大模型首先轮融资规模纪录,拉低e拉投后估值超过3500亿元。倍梁把仅时隔两个月,文锋其投前估值便攀升约43%,斩杀线两轮募资实现后往往方式金额将超千亿元。成本估值狂飙的拉低e拉底气,来自DeepSeek正在改写行业条件的倍梁把方式费条件。详详见细的文锋状况是这样的,权威模型测试媒体Artificial Analysis放出了一组实测数据,他们用多个主流模型跑同一组基准测试,比谁的平均成本更低。测试结荚显示,DeepSeek V4-Flash 跑完善套基准测试,平均一次任务成本只需3美分。乍一看这个数据可能没什么,然而如果把其他主流模型拉来作为比较,一切就都变了。在同一份基准下,Anthropic 的旗舰模型ClaudeFable 5平均成本为3.15美元,GPT-5.6 Sol 关键1.86美元,DeepSeek 比 Claude 便宜了100倍。同时这只是金钱成本,DeepSeek V4-Flash 还有一大特点就是快。根据 Artificial Analysis 的实测数据,DeepSeek V4 Flash(Max Effort 模式)的输出高效度约为113tokens/秒,而同级别的 Anthropic 旗舰模型Claude Opus 5约为74tokens/秒,约为1.5倍。也就是说,当DeepSeek跑完所有基准测试的时候,Claude才刚跑完一半。代价是什么呢?为了得到这种极致的性价比和效率,DeepSeek V4-Flash在智能水平上做了一定的取舍。Artificial Analysis的数据显示,智能指数部分V4-Flash得分为50分,跟谷歌Gemini 3.6 Flash持平,只落后旗舰模型约10分——Claude Opus 5为61分,Fable 5为60分。便宜100倍,快2倍,性能只低不到20%。尤其是对于那些需采购模型 API 的企业来说,这笔账可能得重新算算了。A过去这几年,大模型行业的定价方式既便捷又粗暴,按跑了多少token算钱。输入每百万token多少钱,输出每百万token多少钱,厂商怎么定价,用户就怎么交钱。但这个算法有个状况,它比的是“原材料价格”,不是“成品价格”。就像去饭店吃饭,菜单上写着“大米5块钱一斤”,但我只在乎“一碗米饭多少钱”。token相当于是大米,任务就是那碗米饭。大米就算再便宜,蒸成米饭的工艺依然会意义米饭的最后价格。DeepSeek V4-Flash的官方定价是每百万输入token 0.14美元,每百万输出token 0.28美元,人民币定价为输入缓存未命中每百万输入1元,输入缓存命中每百万0.02元,输出每百万2元。这个价格本身就已经是行业最低梯队了。但状况是,token价格低不等于任务成本低,一个模型如果需生成更多的token才能实现同样的任务,那便宜的token单价可能换来一张昂贵的账单。Artificial Analysis 做的事情,就是把这层“翻译”给做了。他们比的是“跑完同一套基准测试关键花多少钱”。这个口径叫“每次任务成本”(Cost per Task),它把token用量、推理深度、缓存命中率、思考时间这些变量全部揉在一起,直接给出一个终极答案,干完一件事到底关键花多少钱。但状况来了,DeepSeek凭什么能这么便宜?V4-Flash模型总参数有2840亿,但每次推理时实际激活的只有130亿,不到总参数量的5%。但光靠这些还不够。V4在注意力机制上做了很大的文章,他们设方式了一套叫CSA(压缩稀疏注意力)和HCA(重度压缩注意力)交替排列的混合架构。这两套机制的题是不一样距离的材料,用不一样的精度来记。例如最近几分钟发生的事,记得特别清楚,每一个细节都能说出来;几天前发生的事,大概就只能记得发生了什么,细节被模糊掉了;几个月前的事,可能只记得一个大概的印象。CSA和HCA,就是模拟了这个“近清楚、远模糊”的记忆规律。随着上下文增首先,把题的材料留下,不题的就全都抹去。在百万token上下文下,V4 Flash的单token方式算量只有V3.2的10%,KV缓存更是只需7%。同时上下文越首先,这个好处越大。但架构也还只是故事的一半,V4-Flash从预览版到正式版开展了一次“原地升级”。这两个版本的模型一个参数都没动,唯一的区别在于后训练。这背后是DeepSeek一套独特的两时期后训练方式。首先时期叫“分科培养”。数学、代码、Agent、指令跟随这些领域,各自单独训练专家模型。每个专家先用监督微调(SFT)打基础,再用GRPO强化学习反复打磨。GRPO是郭达雅在DeepSeek时发表比如文DeepSeekMath中首先次提出的概念。传统PPO算法需额外训练一个价值函数模型,又费显存又费算力,而GRPO直接把这一步砍了,改成让模型对同一状况生成多个答案,用组内的相对排名来代替不过对价值评估,自己跟自己比、自己跟自己学。既省了训练成本,成效还更好。第二时期叫“融会贯通”,用On-Policy Distillation(在线对策蒸馏)把多个领域专家的能力合并回同一个模型里。蒸馏的时候不是便捷地复制输出,而是让目的模型在自己的对策分布下生成数据,再用专家模型的输出来矫正,确保合并后的模型不会“学了这个忘了那个”。过去说模型蒸馏,都是先让高性能的模型生成答案,再让低性能的模型去学。然而在线对策蒸馏是反过来的,是学生先自己做题,老师在旁边看着,边看边指导。学生根据各个老师的反馈,当场调整自己的思路,后续往下做。做完一方式,再做下一方式,边做边学。“在线”指的是学生和老师是同步的,老师实时给学生反馈。“对策”指的是它学的不是详详见细某方式题的答案,而是“遇到状况该怎么想”这套思考方式。其结荚是,Terminal Bench 2.1从61.8分干到了82.7分。这个测试测的是模型在真实终端环境中实现复杂命令行任务的能力,分数直接超过了自己的老大哥V4-Pro预览版的72.1分,逼近Anthropic旗舰Opus 4.8的85.0分。更夸张的是 DeepSWE,这是一个专业测试GitHub真实Issue处理能力的基准,DeepSeek V4-Flash从7.3分飙到54.4分,涨幅645%。一个Flash级别的轻量模型,在9项Agent基准测试上完善碾压自家旗舰Pro的预览版。B100倍的价差很可能会变化企业对模型API的采购逻辑。过去几年,企业选模型的流程就像选供应商,比参数、比跑分、比价格,最后选一个“综合最优”的。这种思路的前提是模型之间的价格差距不大,都在同一个数量级内,当然大家都会选能力最强的。但在Artificial Analysis提出“每次任务成本”之后,这个前提就塌了。假设一个企业每天关键处理100万次API调用,用Claude,每天的成本是31500美元,用DeepSeek,每天只需300美元。一年下来,差距是1130万美元。这已经不是省点钱的状况,这是能不能活下去的状况。因此企业的题命题就不再是“用哪家模型”了,目前变成了“怎么把任务分到最适用用的模型上”。这个思路在行业里有个名字,叫模型路由(Model Routing)。模型路由的逻辑很便捷,把高价值、高失败成本的复杂任务放到Claude Opus 5或 GPT-5.6这样高上限的模型里,例如自动编程中架构设方式、金融报告的题探究、法律文书的条款审查等等,企业给模型的智能等级和成功率付费。然而这些任务数量其实并不多,题是任务失败会导致企业付出巨大的代价,用贵模型是完全合理的投资。像是批量分类、代码初筛、数据清洗、低风险Agent任务之类的“苦力活”,频仍占据了企业运营的80%,因此把这些全都交给DeepSeek,省下来的每一分钱都是纯利润。根据Menlo Ventures的企业AI调研,37%的企业已经在生产环境中采取5个以上的模型。学术部分也有相同的推比如,LMSYS团队(UC Berkeley、Anyscale)在 ICLR 2025上发表的RouteLLM探究发现,在MT Bench基准上,智能路由可以在保持GPT-4 95%质量的前提下削减85%的成本。在已经公开的行业实践中,不一样任务分布和路由对策下,降本幅度常见在40%到85%之间。路由做得好不好,直接决定了企业的AI成本。一个路由对策粗糙的企业,可能80%的任务都打到了旗舰模型上;而一个路由做得精细的企业,可能只有20%的任务需旗舰模型,其余80%都分流到了高性价比模型。两家企业做同样的事情,AI成本可能差出5到10倍。这种方式便捷粗暴,但不准。很多时候会错配,便捷任务给了贵模型;复杂任务给了便宜模型,做不好还关键重来,反而更贵。高级一点的,是用分类器。先训练一个小模型,专业用来判断“这个请求应该用哪个模型”。请求进来,先过分类器,分类器说便捷,就给便宜模型;分类器说难,就给贵模型。这种方式比静态条件准,但还是有状况。分类器本身也会犯错,同时它只能根据请求的字面意思判断,不知方式模型实际做出来成效怎么样。再高级一点的,叫做“先试后升”。不管什么请求,先让最便宜的模型试试。如果结荚质量够好,就直接用;如果质量不够,再自动升级到更贵的模型重做。例如一个任务,直接用Claude关键3美元。用DeepSeek先试,3美分,成功了就赚了;失败了,再用Claude,总共 3.03美元,也只比直接用Claude多花了1%。只关键成功率不是0,这个买卖就划算。因此闭源厂商的日子,之后会越来越不好过。它们必须不断往上走,去做那些更难、更复杂、价值更高的任务,把自己的护城河挖得更深。因为下面的市场,已经被DeepSeek占满了。最难受的是中间那档模型,比DeepSeek强,但又没强到哪里去,价格还贵了几十倍的。往上,打然而旗舰模型的能力;往下,打然而DeepSeek的价格。这就引起了一个新的状况,DeepSeek斩杀线。CArtificial Analysis做了一张图,把所有主流模型都放在一个坐标系里。横轴是每次任务的成本,对数坐标;纵轴是智能指数得分。图片中的虚线,代表了DeepSeek V4-Flash正式版的性价比斩杀线,任何处于虚线中的模型,都无法在DeepSeek可以实现的任务中,价格低于DeepSeek。之前,行业常会用GPT-4o、Claude Sonnet、Gemini Pro这些模型来作为参考,它们的性价比就成为了行业基准。比它们贵的,就得说明自己更强;比它们弱的,就得说明自己更便宜。然而图片中可以看到,这些作为行业基准的模型,它们的斩杀线是很低的,稍微推理强度高一点的模型,都可以容易逃过被斩杀的命运,DeepSeek V4-Flash正式版的出现,让整个斩杀线抬高到了一个特别高的地方,全球将近70%的模型都处于被斩杀区域。图片另一边的橙黄色区域,是Artificial Analysis基于V4-Flash预览版和正式版之间的区别,对旗舰模型V4-Pro的正式版性能和价格的预测。V4-Pro目前的定价,输入缓存命中是每百万token1 元人民币,缓存未命中是12元,输出是24元。限时优惠期间更便宜,输入只关键2.5元,输出12元。虽然价格比Flash贵了不少,然而性能也提高了很大。这也就意味着,涵盖低推理强度的Fable 5和GPT-5.6在内,全球90%的模型,在实现任务的性价比这部分,都被DeepSeek斩杀了,更有甚者,无比如是把推理强度调高也好调低也好,依然也逃然而被DeepSeek满血斩杀的命运。而DeepSeek手里还有另一张牌,Harness。8月初,DeepSeek Harness负责人崔添翼在X发文称“如果你是Agent Harness相关开源项目的开发者,希望参加 DeepSeek Harness的内测,可以回复或私信关联我。请附上GitHub id以及开源代表作。”虽然有保密协议以防止参与测试者泄露DeepSeek Harness的功能、参数相关材料,但已有部分参与测试者发文称,“成效炸裂”。Harness是DeepSeek自研的Agent运行时框架,类似于OpenAI的Codex和Anthropic的Claude Code,但深度绑定了 V4系列的模型能力。它的功能是让模型在实施Agent任务时少走弯路、少浪费token。一个Agent任务的实现质量,不只取决于模型本身的能力,还取决于框架怎么组织上下文、怎么处理工具调用的错误返回、什么时候该重新规划、首先会话怎么压缩、什么需算任务实现。Harness所负责的,正是这些事情。在V4-Flash正式版的基准测试中,DeepSeek已经用自家Harness的minimal模式跑了Code Agent任务,max档位,top_p 0.95,温度1.0。前文所提到的V4-Flash正式版分数,很多都是DeepSeek Harness跑出来的。但minimal模式只是Harness能力的冰山一角。Harness正式发布并开放完善功能后,同样的模型在同样的任务上,可能会谝出更高的成功率和更少的token浪费。换句话说,同样的智能水平,实际成本再降一截。返回搜狐,查看更多平台声明:该文观点仅代表作者本人,搜狐号系材料发布平台,搜狐仅给予材料存储空间服务。
很赞哦!(48)
相关文章
- 罗马诺:所罗门的交易进展顺利,西汉姆很有信心成交|热刺队|佛罗伦萨|西汉姆联足球俱乐部_网易订阅
- 生益电子股价涨5.92%,财通基金旗下2只基金重仓,合计持有35.02万股浮盈赚取213.26万元_新浪财经_新浪网
- 生益电子股价涨5.92%,华安基金旗下1只基金重仓,持有30.52万股浮盈赚取185.84万元_新浪财经_新浪网
- 美湖股份股价涨5.87%,永赢基金旗下1只基金位居十大流通股东,持有1627.9万股浮盈赚取2246.5万元_新浪财经_新浪网
- [流言板]解说:这场可能是AUBL两年来关键时刻最夸张的决胜时刻-CBA-CBA专区-虎扑社区
- 西部材料股价涨5.25%,方正富邦基金旗下1只基金重仓,持有18万股浮盈赚取33.84万元_新浪财经_新浪网
- 恒帅股份股价涨5.19%,富荣基金旗下1只基金重仓,持有6.21万股浮盈赚取23.49万元_新浪财经_新浪网
- 生益电子股价涨5.92%,海富通基金旗下3只基金重仓,合计持有83.34万股浮盈赚取507.55万元_新浪财经_新浪网
- 中国真的帮大忙,金正恩治下的朝鲜发生重大变化|外交|朝方_网易订阅
- 江西铜业股价涨5.25%,华泰柏瑞基金旗下1只基金位居十大流通股东,持有836.29万股浮盈赚取1931.84万元_新浪财经_新浪网
热门文章
站长推荐

《大步同行》克制修复音量 称听见身边玩家是设计核心|游戏|音效|麦克风_网易订阅

融捷股份股价涨5.09%,建信基金旗下1只基金重仓,持有2.18万股浮盈赚取7.13万元_新浪财经_新浪网

长信科技股价涨5.13%,前海开源基金旗下6只基金重仓,合计持有627.67万股浮盈赚取225.96万元_新浪财经_新浪网

盈峰环境股价涨5.39%,华安基金旗下10只基金重仓,合计持有1791.36万股浮盈赚取877.77万元_新浪财经_新浪网

[流言板]小心你的头!凯尔特人官方Ins晒球员们的扣篮照与球迷分享-NBA新闻-虎扑社区

科创芯片设计ETF富国(589400)涨5.42%,半日成交额1044.19万元_新浪财经_新浪网

美湖股份股价涨5.87%,前海开源基金旗下1只基金位居十大流通股东,持有220.65万股浮盈赚取304.49万元_新浪财经_新浪网

中芯国际股价涨5.06%,摩根基金旗下2只基金重仓,合计持有60.16万股浮盈赚取368.78万元_新浪财经_新浪网