DeepSeek又更新了,这次梁文锋没放大招|进击的独角兽|调用|系列模型|flash|agent|deepseek_网易订阅

作者:知识 来源:综合 浏览: 【 】 发布时间:2026-08-08 22:19:14 评论数:
DeepSeek又更新了,这次梁文锋没放大招|进击的独角兽|调用|系列模型|flash|agent|deepseek_网易订阅
出品|虎嗅科技组作者|宋思杭编辑|苗正卿头图|视觉中国这是又更用系易订阅进击的独角兽第31篇,该系列关注月之暗面、新次型智条件、梁文列模MiniMax、锋没放阶跃星辰、招进零一万物、独角百川智能、兽调面壁智能和DeepSeek共8家大模型独角兽公司。又更用系易订阅梁文锋的新次型热度一直在AI圈的Top级,尤其是梁文列模今年。从V4预览版发布,锋没放到后来的招进融资与IPO传闻,再到一份流传甚广的独角四小时谈话实录,DeepSeek的兽调每一次动作,都能高效高效成为行业话题。又更用系易订阅7月31日下午,DeepSeek又更新了。这次,DeepSeek只是在API文档的更新日志里宣布,V4-Flash正式版API上线公测。从“正式版”和“公测”两个词同时出现来看,这并不是V4的最后形态。DeepSeek也特意强调,本次更新只包含V4-Flash的API,V4-Pro及App、Web端模型均未发生变化,V4-Pro正式版还关键再等等。但这次更新依然值得关注。从最新版本来看,V4-Flash-0731没有变化模型架构和参数规模,只重新开展了一次后训练。更新后,DeepSeek把几乎所有篇幅都用来强调它在Agent,尤其是Code Agent上的发展。这意味着,V4-Flash并不是一次便捷的模型更新。DeepSeek正在尝试回答一个新的状况:到了Agent时期,一家公司最需的,究竟是一个能力最强的模型,还是一个足够强、足够快,也足够便宜的模型?这一次,DeepSeek没有后续堆参数V4-Flash并不是7月31日才首先次出现。4月24日,DeepSeek发布V4预览版时,已经同时推出V4-Pro和V4-Flash。两者都是MoE模型,但体量差距明显:V4-Pro具有1.6万亿总参数,每次推理激活49B参数;V4-Flash具有284B总参数,每次只激活13B参数。两款模型均协助100万Token上下文。在DeepSeek的定位里,Pro负责能力上限,Flash负责效率。参数规模更大的V4-Pro,在世界知识以及高难度Agent任务上谝更好;V4-Flash则可以通过提高思考预算,在部分推理任务上接近Pro。换句话说,Flash牺牲了一部分知识容量,却用更小的激活参数换来了高效度和成本。7月31日的更新没有变化这套架构。DeepSeek清楚表示,V4-Flash-0731与预览版的模型结构、尺寸完全相同,仅重新开展了后训练。但就是这次后训练,让V4-Flash的Agent能力出现了明显变化。按照DeepSeek公布的结荚,V4-Flash-0731在Terminal Bench 2.1上实现82.7,在NL2Repo上实现54.2,在DeepSWE上实现54.4,在Toolathlon Verified上实现70.3。DeepSeek称,这些结荚已经大幅超过V4-Pro预览版。这件事的意义在于,DeepSeek没有通过提高参数和重新预训练,来提高模型的Agent能力。用通俗的话来讲就是,DeepSeek虽然后续在追求AGI,然而并没有通过一味地提高参数来实现这件事情,而是让模型学会更好地拆解任务、调用工具、实施代码,并在更首先的任务轨迹中减小错误。过去,大模型公司的题竞争发生在预训练时期。谁有更多算力、更多数据,谁就有机会训练出参数更大、知识更多的模型。但进入Agent时期后,模型能力不再完全由预训练决定。一个模型会不会采取终端,能不能在数百次交互中维持任务状态,遇到错误后能否修正,以及是否知方式什么时候应该调用什么工具,这些能力越来越依赖后训练、强化学习和模型外部的实施框架。V4-Flash的变化,恰好验明正身了这一点。这也是为什么,DeepSeek这次除了更新模型,还原生协助了Responses API,并专业适用配Codex。同时,DeepSeek在测试Code Agent任务时,采取了尚未正式发布的DeepSeek Harness minimal mode。换句话说,这些Agent成绩不完全属于模型本身,而是属于“模型、推理预算与Harness”共同组成的系统。这当然也意味着,目前公布的数据仍需谨慎看待。一部分,部分结荚来自DeepSeek内部测试集;另一部分,DeepSeek Harness尚未公开,外界还无法在完全相同的环境下复现这些成绩。正式版V4-Flash究竟比预览版发展了多少,还需等待独立评测以及真实开发场景验明正身。但至少从这次更新可以看出,DeepSeek正在从只给予模型和API,向Agent所需的实施环境多走一步。但DeepSeek目前还没有亲自做一个完善的Agent产品,却最初给予让模型进入Agent工作流所必需的接口、适用配和Harness。这是一种特别克制的产品化。为什么是Flash?既然V4-Pro的能力上限更高,DeepSeek为什么不先更新Pro?最直接的因素是,Agent并不是一次模型调用。在聊天机器人时期,用户提出一个状况,模型生成一次答案,一次交互就结束了。但在Agent任务里,模型需先理解目的,再拆解任务、检索材料、调用工具、读取结荚、修正错误,最后实现交付。一个复杂任务,可能涵盖几十次甚至数百次模型调用。这时,模型单次推理提高的成本和延迟,会在整个任务轨迹中被不断放大。一个能力更强、但高效度更慢、成本更高的模型,未必能带来更好的实际结荚。Agent真正需的,频仍不是每一步都调用能力最强的模型,而是在不过大多数步骤中,采取一个能力足够、价格更低、响应更快的模型。这正是V4-Flash的价值。根据DeepSeek技术报告,在100万Token上下文下,V4-Flash单Token推理所需的方式算量,约为V3.2的10%,KV Cache则约为V3.2的7%。它的总参数只有V4-Pro的约六分之一,每次激活参数也只有Pro的约四分之一。这种差距最后也体目前API定价上。目前,V4-Flash每百万Token未命中缓存的输入价格为1元,输出价格为2元;V4-Pro分别为3元和6元。V4-Flash的并发限制为2500,Pro则为500。Responses API目前也只有V4-Flash协助,V4-Pro预方式到8月初才会接入。在V4的产品体系里,Pro负责说明DeepSeek的模型能力能够实现什么位置,Flash则负责承担真正高往往、首先链条的Agent任务。前者是能力模型,后者更像生产模型。梁文锋曾在内部公开说方式,“模型应该放在相同成本下比较;在现时期,Coding Agent的优先级高于其他垂直Agent。”从这个角度来看,V4-Flash此次更新的方向,确实与这两个判断形成了呼应。DeepSeek没有选项通过扩大参数,让Flash在所有能力上追上Pro;它选项在模型架构不变的状况下,通过后训练和Agent框架,提高Flash实现真实任务的能力。这背后是一种更现实的方式算。如果Agent最后关键进入企业和开发者的日常工作流,那么决定模型能否被大规模采取的,不只是Benchmark,而是实现一个任务需多少时间、消耗多少Token,以及最后成功率是多少。然而,这也是V4-Flash目前最需说明的地方。DeepSeek公布的Agent成绩大多采取Max reasoning effort实现。更高的思考强度常见意味着更首先的推理流程和更多Token消耗。一个模型每百万Token的价格很低,不等于实现一项任务的总成本一定更低。如果V4-Flash需消耗更多Token才能实现接近Pro的成效,那么它在单价上的好处,可能会被更首先的任务轨迹部分抵消。因此,真正有价值的比较,不是V4-Flash在某一项Benchmark上超过了谁,而是在实现同一个Agent任务时,它与V4-Pro、Kimi、GLM以及闭源模型分别需多少Token、多少时间和多少次重试。DeepSeek暂时还没有给出这个答案。本文来自虎嗅,原文链接:https://www.huxiu.com/article/4879740.html?f=wyxwapp

最近更新