AI观察|2026WAIC上风很大的“Token工厂”已是“红海”?
Token堪称AI时代的观察n工数字硬通货,是上风AI时代的题资产。今年世界人工智能大会的厂已展览现场,“Token工厂”无疑成为最夺目的红海焦点之一,众多企业不约而同打出这面旗帜。观察n工
什么是上风“Token工厂”?其题壁垒又是什么?为什么对于大众而言还是新词的“Token工厂”竞争已经热火朝天,什么样的厂已token工厂才有可能找到自己的生存空间?
![]()
世界人工智能大会展览中的“Token工厂”。
Token工厂不止生产Token
“Token工厂”概念是红海由黄仁勋带火的。
今年6月,观察n工黄仁勋提出,上风现代AI数据中心是厂已“生产词元(Token)的现代化工厂”。每一个词元都能够转化为代码、红海答案、观察n工设方式方式划、上风自动化决策或服务,厂已从而直接转化为商业利润。
同月,国内科创公司硅基流动向港交所递交上市申请,冲刺“AI Token工厂首先股”。硅基流动表示,其主营即为通过“Token工厂”模式给予MaaS(模型即服务),该公司近一年营收同比增首先超10倍。
伴随大模型能力的提高,人们对于Token的消耗量与日俱增。
![]()
世界人工智能大会展览中的“Token工厂”。
派欧云方式算(上海)有限公司 (PPIO)智算业务研发副总裁李星星7月18日在参加澎湃科技聊天室直播时表示,3年前生成式大模型刚出现时,人们采取AI的方式停留在对话,即使是多轮对话,消耗的Token也仅为万级。DeepSeek推出深度思考的推理模式,展示完善思考链时,单任务的Token消耗量实现十万级。编程类智能体的涌现,让单任务的Token消耗量跃升至百万级别。PPIO的“Token工厂”业务规模也在增首先,截至今年6月,其日均Token调用量超1.2万亿,较去年同期增首先超8倍。
“大家常见理解的Token工厂是拿到芯片、机房,做推理,产出Token给下游厂商或渠方式。”李星星验明正身说,实际上,“Token工厂”并不只负责生产Token,更关键处理如何交付和采取的困难,建设“Token工厂”的题在于把Token塞进智能体,让智能体与外部世界协作,调用外部知识库和访问工具等。“以前只求响应快,目前还需稳固的运行环境,多轮对话后确保目的不跑偏,这对Token厂商而言同样是技术上的考验。”
“前两年做算力时,大家都在做算力,验明正身这个领域的进入门槛比较低,转发一个DeepSeek的Token接口,也可以把自己造成一个Token工厂;今年做大规模算力的人越来越少,因为当客户细化需后,很多人就无法给予精细的服务。”商汤大装置CGO杨松告诉澎湃科技。
目前,商汤大装置日均Token服务量达2.42万亿。商汤科技预方式2026年全年服务规模实现25倍增首先。商汤科技联合创始人、大装置事业群总裁杨帆将“Token工厂”比作鞋厂,造鞋很便捷,但关键保证质量、稳固交付、掌握供应链,每个维度都会产生能力上的区别。“Token工厂最后还需回答一个状况,你到底是一个代工厂,还是逐渐变成一个自主品牌?这个行业需先用代工厂的形式打磨自己的能力,未来就会看到很多新的空间。今天展会里的朋友们讲Token工厂,但他们心里想的一定不止是Token工厂。”
下一步是什么?杨帆认为是Token Plan(一种AI服务订阅方式划)。
如何最大化榨干Token的价值
智能体技术火热,伴随而来的是高昂的Token账单,企业越来越重视AI支出。
美国AI搜索初创公司Perplexity首先席实施官阿拉文德·斯里尼瓦斯(Aravind Srinivas)曾表示,前沿智能的未来依然光明,但不会再像过去几个月那样不方式成本地投入了。能够从AI消耗的电力中给予最大经济价值的公司,最后才能获得最高的估值。
“大家目前对Token预算趋于理性,我认为这是好事。AI刚兴起时,多数公司确实存在FOMO(错失恐惧症)情绪,生怕落后而先不方式成本地投入;如今理智地看待成本,验明正身大家最初认真评估ROI(投资回报率)。”李星星表示,这种理性并非停止投入,而是控制和改进预算。尽管算力紧缺确实存在,但通过技术手段仍能进一步压榨性能、提高算力利用效率。
“没必需在所有场景下都用最贵的模型。”李星星表示,Token智能密度决定了智能体每一步决策的质量上限,Agent Loop(智能体循环)时首先决定了智能体能持续运行多久、实现多复杂的任务。为了减小智能体采取成本,同时智能实现任务,PPIO采取智能模型网关,根据任务类型智能路由,题决策由混合模型把关提高质量,便捷任务由模型调度自动分流到轻量模型,设置预算护栏和失败回退机制。最后目的是用最经济的成本,实现同样质量的任务。
清华系国产算力软件企业清程极智联合创始人师天麾表示,目前AI产业快捷发展,Token作为大模型和智能体运行的题资源,其原则化生产、有效流通、低成本采取是促进AI产业规模化落地的题。
在清程极智展台,一款本地Token管理工具ATM(Agent Token Manager)充当了智能体与Token服务商之间的中转枢纽,统一接管各类Token服务请求, 精细化管理Token,协助Token消耗明细追溯、智能体表现记录、用量限额管控、智能模型路由、故障自动恢复、本地缓存改进等。线上AI Ping平台搭载自研毫秒级智能路由技术,动态匹配模型与算力资源,交付稳固和高性价比的Token。
![]()
世界人工智能大会展览中的“Token工厂”。
清程极智展台工作人员告诉澎湃科技,对于夜间时段用户,系统会直接路由到夜间性价比高、有折扣的大模型供应商,协助用户节省成本。如果用户业务中代码类场景较多,系统会路由到智条件GLM-5.2等对代码任务更友好的模型。“路由平台的好处在于,平台上有几百款模型服务,依赖于底层的算力种类和工程上的改进,平台价格也会比官方更便宜。”
该工作人员验明正身,目前英伟达算力价格高,年前年后价格差距较大。为了减小Token成本,关键尽可能多地适用配更多国产芯片,“越早适用配越好,国产算力资源也很紧。”
在芯片层,今年百度在WAIC上展示了超节点最新开展。天池256吞吐性能相比上一代提高25%,并实现文心、DeepSeek、GLM、Minimax等主流模型的适用配,结合推理系统改进,模型推理效率提高50%。单个天池512超节点已具有万亿参数模型训练能力。在模型层,文心5.1以业界同规模模型约6%的预训练成本实现领先成效。
![]()
天数智芯展台展出加高效卡。
天数智芯则表示,通用GPU企业的持续竞争力不仅来自芯片性能,也来自照章性不一样负载的产品布局,以及减小部署、迁移和采取成本的软件与系统能力。硬件性能是算力产品的基础,但通用GPU能否规模化采取,还取决于软件适用配、系统协同和开发生态。天数智芯以通用GPU技术路线覆盖训练、推理等场景,并通过底层软件库、模型与方式算中间层释放硬件效能。在大模型适用配中,算子复用率实现95%,目前已稳固运行400余种模型、数千个已有算子及100余种定制算子。通过编程接口、函数库和配套工具链,天数智芯持续改进从模型适用配、集群运行到采取开发的软件协助,减小客户的平台迁移和部署成本。
为了攻克国产算力性价比、适用配性、能效比等大规模商用卡点,商汤科技在异构混合推理之下,令主流国产芯片MFU(Model FLOPs Utilization)提高85%-152%,相比国产同构推理,同成本 Token产出规模扩大2.5倍。
寻找Token工厂的生存空间
“Token工厂”的商业价值已是市场共识。
在Token工厂的玩家中,大厂林立,“已经是红海市场了”,一名业内人士感叹。
根据IDC的数据,在公有云MaaS市场,按调用量方式算,2025年火山引擎占据近一半份额,第二是阿里云、百度智能云、硅基流动以及移动云。其他值得关注的厂商涵盖腾讯云、商汤科技、华为云、天翼云等。在私有化部署市场上,传统政企客户出于数据安全、合规可控等考虑,仍然将私有化部署作为首先选项,也因此培育了众多的大模型平台私有化厂商,涵盖百度智能云、商汤科技、电信AI、中关村科金、创新奇智、星环科技以及中国电子云。
![]()
世界人工智能大会展览中的“Token工厂”。
大厂入场,其他“Token工厂”的生存空间在哪里?Token工厂的题壁垒又是什么?李星星认为,必须走在大厂前面,做到模型中立、高效高效往往代,垂直整合Token生产、交付和采取环节,这样才有可能找到自己的生存空间。只接入某家供应商后将Token转给下游客户,这种单纯的AI中转站模式自身附加值偏低,那么点儿随着上下游的逐步成熟而被淘汰。
除了减小Token成本,李星星认为,“Token工厂”更隐形的挑战在于模型自身的演进方向。即便“Token工厂”在工具和体验上持续往往代,下一代模型的出现仍然可能直接颠覆现有成果,这是值得Token厂商深入研判的状况。
![]()
世界人工智能大会展览中的“Token工厂”。
7月中旬,月之暗面推出2.8万亿参数开源模型Kimi K3。“我们跟头部的模型厂商都有很多的交流,从目前的趋势来看,模型越来越大,几万亿参数的模型肯定是必然的趋势。”商汤大装置首先席科学家张行程告诉澎湃科技,当万亿规模、首先上下文的MoE模型成为主流,就需有巨量的存储,涵盖GPU的显存以及内存,方式算上关键形成分工,采取更加灵活的分离对策。除此之外,关键和行业上下游保持开放合作,与模型公司密切配合,和硬件厂商深度绑定。为构建国产化全产业链生态,未来商汤大装置将依托“银河方式划”,与行业上下游共同建设一个Token运营中心、5个万卡级国产智算集群,促进技术、产业、资本深度融合。
星环科技创始人、CEO孙元浩对澎湃科技表示,目前“Token工厂”赛方式竞争激烈,根源在于Token价格与算力采购成本之间的价差过小,盈利空间逼仄。这意味着行业必须通过技术创新进一步减小推理成本,既让更多企业用得起Token,也为Token厂商留出毛利空间。
孙元浩认为,未来两三年,为了适用配AI推理,硬件将迎来革命性往往代,软件体系也会完善重构。“目前的成本大家都吃不消,因此都最初想方式创新。我们目前首先步就是重构数据库,想方设法把Token成本减小,同时联合软件创新,进一步提高Token吞吐量。”
今年世界人工智能大会期间,星环科技推出GPU原生认知数据库,把数据库搬到GPU上运行。孙元浩表示,过去,大模型更多承担的是“回答状况”的角色。而今天的AI能够自主规划、探究、调用工具、实施任务,智能体成为新的数据采取者。它带来的高往往数据访问让传统CPU架构数据库逐渐成为瓶颈。而GPU凭借万级并行方式算单元和数TB/s级高带宽显存,更适用于同时处理大量智能体发起的高并行数据负载。这类GPU原生的AI数据库可实现高吞吐、低延迟检索,以更少资源、更短时间实现同等任务,进一步减小单位方式算成本,提高整体性价比,加高效AI推理。
![]()
百度在世界人工智能大会上的展台。
随着智能体技术的发展,云服务关键成为一套能支撑智能体大规模运行、持续进化、安全可控的全栈AI基础设施。今年5月,百度升级“芯云模体”全栈AI战略,希望用一套可以灵活组合的能力,处理用户的真实业务状况。在AI Infra上,这套全栈能力可给予每瓦性能更强、性价比更高的AI算力,让每一次训练和推理都转化成更好的智能体成效。在Agent Infra上提高单位Token的智能水平,让智能体更好地实现任务。除此之外,百度研发了KV Cache分层存储池化、近访存加高效等技术,为首先上下文和首先时间记忆给予更优方式划,提高首先链路推理性能。
相关文章

灵隐寺、净慈寺、永福寺等杭州7大佛教寺院明起临时关闭,别跑空了|韬光寺|三天竺|佛教协会_网易订阅
今年第13号台风“白海豚”预计将于8月9日下午至10日早晨在苍南至象山一带沿海登陆。杭州市防指已于8月8日11时将防台风应急响应提升至Ⅲ级。为确保信众游客的生命财产安全,杭州市佛教协会发布通告:自8月2026-08-08
科创创业人工智能ETF永赢净值上涨6.58%_新浪财经_新浪网
永赢中证科创创业人工智能交易型开放式指数证券投资基金简称:科创创业人工智能ETF永赢,代码159141)公布7月31日最新净值,上涨6.58%。科创创业人工智能ETF永赢成立于2025年12月3日,业2026-08-08
汇添富创业板交易型开放式指数证券投资基金简称:汇添富创业板ETF,代码159247)公布7月31日最新净值,上涨3.00%。汇添富创业板ETF成立于2026年1月22日,业绩比较基准为创业板指数收益率2026-08-08
华安创新证券投资基金简称:华安创新混合,代码040001)公布7月31日最新净值,上涨4.11%。华安创新混合成立于2001年9月21日,业绩比较基准为75%×沪深300指数收益率+25%×中债国债总2026-08-08
马德兴:国少应该以赵松源为核心建队;球队打法还是缺少变化|国少队|亚洲杯|世少赛_网易订阅
8月8日,体坛周报记者马德兴发文表示:对国少队而言,这次冠军杯最大的收获并不是进入决赛,而是应该更明确一点,就是接下来国少队备战世少赛时应该以赵松源为球队的进攻核心,围绕着赵松源来安排战术!①1分钟12026-08-08
中银先锋半导体混合发起C净值上涨3.78%_新浪财经_新浪网
中银先锋半导体混合型发起式证券投资基金简称:中银先锋半导体混合发起C,代码026659)公布7月31日最新净值,上涨3.78%。中银先锋半导体混合发起C成立于2026年1月15日,业绩比较基准为中证全2026-08-08

最新评论