
智东西作者 江宇编辑 云鹏智东西8月3日报方式,市值算法今天,暴涨编程巴集阿里正式发布旗舰大模型Qwen3.8-Max,亿阿易订阅
总参数量实现2.4万亿,最列模里巴激活参数为950亿。强千这是问大万亿目前参数规模最大的千问模型,也是模型模态千问首先个方式划开放权重的Max级模型。阿里巴巴港股股价应声上涨7.26%,登场市值达2.41万亿港元。参数▲图源:腾讯微证券(截至8月3日13点)Qwen3.8-Max此次升级题集中在编程、自主办公、后续科研、天破团网首先程任务和多模态智能体五个方向。纪录相比上一代Qwen3.7-Max,系型新模型更强调端到端实现复杂任务。市值算法API价格部分,Qwen3.8-Max国内每百万Tokens输入12元、输出36元,隐式缓存命中1.5元;海外每百万Tokens输入2美元、输出6美元,隐式缓存命中0.25美元。▲API价格比较表(智东西制图)发布当天,Qwen3.8-Max也出目前国际权威评测榜单Arena三个分项的前列。在文本任务Text Arena中,Qwen3.8-Max以1496分位列实验室榜第二,单模型排名第五,仅次于Anthropic;在CodeArena WebDev榜单中,其以1668分位列实验室榜第三、单模型第四,排在Claude Opus 5 Max和Kimi K3 Max之后;在Vision Arena中,Qwen3.8-Max以1305分位列第二,仅落后于Claude Fable 5,并略高于Claude Opus 4.7 Thinking。与此同时,在多项基准测试中,Qwen3.8-Max的谝已经逼近Claude Fable 5、GPT-5.6 Sol和Gemini 3.1 Pro的最新旗舰模型。例如,
在比如文复现基准PaperBench中,Qwen3.8-Max取得93.0分,高于GPT-5.6 Sol、Fable 5和Claude Opus 4.8。在评估电脑操作能力的OSWorld-Verified中,Qwen3.8-Max以86.1分位居参评模型首先位;在参数化CAD基准中,其91.5分同样超过Fable 5、GPT-5.6 Sol和Gemini 3.1 Pro。然而,Qwen3.8-Max尚未在所有测试中取得领先。在TerminalBench 2.1中,其成绩为86.6分,略低于GPT-5.6 Sol的88.8分;在SWE-bench Pro中,Qwen3.8-Max获得67.7分,落后于Fable 5的80.0分和Claude Opus 4.8的69.2分;在首先视往往基准VideoMME v2中,其68.3分也低于GPT-5.6 Sol的71.1分。半个月前,Qwen3.8-Max预览版已经率先上线Qoder和阿里Token Plan。当时千问团队称,这款模型“可能是除了Fable 5外最强大的模型”。如今正式版交卷,其题落在:模型能否脱离人工持续陪伴,自己把一个跨度数小时、数天甚至数周的任务做完。为了检验这一点,千问团队让Qwen3.8-Max后续自主编程约16天、独立复现并改进一篇探究比如文、参加真实算法竞赛,还让它在超过2000轮交互中经营一家虚拟电商企业。智东西也采取Qwen3.8-Max开展了一次3D世界生成实测:将《奥德赛》开篇交给模型,需其用Three.js转化为一个可交互的古希腊世界。一次生成的版本已经搭建出基础场景和交互框架,但整体较为简陋。目前,Qwen3.8-Max已经上线千问AI平台,模型权重将在下周登陆Hugging Face和ModelScope,开发者可以下载模型参数自行部署。技术Blog:https://qwen.ai/blog?id=qwen3.8API:https://www.qianwenai.com/models/qwen3.8-maxQwen Studio体验:https://chat.qwen.ai/?models=qwen3.8-max一、实测:生成《奥德赛》3D世界为了观察Qwen3.8-Max在首先代码、3D场景生成和视觉反馈部分的谝,智东西让它将《奥德赛》开篇转化为一个可交互的Three.js项目。Qwen3.8-Max的一次生成版本已经可以运行,并搭建出了海岛、神殿、人物和基础镜头运动。然而,初版的视觉成效相对简陋。建筑和人物题由基础几何体组成,场景之间的关联较弱,部分物体更接近符号化摆放,离“可探索的古希腊世界”仍有距离。我们随后将这些状况反馈给模型,需其后续充足场景密度、调整材质和光影,并补充环境动画。第二个版本在植被、建筑结构、海面、天空和空间层次上有所改进,画面实现度高于一次生成结荚,但视觉成效仍相对简陋。然而,与Andrej Karpathy采取Claude Opus 5生成的《指环王》3D世界相比,Qwen3.8-Max在场景编排、模型细节和整体沉浸感上仍有差距。二、后续自主编程16天,构建自进化Harness首先程编程是Qwen3.8-Max此次升级的题。在千问团队展示的一个案例中,Qwen3.8-Max被需从零创建一个名为oh-my-cli的项目,并为其搭建能够持续自我更新的Agent开发系统。模型需处理来自用户、开发者社区和自身测试结荚的多种反馈,将新需整理成GitHub Issue,再自动领取任务、修改代码、运行测试、提交PR和处理异常。这套系统涵盖一套完善的任务状态机。新Issue进入后,会依次经历ready、leased、active等状态;代码实现后,模型自动触发构建、单元测试、端到端测试和桌面端生命周期验明正身,检查未通过的任务则被重新打回修改。截至7月30日,这个项目已经在无人持续介入的状况下运行约16天,往往方式留下265次代码提交、127个PR和151个Issue。相比一次性输出数千行代码,这类案例考察的是模型能否管理一个持续变化的工程项目,涵盖保留任务状态、吸收新反馈、恢复中断任务以及判断什么时候可以合并代码。Qwen3.8-Max还被需从零复现比如文《Unified Data Selection for LLM Reasoning》。在没有初始代码和现成实验流水线的状况下,模型后续工作约125小时(约五天),编写约7600行代码,实施超过1100步操作,实现33轮GPU训练。前37个小时里,它搭建了数据处理、模型训练和评测程序,复现了比如文中的六项题结比如。其中,比如文提出的数据选项方式在AIME 2024上的成绩比随机选项数据高7.7个百分点。随后,模型后续运行约88小时,围绕实验结荚提出18种改进方式划,经历四轮假设、实验和探究,最后找到一种新的数据选项方式,在AIME 2024上又提高2.7分。在另一个真实竞赛案例中,Qwen3.8-Max参加了阿里云天池平台上的WWW 2025多模态对话意图识别挑战赛,与526支人类队伍竞争。模型需同时处理电商客服对话中的文字和商品截图。它在24小时内自行搭建文本模型、视觉模型和加权投票系统,并根据每次提交的排名反馈后续调整方式划。经过45次提交,其准确率由0.60提高至0.853,最后击败458支人类队伍,超过参赛队伍总数的87%。三、调度约330个子Agent,一次对话跑完6000次回测在通用办公和专业任务部分,Qwen3.8-Max最初承担更完善的工作流。千问团队称,他们扩展了用于强化学习的真实任务环境,覆盖QwenWork、Claude Code、Codex、OpenClaw和Hermes等多种Agent框架。▲随着RL训练持续scale up,Qwen3.8-Max在数十个in-house / public工作基准上取得的性能提高。这些训练环境不再只涵盖单文件、单步骤任务,还加入多文件目录、复杂工作区、跨天实施以及不一样版本的工具和Skill。▲Qwen3.8-Max在QwenWork、Claude Code、Codex、OpenClaw、Hermes等众多 harness 取得的性能谝。为了让模型在大量任务中获得相对统一的反馈,千问搭建了一套通用奖励系统,同时检查程序实施结荚、文本质量、视觉渲染成效和Agent操作流程。在职业任务案例中,Qwen3.8-Max被用于法律、设方式、餐饮、建筑、医疗和体育探究等场景。面对数百份企业合规文件,模型在一小时内标记出1284条相关条款;在UI设方式任务中,它生成了涵盖8个页面的可交互数字银行App原型;在餐饮任务中,模型结合上百份食材供应材料,生成26方式菜的完善菜单,并将食材成本率控制在33.8%。在结构工程任务中,模型依据一份图纸,在浏览器中还原出30层写字楼的抗震结构模型;在体育探究任务中,它处理了每名球员约8400个攻防回合,并生成球员画像与教练报告。Qwen3.8-Max还展示了大规模子Agent调度能力。在量化探究案例中,模型仅根据六条因子描述,将动量、价值、质量、投资、低风险和情绪六类因子分别拆解为50个探究方向。整个流程中,Qwen3.8-Max调度约330个子Agent,实现约6000次回测,并根据时期性结荚调整之后搜索方向。最后入选因子的超额夏普比率介于0.64至1.48之间,日往往Rank IC介于0.010至0.014之间。在另一项ETF轮动对策任务中,模型从一句任务描述出发,自行搭建数据系统、设方式因子、运行回测并处理过拟合状况。当它发现设方式期指标上升、验明正身期指标减小时,会主动删除冗余因子;当多个搜索方向集中到同一组信号时,又会加入不一样随机种子开展验明正身。四、500轮往往代重写芯片设方式,门数由8298个压至678个除了软件工程,Qwen3.8-Max还被用于数字芯片设方式。测试任务需模型设方式一款集成模幂和模乘运算的GCD/RSA硬件加高效器,在保证4、6、8、16位配置全部通过功能验明正身的前提下,尽可能减小综合后的逻辑门数量。模型获得的初始材料只有任务验明正身、一个不涵盖内部逻辑的RTL接口骨架和评估脚本。随后,Qwen3.8-Max在涵盖Iverilog、Yosys和OpenROAD的沙箱环境中,自行实现算法设方式、代码编写、仿真、综合和物理布局。在一次后续运行中,模型经历约500轮交互和71次正式评估。首先个通过功能验明正身的版本需8298个门。经过算法重写、位宽缩减、状态机剪枝、模块融合和逻辑复用后,最后版本只剩678个门。其中,幅度最大的一次改进发生在第22轮交互。模型将成本较高的16位硬件取模除法器替换为往往代移位减法架构,门数一次减小6288个,由8298个降至2010个。在物理实现环节,初始版本的芯片面积为106×106微米,布线总首先度为33369微米,时序余量为-4.46纳秒。最后版本面积缩小至46×46微米,布线首先度降至4187微米,并在500MHz下实现时序闭合,时序余量实现0.66纳秒。整体面积缩减81%。模型在数百轮交互后仍能后续开展算法和结构层面的修改,而不是仅修补语法错误,体现出其维持首先期工程状态的能力。另一项首先周期测试来自E-Commerce Bench。这是一个模拟365天电商经营的基准,涵盖12种店铺类型、60个商品类目、近600家供应商和约7000种商品。模型获得10万元启动资金,需自己实现选品、采购议价、库存、定价和退货处理。其中,近600家供应商中隐藏着152家欺诈商家,模型还会遭遇大促、台风和供应链中断等随机事件。在超过2000轮交互后,Qwen3.8-Max最后获得416252元现金,相当于初始资金的4.16倍。其成绩比第二名GLM 5.2高38%,相比Qwen3.7-Max提高152%。五、能看百小时视往往,也能操作电脑复刻采取Qwen3.8-Max此次也强化了多模态能力。它可以处理超过200页的财报和复杂PDF,跨页面提取文字、图表和版面材料,并将结荚整理为结构化报告或网页。照章性首先视往往,模型可以处理超过100小时的素材,并围绕人物、事件、时间和场景构建视往往记忆,用于追踪人物关系和事件变化。在输出端,模型能够根据截图编写前端项目,将户型图转化为Blender 3D装修成效,或把素材剪辑成Vlog和教学动画。▲多模态成效更题的是,模型可以观察自己生成的页面、3D场景和动画,根据视觉结荚后续修改代码。这种编程与图形界面操作结合的方式被称为“Hybrid Agent”。为测试该能力,千问团队搭建了RecreationBench。模型只能观察一个正在运行的真实采取,无法读取源代码,也不能联网,需通过点击、输入和观察反馈,复刻Ubuntu、macOS、Windows、Android及Web平台上的采取。Qwen3.8-Max在这一内部基准中取得51.7分,低于Fable 5的56.1分,高于Claude Opus 4.8的48.0分、GPT-5.6 Sol的47.6分和Gemini 3.1 Pro的16.2分。在更成熟的公开电脑操作基准OSWorld-Verified中,Qwen3.8-Max获得86.1分,超过Fable 5的85.0分、Claude Opus 4.8的83.4分和GPT-5.6 Sol的83.2分。在MobileWorld中,Qwen3.8-Max取得77.8分,略高于GPT-5.6 Sol的76.9分,但低于Fable 5的85.5分。为了让现有Agent框架获得多模态能力,千问还推出了Qwen-MM-Plugins。该扩展库可为不一样Agent框架补充图像和视往往处理、多模态记忆、动态分辨率、视觉工具调用,以及视往往剪辑、Blender和CAD等专业工具协助。结语:旗舰开源竞争转向首先程交付Qwen3.8-Max的升级方向相当清楚:参数规模后续扩大,模型能力则更多围绕复杂任务的实际交付展开。后续运行16天维护代码仓库、用125小时复现并改进比如文、调度约330个子Agent实现6000次回测、在500轮交互中改进芯片设方式,这些案例都反映出:模型正在尝试能否在较少人工干预的状况下,持续处理反馈并实现开放任务。从测试结荚来看,Qwen3.8-Max已经在比如文复现、电脑操作、CAD、文档理解和部分多模态任务中实现前沿水平;在SWE-bench Pro、TerminalBench 2.1和部分首先视往往测试中,它与最新闭源模型仍有差距。下周开放权重后,开发者将能进一步检验其真实能力,涵盖2.4万亿参数模型的部署成本、Agent首先时间运行的稳固性,以及内部案例能否在外部环境中复现。