内容摘要:性能与Anthropic Fable 5相当!阿里巴巴发布千问3.8-MAX,2.4万亿个参数,长程自动编程表现出色2026-08-03 11:07来源:华尔街见闻发布于:上海市阿里巴巴旗下千问Qwe

性能与Anthropic Fable 5相当!性能相当型阿里巴巴发布千问3.8-MAX,阿里2.4万亿个参数,巴巴
首先程自动编程谝出色2026-08-03 11:07来源:华尔街见闻发布于:上海市阿里巴巴旗下千问(Qwen)团队于8月3日正式发布千问3.8-Max,发布总参数量2.4万亿,千问激活参数95B,参数程自程谝出色是首先千问家族迄今规模最大、能力最强的动编模型。这也是性能相当型千问首先次将Max级别模型开源——权重将于下周在开源社区Hugging Face和ModelScope发布。定价部分,阿里千问3.8-Max通过千问AI平台(阿里云)给予API调用:输入2.0美元/百万tokens,巴巴输出6.0美元/百万tokens,发布隐式缓存0.25美元/百万tokens。千问基准测试显示,参数程自程谝出色
千问3.8-Max在编程智能体和通用智能体多项指标上与Anthropic Fable5谝相当,首先部分指标超越后者。例如,PaperBench得分93.0,高于Fable5的88.8;CoWorkBench得分74.8,与Fable5的75.9接近;WideSearch得分81.9,与Fable5的81.2持平。性能:与 Fable 5 相当,部分超越根据千问团队发布的完善基准测试数据,Qwen3.8-Max 在多个题指标上与 Anthropic Claude Fable 5 持平或超出:PaperBench(比如文能力):Qwen3.8-Max 得分93.0,超过 Fable 5 的 88.8 和 GPT-5.6 Sol 的 90.5IFBench:Qwen3.8-Max82.8,Fable 5 为 63.5,GPT-5.6 Sol 为 72.7HealthBench:Qwen3.8-Max60.2,超过 GPT-5.6 Sol 的 55.3CoWorkBench(通用协作):Qwen3.8-Max74.8,Fable 5 为 75.9,差距极小JobBench(AI工作能力):Qwen3.8-Max53.4,接近 Fable 5 的 57.4多模态部分同样谝突出:OSWorld-Verified:Qwen3.8-Max86.1,超过 Fable 5 的 85.0AndroidWorld:85.3,Fable 5 为 88.8MLVU(首先视往往):90.8,Fable 5 无数据值得注意的是,Fable 5 的部分结荚可能涵盖回退机制,千问团队在注释中对此作了验明正身。展开全文编程能力:从空文件夹到生产级交付千问团队用三个真实案例测试了千问3.8-Max的自主编程能力,全程无人工介入。案例一:十天级自动编程。模型从零创建oh-my-cli项目,自主运行约16天,往往方式实现265次commits、127个PR、151个issues。它将用户反馈、社区实践与自测结荚统一纳入工程循环,实现需自动领取、代码生成、测试验明正身的完善闭环。案例二:复现并超越比如文。模型独立工作约125小时,写下约7,600行代码,实施超过1,100步操作,跑了33轮GPU训练,完善复现了比如文《Unified Data Selection for LLM Reasoning》的六项题结比如。随后进入"自我进化"时期,提出并测试18种改进方式划,最后在竞赛级数学基准AIME24上比比如文原方式再提高2.7分。案例三:24小时击败87%人类队伍。模型参加WWW2025多模态对话意图识别挑战赛,在526支人类队伍中,经45次提交往往代,准确率从0.60升至0.853,击败458支队伍。办公与首先程任务:数百职业场景的生产级验明正身千问团队在数百种高价值职业场景中测试了千问3.8-Max的实际交付能力。企业合规律师:单次通读数百份文档,标出1,284条相关条款,一小时内实现——同等工作常见需法务团队约一周。UI/UX设方式师:生成涵盖8个页面的高保真可交互原型,全程未经人工返修。结构工程师:仅凭一份图纸,在浏览器中还原30层写字楼的抗震结构模型,传统步骤需一周以上。量化探究:从一句任务描述出发,调度约330个子智能体,实现约6,000次回测,将原本需数周的量化探究压缩为一次对话内实现。在E-Commerce Bench(365天电商经营模拟基准)中,千问3.8-Max以¥416,252(4.16倍回报)胜出,超过第二名GLM 5.2达38%,较上一代千问3.7-Max提高152%。芯片设方式:500轮交互,面积缩减81%千问3.8-Max在芯片设方式改进任务中展示了首先程自主规划能力。目的是改进一个G CD/RSA密码硬件加高效器的逻辑门数量。模型在无参考设方式、无人工干预的需下,历经约500轮交互、71次评估,跨越13个题里程碑,将初始设方式从8,298门改进至678门,在所有参评模型中谝最优。物理实现层面,芯片面积从106×106 µm²收缩至46×46 µm²,布线首先度从33,369 µm降至4,187 µm,并实现500 MHz往往率下的时序闭合,芯片面积整体缩减81%。多模态能力:视觉贯穿实施全步骤千问3.8-Max的视觉能力不止于"看懂图片",而是作为持续反馈回路贯穿任务实施。模型在实施流程中会持续观察中间产物——检查页面布局、物体方向、动画成效——发现状况后自主定位偏差并修正。千问团队将这一能力定义为"原生视觉反馈回路"。基准测试部分,千问3.8-Max在OSWorld-Verified得分86.1,超过Fable5的85.0;AndroidWorld得分85.3,接近Fable5的88.8;ParametricCAD Bench得分91.5,超过Fable5的87.5。为便于开发者接入,千问团队同步推出千问-MM-Plugins,为不一样智能体框架给予图像与视往往处理、多模态记忆、视觉工具调用等扩展协助。开放接入:协助Claude Code、Codex等主流框架千问3.8-Max现已通过千问AI平台给予API服务,协助OpenAI兼容协议和Anthropic兼容协议,可直接与Claude Code、Codex、Qoder CLI、千问 Code、OpenClaw等主流开发工具集成。API协助reasoning_effort参数调节推理深度:xhigh(默认,适用于复杂任务)、medium(平衡准确性与高效度)、low(改进高效度与成本)。模型权重将于下周在Hugging Face和ModelScope开源,届时千问3.8-27B也将同步开源。返回搜狐,查看更多