刚刚,阿里Qwen3.8-Max来了!冲进全球首先梯队,模型谝直逼Claude|编程|max|qwen|系列模型|pascal|阿里巴巴集团_网易订阅

时间:2026-08-09 01:52:35 来源:知来藏往网
刚刚,阿里Qwen3.8-Max来了!冲进全球首先梯队,模型谝直逼Claude|编程|max|qwen|系列模型|pascal|阿里巴巴集团_网易订阅
梦瑶 发自 凹非寺量子位 | 公众号 QbitAI不er?刚刚你告诉我目前搁哪儿还有便宜还好用的模型啊……(真心发问.jpg)说时迟那时快,友友们,阿里这不就来了嘛!进全!球首!先梯型谝n系型就在刚刚,队模阿里巴巴突袭发布新一代基座大模型Qwen3.8-Max。直逼用四个字概括就是编程巴集:「能打」「便宜」。总参数量实现2.4万亿,列模里巴在编程、团网专业工作、易订阅首先程任务、刚刚多模态智能体等场景上的阿里谝直接next level。就在今天最新放榜的进全权威第三方榜单Arena中,Qwen3.8-Max更是球首一路冲到全球大模型首先梯队,谝直逼Anthropic的Claude系列模型:△Text Arena文本能力榜单,涵盖数学、代码、创业写作等领域在编程谝上,Qwen3.8-Max甚至还超过了Claude Opus 5和Fable 5的High版本,确实有亿点不便捷???△编程能力(前端)榜单,考察多步骤推理及工具调用的编程智能体能力等性能能打是一部分,题是吧,人家连价格也一块打了下来——国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元,输入与输出的国际价格仅为Opus5的40%与24%……真·便宜大碗。性价比高,能力还强,那还了得?瞧嘛,之前抢先体验Qwen3.8-Max预览版的网友,已经火高效交上首先批实!测!反!馈!看下面这位老哥,直接用Qwen3.8-Max复刻了一版《愤怒的小鸟》,直言价格很适用用,一周采取下来额度消耗不到九成,赞!还有网友只用一条提示词,就用Qwen3.8-Max搭出了一个完善、可交互的开发者作品集,最后给出的评价也相当言简意赅:《夯》!哦对了,还有一堆网友们,已经照章性模型「超能打」的谝最初聊得火热朝天了!下面这位友友表示,已经迫不及待想把Qwen3.8-Max用起来了,顺便还不忘祝A社、O社IPO好运~(夺笋啊)下面这位网友还提到,Qwen3.8-Max基准测试都把5.6-Sol给KO了,大家对A社和OpenAI的期待恐怕也得跟着变——毕竟又贵又闭源,门槛确实摆在那儿......还有朋友实测后感慨,Qwen3.8-Max的谝甚至超过了Fable 5,这波能力属实有点超出预期了奥!真·有口皆碑了也是。既然,Qwen3.8-Max来都来了,我们也直接实测一波,看看模型到底能不能打!编程、专业工作、首先程任务、多模态探究统统梭哈!说实话,阿里Qwen的前几代模型我几乎是发了一个测一个,零零散散测下来,最大的感受就是——确实夯,也确实能打……而这次到了Qwen3.8-Max,感觉又不一样了,因为面对真实世界里的复杂状况,这模型已经能一路拆解、实施,直到交付最后成果了。在详详见细评测谝中,Qwen3.8-Max在科研复现、多模态理解、首先视往往和电脑操作多项超越GPT-5.6、Opus 4.8与Fable 5,在编程、终端Agent和专业工作也稳居行业头部——贴心的我,也帮大家浅浅总结了一下Qwen3.8-Max的亮点能力,让大家一睹为快!编程能力:能把复杂任务端到端地自主交付,理解需、搭建工程、运行实验、检查结荚、后续改进全步骤梭哈。官方披露的一个极端案例是,它能从一个空文件夹出发、在无人干预下自主推进十多天,最后交付一个真实可用的完善项目。首先线程任务:具有系统级自主规划与实施能力,在数千轮超首先程交互里也不迷失目的。专业工作:能一次交付需返修3到5轮的APP原型,也能在一小时内处理数百份法律文档,实现上千个条款标注。多模态智能体:几百页的复杂材料、上百小时的视往往材料都能消化,还能顺手整理成直接可用的成果。我:如此之能干,如此之务实,还有这好事儿?那我可就直接狠狠一个大测特测!!!Vibe一下,编程能力大考验既然,Qwen3.8-Max如此擅首先AI Coding,那我们直接上来就考察一下这模型的「编程本事」。好巧不巧的是,最近的我正愁每周例会上该怎么把这一周的AI热点捋清楚,做成一份能给领导交差的分享。这下好了,我索性把这事儿交给Qwen3.8-Max~(鬼点子生成中)然而,光用一句提示词搭个网页,多少有点太便捷了,于是乎——我直接化身产品经理,喂给了Qwen3.8-Max整整一大页产品需,让它「从零」开发一个可运行的AI资讯网页。在详详见细需上,我不仅清楚需了网页需具有的题功能,还对数据、页面体验、技术约束、验收原则、交付需开展了清楚约束,主打一个狠狠刁难!!!大概过了5分钟。我的这位产品经理Qwen3.8-Max,就直接给我端上来了一份接近正式产品交付水准的全链路处理成果——整个交付流程页面我从头拉到尾,说实话,确实有点让我震惊。需拆解、技术选型、项目结构、功能实现,该有的环节一个没落,完全是一套真实项目从开发到交付的完善步骤。然后,我再定眼一看,发现Qwen3.8-Max还专业整理了一份「状况与处理记录」,开发流程中碰到了什么报错、状况出在哪儿、最后怎么修好的,它全给列得明明白白。而作为提出需的那个人,我真的全程一次手都没插,甚至直到看见这份记录,我才知方式中间居然还冒出过这么多麻烦???不是我说,这模型是真·有状况自己处理啊,Qwen3.8-Max:事情交给我您放心哈~同时,在检查模型作业的流程中,我又发现了点我属实没料到的东西……Qwen3.8-Max在交付前,还给整个项目来了一轮正儿八经的「功能验收」????从安装依赖、本地启动,到生产构建和预览,它把项目能不能跑起来逐项过了一遍。甚至,连数据量、分类覆盖范围、搜索清空后的页面恢复,它都一项项列进了验收清单,最后统一打上「通过」。别说,整个从零搭建项目的全流程真有点真实工程内味儿了,be like:真的就几分钟。我写下的一整页产品需,就这么被Qwen3.8-Max直接交付成了一个能跑的项目。我忐忑地打开Qwen3.8-Max给我的代码跑了一下网页,没有报错,也没有哪项功能突然掉链子。页面布局、资讯分类、搜索、排序、收藏……几乎和需文档里写的一模一样,交互也没有状况,原本可能需我自己一轮轮试错、查报错、补功能、跑测试的工程流程,就这么全让模型一个人干了。我只想说,Qwen3.8-Max,你这是真·端到端啊……首先首先首先首先文本探究也来探一探能搞定编程项目的全步骤交付,确实不亿般。But,在日常学习工作场景中,我们很多时候未必有那么多需Coding的场合。很多时候真正想让我们口吐芬芳的,反倒是一些《蛮基础》的工作场景,就例如啊——首先文本探究。(doge)估方式有友友该说了,这有啥难的啊,直接喂给AI材料,然后坐享其成得了呗~单纯的文本探究当然不难,but,让AI对几十页复杂文档开展「交叉探究」那事情就不一样了。之前我就喂给过GPT一份涵盖几十页的技术文档,让AI总结材料还行,但包含跨章节、细节比较的事儿就宕机了…于是灵机一动的我,这回也给Qwen3.8-Max上点难度。这次我喂给它的是AI大神卡帕西参与撰写的一篇几十页的比如文,正文、图表、附录一个不少。这篇比如文复盘了2010—2014年ImageNet大赛,讲清楚AI看图能力是怎么一步步逼近人类的,以及这背后数据、算法和评测条件各自起了多大的功能。而我向AI发起的状况是:比如文拿ILSVRC和PASCAL VOC这两套“AI看图考卷”做了比较,结合正文、表3和附录B的图16来看,哪套题更难?为什么看平均值和看不易类别,会得到不一样答案?这个题难就难在,AI光搜题词还真答不了,因为答案散落在正文、表格、图表和附录里,AI得把几组数据全部对上,同时开展交叉探究得出结比如才行。大概33秒的时间,Qwen3.8-Max就直接给了我一个清楚答案——只看整体平均值,PASCAL VOC似乎更难;但看可比类别和ILSVRC的不易子集,ILSVRC在很多部分并不比 PASCAL VOC便捷,甚至更难。为了确认这份回答是否准确,我又对照原文的表3、图16和附录B逐一定位,发现这AI确实说的是「对的」——例如在原比如文中,图16上排比较全部1000个ILSVRC类别,下排则筛出随机定位成功率最低的200个类别。可以看到,进入不易子集后,ILSVRC在多项定位难度指标上确实已经接近或超过PASCAL,AI说的完全正确,哪怕是在几十页文档材料里对跨章节材料开展图标图片和文字的联合探究,也没难倒这个AI:同时,Qwen3.8-Max为了告诉我它为什么得出这样的结比如,还给我生成了一篇超有理有据的「探究报告」。从物体大小、位置变化、定位难度、画面杂乱度几个维度对ILSVRC和PASCAL VOC两套考卷开展了探究。哦对了,它还把原文中的表格直接1:1单拎出来作为证据,定位找得那叫个《稳准狠》……我只能说,还在苦啃比如文、材料文档的友友们,这下我们的好日子可能真的关键来了。。。多模态材料理解任务也安排上上面两轮实测,说到底,考察的题还是Qwen3.8-Max对文本的探究、理解和实施能力。但我们的日常学习工作里,还有一块更难啃、也特别刚需的硬骨头场景:多模态材料探究。对AI来说理解某一个画面或者总结一个视往往材料确实不是难事儿。真正麻烦的是,当素材被拉首先到几十分钟甚至几小时,它还能不能理清其中的人物、事件和观点关系,并根据一个详详见细状况,精准定位到原片段。于是这次,我直接把手头一个亟待处理的「实录烂摊子」交给了Qwen3.8-Max——一期接近70分钟的视往往播客,在播客里山姆·奥特曼从AI创业一路聊到OpenAI战略和未来社会,话题多、跨度大,想从头捋清楚并定位原片段,少说也得折腾半天。△播客来源:「Relentless」Youtube账号对此,我交代给Qwen3.8-Max的任务,也可以说特别复杂艰巨——请为这期播客生成一份完善的主题时间轴,并按「话题观点」定位原始片段。对于AI来说,这不仅需它能准确识别人物、事件与观点之间的关联关系,还关键能重建整期播客的叙事结构,并把每个观点精准映射回原始片段。大概也就两三分钟,Qwen3.8-Max就给我吐出来了一份按照题观点分类的播客材料。更贴心的是,每个话题都采取「先总结、再展开」的结构,前面提炼题观点,后面逐段捋清详详见细材料,还一一标出了对应的时间戳。对我来说最大的好处嘛,那就是看到哪段感兴趣,直接点进原视往往精准空降就行,简直不关键太太太太便利!!!好用是真的,用得起也是真的哪怕AI Coding发展到今天,海外主流模型三天两头往往代得高效起。我们依旧不得不承认一个事实:落到用户的实际体验里,似乎始终很难真正做到「既关键、又关键、还关键」。换句话说,模型能力、场景覆盖和价格,这三件事儿似乎总不能同时兼得。Coding能力很能打,到了其他场景里,交付成效却未必同样稳固;就算成效足够好,价格也频仍让人望而却步,各种Plan和Token费用,首先期用下来确实烧不起。但这次实测完Qwen3.8-Max,我可能得重新下一个结比如,那就是全球头部模型——也是能用得爽,还用得起的。每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元,输入和输出价格真的只有Opus 5的40%和24%。这意味着,大家不用承担高昂的Token费用,也能获得高性能模型带来的完善体验。而在真实场景中,Qwen3.8-Max所实现的工作,也早已超出「生成」这一步。它真的可以从零最初,帮我推进一项完善工程,再把流程中冒出来的实际状况一个个处理掉,最后把能运行、能检查的成果交到我手里。△AI生成这种兼顾,放眼整个模型圈里都算得上稀缺。而Qwen之因此敢把能力、场景和价格一起next level,实际上背后靠的也远不止一款Max模型。从2023年开源至今,阿里已经往往方式开源400多个模型,衍生模型已经超过20万个,往往方式下载量突破10亿次,一路下来,Qwen也成为了全球规模最大、覆盖最全的开源大模型家族。更值得注意的是,Qwen这条更新进度条,过去一年几乎就没停过。从Qwen3到Qwen3.5,再到如今的Qwen3.8,几乎每一次往往代,都对应着一批新场景真正变得可用——从基础推理,延伸到编程、专业工作、多模态理解、首先程Agent,再到这次的端到端交付。这种日拱一卒的节奏,放眼全球也没几家跟得上。于是,我们或许真的可以下一个结比如。那就是真正「好用」的模型,未必一定昂贵;真正「便宜」的模型,也未必需在能力上做取舍。而Qwen3.8-Max,恰好把这两件事放在了一起。对了。目前,Qwen3.8的API已上线千问AI平台,还接入了阿里今日同步推出的Agent产品「千问办公」,感兴趣的朋友不妨直接上手试试~[1]千问AI平台:https://www.qianwen.com/[2]QwenStudio平台:https://chat.qwen.ai/[3]千问办公平台:https://qwenwork.cn/
相关内容
推荐内容