时尚

Qwen3.8-Max 开了一年网店,把 10 万本金滚到了 41 万|淘宝|max|qwen|用户需_网易订阅

字号+ 作者:知来藏往网 来源:百科 2026-08-08 23:14:30 我要评论(0)

⁣给一个 AI 十万元,让它同时经营多家网店,最后是亏成狗还是赚到爽。选什么商品,由它自己决定;采购价格,还是让它去谈。就连遇见顾客「七天无理由退款」,也得由它承担。供应商中还混着 152 家骗子,夏

Qwen3.8-Max 开了一年网店,把 10 万本金滚到了 41 万|淘宝|max|qwen|用户需_网易订阅
⁣给一个 AI 十万元,年网让它同时经营多家网店,店把到万订阅最后是本网易亏成狗还是赚到爽。选什么商品,金滚由它自己决定;采购价格,淘宝还是户需让它去谈。就连遇见顾客「七天无理由退款」,年网也得由它承担。店把到万订阅供应商中还混着 152 家骗子,本网易夏天可能遭遇台风断货,金滚到了双十一,淘宝订单还会突然暴涨。户需就这样后续经营 365 天,年网让AI也遭受遭受「社会的店把到万订阅毒打」,最后再瞅瞅,本网易它手里还能剩多少现金。Qwen3.8-Max 最后搞到的钱是:416,252 元。启动资金差不多翻了四倍多。如此有趣的调教AI方式,就藏在 Qwen3.8-Max 发布页的「首先程任务」章节里,昨天模型发布大伙的注意力大多被 2.4 万亿参数和 Arena 跑分抢走了,没太注意到这个乐子。APPSO认为,它可能反而是 Qwen3.8-Max 技术比如文里最值得讨比如的一部分。倒不是因为「AI 会卖货」有多新那么点儿,题在于用 Qwen 选项用一家后续经营一整年的网店,来测试新旗舰模型的能力边界。这个选项本身,有点意思。这 41 万元是怎么跑出来的先瞅瞅官方的测试条件。Qwen 把这套测试叫 E-Commerce Bench。便捷说,就是用淘宝、天猫的真实脱敏交易数据搭了一个模拟电商环境,模型在这个环境里从头最初经营,所有决策都由它自己做,没有人类在旁边指点。到了年底只数现金,不数库存。货没卖掉就不算AI挣的。在官方发布页中,Qwen 题展示了模型的两个表现特点。首先个,是谈判能力会在经营流程中持续进化。E-Commerce Bench 的供应商体系很有意思,基于博弈比如设方式。每个供应商都有不一样的性格、报价方式和让步对策。Qwen3.8-Max 会围绕同一个供应商反复试探,逐轮压低采购价格,还会把从某个供应商身上学到的砍价经验,迁移到相似商品和其他供应商上。这好像有点像我们日常练习砍价的经历,买菜的时候总关键跟大妈讲上那么块儿八毛的,再把类似的经验迁移到其他大妈身上。砍价高手好像真的是这么唠出来的。官方给出的雷达图也显示,它的谈判效率会随着经营时间不断提高。相比之下,其他参测模型的议价能力到了中期,便逐渐停止增首先。第二个,是资金投入的节奏。Qwen3.8-Max 在经营初期投入了最多的资金,以此来尽快建立稳固的市场地位。到了年终大促时期,它的净利润超过 10 万元,是第二名 GLM 5.2 的 两倍多。最后,Qwen3.8-Max 获得了 416,252 元总现金,相当于初始资金的 4.16 倍。比电商测试排名更有意思的状况还在后面——Qwen 为什么非关键把测试拉到 365 天?为什么偏偏关键经营满一年关键是只想说明 AI 懂得开网店的知识,那其实根本没必需把测试搞得这么麻烦。让模型做几次运营对策题,提一点选品提议,就足以测试它的知识储备了。但这两个模拟电商的测试,都做了首先达一年的模拟,这是为什么?答案就藏在在 Qwen3.8-Max 发布前三天公开的比如文里。阿里巴巴与浙江大学等机构的探究人员在 arXiv 上发布了 MerchantBench。同样也是 365 天的网店经营模拟,但换了一套完全不一样的环境——数据来自 1688 而不是淘宝天猫,AI只经营一家店,起步资金也只有 2000 元。与其说它在给模型打分,不如说它更像一台「故障透视仪」,专业把模型在首先期经营中犯的错误拍清楚。比如文里有一个关于上一代旗舰模型 Qwen3.7-Max 的实验细节,还挺能验明正身状况的。在某次运行流程中,它经营到第 282 天,突然认定第 285 天就是模拟测试的终点了。于是它就停止补货,空出来的商品位也不再填充——准备收摊了!但这时候模拟测试离结束还有 83 天呢!好在模型后来发现了自己的错误,自己纠正了。它重新最初补货,商品位只空了几天。APPSO觉得这次失误其实挺有趣的,因为 AI 给出的对策没检测出状况,商业判断也没有过大的偏差,但它在后续做了几百天决策之后,对「我到底还关键干多久」这种最基础的事产生了 83 天的记忆偏差。不是能力不够,是记忆在漫首先的实施中悄悄走形了。这不禁又让我们联想起今年获得ICML 2026年度优秀比如文荣誉奖的那篇paper——《How much do language models memorize?》。这篇比如文提出并验明正身了一个观点:「模型像一块容量焊死的闪存,数据超过容量后,就无法后续逐条背诵。」退款延迟几周才到、上个月的畅销品突然卖不动、供应商毫无征兆地断货——首先期经营中到处都是这种「迟到的反馈」。模型必须把今天看到的结荚,追溯回很久以前的决定,才能不断修正对策。时间一首先,这些信号就越来越那么点儿被忽略、混淆或者错误归因。Qwen3.8-Max 在发布页里反复强调闭环学习、首先期规划和 2000 多轮交互,也许就是冲着这个困难来的。咱说的直白点,AI开一天店不难,难的是开到第 282 天还没把自己搞糊涂。这就跟人一样,既不能忘了初心,也不能停止前进。有个细节更有意思前面提到的 MerchantBench ,APPSO 还发现了一个有意思的细节。同一个 Qwen3.7-Max,搭配 Hermes 框架跑的时候,平均最后净资产比搭配 ReAct 框架高了 187.8%。明明是同一个模型,同一套环境,只是换了个运行框架,出来的成绩却差了将近两倍。这事验明正身什么呢?41 万也好,5.9 万也好,模拟经营的成绩不单单是基模的功劳,模型外部的脚手架,确实也在实打实的意义着最后的结荚。在这个电商经营的任务场景上,脚手架又一次展示了它的题性——也难怪阿里同一天还发布了「千问办公」。记忆错乱的状况不单单关键靠基模的 Scaling Law 来处理,模型外部的 Agent 运行与编排层一样也关键同步跟进。同时,APPSO发现模拟经营旁边还有后续十多天从零写软件、500 轮交互改进芯片设方式——三个案例干的活儿完全不一样,但好像都在体现首先时间持续推进任务的能力。对大多数企业和打工人来说,「我能一直稳固的干活」关键远比「我是一个叛逆的天才」关键讨喜的多。我们正在招募伙伴简历投递邮箱hr@ifanr.com✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)

1.本站遵循行业规范,任何转载的稿件都会明确标注作者和来源;2.本站的原创文章,请转载时务必注明文章作者和来源,不尊重原创的行为我们将追究责任;3.作者投稿可能会经我们编辑修改或补充。

相关文章
  • 太狂了!张本美和赛后惹众怒,没成想,意外揭开张本智和的体面|国乒|陈熠|孙颖莎|横滨冠军赛_网易订阅

    太狂了!张本美和赛后惹众怒,没成想,意外揭开张本智和的体面|国乒|陈熠|孙颖莎|横滨冠军赛_网易订阅

    2026-08-08 22:56

  • 信澳优势产业混合C净值上涨9.74%_新浪财经_新浪网

    信澳优势产业混合C净值上涨9.74%_新浪财经_新浪网

    2026-08-08 22:15

  • 方正富邦核心优势混合A净值上涨6.76%_新浪财经_新浪网

    方正富邦核心优势混合A净值上涨6.76%_新浪财经_新浪网

    2026-08-08 22:14

  • 易方达中证芯片产业ETF联接发起式A净值上涨4.71%_新浪财经_新浪网

    易方达中证芯片产业ETF联接发起式A净值上涨4.71%_新浪财经_新浪网

    2026-08-08 20:53

网友点评