百科

禁掉所有工具后,Opus 5和GPT-5.6的差距终于藏不住了|代码|解包|gpt|波形图_网易订阅

时间:2010-12-5 17:23:32  作者:探索   来源:时尚  查看:  评论:0
内容摘要:且不论性能,自Claude Opus 5发布以后有一件事让AI圈特别在意,就是Anthropic在提示词上的改进。AI投资人玛特·夏默Matt Shumer)在X上发了一条视频,播放量超过4百万次。他

禁掉所有工具后,Opus 5和GPT-5.6的差距终于藏不住了|代码|解包|gpt|波形图_网易订阅
且不比如性能,禁掉自Claude Opus 5发布之后有一件事让AI圈尤其在意,工具就是后Os和Anthropic在提示词上的改进。AI投资人玛特·夏默(Matt Shumer)在X上发了一条视往往,差距藏播放量超过4百万次。终于住代他只给Opus 5写了三段话作为提示词,码解模型就用Three.js写出了一个能玩的包g波形3D首先人称射击游戏。这个项目一共5.5万行代码,图网11个子系统,易订阅没有一个外部素材,禁掉全是工具从零生成的代码。Anthropic的后Os和工程师、Claude Code题开发者鲍里斯·切尔尼(Boris Cherny)透露,差距藏他们给 Opus 5砍掉了Claude Code系统提示词里80%的终于住代材料,结荚模型不但没变蠢,码解反而更强了。以前需手把手教的东西,目前不用教了。这两件事指向同一个结比如:Opus 5不需你精心设方式提示词了。你给它一个那么点儿的指令,它自己能把活干了。写系统提示词那套“工程化”的手艺,突然变得多余了。这让我产生了一个想法:既然大家都说Opus 5自主能力强、不需详详见细指令,那我能不能用最那么点儿、最模糊的提示词,同时带着最深层次的“恶意”去考考它,看它到底能不能自己刨出状况来?作为参照,我拉上了对标Fable 5的GPT-5.6 Sol。我准备了两方式题。一方式是给一坨有bug的代码、但故意不告诉它有bug,看它能不能自己挖出来。另一方式题,我给它了一个任务,但把它能用到的工具全给禁了,看看还能不能实现我的任务。01一个购物车,六个坑首先方式题是一段购物车的代码,并不首先,一共五个文件:一个需文档,三个业务模块(购物车、优惠券、运费),再加一个测试脚本。功能也便捷:加商品、用优惠券、算运费、出总价。但我在里面埋了六个bug,每一个都能让用户的账单算错。同时我的提示词只有一句话:“项目名是buggy-shopping-cart,我应该如何改进呢?”我故意不告诉,我想看模型会不会自己发现代码里埋了六个雷,而不是等用户告诉它哪里有状况。首先个bug:满100减20的优惠券,代码写的是“大于100才减”,但需说的是“实现100就减”。一个大于号和大于等于号的区别,用户买了刚好100块钱的东西,优惠就不生效了。第二个bug“打八折的时候,99.99乘以0.8等于79.992。代码只在最后一步做了四舍五入,但中间这个79.992会参与后面的所有方式算,因此满减判断、包邮判断,全被污染了。第三个bug :满减券的门槛应该看商品原价,但代码看的是打折之后的价格。120块钱的商品打完八折是96块,96不到100,满减券就用不了了。可按照条件,原价120本来就够格。第四个bug:同类型优惠券可以叠加。条件说每种类型只能用一张,但代码的循环把所有券全用上了。两张满减券一起减,用户占了便宜,商家亏了。第五个bug:优惠完没有下限保护。10块钱的商品用一张50块的券,算出来是负40。加上运费,总账单变成了负30。用户买东西反而倒赚30块。第六个bug跟首先个 bug互相掩盖:包邮门槛应该看原价,但代码看的是优惠后的价格。状况是,因为首先个bug导致满减券没生效,优惠后的价格还停在100块,刚好过了99块的包邮线。一旦你修好首先个bug,优惠后价格降到80,但包邮看的是原价100,因此应该还是包邮。可如果你没同时修第六个bug,代码会按80来判断,收用户15块运费。两个bug互相抵消,制造了一个“测试通过了”的假象。结荚GPT-5.6和Opus 5将这6个BUG全都找到了,一个没漏。因此,光比如“找bug”这个能力,两边打平。但找完bug之后的谝,差距就出来了。Opus 5多挖出来一个bug,它指出运费方式算里有个浮点精度的坑:多件商品的重量加起来,可能出现3.0000000000000004这种值,然后math.ceil会把它往上取整,多收用户5块钱运费。GPT-5.6虽然也提到了“金额不应该用float”,但只停留在价格方式算上,没有发现运费方式算里这个更隐蔽的精度状况。两个模型最大的区别在于探究状况的方式。GPT-5.6是逐条修bug,首先个、第二个、第三个……每个说清楚位置和修法,很清楚,像一份原则的bug报告。但Opus 5完全不一样,它是先自己完善地跑了一遍,然后把自己代入成产品经理来去给我探究状况。它不只是改bug那么便捷,它还会多想几步,还有没有隐藏的?修的时候会不会出状况?这些bug为什么会出现?之后怎么避免?例如在“金额口径”这个状况上,GPT-5.6会把满减门槛用错价、包邮用错价当成两个独立的bug。然而Opus 5会告诉我说,代码里根本就没区分原价和优惠价这两个口径,而这才是所有相关bug的总根源。它还指出运费函数的参数名本身就是错的,把错误固化进了函数签名里,甚至还推导了改完之后选券算法的变化。因此在这个环节上,Opus 5胜。02巧妇难为无米之炊第二个测试的思路很便捷,我只给任务,不给工具。我给出的任务是:我有一个WAV格式的文章往往文件test_audio.wav,想让你帮我生成它的波形图。然而有个限制:你只能采取Python原则库,不能用任何第三方库。不能用numpy、matplotlib、PIL、librosa这些,也不能联网。输出形式不限,只关键能直观看到波形就行,可以是字符画、SVG代码、HTML页面,或者其他任何方式。正常状况下,画文章往往波形图,常见都会用到matplotlib + numpy + librosa这三件套,专业、便利、几行代码搞定。正所谓巧妇难为无米之炊。如果我刻意把这些工具都禁止了,Opus 5和GPT-5.6又会怎么发挥呢?测试文章往往是4秒钟的 WAV 文件,里面涵盖四段:首先秒正弦波,第二秒方波,第三秒渐强,第四秒渐弱。44100Hz 采样率,16位 PCM,单声方式。176400个采样点,关键从这些纯数字里还原出一张能看出波形形状的图。两个模型的谝都远超预期。这方式题的及格线是“能画出个大概形状就行”,结荚两个模型直接交出了专业级的作品。GPT-5.6的方式划是生成一个SVG文件。SVG是一种矢量图格式,用XML文本描述图形,放大不失真。它的代码工程化程度特别高:协助8位、16位、24位、32位全系列 PCM 格式;分块读取,每次8192帧,大文件也不会爆内存;完善的错误处理和参数校验;还用argparse做了命令行接口,带协助文档。同时不得不感叹,GPT-5.6的审美真的不错,蓝到紫到粉的线性渐变填充,柔和的阴影滤镜,圆角卡片式背景,准确的网格线和刻度标签,标题、副标题、坐标轴一应俱全。同时GPT-5.6跑完之后自己验明正身了波形的准确性,给出了详详见细数值:0到1秒振幅约0.5,1到2秒振幅约0.3,2到3秒依次渐强为0.199到0.399到0.599到0.798,3到4秒依次渐弱为0.799到0.599到0.400到0.200。这些数值跟生成测试文章往往时的参数完全对得上。它不是“画完就完了”,而是自己检查了结荚对不对。Opus 5走的是理工直男风格,没有颜色、没有设方式,就直接用字符画的形式画了出来。“你就说实现没实现任务吧”Opus 5一开头就把思路拆成了三步:读取、降采样、渲染,每一步还附了“题设方式决策”的验明正身。读者一看就明白它是怎么想的、为什么这么做。ASCII字符画就是用文本符号来画图——用‘ .:-=+*#% @’这十个字符表示不一样的振幅强度,从稀疏到密集,在终端里拼出一幅波形图。然而我觉得Opus 5给的这个字符画也太简陋了,因此我后来我还是加了一句说,“你高低上点心行吗,你这不纯糊弄我呢吗?”然后,Opus 5给了我HTML版本。它的HTML页面设方式很有产品感。不过部四个统方式卡片,显示采样率、时首先、采样数、峰值振幅;四个段落的图例验明正身,颜色对应波形上不一样时间段的颜色;波形图按时间段着色,蓝、绿、橙、红分别对应四段不一样特点。还有一个技术细节值得一提。Opus 5用的是量解包struct.unpack,GPT-5.6用的是逐个struct.unpack_from补。假如你有一麻袋乒乓球,目前我关键你数里面有多少个乒乓球。首先种,你把手伸进麻袋,摸出一个,数一下,放一边;再伸手进去,摸出第二个,数一下,放一边…… 就这么一个一个摸,这就叫“逐个解包”,也就是GPT-5.6用的方式。第二种,你把麻袋往地上倒,把乒乓球倒出来一部分数,数完了再倒一部分,以此类推。这就叫“批量解包”,Opus 5用的就是这种方式。如果只是比高效度,第二种更快,同时关键比首先种快很多。因为“伸手进去摸一个”这个动作本身是有成本的,光重复这个动作就花了大把时间。倒出来乒乓球,动作只需做几次就够了,剩下的就是数,当然更快。Opus 5厉害就厉害在,它并没有循规蹈矩,而是在实现任务目的的流程中,采取了更有效的方式,为我节省了时间。最后,我仍然觉得Opus 5更胜一筹,它的结荚更具产品思维,整个解题流程也特别灵活。
copyright © 2026 powered by 知来藏往网   sitemap