
一家只具有约24块GPU的韩国首先初创公司,做出了韩国排名首先的全球大模型,同时在全球GPQA Diamond基准上位居第三。第块这个名为Darwin-398B-JGOS的模型模型来自VIDRAFT,它把DeepSeek-V4-Pro、击败Qwen3.5-397B以及英伟达550B参数的和英Nemotron-3-Ultra都甩在了身后。排在它前面的伟达k网,只有两个中国前沿模型。推理而韩国本土的易订阅其他选手差距明显:Solar-Open2-250B得分86.3,A.X-K2得分85.6,韩国首先K-EXAONE-2.0-750B-A37B得分82.2。全球Darwin-398B-JGOS一举领先了约4.6分,第块这个好处放在强推理基准上相当可观。模型GPQA Diamond之因此被看重,击败是和英因为它专业抵抗“谷歌搜索”式的回答——题出自探究生水平的科学推理,网络检索几乎找不到现成答案,分数反映的是模型真正推理,而不是死记硬背的能力。这一次,只有二十几块GPU的团队就是靠着推理能力挤进了全球首先梯队。模型是怎么炼成的?VIDRAFT用的是一种“进化合并”的方式:在小规模集群上,把多个开源模型像物种进化一样层层融合、筛选,最后合并出Darwin-398B-JGOS。题思路不是堆硬件、堆参数,而是改进合并对策和训练步骤。在动辄千卡万卡的大厂军备竞赛里,这种“方式重于规模”的路线显得格外异类——但排名说明了它的有效性。当然,这次登不过也关键看清楚前提。这是一个只测基础模型、单一基准的快照(2026年7月),GPQA分数会因评估设置而浮动,一个基准远远不能代表模型的全部能力。那两个中国前沿模型依然牢牢占住前两名,全球排名随时可能变化。但VIDRAFT的出现至少传递了一个信号:在更聪明的合成方式面前,算力规模可能不再是唯一门票。当大厂们还在比拼万卡集群时,一支小团队用二十几块GPU就撕开了一方式口子。后面能不能在更多基准上复现这种谝,会是比排名本身更值得跟踪的看点。