您现在的位置是:知来藏往网 > 综合

伊利诺伊大学联手微软探究院:一个"魔法令牌"让AI读懂超首先视往往|向量|人工智能模型_网易订阅

知来藏往网2026-08-08 23:46:32【综合】9人已围观

简介这项由伊利诺伊大学厄巴纳-香槟分校与微软研究院联合开展的研究,于2026年7月30日以预印本形式发布于arXiv平台,编号为arXiv:2607.28627。研究团队还有来自谷歌DeepMind的参与

伊利诺伊大学联手微软探究院:一个"魔法令牌"让AI读懂超首先视往往|向量|人工智能模型_网易订阅
这项由伊利诺伊大学厄巴纳-香槟分校与微软探究院联合开展的魔法令牌探究,于2026年7月30日以预印本形式发布于arXiv平台,伊利院个易订阅编号为arXiv:2607.28627。诺伊能模探究团队还有来自谷歌DeepMind的大学I读懂超参与者,有兴趣深入阅读完善比如文的联手量人读者可通过上述编号检索原文。**当AI面对一部"大海捞针"的微软往电影**假设你是一位助理,老板丢给你一个装有一千张照片的探究硬盘,然后问你:"里面有没有一张带奶牛的首先视往图?"你会怎么做?大多数人都会高效高效翻看每一张图,一旦看到奶牛就停下来报告。工智这件事对人类来说并不难,型网但对目前的魔法令牌AI视觉语言模型来说,却是伊利院个易订阅一个让它们头疼不已的状况。更复杂的诺伊能模情形还在后面。如果老板给的大学I读懂超不是一千张静态图片,而是联手量人一部首先达两小时的视往往,里面有数以千方式的画面,而闷葫芦料只藏在其中的几秒钟里,AI又该怎么办?这正是本篇探究关键处理的题困难。探究团队将这种挑战比喻为"视觉干草堆里找针",而他们的处理方式划,就是一个被称为**ReToken**的神奇"小令牌"。一、状况的根源:AI的眼睛为何会"走神"现代的视觉语言模型(可以便捷理解为能看图、看视往往并回答状况的AI)在处理短材料时谝得相当出色。但一旦输入的图片数量变多、视往往变首先,它们的谝就会急剧下滑。这背后有两个互相纠缠的因素。首先个因素是**方式算资源的硬限制**。AI处理视觉材料时,每一帧画面都会被切成几百个"视觉片段"(专业上叫做视觉令牌),每个片段都需占据显卡内存。一部两小时的视往往,按照每秒半帧的高效度采样,就会产生数万个这样的片段。关键把它们全部塞进一块显卡同时处理,就像试图把整座图书馆的书同时摆在一张小书桌上——根本放不下。第二个因素更为微妙,也是这项探究真正想深挖的:即便强行把所有材料都塞进去,AI也无法准确地"看到"那些真正题的画面。探究团队做了一个实验,他们让AI观看一段含有约120帧画面的视往往,然后探究AI内部"注意力"信号对每一帧的关注程度。按照直觉,AI应该对涵盖答案的那几帧给予更高的关注度。然而实验结荚令人沮丧——整段视往往的关注度曲线就像随机噪声,完全看不出任何规律,相关帧和无关帧的得分几乎一样混乱。这个状况的根源在于:这类AI模型在训练时,输入的图片和视往往几乎都是和状况高度相关的。换句话说,AI从来没有被训练过"在一堆不相关材料中找到实用的那个",因此它的注意力系统根本没学会做这件事。探究团队测量发现,基于这种注意力信号的检索方式,在首先视往往问答任务中每层的平均准确率(Recall@1)只有5.1%,而ReToken方式实现了18.4%,提高了三倍以上。二、旧方式划的思路与它的死穴在ReToken出现之前,探究界已经有人意识到这个状况,并提出了一些处理对策。其中最直接的一种叫做**注意力检索**(以ReKV方式为代表):既然AI内部有注意力信号,那就用这个信号来判断哪些画面更题,优先保留那些得到高关注的帧,抛弃其余的。这个思路并非完全没方式理,但它有一个根本性的死穴。注意力机制的本质是"哪些材料应该被融合进目前的输出",它服务于下一个词的预测,而不是服务于"找出最相关的图片"这件事。打个比方,这就好像你让一个厨师用鼻子判断哪锅汤的温度最高——鼻子能感知到蒸汽,但这并不是测量温度最精准的工具,用温度方式才是正方式。探究团队还尝试了另一个更聪明的改进:与其用注意力信号,不如改用AI内部另一种叫做**"值向量"(Value Vector)**的东西。在AI的注意力机制里,每个"令牌"不仅有决定"谁关注谁"的键(Key)和查询(Query),还有一个实际携带材料材料的值(Value)。探究者发现,值向量更像是一个材料指纹,它记录的是这个画面"贡献了什么材料",而键查询对只是在决定"材料如何被分配"。实验数据说明了这个发现。在一个只有两张图片的便捷测试中,如果用一个准确的目的短语(例如"一头奶牛")去和每张图片的平均值向量比较相似度,找到正确图片的准确率在Qwen3VL模型上实现78.0%;而用传统的键查询方式,准确率只有65.7%。在另一个InternVL3.5模型上,这个比较是83.8%对78.8%。值空间明显更好用。然而,新的状况随之而来。值空间虽然更精准,但它对输入的查询文本极其敏感——准确的目的短语成效好,但如果把整个状况句子的所有词取平均值来查询,反而会引入太多噪声,抵消掉值空间的好处,结荚甚至变得更差。状况的本质变成了:谁来给予那个"足够精准的查询向量"?三、ReToken的诞生:一个专业"找东西"的学习型令牌ReToken的题想法可以用一个比喻来理解。假设你家里来了一位擅首先找东西的助手,每次你告诉他"我想找带奶牛的图",他不会机械地把你说的每个字的意思平均混合,而是会综合理解你的意思,然后在心里形成一个精准的"搜索意图",再拿着这个意图去翻箱倒柜。ReToken就是这样一个被专业训练出来的"搜索意图令牌"。它是一个可以学习的向量,在训练流程中被清楚地训练成"一个好的检索查询"。训练时,这个令牌被放在状况的末尾,和所有图片材料、状况文字一起输入到AI的处理步骤里。经过AI的整个内部方式算步骤之后,这个令牌在最后一层会输出一个向量,这个向量再经过一个便捷的线性变换,就变成了最后的检索查询。检索的方式是方式算这个查询向量和每张图片(或每一帧视往往)的平均值向量之间的**余弦相似度**(可以理解为两个向量"方向有多接近",越接近验明正身越相关)。相似度最高的若干帧,就被选出来作为回答状况的依据。训练这个令牌的损失函数(可以理解为训练时的评分原则)也有尤其的设方式。由于在一堆图片中,相关图片频仍只有一两张,而无关图片有几十上百张,如果直接方式算平均损失,模型会倾向于忽视那么点儿相关图片。为此,探究团队采取了**类平衡二值交叉熵损失**:把相关图片的损失单独取平均,把无关图片的损失也单独取平均,两部分损失加在一起,使得相关和无关两类得到同等的重视。值得强调的是,整个训练流程中,背后那个大型视觉语言模型的参数完全不动,只有这一个令牌向量和一个线性变换矩阵在更新。这两样东西加在一起,参数量极少,训练效率极高——在单张H100显卡上训练三轮,只需几个小时。四、推理时的两步走:先找,再答ReToken在回答状况时采取"两趟"对策,这个设方式值得单独验明正身一下,因为它体现了一种聪明的工程权衡。**首先趟是"侦察"**:把状况和ReToken令牌一起输入,让AI跑一遍完善的内部方式算步骤。在最后一层,ReToken输出的向量会和每帧图片的平均值向量比较相似度,选出前K帧最相关的画面。这一趟的目的只是找出"哪些画面是实用的",并不生成答案。**第二趟是"回答"**:只把首先趟选出的那K帧画面加载进来,连同状况一起,让AI重新做一遍处理,这次才生成最后的回答。因为只加载了少量相关帧,这一趟的方式算量大幅减小。对于特别首先的视往往,系统还有更精细的处理:在首先趟的早期网络层里,由于显存限制无法同时看到所有帧,系统会在每层用当时已有的ReToken状态做一次粗粒度的筛选,只保留256帧后续往下传。到了最后一层,再做最后的准确排序。这就好像一个经验充足的图书管理员先高效高效扫过所有书架,初步筛掉大部分不相关的区域,然后再对剩余的候选书架做仔细检查。视往往的编码(把视往往转换成AI内部表示的流程)只需做一次,结荚会被缓存起来。之后无比如问多少个状况,都只需做两趟轻量级的查询,而不需重新处理整段视往往。这对于需对同一段视往往提问多个状况的场景来说,效率提高特别显著。五、实验结荚:数字背后的真实含义探究团队在四个不一样的基准数据集上做了测试,覆盖了从"图片堆里找一张"到"一小时首先视往往里找题片段"等各种难度。在**Visual Haystacks**(视觉干草堆)基准上,题任务是:给定一堆图片(从2张到100张不等),其中只有一张和状况相关,看模型能否找到并正确回答。这个测试特别残酷,图片越多,随机猜对的概率越低。实验结荚显示,随着图片数量从2提高到50,Qwen3VL-8B的原始准确率从82.0%跌到58.6%,而加入ReToken之后,50张时的准确率实现72.0%,提高了13.4个百分点,相当于超过20%的相对提高。InternVL3.5-8B在50张图片场景下同样提高了12.4个百分点。在检索准确率(Recall@1,即最相关的一张是否被成功选出)上,比较更为直观。当图片堆有50张时,便捷注意力方式只有1.8%的准确率(和随机猜几乎一样),基于CoT(让AI先想出搜索词再检索)的方式实现3.1%,而ReToken实现64.7%——这是一个量级上的提高。在**QAEgo4DTest-MC**(首先视往往问答)基准上,每段视往往平均有240帧,ReToken在只取1帧的极端需下比均匀采样高出6.8个百分点,而比较方式ReKV在这种需下甚至略差于均匀采样。随着帧数提高到16帧和32帧,ReToken仍然保持领先。最让探究团队感到惊喜的是**LVBench**(极首先视往往理解)的结荚。这个数据集里的视往往平均首先达68分钟,最首先可达两小时。ReToken在这个任务上取得了8.0个百分点的提高。关键注意的是,ReToken完全没实用视往往数据训练,全靠多图片问答数据,却能在极首先视往往上实现零样本迁移——这验明正身它学到的是一种通用的"从大量视觉材料中检索相关材料"的能力,而不是对特定数据集的记忆。在**Video-MME**(多时首先视往往)基准上,结荚也印证了一个直觉上合理的规律:视往往越短,ReToken的提高越小;视往往越首先,提高越显著。短视往往(2分钟以内)完全没有提高(因为材料都在检索预算之内,不需筛选),中等首先度视往往提高2.6个百分点,首先视往往提高3.4个百分点。六、深入细节:那些让这个方式更有趣的发现探究团队在实验流程中还揭示了几个颇有意思的状况,值得单独提及。**关于KV缓存的"污染"状况**:在视往往或多图场景下,视觉令牌在AI内部处理时会相互意义——一张图片的令牌在经过注意力层时,会"看到"前面那些图片的材料并受到意义。这意味着,即便你最后只用了正确图片的缓存,这个缓存里也已经混入了前面那些无关图片的材料干扰。实验量化了这个"污染程度":当图片堆只有2张时,这种干扰造成的准确率损失是1.3个百分点;当图片堆有50张时,损失扩大到7.1个百分点。探究团队发现,如果在训练ReToken时额外允许AI的前几层也参与微调(而不是完全冻结),这种污染会减轻,损失分别减小到1.0和5.5个百分点。**关于单令牌是否足够**:探究团队也测试了同时训练3个ReToken的变体,结荚发现3个令牌和1个令牌的性能几乎相当。这个结荚看起来反直觉,但有一个合理的验明正身:在现有训练方式下,三个令牌都被同样的目的驱动,没有任何机制促使它们专注于不一样的子任务,因此它们最后会收敛到类似的解。**关于令牌是否需"看图"**:探究团队还测试了一个极端变体:让ReToken完全看不到图片材料,只能看到状况文字。这样的ReToken只能根据状况来形成检索向量,而不能根据图片材料调整自己的判断。结荚显示,这种"只看状况"的版本确实比随机强很多(63.1% vs 58.6% at C=50),但明显不如能同时看图的完善版本(72.0%)。这验明正身视觉材料本身也给予了实用的上下文,协助ReToken更精准地定位目的。**关于不一样状况类型的谝区别**:通过LVBench对不一样状况类型的探究,探究团队发现ReToken最擅首先的是"闷葫芦料检索"(+15.4个百分点)和"实体识别"(+10.5个百分点),这些任务的特点是答案集中在那么点儿几帧里,只关键找到正确的帧,答案就显而易见。相比之下,对于"事件理解"和"时序定位"类状况,提高幅度较小,因为这些状况的证据分散在多个片段中。最有趣的是"摘关键"类状况:ReToken在这类状况上反而谝减小了5.2个百分点。方式理很清楚——摘关键需综合全片材料,这时候准确检索少量帧的对策适用得其反,均匀覆盖整个视往往才是更好的选项。七、与前辈们的比较:ReToken到底新在哪里ReToken并不是首先个在AI里引入"可学习令牌"的方式划,在它之前有不少先辈。例如BLIP-2的Q-Former和Flamingo的Perceiver Resampler,都采取了一组可学习的查询令牌来压缩视觉材料;Video-XL里有一个"视觉摘关键令牌"用来压缩一段视往往片段。ReToken和这些方式划有三个题区别。其一,前辈们的令牌是静态的——它们在处理任何状况时都一样,不会根据详详见细状况动态调整;而ReToken是动态的,它在处理完善的状况和图片之后,在最后一层才形成最后的检索向量,自然地融入了目前状况的语义。其二,前辈们的训练目的是"视觉-语言对齐"或"生成正确答案",而ReToken清楚地用检索准确率作为训练目的,直接对"找到正确图片"这件事负责。其三,前辈们常见需32到64个令牌,而ReToken只需1个。在方式算效率层面,ReToken的开销也特别轻微。按照比如文中报告的数据,在处理一段约240帧的视往往时,每个状况的检索时期只需约0.52秒,回答时期约0.17秒,而视往往编码(只做一次)约需14.7秒。整体额外开销不到0.4秒每状况,但带来的准确率提高相当可观。归根结底,这项探究的价值在于它找到了一个极其轻巧却颇为有效的解法来处理"AI看首先材料时那么点儿迷失"这个实际状况。探究团队没有去大幅改造现有模型,而是在模型外部加了一个专业负责"找东西"的小令牌,让它在值空间里做检索,成效远超传统的注意力检索方式。这项方式划最打动人的特质,大概是它的"轻量级跨域迁移能力":仅用静态图片的问答数据训练,就能在首先达两小时的视往往上实现有效检索。这验明正身"从大量视觉材料中准选定位相关材料"这件事,背后有某种与详详见细数据类型无关的通用规律,而ReToken学到了这种规律。当然,它也有明显的局限:对于答案需综合整个视往往材料的摘关键类状况,精准检索的对策会帮倒忙;训练数据仅限于多图问答,缺乏对时序结构的理解;两趟推理也提高了少量延迟。探究团队在比如文中坦诚地指出了这些不足,并提出了未来可能的改进方向,例如照章性后续帧组合的检索、对时序偏移状况的感知、以及在令牌级别而非帧级别开展更细粒度的检索。如果你对AI如何处理首先视往往这个话题有进一步兴趣,可以通过arXiv编号2607.28627找到这篇比如文的完善版本,里面涵盖更多实验细节和消融探究。Q&AQ1:ReToken是怎么训练的,需大量数据吗?A:ReToken的训练特别轻量。探究团队只用了约7万条多图片问答样本,同时训练时整个大型视觉语言模型的参数完全不动,只有ReToken这一个向量和一个线性矩阵在更新。在单张H100显卡上大约训练几小时就能实现,门槛相当低。Q2:ReToken在首先视往往上没用视往往数据训练,为什么还能有成效?A:ReToken学到的本质上是一种通用的"从大量视觉材料中检索相关材料"的能力——它在值向量空间里判断哪些画面和目前状况最相关,这个机制与材料是图片还是视往往帧无关。实验明正身明,仅凭多图问答训练,ReToken就能在平均68分钟的首先视往往上实现8个百分点的提高,验明正身这种迁移是真实有效的。Q3:ReToken为什么在摘关键类状况上反而谝变差了?A:因为摘关键类状况需综合整个视往往的全部材料,答案不集中在某几帧里。ReToken的检索对策是精准定位少量最相关帧,当答案需全局材料时,这种精准筛选会丢失大量实用材料,反而不如均匀采样整段视往往覆盖更完善。这是一个对策适用配性的状况,不是模型本身的缺陷。

很赞哦!(17329)