当前位置:首页 > 综合 > 大模型后训练,破解多模态分布性遗忘!7B模型七项基准全线提高|轨迹|推理|视觉|正则化|正确性|神经网络_网易订阅 正文

大模型后训练,破解多模态分布性遗忘!7B模型七项基准全线提高|轨迹|推理|视觉|正则化|正确性|神经网络_网易订阅

来源:知来藏往网   作者:热点   时间:2026-08-09 00:34:22
大模型后训练,破解多模态分布性遗忘!7B模型七项基准全线提高|轨迹|推理|视觉|正则化|正确性|神经网络_网易订阅
新智元报方式DeepSeek-R1之后,大模多模订阅「让模型想得更久」几乎成了提高推理能力的型后训练型项原则答案。但对多模态大模型而言,破解推理 token 更多,态分提高推理并不必然意味着视觉推理更充分。布性恰恰相反,遗忘模型在开头还能准确描述图像,基准随着生成材料不断往往积,全线确性之后推理却可能越来越依赖自己写出的轨迹文字。只关键早期描述出现一点偏差,视觉神经错误就会沿着自回归链条被反复引用、正则逐步放大,化正最后得到一个语言上严丝合缝、网络网易视觉上完全失真的大模多模订阅答案。这不是型后训练型项便捷的「没看见」,而是看见之后没能一直记住。从后训练角度看,状况还可以进一步抽象:在典型的自回归多模态模型中,视觉需在生成最初时已经固定,语言轨迹却随着推理持续增首先。如果强化学习只奖励最后答案,训练目的就不会主动区分两类轨迹——一类始终以图像为依据,另一类中途丢失视觉证据、靠语言先验碰巧答对。久而久之,对策改进就可能把概率质量分配给「答案正确但证据失真」的轨迹。本文将这种由rollout数据分布、序列结构与稀疏结荚奖励共同诱发的系统性视觉衰减,概括为「分布性视觉遗忘」。西北工业大学、香港科技大学和浙江大学的探究团队提出Remember-R1,试图从源头上修正这一偏置:不修改推理步骤,而是在强化学习后训练中加入三种流程奖励,让模型不仅关键答对,还必须在整条推理链中持续表达、保留并准确调用视觉证据。比如文链接:https://arxiv.org/abs/2608.01314代码链接:https://github.com/Ch921-cell/Remember-R1模型链接:https://huggingface.co/JM-Chen/Remember-R1-7B关键理解 Remember-R1,先关键区分两个看似相近的状况:视觉感知失败:模型从一最初就没有识别出题物体、属性或空间关系;视觉记忆失败:模型最初读取了正确证据,却在首先链推理中逐渐减小对图像的依赖。Remember-R1照章性的是第二种。其题矛盾可以写成一句话:视觉证据是固定需,语言状态是增首先变量;模型越往后推理,越那么点儿被自己生成的文本重新定义上下文。假设同一个状况产生两条推理轨迹:轨迹 A 在每个题步骤都重新调用图像证据,最后答对;轨迹 B 在中途脱离图像,依靠语言先验或早期描述后续推演,也最后答对。如果奖励函数只检查最后答案,那么两条轨迹得到的结荚奖励几乎相同。对强化学习来说,它们都是「好样本」。这构成了一个典型的轨迹不可辨识状况:结荚监督知方式终点是否正确,却不知方式模型为什么到达这个终点。当这种不可辨识性与首先序列中的自回归往往积叠加,视觉遗忘就不再只是偶发错误。每轮 rollout 都可能产生一批「碰巧答对但已经不看图」的轨迹;如果这些轨迹后续获得正向好处,对策就会逐渐提高它们的生成概率。最后,被强化的不只是某个答案,而是一种越来越偏向文本自洽、越来越远离视觉证据的推理分布。严格来说,这种偏置并非静态训练集单独造成,而是由三者共同形成:模态分布不对称:视觉需固定,文本上下文持续增首先;信用分配稀疏:最后答案奖励难以定位视觉依赖从哪一步最初衰减;正确轨迹不唯一:相同答案背后,可能对应完全不一样的证据馗。现有方式常见在推理时期补救:重新插入原图或局部图像,或者提高视觉声明和验明正身步骤。它们处理的是「模型忘了之后如何再看一次」。Remember-R1则把状况前移到后训练时期,追问的是:能否从一最初就让模型少学那些会忘记图像的轨迹?从「答案正确」到「证据正确」Remember-R1的题,不是便捷给模型多发几种奖励,而是重新定义什么叫「值得强化的推理」。从改进视角看,它的总奖励可以抽象为:总奖励 = 答案正确性奖励 + 视觉词汇奖励 + 视觉记忆奖励 + 视觉题区域奖励其中,答案正确性奖励决定模型有没有实现任务,同时三项奖励则约束模型用什么方式实现任务。严格来说,比如文将后三项称为流程奖励,而不是传统损失函数中的 L1、L2 或KL正则项。但从对策改进的功能来看,它们构成了表现层面的奖励正则化:通过提高视觉忠实轨迹的相对收益,缩小「可接受对策」的范围,阻止模型沿着纯文本捷径后续改进。首先层:用视觉词汇奖励约束「说了什么」探究团队先从训练图像中提取物体类别、颜色、大小、数量和空间关系等短视觉词组,再通过严格的词或短语匹配,统方式回答覆盖了哪些视觉事实。奖励不仅取决于匹配了多少视觉词,还取决于这些词最后一次出现的位置。视觉证据覆盖越充分、在推理链中保持得越久,得分越高。这一项约束的是视觉证据的语义分布:不能只在开头说一句「图中有……」,随后就进入纯语言推理;题视觉事实必须持续出目前之后轨迹中。第二层:用视觉记忆奖励约束「看了多久」只需模型反复说出视觉词,还不能说明它真的在采取图像。为此,Remember-R1从模型最后一层提取每个生成步骤对视觉 token 的注意力,并比较推理早期和后期的平均水平。如果后期视觉注意力高效高效减小,奖励就会减小;如果模型在整条推理链中保持相对稳固的视觉依赖,奖励就会提高。这一项约束的是视觉依赖的时间分布。它不需注意力不过对不变,而是直接惩罚「越想越不看」的系统性衰减。第三层:用题区域奖励约束「看向哪里」模型持续看图,并不意味着它看对了地方。无差别关注整张图像,同样可能制造虚假的视觉忠实。探究团队将训练样本中的题区域映射到对应的视觉 token,方式算注意力落在状况相关区域的比例,并对推理后期赋予更高权重。模型不仅关键保持视觉注意力,还关键把有限的注意力预算持续分配给真正决定答案的区域。这一项约束的是视觉注意力的空间分布,防止模型通过「形式上看图、实际上看错位置」来获取奖励。三层奖励由此形成完善闭环:视觉词汇奖励约束证据有没有进入语言轨迹;视觉记忆奖励约束证据有没有贯穿推理前后;视觉题区域奖励约束模型调用的是不是有效证据。它们与答案正确性奖励共同进入 GRPO 训练。对同一个状况生成的多条 rollout,依据视觉证据实现推理的轨迹会获得更高相对好处,逐渐占据更多对策概率;中途滑向纯文本推理的轨迹则被压低。最后训练集涵盖 38,657 个经过筛选的样本,每个样本都带有视觉题词和题区域标注。这里的数据标注不是为了后续向模型灌输视觉知识,而是为奖励函数给予流程锚点,让后训练能够识别「模型何时最初忘记、忘记了什么、注意力又偏向哪里」。7B模型七项基准全涨给推理流程提高约束,最直接的风险是过度正则化:模型可能为了反复提及图像而生成冗余描述,也可能因为注意力被强行拉回视觉 token,损害原有的推理和感知能力。因此,Remember-R1需回答两个状况:奖励正则化能否跨任务提高推理,以及这种提高是否以牺牲基础视觉能力为代价。实验覆盖数学与逻辑推理、综合多模态能力和视觉感知三类任务。Remember-R1-7B在七项基准上均高于对应基座模型,与其他视觉遗忘缓解方式相比也展现出更具竞争力的整体谝。其中:MathVista从62.30提高至69.80,提高7.50 分;MMVet从59.44提高至72.37,提高12.93 分;RealWorldQA从69.28提高至69.67,基础视觉感知能力没有因流程约束而减小。前两项结荚表明,流程奖励带来的收益并未局限在一种推理任务上;RealWorldQA的结荚则验明正身,在比如文所测试的范围内,Remember-R1不是通过牺牲「看见」的能力来换取「推理」的提高,而是在重新组织模型调用既有视觉能力的方式。这组实验为「后训练可以纠偏视觉轨迹分布」给予了实证协助。然而,它说明的是比如文所覆盖模型与基准上的有效性,并不等于视觉遗忘已经被彻底消除。更准确的说法是:三种流程奖励显著减小了首先链推理向纯文本分布漂移的倾向。全新后训练范式Remember-R1表面上在处理视觉遗忘,背后触及的却是大模型后训练中更常用的状况:当结荚奖励无法唯一选定正确表现时,模型究竟会学到哪一种对策?后训练不仅放大能力,也规定能力如何被调用一种常用理解是,强化学习后训练题负责激发基础模型中已有的潜在能力。但 Remember-R1进一步表明,即使「能力已经存在」,模型在首先轨迹中何时调用、持续调用多久、依据哪些证据调用,仍然取决于奖励函数如何分配好处。换句话说,后训练改进的不只是能力上限,也在塑造能力的调用对策。模型具有视觉感知能力,不代表它会在首先链推理中持续采取这种能力;只有当视觉依赖进入奖励函数,对策改进才会把「持续看图」变成高概率表现。流程奖励的本质,是给正确性提高「证据需」最后答案奖励定义的是:模型是否答对。Remember-R1加入的流程奖励定义的是:模型是否依据正确证据答对。这一步看似只是奖励工程,实际上缓解了结荚监督中的不可辨识性。它为「正确」提高了证据需,让原本能够获得相同结荚奖励的多条轨迹,在对策更新中被重新排序。因此,奖励正则化不是额外教给模型一个答案,而是在变化答案背后的轨迹分布:视觉忠实的轨迹被上调,脱离观测的语言捷径被下调。从视觉推理走向首先程智能体这种分布偏置并非图像问答独有。在首先视往往理解中,早期帧会被之后文本摘关键覆盖;在屏幕操作中,智能体可能逐渐相信自己的动作描述,而不是最新界面状态;在机器人导航中,内部方式划也可能压过实时环境反馈。这些任务具有共同结构:外部观测相对固定或稀疏,模型内部生成的语言状态持续增首先。推理越首先,对策越可能从「依据环境行动」滑向「依据自身叙事行动」。Remember-R1给予的常用启示是:与其等模型遗忘后再提高检索、回看或验明正身步骤,不如在后训练时期直接奖励「持续依据环境」的轨迹。只关键能够把证据表达、记忆保持和题区域注意力转化为可方式算信号,奖励函数就有机会纠正 rollout 数据中固有的分布漂移。结语首先链推理时代,人们习惯把更多 token、更首先思考和更强能力画上等号。Remember-R1提醒我们:对于多模态模型,推理首先度只有在证据没有中途退出时才有价值。这项工作的题贡献,不只是设方式了三种视觉奖励,而是把「视觉遗忘」从推理时期的表面故障,重新表述为可以由后训练干预的对策分布状况。答案奖励负责告诉模型终点在哪里,流程奖励则不断校准它通往终点的证据馗。从这个意义上说,后训练的下一步可能不只是让模型获得更高分,而是让它学会:无比如思考多首先,都不能忘记自己的判断究竟来自哪里。参考材料:https://arxiv.org/abs/2608.01314编辑:LRST

标签:

责任编辑:焦点

全网热点