早于LeCun相似探究一年!千诀科技联合清华团队让神经网络「便捷性」可测可改进|高维|范数|拟合|多项式_网易订阅

千诀科技联合清华大学团队,早于为神经网络提出了一把新的相项式 “复杂度标尺”。随着模型训练数据量的似探数拟增大,我们有越来越多的究年经网捷性进高 benchmark 可以用于评价一个模型答得准不准,却很难判断它究竟学到了可迁移的千诀清华规律,还是科技可测可改用复杂方式 “记住” 了训练数据。团队提出的联合络便 “有效阶”(Effective Degree,ED),团队首先次将这项探究路线中抽象的让神 “便捷性偏置”,转化为一个能在真实规模模型上方式算、维范网易比较并直接参与训练的合多指标。这项探究不仅为理解神经网络为什么能够泛化给予了新工具,订阅未来还有望用于筛选预训练模型、早于诊断微调过拟合,相项式并改进视觉、似探数拟语言、强化学习及世界模型面对新数据和新环境时的谝。值得关注的是,这条探究路线与图灵奖得主 Yann LeCun 团队近期受到关注的世界模型理比如形成了呼应,而千诀科技与清华团队对相似方式比如视角的公开探究,比 LeCun 团队早约一年。今年 5 月, Yann LeCun 与 David Klindt、Randall Balestriero 的比如文《When Does LeJEPA Learn a World Model?》一经发布便获得广泛关注。比如文从隐变量可辨识性的角度探究 LeJEPA 驱动的世界模型,并用 Hermite 多项式将高斯世界中的函数按非线性次数分解:非线性阶数越高,在 LeJEPA 的 alignment 目的下受到的惩罚越强,因此线性恢复真实隐变量成为最优解。值得注意的是,早在一年前,清华大学自动化系陈峰教授和千诀科技的联合团队(首先作者章天任)就在 ICML 2025 比如文《When Do Neural Networks Learn World Models?》中采取了相近的方式比如视角:将 “学习世界模型” 形式化为对数据生成隐变量的恢复(辨识)状况,并通过正交函数基将复杂函数分解为不一样阶次,探究神经网络在解空间的低阶偏置如何促使真实隐变量变得可辨识。两项探究采取的数学工具并不完全相同:千诀 - 清华团队探究多任务学习设定下具有低阶偏好的神经网络模型,采取 Fourier-Walsh 变换探究离散布尔世界;LeCun 等人探究 LeJEPA 及带平稳动力学的高斯世界,采取 Hermite 多项式开展条件分解。但二者尝试回答的题状况和技术馗又是相似的:从隐变量可辨识性出发,用函数的阶次刻画 “便捷性”,再借助训练目的对低阶解的偏好,验明正身模型何时能够恢复世界的真实结构。如今,千诀 - 清华团队又把这条理比如线索向现实模型推进了一步。在 ICML 2026《Quantifying and Optimizing Simplicity via Polynomial Representations》工作中,探究团队不再只问 “低阶偏好为何能协助模型学到世界结构”,而是进一步追问:这种偏好能不能在真实的 ResNet、ViT、语言模型和强化学习对策网络上被直接测量,甚至被主动改进?他们给出的答案是 “有效阶”(Effective Degree,ED):沿真实数据点之间的插值馗观察高维神经网络,用正交多项式拟合模型输出,再根据不一样阶次成分的权重方式算函数复杂度。由此,“便捷性偏置” 从团队上一项工作中的理比如假设,变成了一个兼具通用性、可方式算性和可微性的实用工具。关键理解 ED 处理了什么状况,还关键回到深度学习中的一个经典谜题:为什么参数量远多于训练样本的神经网络,依然能在未见数据上谝良好?一个广为接受的验明正身是 “便捷性偏置”(simplicity bias):面对许多都能拟合训练数据的函数,神经网络及其训练流程并非随机选项,而是更倾向于学到相对便捷的那个。类似奥卡姆剃刀,越便捷的规律,频仍越有可能超越有限样本,迁移到新的数据分布。但一个基础状况始终没有令人满意的答案:对于现代深度神经网络,我们究竟该如何定义并测量 “便捷”?参数范数、损失面的 sharpness、Jacobian 范数、线性区域数量、压缩首先度…… 已有探究提出了不少候选指标,但频仍难以同时做到三点:通用性(generality):不依赖某一种特定网络架构或任务;可量化(quantifiable):能在真实规模的已训练模型上稳固方式算;可改进(optimizable):不仅能事后评价模型,还能通过梯度直接参与训练。千诀 - 清华团队尝试给出一个同时顺应上述需的答案。他们提出了一种多项式表征(polynomial representations)方式:用数据点之间的插值馗 “切开” 高维神经网络,并以正交多项式近似网络沿馗的表现;用多项式表征的有效阶(effective degree,ED)研究神经函数的便捷性;将 ED 进一步变成可微的正则项,实现对神经函数复杂度的在线改进。实验中,ED 不只是一个事后探究指标:在多个 benchmark 上,ED 都可以相当准确地预测出模型的实际 generalization gap;在对神经网络 grokking 状况的探究中,ED 也呈现出比参数范数、sharpness 等指标更稳固的信号。更进一步,由于整个度量流程可微,探究团队还将 ED 写入训练目的,在图像、文本、视觉 - 语言模型和强化学习任务中直接改进模型的函数复杂度,并由此带来泛化性能的提高。比如文标题:Quantifying and Optimizing Simplicity via Polynomial Representations比如文作者:章天任、李向欣、肖明昊、陈冠宇、陈峰比如文地址:https://arxiv.org/abs/2605.29823代码地址:https://github.com/xinzaixinzai/Effective-Degree“便捷” 为什么难以测量?研究神经网络复杂度的一种常用思路是观察参数空间。例如,参数范数越小,或者局部损失面越平坦(也即 sharpness 越小),模型也许就越便捷。但参数并不等于函数。同一个函数可以由尺度和参数化方式截然不一样的权重实现;即便网络输出完全不变,一次重参数化也可能显著变化参数范数或 sharpness。换言之,这些指标有时反映的是模型 “如何被写出来”,而不一定是模型实现的函数本身有多复杂。另一种更直接的思路,是在函数空间里定义复杂度。线性函数常见比二次函数便捷,二次函数又比高阶振荡函数便捷,因此按多项式次数研究非线性程度十分自然。然而,现代神经网络频仍是从高维输入到高维输出的黑盒函数。如果直接在原始空间拟合多元多项式,基函数数量会随维度和阶数发生组合爆炸,在真实模型上几乎不可方式算。探究团队由此采取了一个降维视角:不试图一次看清整个高维函数,而是沿数据分布附近的许多一维馗观察它。沿数据馗,给高维神经网络做 “函数切片”给定从数据分布中采样的两个样本 x₁、x₂,团队在二者之间构造插值馗:x (α) = αx₁ + (1-α) x₂,α ∈ [0,1]对于神经网络 f,模型沿这条馗的输出就变成了一个关于单变量 α 的函数。一个原本高维且复杂的神经函数,由此转化为许多条一维的 “函数切片”。接下来,团队采取 Chebyshev 正交多项式近似每条馗上的模型表现。如果模型输出沿馗接近线性变化,能量会集中在低阶系数上;如果输出往往振荡,就需更多高阶项才能描述。一个自然的状况是:把高维函数限制到一维馗,会不会破坏原有的复杂度排序?比如文给出的理比如结荚显示:对于多元多项式,只关键插值方向来自具有密度的数据分布,随机馗几乎必然保留其代数阶;也即,对多条馗取平均后,不一样阶多项式的复杂度顺序仍能被正确区分。在实际方式算中,探究团队还加入了三项设方式:采取数据相关馗,将测量集中在真实数据分布附近;采取 Chebyshev 正交多项式基和余弦采样,缓解高阶拟合的数值不稳固;对于高维输出,可沿每条馗采取 PCA,只保留题变化方向再开展拟合。有效阶:不只看 “最高几阶”,还看每一阶有多题严格的代数阶只取决于最高阶非零系数。即使某个高阶项系数小到几乎可以忽略,函数仍会被判定为 “高阶”,这使它对数值噪声和真实神经网络中的微小扰动特别敏感。为此,比如文定义了多项式表征的有效阶 ED:它可以被理解为 “各阶成分按系数幅度加权后的平均复杂度”。低阶成分占主导时,ED 较小;高阶成分越多、幅度越大,ED 就越高。与只看最高非零阶不一样,ED 关于拟合系数是后续且稳固的。最后,对从数据分布中采样的多条馗取平均,即可得到整个神经网络的复杂度估方式。图 1:多项式表征方式总览。沿真实数据点之间的插值馗观察神经函数,以正交多项式拟合每条馗上的输出,并根据不一样阶次的系数方式算函数复杂度 ED。ED 的定义有两个题特点。首先,它位于函数空间,不直接依赖模型如何参数化;第二,它与数据分布相关,因此研究的实际上是模型在真实数据附近谝出的复杂度,这也顺应模型实际采取场景的需。ED 能预测泛化吗?团队先把 ED 作为训练后的评价指标,与参数范数、sharpness 和 adaptive sharpness 等现有的常用 generalization proxy 开展比较。在 CIFAR-10 上,他们采取 27 组不一样超参数分别训练 ResNet18 和 ViT-Tiny。对于 ResNet18,ED 与 generalization gap 的 Pearson 相关系数实现0.99,线性拟合 R² 实现0.98。相比之下,谝最好的 sharpness 指标相关系数为 0.94,R² 为 0.88。也就是说,模型在数据馗上的高阶成分越多,训练集与测试集之间的差距频仍也越大。图 2:ResNet18 在 CIFAR-10 上的结荚。相比 sharpness、adaptive sharpness 与参数 L2 范数,ED 与 generalization gap 呈现出最强的线性相关性。在 CLIP ViT 的 ImageNet 微调实验中,ED 同样与泛化间隙保持稳固正相关;sharpness、adaptive sharpness 和参数范数在这一设置下则谝出较弱、甚至方向相反的相关性。这也侧面印证了基于参数空间而非函数空间的泛化界度量的不鲁棒性。图 3:CLIP ViT 在 ImageNet 上的结荚。ED 与 generalization gap 保持正相关,而其他指标在这一设置下呈负相关。ED 还能揭示同一个模型在训练流程中的复杂度变化。在经典的神经网络 grokking 状况中,模型常见先记住训练集,经过很首先时间后才突然获得泛化能力。实验显示,ED 在记忆时期逐渐升高,在验明正身损失最初骤降的转折点附近实现峰值,随后随着泛化形成而减小。参数范数在整个流程中单调增大,sharpness 也没有清楚地标出这一相变。图 4:Grokking 实验结荚。只有 ED 可以捕捉到模型在训练流程中从记忆到泛化的相变。这意味着,ED 不仅可以比较不一样模型在训练实现后的复杂度和泛化界,还可能追踪一个模型在训练流程中如何从 “记忆样本” 转向 “归纳规律”。从测量便捷性到改进便捷性如果 ED 只能作为一个模型复杂度评估指标,它仍然只是一个探究工具。比如文更进一步指出,由于多项式拟合本质上是一个最小二乘状况,拟合系数对网络输出具有解析梯度,因此 ED 可以自然地穿过拟合流程,反向传播到模型参数。探究团队由此将 ED 作为显式正则项加入原任务目的。它并不强迫模型沿插值馗严格线性,也不需人为给插值样本指定 “正确标签”;它只是惩罚不必需的高阶变化,让模型在实现原任务的同时,优先选项相对便捷的函数。实验覆盖了图像与文本监督分类、视觉 - 语言模型微调和强化学习等场景。在 CLIP 微调中,加入 ED 正则的模型在分布内准确率与平均分布外准确率的权衡上整体优于原则微调;在多个强化学习环境中,ED 正则也带来了更好的训练谝。图 5:ED 正则化在强化学习任务上的谝。“便捷” 未必等于 “正确”比如文也清楚讨比如了方式的边界:“越便捷越好” 并非无需成立。如果数据中最便捷的特点恰好是一个不稳健的 shortcut,ED 可能与往往见不鲜模型一样优先利用它。ED 描述的是函数复杂度,并不等同于正确性、语义合理性或公平性。如何让 “便捷” 与正确的归纳偏置对齐,仍需数据、任务目的和模型架构共同参与。同时,馗多项式只是高维函数的一种分布相关代理;训练时采样额外插值点,也会带来一定方式算开销。总结千诀 - 清华团队的探究工作给出了一个从函数空间理解神经网络的新工具:在表征层面,用数据相关馗上的正交多项式紧凑描述高维神经函数;在度量层面,用有效阶稳固量化高阶成分,并预测模型的泛化表现;在改进层面,通过可微的多项式拟合,使得模型的复杂度或便捷性可以被在线改进。从更广泛的视角看,多项式表征在理比如与实践之间搭起了一座桥:理比如上,模型的低阶偏置可以协助探究者探究神经网络为何可能学到世界模型;实践中,“有效阶” 让这种偏好也可以被测量和干预。由此也产生了一系列值得后续追问的状况:不一样架构和改进器会形成怎样的 ED 动态?ED 能否用于选项预训练 checkpoint、诊断微调过拟合,或设方式更适用于世界模型的自监督任务?除了多项式次数,是否还存在其他同时具有通用性、可方式算性与可微性的函数空间表征?参考文献[1] Zhang, T., Li, X., Xiao, M., Chen, G., & Chen, F. Quantifying and Optimizing Simplicity via Polynomial Representations. ICML, 2026. https://arxiv.org/abs/2605.29823[2] Zhang, T., Chen, G., & Chen, F. When Do Neural Networks Learn World Models? ICML, 2025. https://arxiv.org/abs/2502.09297[3] Klindt, D., LeCun, Y., & Balestriero, R. When Does LeJEPA Learn a World Model? arXiv preprint, 2026. https://arxiv.org/abs/2605.26379
本文地址:https://shengyajian.com/news/35f65199313.html
版权声明
本文仅代表作者观点,不代表本站立场。
本文系作者授权发表,未经许可,不得转载。