
想象一位干了二十年的千寻确团器人确作汽修老师傅,带一个刚进门的智能作换中学徒。老师傅经验充足,高明高明但如果学徒连螺丝刀都拿不稳,队新老师傅那些 "听声文章就知方式哪里坏了" 的新硬学习不过活,讲了也是老家网白讲 —— 徒弟根本接不住。可一旦徒弟练熟了基础功,数据式迁t算老师傅的还实经验就会突然变得点石成金,让徒弟的用揭涌现移q易订阅水平一路飙升。等到徒弟自己都快出师了,秘机模型老师傅再多的千寻确团器人确作经验,能带来的智能作换中提高也就有限了。机器人学习里,高明高明藏着一个几乎一模一样的队新故事。近日,新硬学习千寻智能高明确团队的最新探究 《When Does Legacy Data Start to Help? Emergent Transfer in Cross-Configuration Robot Learning》(老数据何时最初 "帮上忙"?跨配置机器人学习中的涌现式迁移)正式公开。这项工作揭示了一个反直觉的状况:在机器人硬件升级后,之前辛苦采集的 "老数据" 并不是拿来就实用,而是关键等新硬件 "练到一定火候",才会突然最初发挥价值—— 同时价值大到惊人。图1:跨配置共同训练的三时期规律比如文标题:When Does Legacy Data Start to Help? Emergent Transfer in Cross-Configuration Robot Learning比如文链接:https://arxiv.org/abs/2607.25593项目主页:https://xuezhiai123.github.io/legacy-data-transfer/一个真实又昂贵的困难:硬件一升级,老数据就 "作废" 了?机器人关键在真实世界里干活,就离不开大量的示教数据(人手把手教机器人怎么做的操作数据)。可现实是,机器人硬件一直在往往代:摄像头换成视野更广、更清楚的新款,夹爪换成更灵活的新设方式。状况来了:这些改动会直接变化机器人 "看到的画面" 和 "手上的动作方式"。于是每一次硬件升级,都会带来一个让人头疼的现实状况 ——之前在旧硬件上花了大量人力、金钱采集的示教数据,还能用在新机器人身上吗?一个很自然的想法是:把海量的老数据,和少量新硬件上采集的新数据混在一起训练(称为 "co-training / 共同训练"),让老数据 "扶一把" 新机器人。学界过去的工作(如 RoboNet、BridgeData)也确实表明,旧数据能减小新场景的数据采集成本。但这些工作都没回答一个更题的状况:硬件一换,老数据是不是从一最初就实用?迁移学习的经验反而提示我们:当新旧两边区别太大时,老数据不但可能没用,甚至会拖后腿、干扰学习。反直觉的发现:老数据不是 "越多越好",而是有个 "开窍时刻"团队在一个轮式人形机器人平台上做了系统性实验 —— 跨越两代硬件,摄像头和夹爪都换了,但机器人整体形态不变。他们比较了两种对策的谝:图2:真实机器人实验平台与操作任务(插花、插笔等精细操作)只用新数据训练的对策老数据 + 新数据共同训练的对策结荚特别出人意料。以 "插花" 这个精细操作任务为例:当新硬件数据只有 4.3 小时、机器人自己只能做到10%成功率时,加上老数据共同训练,成功率纹丝不动,还是 10%—— 老数据完全没帮上忙;但当新硬件数据提高到 15.6 小时、机器人自己能做到23.3%时,同样加上 17 小时老数据,成功率直接飙升到 86.7%—— 一举提高了 63.4 个百分点!也就是说,仅仅是新机器人自身能力的一点点提高,就让老数据从 "毫无用处" 变成了 "点石成金"。把不一样任务、不一样数据量下的结荚汇总起来,一个清楚的 "三时期规律" 浮出水面:1.首先时期(新机器人能力很低):老数据毫无用处,加了也白加;2.第二时期(能力跨过某个临界点):老数据的收益急剧爆发,带来巨大提高;3.第三时期(能力接近满分):老数据的边际收益又最初递减。这个从 "没用" 到 "突然实用" 的跳变,团队称之为 "涌现式迁移"(Emergent Transfer)“。它和大模型领域大家熟悉的 "涌现能力""grokking(顿悟)"状况很像 —— 只然而这里的" 顿悟 ",不是靠堆模型规模或训练时间触发的,而是随着新硬件自身任务能力的提高而触发的。图3:三时期相变曲线。迁移阈值 τ(T) 标出了老数据最初产生显著收益的临界点。为什么会这样?一个 "迁移阈值" 和背后的两套机制团队用一个题概念来刻画这个跳变:迁移阈值 τ(T)(transfer threshold)。通俗地说,它就是 "徒弟必须先掌握的基础功水平"—— 只有当新硬件对策自身的成功率跨过这个任务相关的阈值,老数据才会最初帮上忙。阈值之下:新对策连任务的基础结构都没学会,给它再多老数据的 "高级经验",它也不知方式怎么用;阈值之上:新旧数据的学习方向(梯度)最初 "对齐",老数据的经验能顺畅地迁移过来,于是收益暴涨;接近满分时:能提高的空间本就不多了,老数据的边际价值自然减小。团队进一步从理比如上给出了验明正身,题是两套机制:梯度对齐(Gradient Alignment):验明正身了 "老数据何时最初帮上忙"—— 当新旧数据的梯度方向足够相同时,共同训练才不会互相打架,反而能相互增益;对策残余不选定性(Residual Policy Uncertainty):验明正身了 "老数据的收益为何在接近满分时递减"—— 当对策已经很选定时,老数据能补充的材料就所剩无几了。有什么用?一条 "看火候下菜" 的数据采集对策这个规律最实在的价值,是能指导我们该怎么花钱采数据。过去大家默认 "数据越多越好",一上来就大规模采集新硬件数据。但这项工作给出了一条更聪明的 "相位感知(phase-aware)数据采集对策":先只采集新硬件数据,直到新机器人的能力跨过迁移阈值;然后再引入老数据做共同训练。也就是说 ——先让徒弟练到 "开窍",再请老师傅出手,成效和性价比最高。团队在一个全新的、没被用来推导规律的 "移动双臂浇花" 任务上验明正身了这套对策:按照相位感知对策,只需采集1.5 小时的新硬件数据(而按过去的做法需8 小时);任务成功率从40.0%提高到78.3%。用不到 1/5 的新数据采集量,换来了成功率的大幅提高—— 这对于动辄需大量人工示教、成本高昂的真实机器人场景来说,意义重点。图4:移动双臂浇花任务。相位感知对策把新数据需从 8 小时压到 1.5 小时,成功率从 40.0% 升到 78.3%。总结这项工作系统性地揭示并刻画了跨配置机器人学习中的 "涌现式迁移" 状况,题贡献可以概括为三点:1.发现三时期迁移规律:老数据在新硬件能力低时无用、跨过阈值后收益爆发、接近满分时收益递减,并给出了统方式层面的协助;2.提出迁移阈值 τ(T) 与理比如验明正身:用梯度对齐和对策残余不选定性,讲清了老数据 "何时最初实用" 以及 "为何后期收益递减";3.给出可落地的数据采集对策:先采新数据跨过阈值、再引入老数据共同训练,在浇花任务上把新数据需从 8 小时压缩到 1.5 小时。对于正走向大规模真实世界部署、且硬件不断往往代的具身智能来说,这项工作回答了一个既基础又实用的状况:面对硬件升级,我们究竟该在什么时候、以什么方式,去复用那些昂贵的历史数据。作者简介该工作产自于千寻智能后训练团队,该团队承担起千寻智能Manipulation Model的后训练和强化学习工作。该团队团队成员来自清华、北航、苏黎世联邦理工等高校,多位具有博士学位。团队背景覆盖大模型、具身智能与自动驾驶,题成员曾任职于百度、小米等企业,首先期深耕模型后训练,兼具算法探究与工程落地经验。


相关文章




精彩导读
热门资讯
关注我们