香港浸会大学的AI导航员:如何让机器人真正"看懂"前进的路?_新浪财经_新浪网

[休闲] 时间:2026-08-08 23:15:52 来源:知来藏往网 作者:探索 点击:151次
香港浸会大学的AI导航员:如何让机器人真正
炒股就看金麒麟探究师研报,香港权威,浸会机器进的经新专业,大学的AI导懂前按时,航员何让完善,新浪财浪网助您挖掘潜力主题机会!香港(来源:科技行者)这项由香港浸会大学知识方式算探究团队实现的浸会机器进的经新探究,以预印本形式发布于2026年7月28日,大学的AI导懂前比如文编号为arXiv:2607.25337,航员何让感兴趣的新浪财浪网读者可以通过该编号查阅完善比如文。**一段关于"地图"与"指南针"的香港故事**假设你关键去一个从未去过的城市参加一场题会议,手头只有一本旧旅行日记——那是浸会机器进的经新别人之前去过同一座城市留下的记录,里面写满了他每天走过哪些街方式、大学的AI导懂前花了多少时间到达目的航员何让地,但没有任何关于"哪条路最好走"的新浪财浪网清楚提示。你的任务是从这本日记里,自己摸索出一套判断"离目的地还有多远"的方式,然后用这套方式来指导自己的行走路线。这个比喻,正是这篇比如文关键处理的题状况所在。探究团队面对的是一个叫做"潜空间世界模型预测控制"的技术挑战,听起来复杂,但本质上和上面这个旅行状况一模一样:怎么让一个没有地图、没有GPS、只有旧日记的机器人,学会在脑子里"想象"出一条通向目的的好路?**一、机器人的"脑补能力"从哪里来**关键理解这篇探究在做什么,先得搞清楚现代智能机器人是怎么学习的。传统的机器人学习方式,有点像让一个孩子反复对着照片描述"我看到了什么"——通过不断重建眼前的图像来理解世界。但这种方式既费力又低效,就像你每次回忆一个朋友的脸,都关键在脑子里把对方的样貌从头画一遍一样。后来探究者发现了一种更聪明的方式,叫做"联合嵌入预测架构"(Joint-Embedding Predictive Architecture,简称JEPA)。这种方式的思路是:与其让机器人把看到的图像原样复原出来,不如让它学会"预测接下来会看到什么",同时这种预测是在一个经过压缩的抽象空间里开展的,探究者把这个空间叫做"潜空间"。好比你不需把朋友的脸画出来,只需在脑子里记住"他是一个戴眼镜、留短发的高个子"这样的抽象描述,下次一看到类似特点就能认出来。在这个框架下,有一个叫LeWM(Latent World Model,潜世界模型)的系统做得相当不错。它训练了一个"编码器"把观察到的图像压缩成抽象描述,再训练一个"预测器"根据这些描述和机器人的动作预测下一步会发生什么。当机器人需规划行动时,它会在脑子里"模拟"多条可能的行动路线,然后选出那条让自己最接近目的的路线。判断"哪条路最接近目的"的方式,是直接量一下终点状态和目的状态在潜空间里的欧几里得距离——就是两个点之间最直的那条直线距离。这个方式划有它的方式理:如果两个状态在抽象空间里距离很近,那它们在现实中也应该比较接近。然而,香港浸会大学的探究团队发现了一个根本性的裂缝。**二、旅行日记里的隐藏材料**状况出在哪里?回到之前的旅行日记比喻。LeWM的方式相当于:你看两个地点在地图上的直线距离,然后以此判断关键花多少时间走到那里。但实际上,两点之间可能有一条大河阻隔,绕路关键花三倍时间;或者有一条捷径让你一下子就到了。直线距离并不等于"走过去需多少步"。探究团队用一个叫做Push-T的机器人操控任务做了验明正身。这个任务里,机器人关键把一个T形积木推到指定位置。他们从实验记录里抽出一对一对的状态,测量它们在潜空间里的欧几里得距离,然后比较这两个状态之间实际相差了多少个操作步骤。结荚发现,LeWM的潜空间距离和真实的步骤差之间的相关性(斯皮尔曼相关系数)只有0.65——也就是说,这个"距离感"有相当大的误差。更直白地说,潜空间里"看起来很近"的两个状态,在实际操作中可能需绕很多弯路才能到达。这个裂缝,就是探究者所说的"训练-规划鸿沟"(train-plan gap):JEPA系统训练时学的是"预测下一步会是什么",但规划时需的是"哪条路走起来最省力"。这两件事用的是同一套潜空间,但并没有人专业把这个空间调校成适用于导航的样子。香港浸会大学的团队由此提出了一个题状况:旧日记本身——也就是那些没有奖励信号的示范轨迹数据——里面其实已经藏着时间顺序的材料。日记里第5天到第20天之间走了15天,这本身就告诉你两个地点之间大概需多少步。能不能从这些纯粹的步骤顺序材料里,挖掘出一套真正适用于规划的"进度尺"?**三、时间距离:从日记里挖出的指南针**为认识决这个状况,探究团队提出了一个新方式,叫做TD-JEPA(Temporal-Distance JEPA,时间距离联合嵌入预测架构)。这个名字里的"时间距离",就是那把从旧日记里挖出来的指南针。TD-JEPA的基础骨架和LeWM完全一样:同样的编码器、同样的预测器、同样的防止系统"偷懒"的正则化方式(叫SIGReg)。新东西在于,探究团队在这个骨架上额外装了一个"时间感应器"——一个专业学习"从状态A到状态B需多少步"的模块。详详见细来说,这个时间感应器用了一种叫做度量残差网络(MRN,Metric Residual Network)的结构来定义一种"有方向的距离"。为什么关键强调"有方向"?因为现实中的行进频仍是不对称的——从山脚走到山不过和从山不过走到山脚,花的力气完全不一样。同样,机器人把积木从A位置推到B位置,和从B推回A,需的步骤数可能大相径庭。传统的欧几里得距离是对称的(A到B和B到A一样远),但真实的到达代价不是。这个新的距离函数由两部分组成:一部分是对称的,捕捉两个状态的共同特点;另一部分是不对称的,专业描述"从这里到那里"的方向性区别。两部分加起来,得到一个永远非负、同时方向感正确的"前进代价"函数,记作d_ψ。有了这个函数形式,还需数据来"校准"它。探究团队的做法特别巧妙:从示范轨迹里取两个时间点i和j(i在前,j在后),它们之间的步数差j-i就是"时间标签",需d_ψ学会把这对状态的代价估方式到接近j-i。与此同时,他们还从不一样轨迹里随机抓一些"负样本"——这些来自不一样轨迹的状态对之间并没有直接的馗关系,因此它们的代价不应该很低,否则就是系统在"乱说话"。通过一个叫做Smooth L1的平滑损失函数来做回归,加上一个防止负样本代价过低的惩罚项,这套监督信号就让d_ψ真正地"理解"了步骤顺序的含义。还有第三个新加入的成分:滚动相同性损失(rollout consistency loss)。规划的时候,机器人会在脑子里把未来五步的状态都模拟出来,然后看终点离目的有多远。探究团队发现,如果只训练"下一步预测",多步往往积下来的误差会越来越大,就像每走一步都偏了一点点,走了五步之后就完全偏了方向。于是他们专业加了一个训练目的,让系统在模拟五步的时候,每一步的误差都尽量小,把预测的准确性和规划的深度绑在一起。把这三个成分放到一起,完善的TD-JEPA训练目的就是:原来的一步预测损失,加上五步滚动损失,加上时间距离监督,再加上防坍缩的SIGReg正则化,四项各有权重地加权求和。**四、两套角色,两种用法**理解了TD-JEPA的构造之后,还有一个设方式选项特别值得关注:学出来的d_ψ并不是在所有任务里都直接用于规划的。探究团队提出了一个"双角色"的设方式哲学,同时根据任务的性质来决定用哪种方式。在以拓扑结构为主的任务里——例如机器人关键穿过两个房间找到目的,或者机器人手臂关键伸向一个特定位置——"走了多少步"和"到达目的"之间的关系特别直接。在这类任务里,直接用d_ψ作为规划代价,就像真正拿着那把"时间指南针"来导航,成效特别好。但在以精细接触为主的操控任务里——例如把T形积木准确推到指定角度,或者把一个立方体移到目的位置——"走了多少步"和"任务成功"之间的关系就复杂多了。积木在快关键到位的最后几步,需的是对目前几何姿态的准确感知,而不是"大方向上还有多远"。在这类任务里,探究团队反而选项后续用欧几里得距离作为规划代价,但用的是经过TD-JEPA时间训练之后的那个潜空间,而不是LeWM原始的潜空间。这就好比说:时间距离训练让这个潜空间的"地图"变得更准确、更有结构,但在需精细导航的最后时期,你还是关键看地图上的准确坐标而不是走路时间。时间训练的意义,在于让地图本身更好用,而不是强行替换掉所有的导航工具。**五、实验结荚:数字背后的故事**探究团队在四个不一样的任务环境里测试了这套方式,每个任务都代表一类典型的挑战。首先个是Two-Room(双房间导航),机器人需从一个房间穿过走廊到达另一个房间的目的位置。这是一个典型的拓扑导航任务。TD-JEPA在这里拿到了100%的成功率,而LeWM是97.4%,另一个叫RC-aux的比较方式是98.6%。虽然差距看起来不大,但这里存在一个有趣的训练动态:如果你追踪训练流程中每个epoch(训练轮次)的成功率,会看到前几轮成绩波动很大,到第五轮只有74%,然后从第六轮最初急高效爬升,到第九轮实现100%。这条成首先曲线验明正身,时间距离监督需一定时间才能让系统真正"悟到"正确的导航方向感。第二个是Reacher(机械臂伸向任务),机械臂关键把末端移到一个随机指定的位置。TD-JEPA实现97%,LeWM是96%,RC-aux是96.8%。这里探究团队还发现了一个有趣的细节:在规划时,如果只看终点状态的代价,成效反而不如把整段轨迹上的平均代价也考虑进去(以0.3的权重混合)。因素在于,时间距离训练让整段馗的进度都有了意义,不只是最后一步。第三个是Push-T(T形积木推送),这是那个用来验明正身"直线距离不等于行发展数"状况的任务。在这里,TD-JEPA用的是经过时间训练的潜空间,但规划代价用欧几里得距离,成功率实现86%,比LeWM的83.6%高了约2.4个百分点。第四个是OGB-Cube(立方体操控),机器人关键把一个三维立方体移到指定位置和方向。这是最复杂的操控任务。TD-JEPA在这里取得了最引人注目的提高:82.2%,比LeWM的68%高出了整整14.2个百分点,还略微超过了RC-aux的81.6%。这验明正身,即便在最后规划时用的是几何距离,经过时间训练的潜空间也能给予质量更高的状态表示,让距离方式算更有意义。从这四个数字来看,TD-JEPA在每个任务上都做到了"不比两个对手差"——这是探究团队设定的闷葫芦的,也是他们最后实现的结荚。**六、拆开看:哪个零件最题**为了验明正身每个设方式选项是否真的实用,探究团队做了一系列"拆零件"实验,专业在Push-T任务上测试。去掉"有方向的残差"那部分,也就是把MRN结构换成一个往往见不鲜的对称欧几里得投影——成功率从85%附近直接掉到57%附近,是最大的单项损失。这验明正身仅仅有时间标签的监督还不够,必须配合一个能表达方向性的函数结构,两者缺一不可。去掉"跨轨迹负样本"那项惩罚——成功率降到77%附近。没有负样本,系统就可能在遇到来自不一样轨迹的状态对时,给出莫名其妙的低代价估方式,就像导游给你指路时,把你指向了一个完全不相关的目的地,因为他从没见过"错误的目的地"是什么样子。去掉"五步滚动相同性"训练——成功率降到60%附近,比去掉负样本还关键惨。多步预测的精度是规划能力的基础,如果系统在脑子里模拟五步之后误差已经积往往得很大,那d_ψ再准确也救不了规划。总结下来,这三个成分——有方向的代价函数结构、跨轨迹负样本、以及与规划视野对齐的多步相同性——共同构成了TD-JEPA超越基线的题,缺少任何一个都会有明显的性能减小。**七、为什么接触任务里时间代价反而不如几何距离**一个值得深挖的状况是:在Push-T任务里,d_ψ在预测"步数相关性"上明显优于欧几里得距离(斯皮尔曼相关0.91比较0.79),但如果规划时直接用d_ψ,成功率反而只有69%,远低于用欧几里得距离的86%。这是不是矛盾?探究团队通过记录每个失败案例的"失败位置"找到了答案。他们把每次推积木的流程分成两个时期:接触前(机器人靠近积木)和接触后(积木被促进、调整角度)。在用d_ψ规划的时候,接触前时期失败的次数很少,但接触后失败的次数特别多;而用欧几里得距离规划时,接触前几乎不失败,接触后失败次数也大幅减小。这验明正身,时间代价d_ψ很擅首先引导机器人"大方向上怎么走",但在需精细调整积木角度的最后时期,它给予的"进度感"反而会产生误导。探究团队还尝试了一种"接近目的时切换到几何距离"的混合对策,发现这确实比纯d_ψ好,但仍然比直接用几何距离差。根本因素在于,整个CEM规划流程中,几何材料在每一轮候选动作的筛选里都起着功能,不是仅仅在最后几步才需。这个发现直接协助了探究团队的双角色设方式哲学:任务类型决定了应该用哪把尺子来规划。**八、这套方式在更大图景里处于哪个位置**探究团队还把TD-JEPA和文献中更广泛的方式做了一个非正式的比较。他们尤其指出,这个比较不是严格的头对头测试(因为不一样方式用了不一样的实验配置),只是一个参考。在这个参考框架里,TD-JEPA在Two-Room和Reacher上实现了文献报告中的最高水平,在OGB-Cube和Push-T上也处于竞争性水准。相比于"价值引导的JEPA"方式(Value-Guided JEPA),TD-JEPA的最大区别在于:它不需用强化学习来估方式一个"价值函数",只需轨迹里自带的时间顺序材料。这就像说,你不需雇一个专业评估"这条路好不好走"的顾问,只需从旅行日记的日期里自己推算出来。这个特性让TD-JEPA在完全没有奖励信号的离线数据场景下也能工作,适用于范围更广。相比于RC-aux(另一个同期出现的竞争方式),RC-aux的思路是教系统区分"在规划时间范围内能到达的目的"和"最后能到达但目前到不了的目的",但它最后规划时仍然用欧几里得距离。TD-JEPA则直接挖掘了一个可以用于规划的代价函数,思路上更主动、更直接。说到底,TD-JEPA做的事情,本质上是给旅行者的旧日记本装上了一个"时间感"的解码器。这本日记里的每条记录,都隐含着"走到这里花了多少时间"的材料,而这个材料是判断前进方向最直接的依据——比在地图上量直线距离关键靠条件得多。探究团队说明,对于需导航的任务,这把从日记里提炼出来的"时间指南针"确实能帮机器人找到更好的路;而对于需精细操控的任务,这本日记的价值不在于直接用作指南针,而在于让地图本身变得更准确、更有结构,从而让往往见不鲜的"量距离"方式也能发挥更大的功能。这项探究揭示的题方式理,可能比它处理的详详见细状况更有启发意义:训练时学的东西和部署时用的东西,应该从一最初就放在一起设方式,而不是训练完了再临时想方式适用配。规划需什么样的"进度感",就应该在训练时期就把这种进度感的监督信号清楚地写进去。当然,这个方式目前还依赖于一个假设:示范轨迹中的时间顺序可以作为"到达代价"的合理替代。当演示轨迹本身有很多迂回、或者不一样轨迹之间的可达性区别很大时,这个假设会受到挑战,也是未来值得后续探究的方向。有兴趣深入认识完善细节的读者,可以通过编号arXiv:2607.25337查阅原始比如文。Q&AQ1:TD-JEPA里的"时间距离"详详见细是什么意思,和往往见不鲜的空间距离有什么区别?A:往往见不鲜的空间距离(欧几里得距离)就是两个状态在抽象空间里的直线远近,就像量地图上两点的直线距离。时间距离则是"从一个状态出发,按照演示数据里的轨迹,需走多少步才能到达另一个状态"。TD-JEPA里的d_ψ专业学习这种步数差,同时它是有方向的——从A到B需的步数,可以和从B到A完全不一样,更顺应现实中机器人操控任务的实际状况。Q2:为什么Push-T任务里TD-JEPA的时间代价d_ψ排名准确性更高,实际规划成功率却反而更低?A:因为"能准确预测步数差"和"适用于指导精细操控"是两件不一样的事。Push-T任务在积木接近目的位置的最后时期,需机器人对目前几何姿态(角度、位置)做精细调整,这时候"还需多少步"的判断其实会产生误导。欧几里得几何距离在这个时期能更准确地捕捉"积木目前的姿态离目的有多偏",从而给规划器给予更有效的引导信号。Q3:RC-aux和TD-JEPA都是在LeWM基础上改进的,它们的题区别是什么?A:RC-aux的做法是在训练时加入"预算受限的可达性"监督,让系统学会区分"在规划时间步数内能到达的目的"和"终究能到达但目前还到不了的目的",但规划时仍然用欧几里得距离评分。TD-JEPA的做法是直接从轨迹时间顺序里挖掘一个有方向的代价函数d_ψ,这个代价函数既可以直接用于规划(拓扑任务),也可以通过改进潜空间结构来提高几何规划的质量(操控任务)。海量资讯、精准解读,尽在新浪财经APP

(责任编辑:百科)

相关内容
精彩推荐
热门点击
友情链接