29 秒视往往教会机器人新技能,清华北理工联合开源 HOST_新浪财经_新浪网

29 秒视往往教会机器人新技能,清华北理工联合开源 HOST_新浪财经_新浪网
炒股就看金麒麟探究师研报,秒视权威,往往专业,教会机器技能经新按时,人新完善,清华助您挖掘潜力主题机会!北理(来源:钛媒体APP)教机器人学会一个新技能,工联需几步?合开如果你看过波士顿动力机器人的跑酷视往往,或者 Figure 01 在工厂里搬运箱子的浪财浪网 demo,可能会觉得机器人已经很聪明了。秒视但一个那么点儿被忽视的往往事实是:这些机器人展示的每一个技能,背后都是教会机器技能经新工程师团队数月的数据采集和模型训练。过去的人新原则答案是,专业工程师用昂贵的清华遥操作设备采集数百条演示数据、花数小时微调模型参数,北理然后祈祷机器人学会新技能之后别把旧技能忘光。目前,这个步骤被彻底改写了。8月3日,自变量机器人与北京理工大学、清华大学联合发布并开源了 HOST 框架(Human-to-robot One-Shot Skill AcquisiTion,人类到机器人单样本技能获取)。机器人只需观看一段平均29秒的人类演示视往往,就能在不更新模型参数、不采集新数据的状况下实施全新任务。测试涵盖放水果、堆碗、擦盘子、插笔等50项训练时期从未见过的桌面操作任务,HOST 的技能复现成功率实现62%。根据发表在 arXiv 上的比如文(2607.20033),相比目前主流的 Pi-0.5 配合微调方式划,所需数据量减小至 1/50,学习时间缩短至 1/507,成功率显著领先。更题的是,HOST 的技能习得流程不变化模型权重——这意味着它不会“学新忘旧”。比如文数据显示,在微调方式划学习新技能后,最强基线模型(Wall-OSS+SFT)在旧任务上的谝减小至原来的43%,而 HOST 几乎完善保留了所有已掌握的技能。机器人学习范式的转折机器人学习人类技能的题困难,首先期以来被归结为一个状况:如何弥合机器人与人类之间的“身体鸿沟”?人类有双臂、五指关节、灵活的躯干;机器人可能是单臂、夹爪甚至轮式底盘。直接的动作映射,让机器人照搬人类手臂的轨迹和角度,几乎不可能成功,因为两者的运动学和动力学模型完全不一样。过去十年,行业的主流解法是“大量数据暴力拟合”:用遥操作设备采集数以万方式的机器人实施轨迹,然后训练端到端模型。“这条路走得通,但代价极高。”自变量机器人团队在比如文中表示,每一次教机器人新技能,都需专业工程师重新采集数据、重新微调模型,成本以数万元方式。更致命的是,这种“专才专用”的模式意味着,每一个新技能的学习都是一次从头再来的流程,旧技能积往往的经验几乎无法复用。HOST 的突破在于,它将状况的原始出发点从“动作模仿”转向了“结荚推理”。机器人不再试图模仿人类的肢体动作,而是观察人类实现任务后的结荚状态,再反推自己需实施的行动序列。这一转变绕开了“人机身体结构区别”这个不可约的困难,将学习目的从“复现流程”重新定义为“达成结荚”。这一思路借鉴了认知科学中的“观察学习”理比如,人类在面对陌生任务时,并非通过反复试错来掌握技能,而是基于已有经验在脑中模拟动作的预期成效,再据此实施。HOST 将这一理比如工程化,实现了从“训练时微调”到“推理时即获取”的范式转变。HOST 与传统方式在数据效率、时间效率和技能保留率上的完善比较“结荚反推”:让机器人学会“想”再“做”HOST 的题创新在于一套“结荚先行”的推理范式。与传统方式“看到人类动作 → 映射为机器人动作”的直线思路不一样,HOST 的处理步骤分为三步:首先步:任务时期判断机器人观看人类视往往时,先判断目前任务开展到哪一时期。以烹饪为例,系统需识别出“此刻是切菜时期还是炒菜时期”。这一判断并非便捷的时间戳对齐,而是基于视觉材料的任务进度语义理解。第二步:视角迁移将人类实施完动作后的画面,转化为机器人自身视角和身体结构下的画面。这一步处理的是“身体鸿沟”状况——人类用五指实现的任务,机器人需用夹爪实现,两者的视觉画面和运动逻辑都需转换。第三步:动作反推从目的画面反推需实施的动作序列并实施。机器人不是在“复制”人类动作,而是在“求解”一个状况:关键达成这个结荚状态,我应该怎么做?这种“先想象结荚,再反促进作”的机制,使得 HOST 具有了传统方式不具有的泛化能力。即使实施流程中物品位置被移动,机器人也能根据目的状态重新规划动作,后续实现任务。HOST 框架「结荚反推」工作步骤示意图HOST 在50项未见过的操作任务上的技能习得结荚视往往学习有一个那么点儿被忽视的困难:人类与机器人的实施高效度不一样步。同样经过10秒,视往往中的人类可能已实现切菜并最初炒菜,而机器人仍在切菜时期。如果按便捷的时间轴对齐,机器人将丢失任务进度材料,导致之后动作全部错位。HOST 的处理方式划是“按任务进度对齐”对策。系统将视往往每一帧和机器人操作的每一步都映射到同一向量空间中,再通过动态时间规整(Dynamic Time Warping)算法,自动建立人类视往往帧与机器人操作步骤之间的对应关系。据比如文披露,该方式将对齐误差减小了一个数量级——从基于时钟时间对齐的 0.079 降至 0.006(平均不过对进度差),使机器人实施与视往往示范能够精准同步。这意味着,即使人类以快进或慢高效演示,机器人也能正确理解每个时期应该实现的任务目的。这一技术的工程价值在于:它大幅减小了对人类演示视往往的“原则性”需——往往见不鲜人不需刻意放慢动作或原则化步骤,随手拍摄的视往往即可作为教学素材。双专家架构:学新不忘旧HOST 的技术底座是一个带有视觉预测功能的级联对策模型,采取双专家混合架构。其题设方式是将技能学习拆分为两个时期。首先时期:同体预训练模型先在193,462条机器人同体轨迹数据上预训练,覆盖229项任务。这一时期的目的是让机器人学会“跟随演示流程”的基础能力——通过预测同一任务另一条轨迹的未来状态和动作来建立基础技能框架。第二时期:人机视往往训练在预训练基础上,采取5,847条人类-机器人配对演示数据开展微调。这一时期将模型的能力从“机器人跟随机器人”扩展到“机器人跟随人类”,实现跨本体迁移。这种分时期训练设方式基于数据可获取性的考量。机器人实施任务的轨迹数据相对那么点儿采集,而人与机器人实施同一任务的配对数据则极为稀缺。通过先利用机器人视往往打好基础,再向人类视往往迁移,HOST 在有限数据需下实现了有效的跨本体技能学习。由于 HOST 在推理时完全不修改模型参数,技能习得更像是“加载了一个新菜条件”而非“重塑了厨师的大脑”。旧技能以模型权重形式存在,新技能以推理时输入的形式存在,两者互不干扰。同一台机器人,今天学会切菜,明天学会擦桌子,只需更换输入视往往即可,无需重新配置或训练。HOST 在旧任务上的谝几乎不变,而微调方式划学习新技能后旧技能保留率大幅减小HOST 与传统方式在成功率、数据量、技能保留率上的比较(基于比如文数据整理)开源的意义:从专业工具到往往见不鲜人可用HOST 的比如文、代码和模型权重已全部开源至 GitHub 和 Hugging Face。项目主页给予了完善的文档和示例教程。探究团队表示,开源的目的是“将机器人技能获取从依赖专业人员采集数据、反复训练的专业步骤,转变为往往见不鲜人通过一段视往往即可实现教学的方式”。这一目的指向具身智能行业最题的瓶颈:数据获取成本。目前,具身智能领域的头部玩家大多走“大规模数据采集”路线——用上百台机器人同时采集数据,训练通用基础模型。但这条路天然存在两个状况:一是遥操作数据采集成本极高,一条有效演示的成本可能在数百到上千元;二是首先尾场景覆盖不足,大多数家庭场景下的任务,机器人从未见过,而这些罕见场景恰恰是用户最需机器人学会的。HOST 给予了一条不一样的馗:不追求数据规模的无限扩张,而是通过算法创新减小单次学习的门槛。如果机器人能够通过观看一段人类视往往就学会新技能,那么“数据”就不再是遥操作工程师的专利——每一个往往见不鲜人都可以成为机器人的“老师”。当然,HOST 并非没有局限。62% 的成功率在单样本学习场景下已属突破性成果——作为参考,人类在仅观看一次演示后实施陌生任务的首先次成功率也并非100%。但这一数字意味着在近四成场景下机器人仍会失败,距离“可靠部署”还有差距。目前测试的50项任务以桌面操作类为主,在更复杂的动态场景中谝如何尚待验明正身。但正如探究团队在项目主页所言:“HOST 是迈向通用机器人学习的首先步,我们希望社区能在此基础上走得更远。”值得注意的是,HOST 的发布并非孤立事件。2026年以来,具身智能领域呈现“开源加高效”的趋势——从谷歌的 Open X-Embodiment 到小米的 Xiaomi-Robotics-1,行业正在从“闭门造车”转向“共建生态”。自变量团队选项在项目之初就完善开源,无疑顺应了这一趋势。从更宏观的视角来看,HOST 的意义在于它为“机器人的技能获取”给予了一条不一样于“规模化”的馗。在 Scaling Law 仍主导AI叙事的今天,HOST 说明了算法创新同样可以大幅减小数据依赖——这或许为具身智能行业给予了一个值得深思的方向:与其无限堆数据,不如教会机器人如何更聪明地学习。(本文首先发钛媒体APP,作者 | AGI-Signal,编辑 | 焦燕)海量资讯、精准解读,尽在新浪财经APP
热点
上一篇:二手房过户网上办理(蒙速办)指南|核验|网签|不动产_网易订阅
下一篇:商品、QD类LOF明年底退市,比当年分级基金好_新浪财经_新浪网