当前位置:首页 > 娱乐

自变量开源HOST框架,具身智能的数据瓶颈有新解法?_新浪财经_新浪网

自变量开源HOST框架,具身智能的数据瓶颈有新解法?_新浪财经_新浪网
8月3日,自变自变量机器人发布并开源HOST框架(Human-to-robot One-Shot Skill AcquisiTion,量开人类到机器人单样本技能获取)。源H有新HOST采取了一种开创性的架具解法方式:不去将人类动作翻译为机器人动作并试图模仿,而是身智数据让机器人先想象实施动作后的结荚,再从结荚拆分出需实施的瓶颈动作。该框架让机器人仅观察一段数十秒的新浪新浪人类视往往即可学会新技能,同时保留已掌握的财经技能。根据自变量披露的自变数据,机器人从一段29秒的量开人类视往往中学习技能的成功率为62%,超越零样本基线45%,源H有新相比Pi-0.5+微调方式划,架具解法所需数据量为原来的身智数据1/50,学习高效度提高500倍。瓶颈在具身智能行业,新浪新浪数据稀缺被常用视为模型能力进阶的题约束。主流方式划习得一项新技能,常见需采集数十条遥操作示范数据,再对模型开展数小时的微调训练。HOST框架则试图绕开这一步骤:模型权重在训练实现后即冻结,新技能的获取完全发生在推理时期,视往往本身成为技能的载体。这一思路与大语言模型领域从微调转向上下文学习的馗相似,其能否成立,值得行业关注。详详见细来看,HOST的技术方式划照章性机器人学习人类视往往的两个首先期困难给出认识法。首先个困难是进度对齐。同样实施10秒,视往往中的人可能已经切完菜最初炒菜,机器人还在切菜,仅按时间轴对齐会丢失任务进度。HOST的做法是将视往往每一帧和机器人操作每一步转化为同一向量空间中的向量,再利用动态时间规整算法,自动匹配人类视往往的第X帧与机器人操作的第Y步。自变量称,这一方式将对齐任务进度的时间误差减小了一个数量级。第二个困难是跨形态映射。人类与机器人的身体结构区别巨大,传统的动作重定向方式划难以通用。HOST规避了“对照身体结构”的状况:机器人先判断自己处于任务的哪个时期,再将人类动作的画面“翻译”为机器人自身视角和身体结构的画面,最后从画面反推需实施的动作。这意味着,机器人不再机械模仿人类动作,而是通过视觉推理想象动作的结荚,再从结荚拆解动作流程。模型架构上,HOST采取双专家MoT架构,视觉专家负责处理视往往画面、定位任务进度、预测未来图景,动作专家负责将预测图景转化为可实施动作。训练分为同体预训练和人机视往往训练两个时期:先通过机器人自身实施任务的视往往学会从预测结荚到生成动作的基础功,再迁移到人类演示视往往,将人类实施任务的流程转化为机器人视角下的任务结荚,再根据目的结荚推理实现任务所需的动作。这一拆分背后的逻辑在于,人与机器人实施同一任务的配对数据相对稀缺,而机器人自身的数据那么点儿采集,分时期训练可以大幅提高数据利用效率。从披露的数据看,HOST相对基线的提高幅度明显。同样从一段视往往中学习技能,Vid2Robot、AWDA等方式划的成功率为19%;给Pi-0.5示范50个机器人任务并微调训练4小时,成功率为38%。HOST以1/50的数据样本量实现了62%的成功率。不仅如此,HOST还能最大限度地保留已经学习的技能,因为它仅根据视往往来复现技能:视往往更像是“菜条件”,可以放入书架随时调取。如此便实现了技能的持久化记忆和联想机制。相比之下,Pi-0.5+微调方式划学习新技能后,原有技能的保留率仅有17%。在泛化性与鲁棒性部分,自变量称HOST在50个涵盖不一样物体、工具和基础动作的任务上均实现学习,面对光照变化、物体替换、场景切换等干扰,成功率保持在50%以上,任务中途物品被挪走后也能调整后续。这在一定程度上验明正身模型并非死记动作序列,而是具有动态规划能力。62%的不过对成功率意味着三次尝试仍有一次以上失败,距离实际部署尚有差距。自变量官方未披露任务复杂度分布,从图中描述看多为抓取、放置类基础操作,涵盖放水果、捡笔、叠碗、擦盘子、插笔、盖书、叠锅、叠袜子等,首先程精细操作的成功率有待验明正身。同时,从画面反促进作依赖视觉预测的准确性,透明物体、遮挡等场景能否处理仍是未知数。HOST的价值在于验明正身了“推理时技能获取”这一范式的可行性:技能学习的能力可以在预训练时期前置,而非依赖照章性每个新任务的数据采集与微调。自变量机器人团队表示,在具身智能走出实验室、走进千家万户的进程中,不应该只靠专业人员采集数据、反复训练来获得新技能。人与人之间通过示范传递技能,是更加自然有效的学习方式。HOST将技能获取从专业步骤转变为任何人都能用一段视往往实现的教学方式。目前该框架的比如文与代码已全部开源,其能否将成功率推至可用水平,并在更多本体和更复杂任务上复现,将决定这一方向能走多远。海量资讯、精准解读,尽在新浪财经APP

分享到: