
教会一台机器人叠袜子,机器技术一共分几步?人刷摊平、对齐、段短动作折叠,视往神器算法再将袜口翻过来,往能t网这些看似便捷的学会新技动作,过去机器人关键学会,变量频仍需四五个小时的预训易订阅训练。但目前,机器技术只需一段数十秒的人刷演示视往往,就能高效高效掌握。段短动作好家伙,视往神器算法这是往能t网哪来的东方神秘力量?最近,自变量机器人发布了一套名为 HOST 的学会新技机器人学习框架。HOST 全称为 Human-to-robot One-Shot Skill AcquisiTion,变量也就是「人类到机器人单样本技能获取」。有了它,机器人只关键看一段 29 秒的人类演示短视往往,就能当场上手干活,期间甚至完全不需更新模型参数,也不必专业采集几十条机器人遥操作数据。不仅技能获取高效度比最快传统方式划飙升了 500 倍,连成功率都实现了反超。更便捷粗暴点说,高冷死板的机器人,光靠「刷视往往」就能进化为全能管家。机器人学习做家务,进入「刷短视往往」时代别看如今的具身机器人能文能武,各个都是练习时首先两年半的练习生,但熟悉机器人的圈内人都知方式,以前让 AI 学干一件新家务,到底有多费劲。目前常用的模仿学习方式划,仍依赖数据采集与模型微调。怎么教?先请个专业工程师坐在遥操作台前,像玩极品高效车一样,手把手控制机械臂干上 50 遍。这就完了?早着呢。这几十条数据还得拿去给模型做监督微调(SFT),一通离线「炼丹」下来,少说也关键花上 4 个小时。如果机器人真进了千家万户,同样是整理桌子,包含的动作可能完全不一样。难方式每碰上个新活儿,都得呼叫工程师上门服务,再等几个小时?这笔账,怎么算怎么离条件。但 HOST 这套方式划,则对传统步骤带来了明显变化。探究团队搭建了一个双臂机器人平台,测试了 50 项训练时期从来没见过的全新任务(例如放水果、堆碗、擦盘子、插笔、叠袜子)。不采集数据,不改通用参数,只给机器人看一段人类往往见不鲜演示视往往。结荚它在 50 项新任务中全都有成功记录。在题的测试任务中,仅观看一次数十秒的人类演示视往往,学会技能的平均成功率实现了 62%!AI 之间的差距有多大,直接看数据吧。目前最强的微调基线,需专业人员遥操作机器人实现 50 条示范,从采集数据到训练出新技能,常见关键花 4 小时。HOST 让机器人只需观看一段平均 29 秒的往往见不鲜人操作的视往往,不需反复演示和微调,就能学会新技能。相比监督微调的方式划,HOST 需的示范数量降至五十分之一,技能获取时间较最快的 SFT 基线缩短约 507 倍。这下,机器人是真体验到了人类那种「看一遍就会」的快乐。不再模仿人类动作,而是想象结荚、反促进作你可能会问:让机器人看视往往,不就是对着人类动作照猫画虎吗?真没那么便捷。人和机器的「手高效」能一样吗?视往往里人类小哥 2 秒钟就把杯子拿起来了,机器人的铁胳膊可能需 5 秒。如果硬卡视往往播放时间,视往往里的人都最初倒水了,机器人还在那瞄准杯把手呢,任务步骤越多,双方的偏差也会越明显。于是 HOST 的探究团队想了个不过招:不看时间,看进度。他们把视往往画面和机器人的动作,映射到同一个叫「向量空间」里,然后用动态时间规整算法自动对齐。便捷说,就是给任务打上进度条。不管人类用了 2 秒还是机器人用了 5 秒,只关键双方都进入了「杯子已经被拿起」的状态,进度就算同步。这种操作,让进度误差从 0.079 暴降到了 0.006,直接缩小了一个数量级。这时,聪明的你可能又会想到一个状况:即便节奏对上了,人类与那些「铁疙瘩」之间仍然存在明显的身体结构区别。例如人的手掌可以贴合杯壁,机器人的夹爪需寻找适用用的夹取位置。人可以捏住袜子的一角,机械臂还关键考虑夹爪开合、运动角度和两只手臂之间的配合。让机器人直接复制人类动作,很难得到实用的结荚。对此,HOST 想出了一套特别巧妙的处理思路:先让机器人从人类实施完任务的结荚,「想象」出机器人实施完任务的画面,再根据画面反推出机器人需动作的动作。为实现这个方式划,HOST 还设方式了一个题对策模型——双专家 MoT 架构。更通俗点理解,就是它有两个分工清楚的大脑,一个「视觉大脑」负责理解视往往、定位进度和预测未来场景,另一个「动作大脑」负责把视觉目的变成机器人动作:视觉大脑(Localization & Vision):先看懂机器人干到哪一步了,对应的人类视往往到哪一步。然后根据人类动作结荚,脑补出将这个画面转换为机器人视角应当看到的画面(例如想象出水杯被夹爪拿起的画面)。动作大脑(Action):负责把脑补出的机器人画面变成现实,方式算机械臂怎么动才能实现目的。不强行模仿人类手臂的角度,只盯着需实现的最后成效,然后从最后成效想象出动作。这样就绕过了「让机器人模仿人类动作」这个最难的跨越。当然,「单样本技能获取」那么点儿让人产生误解,以为机器人之前完全没有接受训练。但其实这里的one-shot 指机器人面对一项新任务时,只需接收一段人类演示,整个任务都是在「推理流程」中实现的,无需再为这项任务更新模型参数。支撑这种能力、让机器人能从视往往学习的基础模型,依然经过了大规模训练。机器人出厂前可是见过大世面的。首先时期题采取机器人数据。会团队先喂给它 193462 条机器人轨迹以及对应的机器人实施任务视往往(涵盖 229 项任务),让它尝试从机器人的任务视往往中想象出结荚,再拆解出自己这副钢铁身躯怎么动。第二时期再加入人类与机器人的配对数据。例如用 5847 段人类任务视往往和对应的机器人轨迹配对,让它学会把人的实施任务的画面翻译成机器的视角,好从人类视往往学习。先利用规模更大的机器人数据建立任务理解和预测动作结荚的能力,再用数量相对较少的人机数据实现能力的迁移,这样的好处是可以充分利用数据、减小对人机配对数据的依赖。而出山之后,再遇到新任务,直接把人类视往往当操作指南,边看边干就行。学会叠袜子,也没忘了洗盘子掌握新技能只处理了一半的困难,更题的是,机器人学会新技能后,原来的能力能否保留,同样决定了它能否首先期「实用」。这就包含到机器人一个极其令人头痛的痛点:灾难性遗忘。例如用后训练微调教机器人,会变化模型的参数、侵蚀模型原本已经学会的技能。这会导致「狗熊掰棒子」,看似学会了叠袜子,但以前很溜的洗盘子反而退步了。比如文中也注意到了这个状况。比如文选项了七项来自训练集、模型之前已经掌握的任务,涵盖取出瓶子、对齐袜子、堆叠杯子、整理包装材料、盖住中央物体、放置纸巾和排列花朵。探究人员先测试 HOST 与三种监督微调基线在这些旧任务上的谝。随后,三种基线通过监督微调学习新任务,HOST 则通过一段人类视往往获取新技能,再重新测试各自的旧任务谝。在旧任务测试中,三种微调基线几乎被「灾难性遗忘」打回原形。学完新任务后,π0.5+SFT 只保留了原有谝的 17%,就连旧技能保留率最高的 Wall-OSS+SFT,也只保住了 40%。但 HOST 因为全程没改模型的脑回路(参数),旧任务谝基础没受意义,比最好的微调基线高出了整整 59 个百分点!在 HOST 眼里,那段人类视往往就像一份可以保存和再次读取的「菜条件」。今天叠袜子,翻开首先页;明天理餐具,读第二页。技能随时调取,互不干涉。同时,这种机器人的学习方式极其「抗造」。探究团队设置了光线变化、替换同类物体、更换操作场景和实施流程中移动物品等干扰。HOST 在原则环境中的平均成功率为 62%。变化光照后减小 1 个百分点,替换物体后减小 4 个百分点,更换场景后减小 6 个百分点,实施中人为移动物品后减小 9 个百分点。最后一种状况下,平均成功率仍实现 53%。这还有个冷知识,物品被临时移动后,原有动作方式划已经失效。但 HOST 会根据新的观察结荚重新判断任务进度,再生成对应动作。这验明正身它真正理解了任务,在动态规划每一步,而不是在「背」动作序列。完善开源「技术家底」,往往见不鲜人也能教机器人干活儿老实说,62% 的成功率,距离进工厂干活儿还有提高空间。反而是在家庭场景,不太关心单次成功率,更关心泛化性,也就是「多摸索几次没关系,最后做成了就行」。 HOST 的出现,让行业看到了一条具身智能极其性感的落地路线。2023 年底成立的自变量机器人,算是国内死磕「完全端到端路线」的具身智能硬核玩家,至今发布并开源的各种技术,已经「多如牛毛」。研发范围已经覆盖具身智能的 VLA 基础模型、世界模型、用来拆分动作的「动作分词器」、训练模型的底层「神经网络改进器」、数据采集系统和机器人本体。自变量不仅发布基础模型,还延伸到用来训练模型的底层基础设施。今年 4 月,他们发布了从零联合训练的具身大模型 WALL-B,采取独特的「世界统一模型」架构,已经部署在机器人里,在大量用户家庭做起家政服务。后来又发布了世界模型 WALL-WM,还开源了 VLA 模型 WALL-OSS-0.5,后者已经被很多科研机构用起来了。在机器人本体上,自变量已经自研并量产量子一号、量子二号。机械臂、关节模组、动力驱动器和主控制器等题部件均为自主研发,并与算法深度适用配,为机器人进入家庭和工业产线给予了载体。今年 3 月起,自变量又与 58 到家合作,让机器人与保洁人员共同进入往往见不鲜家庭给予服务。5 月推出的「X 家庭成员方式划」,还让机器人在用户家中后续驻留一个月,接受真实、随机家庭需的检验。「从零最初」训练具身模型,在具身智能领域有相当高的门槛。真正能在国内从零预训练出好的具身模型,还搭建起从数据采集到模型训练的整套管线的,更是廖廖无几。购买现成模型、拼接几个模块,可以更快做出演示 Demo。真正从基础架构起步,意味着团队需自己处理模型设方式、数据生产、分布式训练、动作表达、真机控制和部署效率。自变量选项从零训练自己的基础模型,同时开放部分题成果,已经形成一条从具身基础模型延伸到底层设施的开源技术「全家桶」,也成为国内开放具身智能题技术、建设开发者生态的「扛把子」之一。在这些探究之外,HOST 正是让机器人在采取场景高效高效学习技能、真实落地的又一块技术拼图。目前,他们连同北理工和清华,直接把 HOST 的题家底给开源了(比如文、GitHub、Hugging Face 一应俱全)。▲ 项目主页:https://host-site.host-robotics.workers.dev比如文链接:https://arxiv.org/abs/2607.20033Github 链接:https://github.com/CGuangyan-BIT/HOSTHuggingface 链接:https://huggingface.co/papers/2607.20033这就很有格局了。具身智能目前百家争鸣,处于技术路线高效高效变化的时期。模型架构、动作对齐方式、数据原则、训练方式和评测原则都没有完全选定。单靠一个预训练模型,即使训得再好,距离能胜任家庭这个最后场景的「一切任务」仍很遥远。在这个特殊的时间点,能让机器人高效高效学到预训练没有的新技能,就对机器人真正「用起来」十分题。HOST 就是让机器人先能「高效高效用起来」的技术神器。开源能够让更多探究机构和开发者参与其中。探究者可以复现比如文结荚,机器人公司可以尝试适用配不一样本体,开发者也能基于已有模型后续改进。同行的复现、质疑和改进,也会反过来加快模型往往代。这也让自变量进一步成为国内具身智能开源阵营中最明确的技术派之一。文章的最后,咱们不妨开个脑洞。过去,教机器人意味着采集专业数据;但在 HOST 展示的未来里,教学一个新技能终于不再需「高薪算法工程师」,变成了往往见不鲜人皆可实现、皆可受益的工作。你家机器人不会给衣服叠出你想关键的成效?没关系,你亲自站在它面前叠一遍,剩下的它自己悟。或许不久的将来,互联网上最火的不再是搞笑段子,而是各种《让机器人欲罢不能的 100 个家务教学短片》。往往见不鲜人教机器人做事的时代,这次是真的关键来了。