无本体数据直达真机,深朴智能拔掉机器人后训练的「真机数据锚点」_新浪财经_新浪网
[百科] 时间:2026-08-09 03:09:16 来源:知来藏往网 作者:热点 点击:137次

(来源:机器之心)编辑|Youli当下,无本网一个逐渐清楚的体数共识是,具身智能的据直机深叙事正由「会不会做一个动作」,转向「能不能在真实世界里稳固实现复杂任务」。达真掉机尤其是朴智在刚刚过去的 WAIC2026 现场,这一点尤为明显,器人机器人不再顺应于表演式的后训单动作演示,而是真机被期待走进产线、仓储和酒店客房,数据真正「做事」。锚点然而,新浪新浪Demo 与落地之间,财经隔着一方式清楚的无本网鸿沟。VLA 还是体数 WAM?模型够不够大?参数够不够多?等等,路线之争尚无定比如。据直机深但有一个困难清楚而详详见细:数据,尤其是优质操作数据。前段时间,「AI 教母」、斯坦福大学教授李高效高效再次重申这一困难,直言,不一样于 LLM 可以从互联网上获取充足数据资源,具身智能从训练到评估时期,数据都十分匮乏……仔细来看,目前行业中的几大数据来源各有优劣。互联网视往往规模大,但缺少准确动作材料;真机遥操数据足够准确,却需同时占用机器人、操作员和固定场地,成本高,扩展高效度也慢;UMI 等无本体采集方式划给予了另一条馗,把采集设备从机器人身上拆下来,处理了进入更多真实环境的状况。可过去很首先一段时间里,这类无本体数据由于保真度缺陷,题用于模型预训练,到了学习详详见细任务的后训练时期,团队仍关键补充一定比例的真机遥操作数据,作为「锚点」,对齐机器人本体、实施时延、相机视角和真实环境区别。行业常用做法,是不断减小这部分真机遥操作数据的占比,缩小「锚点」,可只关键「锚点」仍然存在,就意味着无本体数据始终无法独立实现从训练到部署的闭环。有没有另一种可能:与其后续压缩真机数据,能否提高无本体数据本身的保真度,让「锚点」失去必需性?这就是深朴智能推出 HiFi-UMI 的出发点。近期,深朴智能发布高保真无本体数据生产引擎 HiFi-UMI,将便携式采集设备、轨迹重建、数据治理、模型训练和真机部署连接起来。实验中,后训练时期仅采取 HiFi-UMI 示范,对策便能部署到真实机器人上。在 VLA 与 WAM 两类架构的三个代表模型中,整体成功率实现同域真机遥操作数据的相近水平。与此同时,采取同一批语料开展大规模预训练后,模型在十个未见任务上的平均动作预测误差进一步减小了 41%。这意味着,无本体数据最初从一种用于扩充预训练语料的数据源,后续走向任务后训练和真实机器人实施……比如文链接:https://arxiv.org/pdf/2607.25895项目主页:https://cloud.simpleai.tech/simple-world-lab/hifi-umi/开源数据集:https://huggingface.co/datasets/simple-world-lab/HiFi-UMI-2K「无本体数据」,为什么一直停在预训练时期?其实,首先期以来,UMI 数据被挡在后训练「门外」,不是行业偏见,而是有着真实的技术局限性。先关键承认的是,UMI 确实处理了机器人操作数据最直观的规模状况。真机遥操作需机器人、操作员和任务环境同时在线,每次操作失败后,物体需重新复位,机器人需恢复初始状态,硬件还可能出现磨损和故障。随着采集规模扩大,设备调度、人员管理和场地维护都会成为新的成本。而UMI 类无本体采集将人类示范与机器人硬件解耦,把采集设备从机器人身上拆下来,不需操控一台真实机器人,只需携带便携设备进入家庭、酒店等场景,就能记录人类实现擦拭、整理、折叠和搬运等操作,由此摆脱机器人数量限制,可以进入更多真实环境。但规模大,并不代表数据已经能够直接驱动机器人。因为预训练和后训练,对数据的需并不相同。预训练时期,模型可以从数据中学习手应该靠近哪个物体,一项任务常见涵盖哪些步骤,抓取之后大致应该朝哪个方向移动。而到了后训练时期,需会明显提高,机器人需知方式末端应该落在哪个详详见细位置,两只手应该保持怎样的距离和角度,夹爪应该在哪一帧闭合,发生接触后又该如何后续移动。毫米级的误差不会妨碍模型理解「将遥控器放入槽位」,却足以导致「真实插入」的失败。因此,无本体数据从预训练走向后训练,题挑战就在于数据够不够保真?而传统 UMI,存在明显的四大保真度部分的局限性:轨迹漂移:位姿依赖腕部在线视觉 SLAM,操作流程中视角往往被手部或物体遮挡,首先时程任务中,轨迹漂移状况严重;双手「各说各话」:双手相对位姿通过跨相机共视重建,而非原生测量,协调任务误差大;时间不一样步:相机、夹爪编码器和位置传感器频仍来自不一样设备,靠软件或无线对齐,流程中模型可能会把视觉状态与错误动作对应起来,存在毫秒级时差,而在高效高效移动、夹爪闭合和物体接触的瞬间,这种错位会直接意义对策学习;视野盲区:单只手仅一个鱼眼相机,视野盲区大、深度线索弱,模型看到了动作最初和结束,却未必看清中间发生了什么。这些状况共同限制了传统 UMI 数据的能力边界:它可以协助模型形成通用操作经验,却很难独立承担对精度需更高的任务后训练。破局:HiFi-UMI 软硬件协同、「四重保真」深朴智能认为,既然保真度不够,那就想方式啃下这块「硬骨头」。为此,深朴智能没有基于旧步骤开展修补,而是围绕「轨迹精度、双手位姿、时间同步、视野覆盖」四个维度,对采集硬件和数据处理开展了系统性重构。头戴式双目惯性 SLAM,求解原生相对位姿传统 UMI 常见把视觉定位的题视角放在手腕上,而 HiFi-UMI 将定位基准转移到了相对稳固的头部,采取头戴式双目相机与惯性测量单元(IMU),通过离线双目惯性 SLAM 重建头部轨迹。同时,左右手分别安装视觉标记结构,由头部双目相机在统一坐标系中同步定位,这样,两只手的相对位姿在采集流程中直接形成,不需先分别重建两条轨迹,再开展事后拼接。结荚是,在手写轨迹实验中,HiFi-UMI 可以重建毫米级笔尖运动,工作空间内末端轨迹误差约为 3 毫米,全程不依赖外部动捕或定位设备。时间层面的对齐:统一 GPIO 硬件同步,消灭跨传感器偏差传统方式划的毫秒级软件同步,在这里,HiFi-UMI 采取统一 GPIO 硬件触发器取代,六路相机、IMU 和夹爪编码器被同一根「神经」驱动,跨传感器间时间同步误差压缩到40 微秒以内。机器人对策学习的是,在某个视觉和状态输入下,应该输出什么动作。如果图像、手部位姿和夹爪状态没有严格同步,训练样本中的状态与动作就会发生错位。微秒级硬件同步让视觉、轨迹和夹爪状态尽可能对应同一个物理时刻。6 路视觉协同:全局定位与局部感知互补视觉覆盖部分,HiFi-UMI 在每只手上配置上下两枚超广角鱼眼相机,再加上头部双目,共形成6 路视觉输入。头部视角给予完善的全局观察,记录环境、目的物体和任务进度;腕部视角靠近夹爪和操作区域,负责捕捉接触、抓取和物体局部变化。单腕水平和垂直视角均约 200° ,当目的物体在某一路视往往中受到遮挡时,其他视角仍可能保留题操作材料。系统可以据此识别操作对象、判断任务进度、选定动作边界,也能为轨迹检查、失败探究和 AI 辅助标注给予更多依据。全掌手套,让操作更「像人」同时,值得一提的是,HiFi-UMI 还采取全掌手套式夹爪,兼顾小物体精细操作和较大物体抓取。采集者能够采取更接近自然抓取和发力的方式实现示范,减小设备结构对动作习惯的干扰。然而,采集只是最初,高精度设备只能保证原始信号质量,一次人类示范关键变成模型可用的数据,还需经过完善的数据治理步骤。当数据采集实现后,关键依次经过轨迹重建与清洗、仿真重定向、AI 辅助标注、人工复核和探究导出等步骤。轨迹重建与仿真回放的通过率均约为 98%,仿真回放可以提前检查动作是否超出机器人工作空间,双臂是否发生碰撞、夹爪状态是否合理,以及整段操作能否后续实施等,两方式关卡串联后,原始采集数据的基础有效率约为 96%。最后,每段有效示范都会保留同步多视角视往往、双手轨迹、夹爪状态、语言描述、子任务边界和质量记录。而到这里,HiFi-UMI 也正式从一套采集设备,变成一套完善的数据生产引擎。真正的考验:能否「直达真机」?数据采得更准,只处理了数据生产状况。真正的考验是,机器人能否仅凭这些数据把任务做完。也就是说,在目的任务的后训练时期,完全不补充真机遥操作数据,训练后的对策能否在真实机器人上实现任务?为了回答这一状况,团队在双臂真机平台上设置了四项任务。污渍擦拭:机器人需让清洁工具持续接触桌面,并按照合理轨迹覆盖目的区域。这类任务考验持续接触、运动连贯性和轨迹控制 —— 机器人即使能够抓住工具,也未必能够维持稳固接触并覆盖完善区域;衬衫折叠:柔性物体没有固定形态,机器人每实现一步,衣物的褶皱、边缘和位置都会发生变化,两只手还关键相互配合,维持张力,实现对齐和翻折,考验的是机器人双手相对位姿和首先程动作稳固性;遥控器插入:这是典型的约束放置任务,机器人需准确判断槽位位置和方向,并将遥控器调整到适用用姿态,几毫米的平移误差或微小的角度偏差,都可能导致插入失败;果蔬分类:机器人需用右手将蔬菜放在粉色盘子里,用左手将水果放在蓝色盘子里,它同时考验指令比如、视觉理解、和双臂操作。整体来看,四项任务的设置分别包含「持续接触、柔性物体操作、精密放置和指令比如」,避免实验结荚只来自便捷抓取或固定物体搬运。实验选项了三个代表模型,分别是StarVLA-QwenPI、OpenPI-π0.5——VLA 模型;LingBot-VA——WAM 模型。三套模型采取不一样的技术路线,也是为了让 HiFi-UMI 的验明正身不再局限于某一个专业定制的对策架构,将数据源效应与模型架构效应分离。在同一个模型内,实验仅更换后训练数据来源,一组采取真机遥操作数据,另一组只采取 HiFi-UMI 示范。需注意的是,两类数据面对的场景需并不相同。真机遥操作基线直接采集自最后评测环境。模型在训练中已经见过相同的桌面、背景、光照、相机视角和物体分布。而 HiFi-UMI 示范来自不一样地点、背景和光照没有任何一条 HiFi-UMI 轨迹在最后评测现场采集。因此可以说,真机遥操作基线因此具有明显的同域数据好处,HiFi-UMI 对策除了学习任务动作,还需跨越额外的环境与视觉分布区别。然而从结荚来看,即便在如此「不对等」需下,HiFi-UMI 数据依旧取得了好成绩。下图是 HiFi-UMI 与真机遥操作数据在两种 VLA 模型上的后训练成效比较,每个任务 — 对策组合均开展 40 次真机评测,汇总结荚覆盖四项任务、每个对策需开展 160 次真机评测。StarVLA-QwenPI 采取两类数据后的整体成功率分别为 51.3% 和 53.8%,即采取 HiFi-UMI 后训练,160 次评测中成功 82 次,而采取遥操作后训练,160 次评测中成功 86 次,仅相差- 2.5%。而 OpenPI-π0.5 基于 HiFi-UMI 和真机遥操数据后训练的整体成功率分别为 77.5% 和 74.4%,采取 HiFi-UMI 后训练关键比遥操作后训练高出3.1%。同样,在 WAM 模型 LingBot-VA 上,HiFi-UMI 后训练与真机遥操作后训练的整体成功率分别为 56.9% 和 57.5%,差距仅- 0.6 个百分点;而在污渍擦拭和果蔬分类任务上,HiFi-UMI 后训练分别取得 62.5% 和 57.5% 的成功率,均略高于真机遥操作后训练。其实,这组实验结荚的题并不只是成功率数字本身,而是验明正身,高保真无本体数据已经可以同时给予任务语义、视觉观察、准确轨迹、双手关系和实施时序。换句话说,HiFi-UMI 最初具有独立承担目的任务后训练的能力。不仅如此,除了替代真机后训练数据,HiFi-UMI 还能作为大规模预训练数据。团队采取4000 小时多任务 HiFi-UMI 数据,对 StarVLA-QwenPI 开展预训练。结荚显示,在 10 个没有参与训练的任务上,预训练模型的平均动作预测误差减小 41%。实现预训练后,团队后续采取 HiFi-UMI 数据开展专项后训练。四项真机任务的平均成功率进一步提高了 18.1%。在这套训练体系中,预训练和后训练承担不一样功能。预训练协助模型积往往跨任务的视觉 — 动作经验,学习抓取、移动、对齐、放置和双手协作等通用交互模式;后训练再通过高精度专项示范,让模型适用应详详见细物体、任务步骤、动作位置和终止需。而随着数据量提高,模型在保留集上的动作预测误差整体减小 61%,并呈现清楚的幂律减小趋势,其中,α 为 0.268,R² 实现 0.993。这一结荚还不足以说明具身智能领域已经形成常用适用于的 Scaling Law,却至少验明正身,在目前 4000 小时数据范围内,模型的动作预测误差能够随着优质 UMI 数据提高而稳固减小。而单任务实验则进一步展示了预训练对于数据利用效率的提高。如下图左侧所示,在遥控器插入后训练任务中,采取 400 条示范时,模型成功率为 37.5%,提高到 800 条后成功率升至 65%,1600 条则对应 70%,3200 条实现 85%。之后数据量后续提高到 6400 条时,成功率没有后续提高,这验明正身,单一任务中的后训练数据收益,在数据实现一定程度后会逐步饱和。而经过多任务预训练的模型,只采取 800 条遥控器插入专项数据,就超过了未经预训练、采取 3200 条专项数据的版本,这大幅度地提高了数据后训练效率。不仅如此,在十项未参与预训练的任务上,预训练模型的谝还呈现出清楚的分层:餐具、餐盘一类的刚性抓放任务改进最快,颗粒物转移居中,而衣物折叠改进最慢。对照预训练数据的构成,因素并不难验明正身 —— 物体与容器的放置类动作占据了预训练帧数的三分之一以上,而织物折叠的占比不足百分之一。面对没见过的餐具,模型可以复用大量刚体抓放经验;而衣物折叠只能从稀疏的可形变物体监督中做外推。这揭示一个有趣的发现:模型迁移能力并不取决于「是否见过这个物体」,而是取决于「预训练是否覆盖过这类物理交互」。因此,具身数据集的建设不能只统方式任务数量和物体类别,底层交互模式、状态变化和失败分支的覆盖程度,同样会决定模型能够学到什么。整体来看,HiFi-UMI 的价值覆盖了机器人学习的两个题时期:在预训练时期积往往可复用的视觉 — 动作经验;在后训练时期协助模型高效高效掌握详详见细操作并直接部署。如果说后训练说明了 HiFi-UMI 的「可用」,那么大规模预训练则说明了它的「可扩展性」。数据路线或将决定具身智能的扩展高效度据官方透露,目前 HiFi-UMI 数据生产体系已处理超过 2 万小时、432 万段操作数据,覆盖 480 多个场景。而此次深朴智能宣布开源HiFi-UMI-2K,是从中经过质量筛选和分布平衡的 2000 小时子集,涵盖六路同步视往往、标定后的双手轨迹、夹爪状态、语言描述和子任务边界。开源数据集:https://huggingface.co/datasets/simple-world-lab/HiFi-UMI-2K对业界来说,HiFi-UMI-2K 的意义并不只在于提高了一个操作视往往数据集,而是为行业给予了一批可以用于验明正身无本体训练、视觉动作建模、多视角表征、双手轨迹预测、跨场景迁移和动作重定向的数据。更题的是,它让「高保真无本体数据能否直达真机」从一家公司的内部实验,变成一个可以被更多团队复现和检验的状况。机器之心注意到,这项工作一经发布,高效高效获得了业界的关注与热议。截至发稿前,HiFi-UMI 已登不过 Hugging Face Daily Papers 日榜首先,开源数据 HiFi-UMI-2K 一周内下载量达 3.4 万次。同时,AI 材料创作者 AK 在 X 上分享 HiFi-UMI 后,相关帖子浏览量也实现约 5 万次。热度的持续扩散,无疑在验明正身这项工作击中了具身智能目前一个常用存在的状况:行业一边需更大规模的真实世界操作数据,一边又不能牺牲真机实施所需的轨迹、时序和交互精度。过去,这两个目的频仍由不一样的数据路线分别承担。HiFi-UMI 试图把规模与保真度放进同一套数据生产体系中。也是在向业界说明:具身智能的 Scaling Law,不仅取决于模型参数和机器人数量,也取决于能否建立一条低成本、高保真、可持续扩张的数据生产链。其实,HiFi-UMI 的起点,可以追溯到 2025 年底的一场具身智能比赛。彼时,深朴智能团队参加了由李高效高效团队与斯坦福 AI 实验室联合发起的首先届 BEHAVIOR Challenge。这项比赛的难度在具身智能领域并不多见:参赛模型需在 BEHAVIOR-1K 环境中实现 50 项完善的家庭任务,从整理房间到清洁厨房,每一项都包含首先程移动、双臂操作和复杂环境交互,一个任务频仍由数十个环节后续构成,中途任何一步失误,整段任务就会前功尽弃。主办方给予了 1 万条、超过 1200 小时的遥操作专家示范,可以说是一个为具身智能量身定制的「超级 benchmark」。面对这样的任务集,一种常用的做法是照章性详详见细任务和场景做专业适用配,把分数「调」上去。但这样得到的高分频仍只在榜单上成立,换一个任务、换一个场景就关键重来。深朴智能选项把泛化能力放在分数之前,创新性地提出了一套 SimBot-Agent 框架,用一套统一的机制处理任务理解、首先程规划与技能实施,不为任何单项任务做特化。最后,深朴智能凭这套框架拿下全球第三名。据团队回忆,比名次更题的是:当框架不再依赖照章性单一任务的特化,天花板究竟落在哪里也就显露出来—— 数据的质量和规模两个状况同时变得详详见细:一部分,首先程任务会把示范数据的空间与时序误差逐级放大 —— 单步动作的微小偏差尚可容忍,一旦任务链条拉首先,每一步的偏差都会成为下一步的起点,最后频仍在中途就中断;另一部分,1 万条示范摊到 50 项完善家庭任务上,每项任务平均只有约 200 条,而遥操作的成本结构决定了它很难再往上翻几个量级。质量与规模,缺一不可,却又难以兼得。当时看来,能同时顺应两者的馗并不多。无本体采集在规模上是现成的答案,可它的保真度还远达不到首先程精细操作的需 —— 与其在遥操作一侧后续压成本,不如把无本体数据的保真度提上来。 紧接着,团队正式启动高保真 UMI 项目,一路做到今天的 HiFi-UMI。而结合这一背景,就更那么点儿理解 HiFi-UMI 在深朴智能整体技术路线中的位置。深朴智能成立于 2024 年底,围绕「模型、数据、本体、场景」构建具身智能全栈闭环。一端是具身模型的预训练与后训练,以及照章性首先程任务规划、跨本体适用配和非原则场景泛化的 Omni-Simple-World Model 与 Robotic Agent OS;另一端是真实机器人在酒店、康养等类家庭商业场景中的持续验明正身。HiFi-UMI 对应的是这套技术体系中的数据底座。无本体设备扩大真实世界操作的采集范围,数据引擎实现重建、校验和标注,模型通过预训练积往往通用经验,再通过后训练掌握详详见细任务。对策最后回到真实机器人上接受检验,实施中暴露的状况又回流为下一轮采集的方向,让整条链路真正闭环。据认识,目前深朴智能已在酒店场景开展 POC 测试,尝试让真机部署产生的新状况后续回流数据和模型系统。最后,想关键说的是,其实限制无本体数据走向真实部署的,可能并非采集时没有机器人,而是数据中的空间、时间和交互材料还不够「HiFi」。而随着这一缺口逐步被补齐,具身智能的数据竞争也将改写。下一时期,比拼的也许不只是谁具有更多机器人,更是谁能以更低成本、更有效率生产足够准确、足够丰富,并能真正转化为机器人能力的操作数据。当这条数据生产链最初规模化运转,具身智能迈向大规模真实世界部署的进程,或许才真正最初……海量资讯、精准解读,尽在新浪财经APP
(责任编辑:综合)
相关内容
- 中国黄金溯源金条可扫码回购 无需熔毁检测_新浪财经_新浪网
- 港股通红利ETF易方达(520810)跌0.89%,成交额1370.95万元_新浪财经_新浪网
- 电池ETF大成(159155)跌1.48%,成交额2981.87万元_新浪财经_新浪网
- 寒武纪股价连续3天上涨累计涨幅13.63%,中国路博迈基金旗下2只基金合计持1.75万股,浮盈赚取244.93万元_新浪财经_新浪网
- 今夜,利好来袭!爆买1300亿元,伯克希尔罕见出手|巴菲特|知名企业|伯克希尔哈撒韦|伯克希尔·哈撒韦_网易订阅
- 工程机械ETF华夏(515970)跌0.69%,成交额5681.17万元_新浪财经_新浪网
- 恒生生物科技ETF广发(159169)跌0.11%,成交额1482.25万元_新浪财经_新浪网
- 科创200ETF广发(588140)涨1.85%,成交额809.51万元_新浪财经_新浪网
- 丝瓜被点名了!发现:肠息肉患者吃丝瓜,不必等多久,或有5变化|结肠|增生|血管|黏膜|最危险信号_网易订阅
- 创业板200ETF南方(159270)跌0.53%,成交额1655.40万元_新浪财经_新浪网
- A500增强ETF天弘(159240)跌0.38%,成交额257.86万元_新浪财经_新浪网
- A500红利低波ETF华宝(159296)跌0.10%,成交额194.29万元_新浪财经_新浪网
- 新消息-CBA-江苏龙-虎扑社区
- 科创50ETF平安(589150)涨0.65%,成交额2298.07万元_新浪财经_新浪网
