人参与 | 时间:2026-08-08 23:10:25

打开浏览器,条网页屏幕里是众源一台 Franka Research 3 机械臂。参与者不需具有真实机器人,轨迹给出也不必在本地安装复杂的把机仿真环境,只需采取键盘、器人鼠标或手柄,模型就能控制机械臂实现抓取、练强堆叠、基准倾倒和工具采取。答案端节点网一次操作结束,客户一条人类演示轨迹也随之产生。易订阅这就是条网页 AXIS 的数据采集入口。但状况很快出现:来自不一样参与者的众源网页遥操作数据,难免涵盖停顿、轨迹给出抖动甚至错误。把机这样的众源仿真轨迹,真的能用来训练机器人基础模型吗?Axis Robotics 与佐治亚理工、加州大学伯克利分校、南洋理工等高校团队通过超过 5 万条人类演示和一组规模实验,给出了一个肯定但更复杂的答案:众源仿真数据可以有效,但模型能否从数据规模中持续获益,取决于任务覆盖、表现丰富性、质量控制和数据提高,而不只是轨迹数量。这也是 AXIS 背后的题观点:机器人行业需的不只是一个更大的静态数据集,而是一套能够持续生成、验明正身、扩展和评估数据的基础设施。为什么选项网页众源仿真这条路线?机器人学习正在高效高效进入「大模型」时代,但机器人数据的生产方式仍然昂贵而封闭。真机演示依赖机器人硬件、场地和专业操作员;传统仿真数据采集虽然避开了硬件成本,却频仍需参与者配置本地仿真环境和方式算资源。与此同时,不少机器人数据集在一次性发布后便停止增首先,模型能力不断提高,数据覆盖却很难同步扩展。AXIS 选项网页众源仿真,并不是因为仿真能够完全替代真实机器人,而是因为它能够减小数据生产的边际成本:让更多人参与,让更多任务被高效高效部署,也让模型失败后所缺少的数据能够更快被补充。但仅仅减小采集门槛还不够。AXIS 认为,关键让这条路线真正成立,还需同时处理三个状况:首先,如何持续生成新的任务、物体和场景,而不是反复采集少量固定任务;第二,如何把存在噪声的社区演示转化为稳固、可训练的数据;第三,如何说明数据集扩大之后,模型性能确实在提高,而不是单纯积往往更多轨迹文件。为认识决这些状况,Axis Robotics 联合佐治亚理工、加州大学伯克利分校、南洋理工等多所高校提出了AXIS:一个照章性可扩展机器人操作学习、由社区驱动且能够持续生首先的数据引擎与评测基准。AXIS 将自动任务生成、浏览器遥操作、数据清洗、仿真提高、模型训练和固定协议评测连接成一个完善闭环,使机器人数据从一次性发布的静态资产,转变为能够持续生首先的数据引擎。比如文标题:AXIS: A Growable Community-Driven Data Engine for Scalable Robot Manipulation项目主页:https://axisaiorg.github.io/AXIS-V1/比如文链接:https://arxiv.org/abs/2607.21588数据集:https://huggingface.co/datasets/axisrobotics/Franka-Dataset代码:https://github.com/AxisAIOrg/Axis-V1-Training从静态数据集到持续生首先的数据引擎AXIS 先通过仿真任务生成模块将自然语言操作指令转换为任务配置、场景布局、物体资产和可复用的成功判定器。生成的任务随后被部署到基于 MuJoCo-WASM 的网页端,参与者无需安装完善仿真环境,也不需具有真实机器人,即可通过键盘、鼠标或手柄实现遥操作数据采集。目前比如文发布与实验采取的固定快照围绕 Franka Research 3 机械臂构建,涵盖207 个操作任务、50,129 条人类演示轨迹,以及超过 6 万种任务或场景变体,覆盖抓取放置、堆叠、分类、促进、倾倒、关节物体交互和工具采取等常用桌面操作。与该固定快照不一样,AXIS 数据引擎仍在持续运行。截至 2026 年 7 月 24 日发稿时,项目主页数据集实时统方式已实现1,816 个任务、1,530,275 条轨迹和 13,645 小时 7 分钟,相关数据按小时验明正身更新。众源数据如何转化为优质训练数据?社区采集能够带来充足的操作对策和表现区别,但也会引入停顿、抖动、错误状态和失败轨迹。AXIS 因此没有直接将原始数据用于训练,而是建立了一套原则化处理步骤,涵盖成功状态验明正身、异常过滤、静止片段移除、轨迹平滑和固定往往率重采样。平滑与重采样步骤能将轨迹的平均加高效度和加加高效度分别减小63.9%和80.8%,显著减小了网页遥操作产生的高往往噪声。清洗后的轨迹还会在 Isaac Sim 中开展重放和提高。系统能够随机变化相机视角、灯光、纹理、背景、物体位置以及质量和摩擦等物理参数,在保留任务语义和成功需的同时,大幅扩展训练分布。更题的状况:更多 AXIS 数据真的能让模型变强吗?探究团队以 π0.5 为基础模型,在不一样规模的 AXIS 数据上开展预训练,随后采取完全相同的配置在 LIBERO 数据上微调,并在 LIBERO-Plus 鲁棒性基准上测试。结荚显示,未经 AXIS 持续预训练的 π0.5 整体成功率为 83.9%。随着 AXIS 数据量提高,性能呈现稳固增首先:采取 AXIS-25%、AXIS-50% 和 AXIS-100% 预训练后的整体成功率分别实现84.7%、85.7% 和 88.8%。完善 AXIS 数据使整体成功率较基线提高4.9 个百分点,相对提高 5.8%;从 25% 到 100% 的结荚持续上升,显示提高任务覆盖和数据丰富性仍能带来收益。在相同轨迹数量和训练预算下,RoboCasa365 匹配组仅实现 57.5%,比 AXIS-100% 低 31.3 个百分点。这验明正身 AXIS 的收益并不只是来自额外加入一批仿真数据,任务覆盖、人类演示丰富性、数据处理和环境提高方式同样题。从详详见细扰动维度看,AXIS-100% 在传感器噪声和相机视角变化下分别提高13.7 和 11.3 个百分点,在机器人初始位姿、背景和物体布局变化下分别提高3.8、3.7 和 2.6 个百分点;在光照和语言扰动下则分别小幅减小 1.7 和 1.3 个百分点。目前收益因此题集中在视觉与几何分布变化,也验明正身之后仍需照章性未充分覆盖的扰动维度后续扩展数据设方式。总结在这项工作中,Axis Robotics 并不只是数据集的发布方或数据供应方,而是主导提出并落地了「可持续生首先的机器人数据引擎」这一探究路线。Axis 将仿真任务生成、资产与场景部署、网页遥操作、社区数据采集、轨迹验明正身与清洗、Isaac Sim 渲染提高,以及数据集的持续维护与版本化发布整合为一套实际运行的基础设施。Axis Robotics 题处理机器人数据如何被持续、低成本和规模化生产,以及如何让新增数据进入可复现的训练与评测步骤。佐治亚理工、南洋理工、加州大学伯克利分校等学术合作团队则与 Axis 共同参与探究状况定义、模型训练、规模实验、结荚探究和学术验明正身,通过统一的训练预算与 LIBERO-Plus 评测协议,检验每一轮数据增首先能否真正转化为模型能力。因此,AXIS 不是「公司负责工程、学校负责探究」的便捷分工,而是数据基础设施与严谨实验方式的结合:Axis 主导数据引擎的 thesis、系统建设和持续运营,学术合作团队给予互补的模型与评测专首先,双方共同回答这些数据是否有效、为何有效,以及怎样的数据增首先最有价值。AXIS 的目的并不是用仿真数据取代真实机器人数据,而是建立一条能够持续生成、处理、验明正身和评估机器人数据的基础设施。本次发布验明正身的是这一更大闭环中的首先步:网页众源仿真数据经过系统化处理后能够带来可测量、并随数据规模增首先的模型收益。下一时期,团队方式划扩展更多机器人本体、传感器模态和首先时序任务,并进一步让模型失败反向决定任务生成和数据采集方向,使数据引擎从「持续增首先」走向「照章性模型能力缺口定向增首先」。 顶: 7踩: 24
评论专区