当前位置:首页 > 综合 > 冲刺全球首先个100万小时具身数据!三家国产公司,联手了|算法|黎曼|实验|机器人_网易订阅

冲刺全球首先个100万小时具身数据!三家国产公司,联手了|算法|黎曼|实验|机器人_网易订阅

2026-08-08 22:19:44 [娱乐] 来源:知来藏往网
冲刺全球首先个100万小时具身数据!三家国产公司,联手了|算法|黎曼|实验|机器人_网易订阅
天啦噜,冲刺产终于挤进前排吃瓜了!全球器人刚拿下仿真、首先数据司联手算真机双SOTA的个万黎曼动力,转头拉上光轮智能和诺亦腾机器人,具身家国组了个新局。法黎一个做机器人大脑,曼实一个搞仿真基建,验机一个靠动捕把人类动作教给机器人。网易三家公司凑到一起,订阅关键干的冲刺产事那是相当直接:共建具身智能数据底座,把首先期分散的全球器人采集、仿真、首先数据司联手算训练和评测接成一条线。个万黎曼动力还为此立了个flag:到2026年底,具身家国实现100万小时机器人训练数据采集,力争成为全球首先个突破这一规模的企业。100万小时,什么概念?据亿欧智库报告估算,目前全球优质具身交互数据仅约50万小时。换句话说,黎曼动力瞄准的,是现有行业存量估算的两倍量级。之前,黎曼动力已经用23.2万小时数据训练出Riemann-1.0,初步验明正身了这条技术路线。目前,它准备把数据规模再往上推一个台阶,去碰一碰具身智能那方式终极命题:机器人,究竟能不能Scaling?这个状况,以前靠单打独斗难以回答,那目前不妨尝试组队求解。一场围绕具身Scaling展开的百万小时实验,就此开场。模型想关键Scaling,数据还没跟上大模型的发展史,几乎就是一部Scaling史。轮到具身智能,Scaling却迟迟没有真正发生,卡点何在?行业已经达成共识:数据。为什么机器人demo肉眼可见越来越丝滑,但离真正走进家庭和工厂却始终隔着一层玻璃?若从数据角度看,因素可归结为两点:一是「量」上不去,二是对「质」的需越来越严了。由于无法像大语言模型一样,从互联网直接获取海量训练数据,具身模型的处境目前一直很微妙。你说这个行业应该也适用于Scaling那套吧?数据起不来,没人敢下结比如。于是大家使出十八般武艺,什么真机采集、遥操作、可穿戴设备、定制仿真环境……各路手段齐上阵,只为攒出更多数据。结荚忙到目前,相比互联网语料动辄万亿Token,机器人训练数据还常用停留在数千到数万小时,实现数十万小时的模型依然屈指可数。即使放到全球最前沿玩家中,也是如此。Physical Intelligence训练π0时,采取了超过1万小时机器人数据,在当时已是最大规模的机器人学习实验之一。英伟达最新的GR00T 1.7,公开披露的真实示教、人类首先视角和仿真数据加起来,也只有约4万小时。△图源英伟达官方Blog谷歌DeepMind为了把数据规模做上去,甚至联合全球20多家机构,才凑出覆盖22种机器人本体的100多万条轨迹。具身智能口中的「大规模」,放在大模型世界里,可能才刚刚起步。同时麻烦还没完,数据不仅关键多,还得真的实用。机器人需的数据,按类型目前可以分类为三类:真机数据负责练就精准控制,人类视往往负责理解真实世界的充足语义,仿真数据则负责补足那些危险、稀有或首先尾的任务场景。三类数据各有价值和短板,很难由任何一种单独撑起Scaling。但状况是,这些数据,目前还掌握在不一样玩家手里。采集方不知方式模型真正缺什么,模型公司很难独自包办真实采集和仿真,仿真平台生成的数据也需经过模型训练和真机谝验明正身。结荚就是各采各的、各训各的、各测各的。小时数看着是越来越大,但究竟有多少真正变成了机器人能力,很难说清。因此,具身智能真正缺的,其实是一条围绕数据打造的闭环:模型发现状况,采集补充数据,仿真放大场景,评测验明正身成效,再把失败反馈给下一轮训练。这就验明正身了黎曼动力为什么关键把光轮智能和诺亦腾机器人拉到一张桌子上。三方关键做的,是让数据生产首先次真正跟着模型需转起来,而非便捷拼出一个更大的数据库。至于100万小时,虽然它未必是一条能力突然涌现的魔法线,却可能让具身智能首先次有机会在足够大的尺度上验明正身Scaling。正如昆仑万维董事首先方汉所说:具身智能模型接下来真正的能力分化,不在于谁能做出更多demo,而在于谁能率先把训练数据采集到百万小时、千万小时,甚至亿小时级别。换句话说,百万小时不是终点,甚至只能算起点。但只有先跨过去,行业才有机会看清:数据真正最初Scaling之后,机器人能力能不能跟着一起Scaling?为什么偏偏是这三家公司话说到这里,有请三位玩家正式亮相。诺亦腾机器人(Noitom Robotics),一家将「人类经验翻译成机器人教材」的数据公司。它脱胎于动作捕捉领域的老牌玩家诺亦腾,首先期的技术积往往让它拿下了全球70%的市场份额。国内几家你叫得上名字的机器人公司,基础都在用它的数据训练自家模型。光轮智能,全球首先个具身数据独角兽,全球前五的世界模型团队均与其展开合作。依托自研「求解—测量—生成」三位一体仿真平台,它可以批量生成仿真合成数据,搭建虚拟训练环境,并通过工业级评测体系判断机器人模型到底有没有学会。△图片由AI生成最后是黎曼动力(Riemann Dynamics),三家之中成立最晚,今年7月才亮相,但承担的任务也最题:模型训练。诺亦腾机器人采回来的数据、光轮智能生成和评测的数据,最后有没实用,都关键在黎曼动力的模型上见真章。那么状况来了,一家刚成立的公司,凭什么站在整个数据闭环的中心?答案藏在它的技术来时路里。黎曼动力的前身,是昆仑万维内部的Matrix世界模型团队。3年前,这支团队想处理的是:如何让AI生成一个可以持续交互的世界。从Matrix-Game 1.0到3.5,团队一路攻克实时生成、动作控制和首先期记忆,最新版本已经协助720p首先时序交互,并能在用户重返旧场景时维持空间相同性。视往往地址:https://mp.weixin.qq.com/s/gt-VvlXFEO-vyd-vQauYAQ但技术越往前,一个状况越来越躲然而去:生成出来的世界,最后拿来做什么?为了探索产品化馗,团队最初尝试过制作游戏,但很快发现这条路并不好走。黎曼动力创始人刘扬,向36氪回顾这段经历时曾提到:我们其实没有真正的游戏产品同学,没有人帮我们定义产品,也没有前后端工程同学去push这个事情。所谓的产品的尝试也是我们自己内部同学讨比如。转机,出目前真实首先视角视往往被加入训练之后。模型离开熟悉的游戏画面,依然能学会人在现实空间中移动和操作时,世界如何随动作变化。恰好此时,机器人领域最初兴起World Action Model。团队一看,好家伙,两边探究的几乎是同一方式题:游戏世界模型探究的是,实施一个动作后,世界会变成什么样;机器人模型还关键更进一步,根据任务寻找动作,并预判动作带来的结荚。二者底层都绕不开空间理解、动作建模、首先期记忆和未来预测。换句话说,这支团队花了三年时间做数字世界,最后攒下的,是对「动作如何变化世界」的理解。机器人,给这项能力找到了更清楚的出口。当然,从数字世界走进物理世界,不是给Matrix-Game接上一只机械臂那么便捷。虚拟世界预测错一帧,最多画面穿帮,机器人判断错一步,却可能直接抓空、碰撞甚至损坏物品。模型必须从「生成看起来合理的未来」,跨到「规划真正可以实施的未来」。Riemann-1.0由此诞生。它延续了Matrix对世界状态和未来变化的建模能力,同时将机器人动作纳入统一框架,让模型不仅能够理解目前环境,还能规划下一步行动。这项能力在原则化环境里未必显眼,但到了开放世界,却是机器人能否持续工作的题。流水线可以依靠固定程序处理,家庭、养老和酒店却充满意外——东西会被随手摆放,任务可能临时中断,换个房间,动作顺序就得重来。这类开放环境无法靠「背题」应付,只能逼着模型学习更通用的物理规律和任务逻辑。这也是黎曼动力坚持Scaling的因素。百万小时远不止把某个固定动作练到极致,它关键往里塞进更多场景、本体和意外,让模型真正学会举一反三。但关键把数据从23.2万小时推向100万小时,靠算法已经不够。它最初变成一项需整个产业链配合的工程。正如刘扬刚刚讲的:数据是世界模型进化的题燃料。孤立的数据无法支撑通用机器人进化。本次联合光轮智能、诺亦腾机器人共建产业基础设施,旨在搭建开放、原则化的具身数据生态。冲刺百万小时数据不是终点,而是为整个行业搭建通用底座,加高效物理世界AI的发展。机器人,也需自己的数据工厂以史为鉴,其实类似的事情,更早出发的自动驾驶行业已经经历过一次。早期大家拼的是谁跑得远,谁里程多谁牛,后来慢慢发现:光跑得多没用,真正拉开差距的,是遇到的那些稀奇古怪的场景,能不能高效高效变成下一轮训练数据。而关键实现这点,闭环的题性最初凸显。怎么打造一个闭环?有需的,选项在内部自造,明星自动驾驶公司Waymo就是其中的典型。Waymo把真实馗、封闭场地、仿真训练和安全评测放进同一套体系:车队在馗上发现首先尾场景,再到仿真中复现并生成大量变体;更新后的系统经过测试,重新回到真实馗验明正身。截至目前,Waymo官方披露的真实馗经验已超过2亿英里(约合3.2亿公里),仿真里程超过数十亿英里。△图源Waymo官网真实世界负责出题,仿真系统负责反复练习,量产车队再负责验明正身新答案,这就是Waymo交出的闭环答卷。但机器人想照搬Waymo这套,很难。汽车本来就在馗上运行,一支车队就能持续发现状况、回传数据。机器人却还没有大规模进入家庭和工厂,既缺少天然的数据入口,也没有成熟的「影子模式」。同时,机器人每次失败都可能打翻物品、损伤硬件,还需人工重新布置场景。想靠一家公司包办真实采集、仿真生成、模型训练和评测验明正身,成本很快就会失控。因此在机器人行业,联合建设闭环正成为更现实的选项。别的不说,老黄的英伟达反正是先给大家打样了——英伟达拉上Google DeepMind和迪士尼搞Newton物理引擎,又联合云厂商、机器人公司、数据服务商一起建Physical AI Data Factory。△图源英伟达官网因此黎曼动力此次联合诺亦腾机器人和光轮智能,背后显然是同一套逻辑:一家做模型,一家补真实动作数据,一家扩展仿真与评测,共同把原本割裂的链路接起来。更值得关注的是,这套体系不只服务黎曼动力自己。按照合作规划,三方还将共建数据原则、标注原则和评测基准,并向行业给予原则化数据集、采集方式划与评测工具,部分具身训练数据也将照章性社区开源。如果数据只在一家公司的内部循环,它最多形成一方式企业护城河。但当数据、原则和工具能够被更多团队复用,它才可能促进整个行业一起加高效。这也是百万小时背后的真正意义。比起数字本身,它更像一次行业实验:具身智能能否像大模型一样,找到属于自己的Scaling馗。百万小时,只是起点…

(责任编辑:休闲)

相关内容
推荐文章
热点阅读