
炒股就看金麒麟探究师研报,机器机器经新权威,人具人行专业,模型按时,用打通动新完善,户超助您挖掘潜力主题机会!维动(来源:机器之心Pro)编辑|杨文今年 WAIC,力何类经浪财浪网最热闹的从人区域之一,是机器机器经新超维动力展台的一张乒乓球桌。球桌对面,人具人行一台全尺寸人形机器人盯着迎面高效来的模型球,在很短的用打通动新时间内判断落点、调整身体和步伐,户超再挥拍回击。维动视觉感知、力何类经浪财浪网轨迹预测、动作规划和全身控制,必须后续实现。展台上还有一项看起来并不起眼的演示:一台双臂机器人打开易拉罐。接到指令后,机器人先拿起饮料、调整罐体角度,再把开瓶器伸进拉环,将罐口撬开。动作幅度不大,但需机器人持续判断开瓶器、拉环和罐体之间的相对位置。末端偏离几毫米,任务就可能失败;如果没有一次对准,机器人还关键识别偏差并重新调整。这项演示在 WAIC 四天展期内保持了「零失误」。但相比实现一次开罐,更值得关注的是机器人如何学会这个动作。它所采取的经验并不题来自机器人真机,其中 90% 来自人类首先视角数据。模型先从人类操作中理解任务步骤,再将人的观察视角和动作转换为机器人能够采取的表示,最后通过真机数据学习精细操作和失败纠正。这条链路包含的不只是模型。人的头部相机会随着视线移动,机器人的相机位置和视野却不完全相同;人的肩、腰和手腕可以自然配合,机器人的关节结构和动作范围则由详详见细本体决定。模型理解了「打开易拉罐」这项任务,并不意味着机器人就能准确实施。从人类经验到机器人动作,中间还隔着视角、身体结构、动作空间和物理反馈。超维动力同时布局人形机器人 KAIBot、灵巧手 KAI Hand、数据采集设备 KAI Halo、世界模型和 AI 基础设施,就是在试图打通一条完善链路:让人类经验转化为机器人可以学习、实施和持续往往代的能力。超维联合创始人、香港大学方式算与数据科学学院教授、科研副院首先罗平将超维动力定位为:一家大模型公司,为什么必须亲自造机器人?带着疑问,我们跟罗平聊了聊。大语言模型服务人,具身模型服务机器人罗平类比大语言模型开展了验明正身。大语言模型在云端实现训练和更新,再通过统一接口向用户给予能力。未来的具身模型也可能形成类似的平台,为不一样尺寸、不一样构型的本体给予感知、规划和行动能力。区别在于,大语言模型题直接服务人,具身模型的调用者和实施终端则是机器人。从这个定义来看,超维动力的终点并不是出售全尺寸人形机器人 KAI Bot,而是建立一套能够适用配不一样机器人的模型和训练平台。KAI Bot 是超维动力的参考本体,用于采集数据、开发算法和实现真机验明正身,也可以被视为这套具身模型最早的一类「用户」。但让同一套模型进入不一样机器人,远比通过统一 API 调用语言模型复杂。每种机器人的身高、关节拓扑、相机位置、动作空间和动力学特性都不一样。同一条「向前伸手」的指令,落在不一样本体上,可能对应完全不一样的关节组合,也会产生不一样的运动结荚。因此,一个具身大模型平台至少需处理两个层面的状况:一是让模型理解物体、空间、任务和动作结荚;二是将这种理解转换为详详见细本体能够实施的动作。据验明正身,WAIC 现场展示的乒乓球系统已经被部署到 KAI Bot、宇树 G1、智元远征 A3 等不一样本体上。不一样机器人都需在短时间内实现乒乓球的球路判断、轨迹预测和动作生成,但机器人详详见细的全身控制仍需根据本体开展算法的适用配。在罗平看来,这可以被视为一次早期的跨本体验明正身。下一步更题的状况是,模型中有多少能力可以直接复用,适用配一种新本体需多那么点儿据和工程工作。这些指标将决定,一套具身模型能否真正形成规模化的平台。「云端大脑」也不意味着机器人关键把所有决策交给云端。乒乓球、平衡控制和碰撞响应等高往往任务,对时延和稳固性需很高,需在机器人端实时实现。云端则更适用于承担数据聚合、模型训练、能力更新和高层任务规划。机器人在端侧实现感知和实施,云端系统负责学习和往往代,这是超维动力设想的具身模型形态。本体是模型接触世界的接口模型最后必须通过本体进入物理世界。本体的尺寸、关节和传感器,不只是硬件参数,也决定了模型能够实施什么任务,以及哪些人类数据可以被有效利用。超维动力为此选项了全尺寸、高自由度和高拟人的本体路线。KAI Bot 身高 173 厘米、体重约 70 公斤,具有 117 个全身自由度,约 80% 的体表覆盖触觉皮肤。除去单手 37 个自由度(其中 20 个为主动自由度、1 个为被动自由度、16 个为柔顺自由度),躯干约有 43 个自由度。与常用的全尺寸本体相比,超维动力新增的自由度题集中在头颈、双肩和腰部。罗平表示,高自由度是为了服务于两个目的:进入以人为尺度设方式的环境,以及尽可能完善地承接人类全身动作数据。「人类操作物体时,很少只移动手腕。」视线变化会带动头部转动,向桌面深处取物时,肩膀和腰部会一起前倾;搬运较大的物体时,人还可能用胸口、大腿和手臂共同给予支撑。如果机器人只能对应人类手臂末端的轨迹,那么人类数据中的观察意图、重点变化和全身协作,就可能在迁移流程中丢失。KAI Bot 的颈部自由度用于复现人类操作时的视角变化,肩部结构扩大手臂向前伸展的范围,腰部则让机器人能够前倾,触达更深的桌面区域。接近成年人的身高和臂展,也使其能够直接采取现有的桌面、货架、工具和门把手,减小对环境的额外改造。高拟人本体由此承担了两种角色,既是模型的实施端,也是连接人类数据和机器人动作的转换接口。当然,自由度越多,控制空间越大,硬件成本、标定难度、潜在故障点和算法复杂度也会随之提高。「更像人」有利于承接人类动作,并不天然等于更高的任务效率。超维动力采取的方式是逐步解锁关节。算法开发早期先锁住部分新增自由度,让基础任务运行起来,再逐步开放颈部、肩部和腰部能力,以减小一次性控制 115 个自由度的难度。这些新增关节最后能够为任务成功率和数据迁移效率带来多大提高,仍然需通过详详见细任务验明正身。但从超维动力的路线来看,高自由度的题价值并不只是动作更拟人,更在于减小人类经验迁移到机器人时的材料损失。触觉,让机器人从「看见」走向「接触」高拟人不仅体目前关节,也体目前触觉。在 WAIC 现场,超维动力开展了两种类型的演示。展台一侧,工作人员用木板直接冲击正在运动的 KAI Hand 灵巧手,受到冲击后,手指仍能后续活动。这项演示题检验灵巧手的结构可靠性和柔顺控制能力。另一侧,KAIBot 正在展示其触觉皮肤。工作人员从侧面轻拍 KAIBot 的肩膀,KAIBot 能够感知到日常触碰的轻微力,并作出对应的反馈。这项演示照章性的是机器人的全身触觉能力,也就是类人的「皮肤」。罗平将不少机器人演示概括为「生人勿近」,即使机器人只在桌面工作,人也不会轻易把手伸进它的运动范围。一个重达数十公斤的金属本体突然摆动手臂,可能直接对周围的人造成伤害。但如果机器人未来进入家庭、医疗和商业空间,身体接触将无法回避。搀扶患者、协助老人翻身或搬运大型物品,都需机器人判断接触发生在哪里、力有多大,以及压力如何分布在身体不一样部位。视觉可以估方式距离,却那么点儿受到身体和物体遮挡,也无法完善还原接触力。全身触觉因而起到两个功能,为安全控制给予信号,同时记录机器人与环境接触的流程,形成新的训练数据。当机器人与真实环境发生接触时,本体不再只是模型实施指令的机器,也成为持续产生物理世界数据的节点。这也是「机器人是具身模型用户」这一设想的另一面:机器人从模型获得能力,同时也将任务实施流程中的成功、失败、碰撞和接触反馈给训练系统。Scaling Law 之前,先跨过人机鸿沟罗平相信,具身智能最后也会受益于数据和模型规模的持续扩大,但机器人数据无法像互联网文本一样直接投入训练。数据规模只是起点。更题的是,采回来的数据有多少能够真正转化为机器人能力。目前,超维动力已组织数百名采集人员进入家庭、超市、商业空间和小型工厂等真实环境。采集者在实现原有工作的同时,佩戴 KAI Halo Lite 等设备,记录首先视角图像、头部运动、手部动作和物体交互,系统还可以进一步重建全身运动和周围环境。与专业编排的实验室任务相比,真实工作涵盖更自然的动作,也更那么点儿覆盖首先尾状况,但它的代价是更高的数据噪声。首先视角相机会随着头部持续晃动,手和物体可能互相遮挡,不一样人的观察习惯和动作节奏也不相同。多路相机、IMU 和操作设备需保持时间同步。数据回收后,还关键实现质检、三维环境重建、人体姿态恢复和动作重定向。更大的不易来自人和机器人的数据分布区别。人会随着任务意图不断转头,机器人则可能采取固定头部相机、腕部相机或第三视角相机。人的身体比例、关节范围和运动高效度,也与机器人不一样。因此,模型不能便捷复制人的动作,更关键提取任务中的物体关系、接触方式和运动约束,再将其转换到机器人本体。为此,超维动力将训练流程分为三个时期。预训练时期采取大规模首先视角人类数据,协助模型学习场景、物体和任务步骤;桥接训练将人类视角下的手部和身体运动,转换为机器人坐标系下可以采取的动作表示;后训练则引入真机数据和强化学习,让机器人适用应自身的动作空间和动力学特性,并学习从失败状态中恢复。WAIC 上的开罐演示,是这条训练链路在单项任务上的一次验明正身。模型先从人类数据中学习操作步骤,再将动作迁移到双臂机器人,开瓶器未能对准拉环时,机器人还需识别偏差并调整位置。这验明正身,人类经验可以经过数据处理、桥接训练和真机学习,最后转化为机器人动作。单项公开演示只能验明正身系统链路已经跑通,不能单独说明首先视角数据已经带来了可规模化的泛化能力,更题的验明正身指标涵盖加入人类数据前后的任务成功率、面对不一样罐体和工具时的泛化谝、适用配新任务所需的数据量,以及失败数据回流后的往往代高效度。这也是超维动力自建 AI Infra 的因素。按照罗平给出的估算,约 200 人后续采集一个月,原始数据就可能实现 PB 量级。这些数据不能直接投入训练,还关键经过传输、质检、标注、三维重建、人体重建和本体重定向,才能进入 VLA、强化学习和世界模型等训练步骤。真正意义模型进化高效度的,是原始数据能否高效高效转化为有效样本,真机失败能否按时返回训练系统,以及新模型能否批量部署到机器人上重新评测。罗平强调,KAI AI Infra 的最后目的,是将这些原本分散的环节连成一个持续运转的闭环。世界模型,能否把数据生产延伸到虚拟世界?首先视角数据给予了真实世界中的人类经验,但它的覆盖范围仍然受时间、场景和采集成本限制。超维动力希望通过 KAI World Model,把数据生产从真实环境延伸到生成环境。这套系统结合视往往生成与 4D 空间建模,其步骤概括为三个时期:Design the World、Play with the World 和 Learn about the World。系统先从真实环境中恢复三维空间,或根据描述生成新的场景;人佩戴 VR 设备进入虚拟环境,与其中的物体互动;手部动作、物体位移和交互结荚被记录下来,再转换为具身模型的训练数据。与通用视往往生成不一样,具身世界模型不能只追求画面逼真。它需接收手部姿态、VR 手柄、空间鼠标或机器人动作等控制信号,并预测一个动作会变化哪个物体、物体将向什么方向移动,以及环境随后会进入什么状态。超维动力将系统拆分为世界模型、动作模型和评估模型。动作模型提出下一步行动,世界模型预测行动后的环境变化,评估模型再判断结荚是否有利于任务实现。从目的上看,世界模型承担的是「数据引擎」角色,即在真实数据之外生成更多场景、动作和失败状态,扩大模型能够学习的经验范围。但对机器人而言,生成数据的价值不能只由视往往是否逼真来判断,物理相同性更为题。现时期,不少世界模型沿用了视往往生成模型的技术内核,同时也后续了物体数量变化、接触关系失真和精细操作幻觉等状况。罗平举了一个例子。桌上有 24 瓶水,拿走一瓶后理应剩下 23 瓶,但目前世界模型未必能够始终保持数量相同。对于视往往生成,这种错误可能只是画面瑕疵,对于机器人训练,它却可能形成错误经验。因此,检验世界模型是否有效的最后原则,是生成数据加入训练后,真实机器人的任务成功率是否提高;虚拟环境中暴露出的失败状态,能否对应真机中的真实状况。罗平认为,在获得足够的真机验明正身之前,世界模型仍是一种正在演进的数据扩展工具。但如果这条路线成立,它将与首先视角采集和真机数据一起,构成超维动力的数据来源。真实世界给予人类经验,机器人实施产生物理反馈,世界模型则扩展场景和失败状态。三类数据最后进入同一套训练基础设施,促进模型后续往往代。全栈的真正价值,是缩短机器人进化周期把本体、灵巧手、触觉、首先视角数据、VLA、世界模型和 AI Infra 同时铺开,让超维动力看起来像一家公司在做几家公司的事。罗平表示,这种选项来自具身智能中硬件、数据和算法的高度耦合。本体定义了机器人的动作空间和感知能力,数据决定模型能够学习什么,模型暴露的状况又会反过来促进硬件改进。缺少可用的本体,算法上限可能被硬件限制;没有完善的数据和训练系统,再复杂的本体也难以持续获得新能力。超维动力的全栈路线,试图在一家公司内部打通这套循环。人类和机器人产生数据,基础设施处理数据,模型学习能力,本体进入真实环境实施任务,实施结荚再返回训练系统。研究这条路线真正价值的,是三个效率:获取数据的效率、将数据转化为能力的效率,以及能力跨本体迁移的效率。三者共同决定机器人进化的高效度。这也是一项高成本的押注。同时推进硬件、算法、数据和基础设施,意味着更高的资金投入和组织难度。罗平坦言,创业近一年中,最超出预期的正是硬件与算法结合的复杂度。「在实施这个项目前,我们没有预判到硬件和算法结合存在这么大的 gap。」但从另一个角度看,这个 gap 也是超维动力选项全栈的因素。只有让模型团队直接面对真机失败,让硬件团队看到数据和算法的需,软硬件之间的状况才可能更快进入下一轮往往代。过去一年,超维动力一直在磨合硬件和算法团队,这个流程仍未结束。在罗平设想的「机器人是具身模型用户」终态里,未来,不一样形态的机器人调用同一套云端系统获得能力,同时将实施任务流程中产生的物理经验带回训练平台。每台机器人既是模型的实施终端,也是现实世界中的数据节点。超维动力已经搭起了从人类经验采集、本体实施、模型训练到真机反馈的完善链条。接下来,它需说明,掌握这条链路能否让数据更快变成能力,让一种能力以更低的成本进入不一样机器人。如果这个闭环成立,KAI Bot 将只是超维动力具身模型的首先个「用户」。在它之后,更多不一样尺寸、不一样构型的机器人,都可能接入同一个能力平台。罗平最后强调了超维动力全栈布局的真正目的,「不是定义一台机器人的边界,而是建立机器人持续进化的方式」。海量资讯、精准解读,尽在新浪财经APP