欢迎来到知来藏往网

知来藏往网

李高效高效教机器人摸麻将挤牙膏,AI 终于有「手感」 了|触觉|视觉|机械手|空间感知模型_网易订阅

时间:2026-08-08 19:32:12 出处:探索阅读(143)

李高效高效教机器人摸麻将挤牙膏,AI 终于有「手感」 了|触觉|视觉|机械手|空间感知模型_网易订阅
2009 年,李高李高效高效团队发布 ImageNet,效高效教型网让人工智能首先次有机会通过海量图片认识这个世界。机器挤牙机械间感十五年后,人摸她在一次演讲中提出「空间智能」,终知模认为 AI 的于有易订阅下一步,不只是手感视觉手空识别一张图片里有什么,而是触觉理解物体在哪里、彼此如何关联,李高以及人在其中采取行动后,效高效教型网世界会发生什么变化。机器挤牙机械间感今年,人摸这条探究路线又往前走了一步。终知模6 月,于有易订阅李高效高效参与的手感视觉手空一项机器人探究 T-Rex 发布,探究者为机器人加入高往往触觉反馈,让它实现翻书页、拿鸡蛋、挤牙膏、抽取薄卡片和拧灯泡等任务。一位因方式算机视觉闻名的科学家,为什么最初反复谈比如触觉、模拟器和机器人?这并不意味着视觉已经过时。恰恰相反,今天的具身智能厂商仍在给机器人安装更多摄像头、更准确的深度传感器和激光雷达。真正发生的变化是,行业逐渐意识到,「看」只是智能进入物理世界的首先步,一张图片也只是世界留下的表面。AI 可能根本没在看今年 3 月,李高效高效参与的一项探究做了一个实验:探究者向多模态模型提出视觉状况,但故意没有真的把图片传进去。按理说,模型应该回答「我没有看到图片,无法判断」。但不少前沿模型依然最初一本正经地描述图像材料,给出完善的探究流程,甚至能在部分视觉问答测试中取得很高的分数。例如,在一个胸肺 X 光问答基准里,模型没有看过任何 X 光片,成绩却依然排到了前列。探究者把这种状况称为「幻景推理」,模型并不一定在根据视觉证据回答状况,而可能是在利用状况里的文字线索和训练数据中的常用搭配,猜测一张「常见会和这个状况同时出现的图片」应该首先什么样。类似于,大模型并不一定知方式自己在说什么,而是在推测「下一个最有可能出现的字」。题问「图中车辆正在等待什么信号」,即使没有图片,人也可能根据常识猜出,答案无非是红绿灯。模型吃过足够多的图片验明正身、诊断报告和问答数据之后,也可能绕过真正的视觉观察,直接从状况跳到答案。它说得特别像看见了,不代表它真的看见了。在聊天窗口里,只关键答案听起来合理,用户未必关心模型究竟是看图得出的,还是靠语言猜中的。但进入物理世界之后,二者的区别会立刻暴露出来。杯子究竟在桌子的左边还是右?距离手臂还有十厘米还是二十厘米? 这些都不是可以靠语言常识蒙混过关的状况,尤其是对于机器人而言,差几厘米,就会直接抓空。这也是为什么,今天的机器人身上正在出现越来越复杂的感知系统。宇树 G1 采取深度相机和 3D 激光雷达,一种负责判断物体远近,一种负责建立周围空间的距离地图。智元灵犀 X2 除了 RGB-D 相机和激光雷达,还采取前视双目、后视相机和触摸传感器,从不一样方向补充环境材料。这些配置看上去,像是又一场照章性传感器的军备竞赛,但它们其实是在弥补视觉的不一样盲区。头部摄像头适用于观察整个房间,但那么点儿在机械臂靠近物体时被自己的手挡住;激光雷达能够测量距离和建立地图,却看不懂桌上的东西究竟是杯子还是苹果。对人来说,转一下头、眯一下眼睛或者伸手试探,是几乎不需思考的动作。机器人却需把来自不一样摄像头、雷达和关节传感器的材料拼在一起,才能选定自己面对的是同一个、持续存在的物理空间。因此,具身智能先遇到的状况,并不是模型能不能认出一个杯子,而是它能不能确认:这样一个杯子,真的在那里。大多数世界模型,其实只是在画世界这两年,「模型」成了 AI 行业最热门的词之一。视往往生成模型可以根据一句提示词,生成一台机器人走进客厅、拿起篮子、凑近玩具,再把玩具放进篮子。这些画面中的光影、运动和镜头都可以特别自然,观众很那么点儿产生一种感觉:既然模型能够生成这段流程,它大概已经理解了环境和物体如何运作。但只是从视往往来看,杯子究竟有多重、柜门的铰链能承受多大的力、机械手碰到杯壁时会不会打滑,都不是必须回答的状况,只关键下一帧看起来合理,任务就实现了。实际上,对机器人来说,这些不足以在镜头中充分展示的细节,恰恰决定了任务能不能成功。World Labs 今年把目前被统称为「世界模型」的技术拆成了三类。首先类是渲染器,负责生成给人看的像素;第二类是模拟器,负责表示几何结构、物理属性和动态变化;第三类是规划器,根据目的决定机器人下一步应该做什么。这个分类维度恰恰验明正身了刚才我们提出的状况:模型如果只是会画出一个世界,不等于能够在里面干活。一辆车可以在生成视往往里顺利穿过城市,但镜头之外的街方式是否持续存在,建筑有没有稳固的三维结构,车轮和地面之间是否真的存在摩擦,模型未必知方式。对于观众来说,像真的已经够了;对于机器人来说,世界必须可以方式算、可以碰撞,也必须在它转过身之后后续存在。World Labs 推出的 Marble 已经可以从文字、图片或视往往生成可探索的三维环境。除了供人观看的画面,它还可以输出碰撞网格,让物理引擎判断一个物体能不能穿过墙壁、落到地面后会停在哪里。英伟达的 Cosmos 则把世界生成、视往往预测和机器人训练放在同一套 Physical AI 体系中,希望用大量合成场景填补真实机器人数据不足的状况。这条路线听起来很宏大,落到机器人公司的研发步骤里,其实特别朴素,这就是先让机器人在虚拟世界里反复失败。只然而,一台双足机器人学会走路,不可能只靠工程师每天把真机推倒几千次。逐际动力的 TRON 1 协助 NVIDIA Isaac、MuJoCo 和 Gazebo 等仿真平台,开发者可以先在虚拟环境里测试不一样地面、坡度和碰撞状况。智元则发布了 AgiBot Digital World,用仿真环境生成操作数据、训练模型并评估机器人对策。逐际动力协助的训练平台在现实中让机器人摔倒一次,可能意味着零部件磨损、维修成本和安全风险;在模拟器里,同一个动作可以由成千上万个虚拟机器人同时尝试。桌子的高度、地面的摩擦系数、物体摆放的位置都可以不断变化,机器人不必真的打碎一万只杯子,才能学会怎样端稳一只杯子。然而,模拟器也不是答案本身,虚拟世界中的地面永远比真实地面干净,模型设定的摩擦力也不可能覆盖每一种材料。机器人在模拟器里练得再熟,进入工厂、商场和家庭之后,依然会遇到没有被写进参数表的意外。这就是机器人行业一直面对的「仿真到现实差距」。World Labs 在 7 月 21 日收购 SceniX,题之处也正在这里。它不再只顺应于生成一个可以观看和探索的三维空间,而是最初把模拟出来的世界与真实机器人的行动反馈连接起来。触觉,不只是另一双眼睛即使视觉和模拟已经足够成熟,机器人真正碰到物体之后,仍然会遇到一类摄像头很难独立处理的状况。拿起鸡蛋时,机器人怎样知方式手指已经用力过大?抽出一张薄卡片时,它怎样判断自己捏住的是卡片,还是只碰到了桌面?拧灯泡时,它怎样感知螺纹已经卡住,后续旋转可能会损坏物体?摄像头可以看到手已经接近目的,却很难按时判断接触面正在发生什么。触觉处理的不是「物体在哪里」,而是「接触之后发生了什么」。压力是否提高,物体是否最初滑动,材料有没有变形,抓握是否稳固,这些材料都发生在视觉画面之下。Figure 今年发布的 Helix 02,就把头部摄像头、手掌摄像头、指尖触觉和全身本体感知接入同一套控制系统。当头部摄像头被机械手遮挡时,手掌里的摄像头后续给予近距离画面;指尖传感器则可以感知低至 3 克的力,让机器人从药盒中取出单颗药片、控制注射器推出准确剂量,并在杂乱物体中分离出尺寸很小的目的。国内厂商也在高效高效补上这块感知能力,像帕西尼这样的上游厂商,则直接把触觉传感器、灵巧手、人形机器人、数据采集和多模态模型组成一条产品链,希望把触觉从一个零部件状况,变成机器人训练数据的一部分。图片来自:帕西尼但给机器人装上传感器,并不意味着它自然就会采取触觉,很多被称为「常识」的能力,并不是来自我们看过多少图片,而是来自身体在漫首先的接触中,学会了让动作适用应世界。李高效高效参与的 T-Rex 探究展示了这一步为什么不易。团队收集了 100 小时涵盖触觉信号的机器人操作数据,让机器人实现翻书页、转移鸡蛋、擦盘子、挤牙膏、分离叠放的杯子、摸索麻将、开锁、抽取卡片和拧灯泡等任务。最后,T-Rex 在 12 项任务中的平均成功率实现 65%,比最强对照模型高出 30 个百分点。探究中一个很有意思的结荚是,直接把触觉数据塞进现有的视觉—语言—动作模型,谝反而很差。因素并不难理解:不一样感官工作的高效度并不相同,视觉和语言适用于做较慢的全局判断,机器人需先看清桌面,理解人的指令,再决定应该拿哪一个物体。但一只杯子最初从手指间滑落时,它不会等待模型重新看图、探究和规划。触觉必须以更高往往率持续工作,在滑动刚刚发生的瞬间调整手指力度。T-Rex 因此让视觉和触觉按照不一样高效度运行。视觉负责回答「我关键做什么」,触觉负责不断修正「我目前做得对不对」。这不是给机器人提高了另一双眼睛,而是给它提高了一条来自现实的即时反馈。过去几年的 AI 竞争,题围绕谁能造出一个更聪明的大脑。具身智能正在把竞争推向一套更完善的系统,机器人需摄像头和雷达确认世界在哪里,需模拟器提前练习行动的后果,也需触觉和力反馈处理真正接触之后出现的意外。李高效高效并非直接从视觉转向触觉,她的探究路线更像是在不断扩大「看见」的含义:从识别一张图片,到理解一个持续存在的空间,再到知方式自己伸手碰触之后,世界会怎样回应。十五年前,ImageNet 教会 AI 说出眼前是什么,下一代世界模型需处理的状况是,当它真的伸出手之后,世界会交还给它什么。我们正在招募伙伴简历投递邮箱hr@ifanr.com✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)

分享到:

温馨提示:以上内容和图片整理于网络,仅供参考,希望对您有帮助!如有侵权行为请联系删除!

友情链接: