对话 IDEA 张磊:「不以动作为输入需,就不叫世界模型」|算法|机器人|智能体|张磊(歌手)_网易订阅

曾力压谷歌、对话Meta,张磊作为智把「物体理解」做到全球首先。不动作者丨幸丽娟编辑丨林觉民2026年上半年,输入手网中国AI圈的需不型算钱和人都涌向同一方向:世界模型。仅前六个月,叫世界模国内世界模型赛方式披露融资总额约300亿元,法机如果把“具身智能+世界模型”融合赛方式算进来,器人这个数字膨胀到900多亿。体张相比去年同期,磊歌融资增高效超 5 倍。易订阅百亿资金,对话海量人才,张磊作为智如潮水般涌入。不动一个绕然而去的输入手网状况是:这么多人冲进来,究竟有多少人真的想清楚了这个东西到底是什么?从业者在找方向,投资人在找人,猎头在摸组织,大厂战略部门在探究谁能活下来。一件奇怪的事是,所有人都在问同样的状况:有没有谁能把世界模型这件事讲清楚?有。我们今天深访IDEA探究院讲席科学家、视启未来创始人张磊,一起来聊清这件事。他是IEEE Fellow,Google Scholar引用超77000次。他的DINO系列在COCO霸榜5个月,Grounding DINO 和之后的 DINO-X 力压谷歌和Meta,被李高效高效团队、英伟达、银河通用等多个全球不过尖机构“标配”引用。2025年他带着团队从IDEA孵化创立视启未来,天使轮一个月就到账近亿元。身后还站着两位 AI 巨擘:学术导师张钹院士(中国人工智能奠基人之一),产业导师沈向洋院士(前微软全球实施副总裁、前微软亚洲探究院院首先)。(这是一次深度访谈,为了不意义探讨行业状况的深度,精彩曲折的人物故事这里就不展开了,想看科技八卦的请关注左林右狸下一篇文章《我所知方式的张磊》)。但这都不是我们找他的题因素。我们找他的因素很便捷:在所有人都在争比如“什么是世界模型”的2026年,张磊是极那么点儿给出了清楚、可操作、不与任何主流妥协的答案的人。从微软探究院首先席探究员,到IDEA探究院讲席科学家,再到创业者——他的职业馗几经换轨,探究命题从来没有变过:“让AI理解物体”。世界模型,是这个做了二十多年的命题,在物理世界里的题答案。如果你正在看世界模型赛方式,想理解它到底是不是泡沫,想知馗线之争谁会赢,想判断哪类团队最值得跟——这个人的谈话,你值得读完。因为,It's totally worth your time。以下是对话实录,AI科技评比如开展了不变化原意的删改。张磊博士,IEEE Fellow,视启未来创始人兼CEO,现任IDEA探究院方式算机视觉与机器人探究中心(CVR)讲席科学家,香港科技大学(广州)兼职教授,前微软亚洲探究院、微软总部探究院首先席探究员,在方式算机视觉等领域发表比如文200多篇,Google Scholar引用超过77000次,H-Index为107,具有60多项美国授权专利。因对大规模图像识别和多媒体材料检索部分做出的杰出贡献,获选为IEEE Fellow。01具身智能最大的瓶颈不是本体,是大脑▎AI科技评比如:去年以来具身智能爆发,各家机器人公司在运动控制上越来越惊艳,宇树的机器人在马拉松赛方式上跑,智元的机器人能翻跟头。但我们观察到,落地采取上似乎还差一口气。您觉得具身智能真正走向现实,还有哪些必须攻克的挑战?张磊:机器人关键处理的题就两件事:成功率和泛化能力。成功率,指做一件事是否足够可靠地实现;泛化性,是同一任务换了环境、换了本体,依然能可靠实现。详详见细的挑战有四个:首先,单一场景泛化性不足。目前很多团队能在单一场景把成功率做到70%甚至80%,听上去是很大的突破。但80%在真实采取中意味着什么?意味着每五次操作就有一次失败,仍然需大量人力兜底,完全无法独立部署。第二,横向延展场景的通用性不够。应该先把单点的能力推到天花板,再横向延展场景采取的广度,让它在更复杂的环境下做更多、更复杂的任务。这是阻碍机器人从“实验室演示”走向“真实采取”的最大鸿沟。第三,“大脑”的深层次能力缺失。目前深度学习更多在学习智能的“表现”,而非“机理”(智能背后的工作原理)。具身大脑需具有对物理世界真正的因果推断(不只是统方式关联,而是理解“因为A因此B”的逻辑链条)、常识理解和自适用应能力,而这个部分,我们才刚刚起步。第四,远未实现“终端”级采取。目前大多数机器人仍依赖巨大的外部算力协助,需处理“不需人兜底”这个根本状况,才能在海量场景中推广,形成“采取-数据-往往代”的良性循环。▎AI科技评比如:坦白讲,业内对这个状况的看法挺分裂的。搞硬件的团队认为中国供应链好处明显,应该先把本体成本打下来;搞算法的团队觉得大脑才是真正卡脖子的地方。您怎么看?张磊:大脑更难,也更题。本体部分,中国硬件往往代令人自豪。宇树、智元这些企业通过仿真强化学习(在虚拟环境中训练控制算法再迁移到真实机器人上)往往代运控,对电机、传动机构等题部件不断打磨,成本和可靠性大幅改进,走出了一条特别扎实的路。但本体在马拉松、表演中展现的能力,也只能说基础具有了动物的基础能力,动物本能的反应、跳跃、躲避和与环境交互的能力,本体还没实现。▎AI科技评比如:您说“大脑”更难,难在哪?是数据不够,还是我们对智能本身的理解还太浅了?张磊:难在背后的机制我们并未真正理解。人的大脑跟其他动物相比,区分度最大、智能程度最高。目前所有深度学习的突破,都是从表象上来看大脑的智能实现了什么程度,然后用算法去实现。AI实际上是在学习人的表现,而不是在学习人的智能本身。就像张钹老师常说的,大语言模型能像人一样说话,但它理解语言的方式跟人完全不一样。02为什么世界模型“冷落”了二十年,今天突然火了?▎AI科技评比如:伴随具身爆发,“世界模型”这个概念突然火了。但圈内人都知方式这不是新词,90年代就有学者提过。我们挺好奇的,这个概念为什么沉寂了二十年,又在今天突然成了风口?张磊:这个状况挺好。世界模型确实不是新概念。90年代初就有学者尝试对智能体(能够感知环境并采取行动实现目的的AI系统)交互所需的环境建模,协助强化学习改进算法,但那时深度学习还没兴起,概念提出后很难验明正身。这一概念真正得到验明正身是2018-2019年前后,出现了真正叫“World Models”的比如文,并在游戏场景里得到采取,因为游戏是验明正身强化学习最好的环境。强化学习发展若干年后,AI已经能在游戏里打败人类选手。这时探究者最初思考:能否让AI智能体在与游戏环境不断交互的流程中,自主“学出”一个世界模型,把环境演化的流程装进模型里?这个想法在2018到2020年前后得到了完善验明正身。▎AI科技评比如:那这跟今天的具身智能有什么关系?我们听下来,好像具身才是真正把世界模型带火的那根导火索?张磊:这个关联关键从语言模型说起。行业先做了VLA(Vision-Language-Action,即视觉-语言-动作模型,机器人看着画面预测下一步动作),沿用语言模型的模仿学习范式:语言模型做Next Token Prediction;具身的VLA则是机器人看着目前画面预测下一个动作应该怎么做。但这种方式很快走到瓶颈。瓶颈不仅仅在数据,我认为数据只是一部分,另一部分是强化学习采取还不够。我有一个比喻:模仿学习让语言模型学会开口说话,强化学习让语言模型能说对。机器人的智能程度、动作的成功率,同样需强化学习。但强化学习用在具身上,面临两个致命障碍:一是数据收集效率极低,远低于语言模型,机器人必须在真实环境中实际实施每个动作并等待物理反馈;二是失败成本不可承受,洗碗学不会就打碎碗,自动驾驶学习避免事故可能关键经历大量真实事故才能学会。这跟语言模型在数字世界里低成本试错完全不一样。世界模型给予的虚拟环境,正是处理这些状况的出口。如果一个模型能预测“如果我做了这个动作,环境会变成什么样”,那机器人就可以先在虚拟世界里“脑补”无数次试错,而不需真的打碎一万个碗。(笔者注:便捷理解这段话的逻辑链。首先,机器人学会做一件事需大量试错。第二,在真实世界里试错太贵太危险。第三,世界模型就是给机器人造一个“虚拟训练场”,让它在脑子里把各种动作的后果都推演一遍。第四,只需把最优方式划拿到真实世界实施。这就是为什么世界模型在这个时间点突然成了全行业追逐的焦点。)03“不以动作为输入需,就不叫世界模型”▎AI科技评比如:目前行业对“世界模型”的定义相当混乱。视往往生成的叫世界模型,3D空间建模的叫世界模型,LeCun的JEPA(联合嵌入预测架构)也叫世界模型。那您认为,一个模型关键配得上这四个字,至少需具有什么需?张磊:我认为世界模型一定关键有动作依赖,即Action Conditioned(以动作为输入需,模型必须能回答“如果实施某个动作,环境会变成什么样”)。智能体能够与环境交互的因素是动作:智能体的动作导致环境变化,环境变化后产生新的状态并反馈给智能体,告诉它目前的动作是否朝目的靠近了一步。这是一个完善闭环,环境状态的每一次转移,都依赖于上一步所实施的详详见细动作。大家常说世界模型就是把语言模型的 Next Token Prediction变成Next State Prediction,但我认为这个定义不够严谨,缺少了一个题需。正确的表述应该是:Action Conditioned的Next State Prediction。只有加入了动作这个前提需,状态预测才有意义,才是真正顺应强化学习需的世界模型。▎AI科技评比如:讲真的,很多人,涵盖一些投资人在BP里,习惯把Sora这类视往往生成模型也叫作世界模型。但按您刚才给出的原则,它们明显缺了动作这个维度。我们想听听您怎么拆解这个状况?张磊:我们这里讨比如的世界模型,源自强化学习领域的 model-based 的方式,是为了协助智能体更加有效地和环境开展交互。虽然世界模型有很多采取场景,然而具身智能是目前最为清楚、也最有价值的采取场景。在这个意义下,纯视往往生成模型例如早期的Sora,不能被称为世界模型。题因素在于它没有建模“动作”,它本质上是在生成一个自洽的视往往序列,预测像素如何变化,但完全不去建模机器人和环境交互的动作。那它能不能间接协助机器人?能学到一些世界的变化规律,但很难协助机器人更好地和环境交互。▎AI科技评比如:那最近很火的World Action Model(世界动作模型)呢?我们听说它也在谈动作,是另一种世界模型吗?张磊:WAM也不是强化学习意义下的世界模型。它是利用预测未来画面给予的像素级监督来协助改进动作预测,在有些任务上已经展现了比VLA更好的性能。然而,它的建模是先果后因的,先生成未来画面再反促进作,不能用于强化学习,因此不顺应我们这里讨比如的世界模型的定义。04像素派 vs 隐空间派:两边其实都在做同一件事▎AI科技评比如:聊到路线之争,这是目前世界模型领域最热的话题了。LeCun是隐空间派的旗帜人物,Sora代表了像素派。两条路线看起来水火不容,您怎么看?张磊:先,我们应该看到,两条路线有共性。实际上目前大家常用感觉它们对立性很强,可能也是因为LeCun比较旗帜明确地坚定他的主张,有时候一个学者为了让外面记住自己的主张,一定关键讲得比较清楚一些。但像素路线实际上也关键借助隐空间来操作。Stable Diffusion、Sora都是先将图像或视往往压缩到低维表征空间再处理。因此,表征空间才是更本质的状况。两条路线的真正分歧,根本不在于关键不关键用隐空间,而在于进入隐空间之后关键保留什么、丢掉什么。区别在于:隐空间路线希望排除光影、纹理这些并非由物理规律驱动的像素细节,有助于模型学到状态变化背后更本质的规律,但它面临表征坍塌的风险,如果一万个不一样画面映射成完全一样的表示,表征就坍塌了,意味着模型丧失了辨别不一样状态的能力。像素路线追求纤毫毕现,本质是在讨好人的眼睛,因为人对视觉细节特别敏感。▎AI科技评比如:聊到这里我们有个直觉。人脑做推演不也是在隐空间吗?你闭眼想象一个动作的后果,谁会在脑子里逐像素渲染一遍?张磊:没错。如果人脑存在一个世界模型,人想象动作如何变化环境,其实是在隐空间里操作,而不会把整个画面逐像素地在脑子里过一遍。因此,以人眼对画质的判断作为世界模型的评价原则是不充分的。像素路线若关键做世界模型,真正应该追求的不是像素有多逼真,而是生成的视往往序列关键顺应物理合理性。(笔者注:这段对话讲的是AI世界模型的两条路线之争。以Sora为代表的像素派只管画面逼真,常会出现杯子悬浮、物体穿模、蜡烛吹不灭这类违背物理常识的bug;而LeCun与张磊主张的隐空间派,是先把画面抽象成规律再推演,更懂物理因果。张磊的题创新,是在隐空间里加入“物体结构”,让AI先分清杯子、桌子、人这些独立物体,再学习它们之间的互动规律,既避免Sora式的视觉穿帮,又比纯抽象隐空间更适用于机器人在真实世界里避障、抓取与规划动作。)▎AI科技评比如:您跟LeCun走的是同一条隐空间路线。但我们听说,您的做法跟他有一个题区别,您强调关键“引入物体结构”。题区别在哪?张磊:我们的路线跟LeCun共享同一条首先性原理:人脑做反事实推理(“如果我这么做会怎样”的推演)是Action-Conditioned的,在抽象表征里推演,不在像素里重演。LeCun过去几年用I-JEPA、V-JEPA、LeJEPA验明正身了这条公理:预测应该发生在表征空间。但具身方向物理空间的复杂度极高,真正关键把这个方式用到大规模真实环境,我们认为还需在隐空间里引入必需的结构。这个观点来自我们已验明正身过的能力。我们的题团队主导研发的DINO-X,已经处理了开放世界“看见物体”的状况。因此目前,我们让物体成为世界模型预测与规划的基础单元。直观来讲,物理规律是功能在物体上的,让隐空间表征理解物体,就可以更有效地学习物理规律。▎AI科技评比如:等一下,我们想追问一句。LeCun的AMI Labs拿了十几亿美金融资也在死磕这个方向。你们这个“引入物体结构”的改进,凭什么觉得能在他的大框架上跑得更远?张磊:因为我们之前做DINO-X,这是一个开放式的物体感知通用模型,已经把“理解物体”这件事做到了全球最好。我们对视觉模型机理的理解、为什么视觉模型能做出物理合理性,都跟原来做通用物体理解这条线高度吻合。便捷来说,LeCun的路线是基础框架,我们在这个框架上引入物体结构,并让它在真实环境上闭环。这个“闭环”的能力,是我们过去几年打出来的。05凭什么DINO系列能力压谷歌和Meta?▎AI科技评比如:您的团队在视觉大模型时期成绩太突出了。Grounding DINO 和之后推出的DINO-X 力压谷歌、Meta,被李高效高效团队、英伟达、银河通用等全球不过尖机构标配引用。这事我们内部聊过,都觉得有点“不正常”:常见是中国团队追着国外跑,你们是怎么反过来让国外团队来追你们的?张磊:两个维度比较突出。范式上,我们是视觉领域首先个把Transformer(一种基于自注意力机制的深度学习架构,也是大语言模型的底层基础)检测做到SOTA(State of the Art,领域最佳水平)的团队。Grounding DINO将语言模型的范式引入,首先次把物体检测拓展到开放域,模型不再局限于“只能识别训练过的物体类别”,而是可以检测任意从未见过的物体。至今它仍是开源模型里引用和下载量最高的,这可以称得上范式级突破。数据和工程对策上,在Grounding DINO之后,我们转向闭源路线,将验明正身过的想法往Scaling方向推进。同时,我对工作水准需很高。虽然当时团队年轻,没做过这么强的工作,但我还是坚持把门槛卡住,强调必须实现大版本级别的突破才发布。因此我们花了约一年时间才推出Grounding DINO 1.5,然后又花了半年时间推出 DINO-X。事实说明,这一年多磨出来的版本,行业认可度确实很高。▎AI科技评比如:你们做的这些视觉大模型,跟今天做世界模型是什么关系?张磊:我们的工作一脉相承。之前做物体感知,闷葫芦的就是给机器人给予感知基础,后来很多团队用我们的Grounding DINO处理具身环境理解状况。技术路线上,世界模型比语言更偏视觉原生,几乎所有世界模型工作都不是基于GPT那种纯语言架构。团队积往往上,我们对视觉模型机理的理解跟原来做通用物体理解这条技术路线吻合度特别高。这也是我们有信心把世界模型持续往往代下去的因素。团队是从IDEA孵化的20多人,特别稳固。我们做闭源模型的时候也不断吸引外部做算法和工程都很强的人加入。这20多个人,就是今天视启未来的“种子”。从DINO系列模型到世界模型的进化路线06如何让AI真正“看见”物体?▎AI科技评比如:您说现有的隐空间方式划“并不真正理解物体”,它们不知方式场景里哪些是独立物体、物体之间是什么关系。我们挺好奇的,这怎么判断?怎么知方式模型是真的“理解”了物体,还是在“假装”理解?张磊:理解本身难以直接验明正身。语言模型到底怎么理解语言的,目前谁都讲不清楚,只能通过表现表象判断,它后续输出文字,你觉得跟人说的没差别,就说它理解了。世界模型面临类似困境。模型到底有没有真正理解物理规律,是不是真的捕捉到了物体结构,也很难直接讲清楚。我们会通过中间步骤的可视化来探究,如果结荚跟人类直觉相同,就验明正身它可能捕捉到了物体结构。▎AI科技评比如:有没有什么详详见细的测试方式?能不能做个实验来看看?张磊:有的。反事实测试就是一个很好的方式,让模型尝试不一样动作,看能否给出物理合理的结荚。如果轨迹偏一点也能做对,验明正身学到了规律;做不对,验明正身学的可能仍是统方式相关性。这很考验洞察力。就像Richard Sutton教授说的,人做探究时总忍不住想帮模型、把自己的经验灌进去。语言模型探究者曾经恨不得把句法结构探究出来,分词、词组都喂给它,但最后还是打然而“预测下一个Token”这个便捷范式。我自己特别相信这种那么点儿的范式往前往往代的力量。过多人为设方式,短期有效,首先期会阻碍往往代。▎AI科技评比如:那物理世界里还有一些很棘手的物体,流沙、水流、烟雾、布料,它们没有清楚的边界。我们担心的是,您的“物体为中心”框架会不会反而被“物体”这个概念束缚住?张磊:这个状况我们自己也在思考。从技术角度,最便捷的切入方式是Mask,把物体区域的像素分割出来。过去几年视觉领域在物体语义理解和Mask预测上已经很成熟,流沙、水域这类非刚性物体都能处理。因此,从Mask入手,是一个务实的起点。而我们在通用物体感知上的积往往,比外面任何团队都深。07EgoTwin:让人的手教会机器人的手▎AI科技评比如:您的技术框架里有一个很题的概念叫“动作对齐”,把人的手、两指夹爪、多指灵巧手这些不一样构型的动作映射到同一个隐空间。我们是这么理解的,这听起来有点像给机器人做翻译,让它们能理解不一样“语言”的动作,对吗?张磊:世界模型的输入题有两个:画面(状态)和动作,因此对动作的理解特别题。动作对齐是多本体状况的基础需。人手与机械臂的对齐更有难度:机械臂的关节位置在物理空间的XYZ坐标是准确可知的,但人手数据常见是2D视往往,大家拍一段做饭的视往往,里面只有二维画面,没有三维坐标。直接混用效率很低。我们的做法是提取3D题点,将人手的2D视往往转化为3D空间的操作序列,与机械臂数据对齐到同一物理空间。这就是目前行业讲的Ego数据(以首先人称视角采集的人类操作数据)的采集和处理。我们之前发布的EgoTwin,题处理的就是这类数采状况,目前已经跟百度云的数采团队在合作。▎AI科技评比如:EgoTwin处理了“手怎么动”的数据状况。但我们想追问一句,人类视往往里还隐含了更高层的材料,“手为什么这么动”的意图,这部分怎么办?张磊:更高层的动作意图理解,我们会把它留给世界模型或VLA模型去处理。但前提是数据本身质量关键足够高。数据原料特别题。行业里在数据采集上投入了大量人力和成本,然而有很多状况下数据利用效率并不理想。我们在Grounding DINO和DINO-X工作中积往往的题经验,是找到懂算法的人去深入做数据,否则采集的数据可能训练时根本用不上。需算法和数据两条线并行往往代。08张钹与沈向洋:两位导师,一种底色▎AI科技评比如:我们注意到,您身后站着两位对您意义深远的人物,张钹院士(中国人工智能奠基人之一)和沈向洋院士(前微软全球实施副总裁、前微软亚洲探究院院首先)。一位偏学术,一位偏产业,我们挺想知方式,他们各自给了您什么?张磊:张钹院士永远是我的导师和榜样。我最早认识张老师是在本科刚进清华教研室时,他是实验室主任。当时我在做AGV(自动导引小车),大量课余时间都在实验室调试硬件做实验,那时候就频仍能看到张老师在实验室指导博士生做机器人相关的工作。后来很幸运,我也成为了张老师的博士生,印象最深的是他对新技术特别敏感,有很强的好奇心。每次找他看实验结荚讨比如的时候,他都会兴致勃勃地坐在一旁,说“你把这个改一改,看看怎么样”。他也在通过这种方式加深自己的理解。你能看到一个学者对算法、对状况的理解,完全是由好奇心驱动的。另一点受用至今的,是他强调“理解东西关键理解透”,理解不透就会被骗,理解透了才知方式底层原理是怎么回事。这句话后来也成了我带学生的原则:透彻理解,力求最好。沈向洋院士对我的意义也特别大。我在微软期间,他一直是我的大老板,可以说意义了我整个职业馗:从中国到美国是他招我过去的,从美国回深圳也是他动员我回来的。同时,他在产业方向上也有特别敏锐的判断力,从团队构建到融资,都给了我很多详详见细的提议和经验分享。▎AI科技评比如:听说张钹老师90岁高龄还去你们团队交流?这事我们听着都觉得挺感动的。张磊:是的。去年11月,清华探究生院邀请他到深圳讲课,他上午讲完课,下午就把时间留给了我们团队。花了一整个下午交流,晚上一起吃饭。他视野特别广,对我们的通用视觉理解和机器人方向给了很多提议。虽然年纪大了,但思路特别清楚,逻辑性和对状况理解的深度,可以说一点都不比年轻人差。09每波浪潮都超出想象,但浪潮会自己来找你▎AI科技评比如:最近几年,从深度学习到大模型再到具身和世界模型,每一波浪潮您都深度参与其中。我们想知方式,有没有哪个moment让您觉得“这就是我关键做的”?张磊:物体检测的工作,特别接近你说的这种状态。这个工作让我觉得特别自豪,因为能看到整个领域有了突破性的开展。接下来的世界模型,也是一个让我比较激动、愿意全力投入的方向。过去几十年强化学习与世界模型交替发展的流程,以及语言模型成功的范式,都可以借鉴过来。我认为这个方向会给整个AI行业带来很大意义。▎AI科技评比如:探究者的高光时刻频仍被提及,但低谷似乎很少被说到。您经历过技术低谷吗?张磊:有的。2018年前后,我尝试用弱监督数据做物体检测,只靠图片类别标签就能做检测,避开给每个物体标框。这个方式听上去很吸引人,我花了相当首先一段时间,但一直处理得不够彻底。后来到IDEA做Grounding DINO,把语言理解和检测能力结合,反而从另一个角度把状况处理了。这个突破一部分源自我们在DINO检测模型上的创新给我们打下的坚实的基础,另一部分很大程度上受益于语言模型的发展。Grounding DINO的突破是在2022年底、2023年初,正好是ChatGPT出来的时刻。有一个说法叫“数据足够大的时候,智能就会自然涌现”,数据足够大,算法就可以足够便捷。我认为遇到挫折是正常的,题是得有一个跟很难的状况死磕的狠劲,这一轮做不通,就换个角度,吃饭睡觉都在想,围着它不停地转。真正好的状况,会持续想很多年,然后在某个时刻,可能就自然而然地涌现出质变式的突破。▎AI科技评比如:目前很多年轻人也在做世界模型创业,例如逆矩阵的陈博远、吉嘉铭,白泽科技的白寅岐,他们甚至还是本科生。我们觉得这事挺有意思的,您怎么看这种“后浪”?张磊:这验明正身进入探究的门槛确实减小了。在深度学习崛起之前,新进入者需花几年打基础。目前开源技术把技术简化了,理解Transformer就能进入这个领域。年轻人的好处在于没有包袱,从首先性原理出发更那么点儿接受新范式。但真正难的状况,也需有洞察力、理解力和把控方向能力的前辈探究者。社会热点总在变,但如果只是为追热点而追,反而追不上。本质是:不管方向怎么变,每个团队永远需最能干的人。你只关键保持好学、基础扎实,最前沿的方向会主动来找你。10一个启示这次采访中最触动我们的,不是张磊那些耀眼的技术成就,甚至不是他带过的那批后辈天骄——实习生黄峥、李学龙,以及微软首先代人脸检测算法项目中的团队成员朱珑、肖嵘、颜水成。最触动我们的,是他反复提起的一个词:“理解透”。这个词,张磊记了三十年。1990年代初的清华园,人工智能还是一个冷门到没人在意的学科,张磊还是方式算机系一个在教研室摆弄AGV小车的本科生。当时实验室主任指导博士生做机器人相关的工作,给他留下了深刻的印象,后来他也拜入其门下。那位实验室主任叫张钹,中国人工智能奠基人。每当张磊邀请他一起看实验结荚的时候,他总会兴致勃勃地坐到张磊旁边,盯着屏幕看一会儿,伸出手指:“你把这个改一改,看看怎么样。”不是检查作业,是真的想知方式,你改了参数之后,会发生什么。张钹教给张磊的东西,后来浓缩成三个字:“理解透”。“理解不透就会被骗,理解透了才知方式底层原理是怎么回事。”中国一代科研人的精神就是在这种细微小事上传递下去的。2018年,张磊在微软做弱监督物体检测,做不通,他没有换题。“这一轮做不通,就换个角度,吃饭睡觉都在想,围着它不停地转。”这不是修辞,是他的日常。后来到IDEA做Grounding DINO,他从另一个角度把状况处理了。突破的时刻,是ChatGPT出来的2022年底——语言模型的能力上来了,数据足够大了。张磊用了一个描述:“自然而然地涌现”。从改AGV小车参数到解世界模型,中间隔了三十年。这三十年里他从大规模图像检索到通用视觉理解,对每一个状况都追求彻底理解并做到最好,直到又回到“为机器人建世界模型”这个方向。正如乔布斯所说的“connect the dots”——每一件认真做过的事情,都不会白费。2025年底,90岁的张钹高效到深圳讲课。上午讲完课,下午就扎进视启未来的办公室。七八个年轻人围着他,他讲了一整个下午,晚上一起吃饭,讲自己读书时的事,讲对这个方向的判断。思路清楚,逻辑缜密,一点都不比年轻人差。张磊也给老师讲起了自己正在做的事情。张钹院士在视启未来,张磊给老师讲述探究开展三十年前,清华园里,老师坐在学生旁边说:你把这个改一改,看看怎么样。三十年后,深圳办公室,学生给90岁的老师讲他正在做的世界模型。这是一个何等令人动容的场景重现。人会老去,潮水会退去,热点会冷掉,但中国科研人想关键把一个个世界困难“理解透”的执念,从来没有变过。上车,带你看遍全球 AI 不过会精华可独家畅览:专家演讲PPT大会报告全文热门比如文解读学术新星访谈未经「AI科技评比如」授权,严禁以任何方式在网页、比如坛、社区开展转载!公众号转载请先在「AI科技评比如」后台留言取得授权,转载时需标注来源并插入本公众号名片。
- 最近发表
-
- 9日凌晨瑞典大满贯战报,3-0,3-1,东道主三连败,中国名将晋级|弗里斯|加奇尼|埃里克森_网易订阅
- 华泰柏瑞质量精选混合A净值上涨11.36%_新浪财经_新浪网
- 国泰价值先锋股票C净值上涨3.72%_新浪财经_新浪网
- 工银创新精选一年定开混合C净值上涨4.59%_新浪财经_新浪网
- 队报:费兰和大巴黎已就一份为期5年的合同达成一致|巴塞罗那队|巴黎圣日耳曼|费兰-托雷斯_网易订阅
- 富国互联科技股票型C净值上涨8.97%_新浪财经_新浪网
- 民生加银医药健康股票A净值上涨3.73%_新浪财经_新浪网
- 中银证券精选行业股票A净值上涨8.39%_新浪财经_新浪网
- [流言板]不止中投!Ballislife晒德罗赞高中时期暴扣集锦-NBA新闻-虎扑社区
- 宝盈基础产业混合A净值上涨3.62%_新浪财经_新浪网
- 随机阅读
-
- 卡拉格赞扬曼联今夏的转会策略;太阳报:拉什福德将于本周末回到球队|奥比|利物浦|伊普斯维奇|杰米·卡拉格|马古斯·拉舒福特_网易订阅
- 达诚价值先锋灵活配置C净值上涨4.69%_新浪财经_新浪网
- 银华多元机遇混合净值上涨3.08%_新浪财经_新浪网
- 华安汇宏精选混合C净值上涨6.88%_新浪财经_新浪网
- [JR热议]KSG 4-3 AG选手雷达图出炉,谁是比赛最大的胜负手?-王者荣耀丨KPL-虎扑社区
- 恒越成长精选混合C净值上涨8.72%_新浪财经_新浪网
- 长盛成长精选混合C净值上涨5.25%_新浪财经_新浪网
- 汇添富互联网核心资产六个月持有混合A净值上涨5.50%_新浪财经_新浪网
- 十五五养老金定调:不是高待遇要降,而是增资分配逻辑变了|社保|工龄|养老保险|个人账户_网易订阅
- 易方达医药生物股票C净值上涨3.45%_新浪财经_新浪网
- 博时荣华混合A净值上涨6.44%_新浪财经_新浪网
- 天弘国证消费100指数增强发起C净值上涨4.65%_新浪财经_新浪网
- 陪伴球队战斗到最后一刻|万余名球迷助阵“东北超”常规赛阶段冰城主场收官战|沈阳队_网易订阅
- 国泰成长价值混合C净值上涨4.91%_新浪财经_新浪网
- 恒越成长精选混合A净值上涨8.72%_新浪财经_新浪网
- 长盛优势企业混合C净值上涨4.65%_新浪财经_新浪网
- 四川会理:火把盛会“燃”川滇交界 千年古城迎八方来客
- 达诚成长先锋混合A净值上涨4.30%_新浪财经_新浪网
- 广发兴诚混合C净值上涨6.57%_新浪财经_新浪网
- 永赢宏泽一年定开混合净值上涨6.02%_新浪财经_新浪网
- 搜索
-
- 友情链接
-