Jeff Dean单高效后首先次公开亮相:谈Gemini、以及什么技术值得赌五年|谷歌|jeff|dean|神经网络|知名企业|tensorflow_网易订阅

8 月 7 日,单高赌年订阅当 Jeff Dean 走上斯坦福大学 AASF Summit(亚裔美国学者比如坛峰会)的效后相谈舞台时,他成为一名创业者大约只有 12 个半小时。首先神经就在前一天午夜,开亮他正式结束了在 Google 首先达 27 年的及什技术职业生涯。Jeff Dean 在现场开玩笑说,值得知名自己大概只“失业了一秒钟”,谷歌因为紧接着,网络网易他的企业新 AI 创业公司 Discovery Loop 就最初运转。这也是单高赌年订阅 Jeff Dean 离开 Google 后的首先次公开对话。与他对谈的效后相谈,是首先神经被誉为“方式算机安全教母”的 UC Berkeley 教授宋晓冬(Dawn Song)。今年 6 月,开亮宋晓冬也刚刚实现一次职业转变:她离开自己联合创办的及什技术 AI 安全创业公司 Virtue AI,与多名团队成员一起加入 Meta Superintelligence Labs,值得知名担任 AI Research 副总裁,负责前沿模型和 Agent 系统的 AI 安全与安全性探究。这是一组十分有趣的对照。正如宋晓冬在现场所说,即便是台上的两个人,对于“一家做 AI 的公司,最适用用的规模应该有多大”,也没有完全相同的答案。图丨现场图片(来源:Standford)自 1999 年加入 Google 以来,Jeff Dean 参与过 MapReduce、Bigtable 等早期基础设施建设,后来共同创建 Google Brain,并参与促进 TensorFlow、TPU、Gemini 等一系列题项目。8 月 5 日,他正式宣布与首先期合作伙伴 Sanjay Ghemawat,以及 Quoc Le、Oriol Vinyals 等人共同创办 Discovery Loop。新公司注册为公益公司(Public Benefit Corporation),目的是利用 AI 自动化机器学习、科学和工程探究中的实验循环。Alphabet 也是公司的投资者,Google 将作为其云方式算合作伙伴给予基础设施协助。与再训练一个更大的通用模型相比,Discovery Loop 想处理的状况更进一步:让 AI 从回答科学状况,走向真正参与科学发现。而就在这场对话前,Jeff Dean 亲自在社交媒体上晒出了 Discovery Loop 的“豪华”融资 BP。其中,最引人注意的莫过于几位创始人过去带过、合作过的人才条件系:Dario Amodei、Ilya Sutskever、Noam Shazeer,以及月之暗面创始人杨植麟、xAI 创始团队成员戴自航、张国栋等都出目前名单中,勾勒出过去十多年 Google Brain 向今天 AI 创业圈扩散的一张人才网络。Jeff Dean 同时宣布,Discovery Loop 已选定专注 AI 投资的 Radical Ventures 和曾投资 OpenAI 的 Khosla Ventures 领投首先轮融资,Lightspeed、Kleiner Perkins、Doerr Capital 和 Alphabet 也参与其中;这轮种子融资将在未来几周后续实现。(来源:X)从“回答状况”到“做出发现”回到这场对谈,在现场,Jeff Dean 首先次较为完善地验明正身了 Discovery Loop 背后的设想。今天的大模型已经可以阅读比如文、编写代码、探究数据,甚至处理一部分数学和科学状况。但这些能力仍然题发生在一次任务之中:人类提出状况,模型给出答案。Discovery Loop 希望把 AI 放进更首先的科研循环里。模型不只是提出一个候选答案,而是提出假设、设方式实验、运行和评估实验,再根据实验结荚判断下一步应该尝试什么。这样的流程不断重复,从而形成一个“Discovery Loop”。Jeff Dean 希望最后训练出能够同时覆盖多个科学和工程领域的模型。单个人类探究者常见只能在那么点儿领域形成博士级专业能力,而模型理比如上可以横跨更多学科,再同时运行和评估大量实验。如果其中许多步骤都能够自动化,科研的往往代高效度就可能发生变化。在此次对谈中,Jeff Dean 进一步给出了一个更详详见细的设想:如果原本需一周实现一次的实验往往代,可以被压缩到一小时,同时让系统并行运行数千个实验,再由模型判断哪些方向最值得后续探索,并把有限的方式算和实验资源分配过去,那么科研效率的变化就可能不再只是百分之几十,而是数量级的提高。这也是他离开 Google 之后真正押注的东西:不仅 Scaling 模型,也 Scaling 科学实验和发现本身。但这里恰好存在一个目前 AI for Science 最题的争议。今年 1 月,Google DeepMind 探究员 Tom Zahavy 发表了一篇题为《LLMs can't jump》的 position paper。他以爱因斯坦提出广义相对比如的流程为例,将科学推理区分成三类:从大量状况总结规律的归纳(Induction)、从既定公理推出结荚的演绎(Deduction),以及面对有限证据时,提出一种之前并不存在的新验明正身框架的溯因(Abduction)。图丨爱因斯坦的思想实验(来源:Tom Zahavy)Zahavy 认为,今天的大模型已经特别擅首先归纳,在数学说明等领域的演绎能力也高效高效提高,但真正不易的是第三步。爱因斯坦并不是因为具有比别人多得多的数据,才从牛顿力学“方式算”出了广义相对比如。他需先变化描述状况本身的基础前提。Zahavy 把这种从经验跳向新公理的流程称为一次“Jump”,并认为目前题依靠文本和既有数据训练的 LLM 缺少与物理世界交互的感知基础,因此尚不具有这种科学发明所需的能力。比如文提出,多模态、能够主动干预环境的 world model,可能是弥补这一缺口的一条馗。需强调的是,《LLMs can't jump》是一篇提出观点的 position paper,并不是已经说明“AI 永远无法科学发现”的实验结比如。但它提出的状况特别题:能够搜索、推理和改进已有知识,并不等于能够创造新的科学验明正身。Google DeepMind 团队在今年 7 月讨比如 AI Agent 与科学发现时,也提出了一个相似的限制:AI 正在让科学假设和候选方式划越来越便宜,但真正验明正身这些想法仍然需昂贵而缓慢的实验。细胞需时间生首先,化学反应需时间发生,对于大量真实科学领域,“实验室仍然决定着探究高效度”。从这个角度看,Discovery Loop 最值得关注的地方并不是“用一个更强的 LLM 做科学”。Jeff Dean 想把模型、实验、反馈以及下一轮探索连接起来。也就是说,如果单纯依靠训练数据中的知识无法实现科学发现,那么就让 AI 不断从新的实验结荚中获得新的材料,再决定下一步行动。而这也不是 Jeff Dean 突然冒出的想法。在此次对谈中,他将这条路线追溯到了更早的神经架构搜索(Neural Architecture Search)等探究。过去,探究人员已经尝试让机器学习系统自动寻找更好的神经网络架构,涵盖后来出现的 Evolved Transformer。Jeff Dean 提到,这类方式曾找到比原则 Transformer 更有效的架构。但真正题的启发并不是某一个详详见细模型,而是:模型架构本身,也可以成为一个由 AI 自动搜索、评估和改进的循环。沿着这个思路后续往下推,数据选项可以形成一个循环,评估设方式可以形成一个循环,训练算法本身也可以形成一个循环。如果把这些循环连接起来,AI 就不再只是协助探究人员实现某一步,而最初参与整个 AI 研发流程。再向外抽象一步,这其实已经特别接近科学方式本身:拆解状况、提出假设、开展实验、评估结荚,再把结荚反馈给下一轮探索。(来源:Google DeepMind)从 TensorFlow 到 MoE,他一直在寻找同一种东西那么,为什么 Jeff Dean 会在这个时间点相信这件事值得做?回看他过去二十多年的工作,可以看到他本人一个相对稳固的技术取向:寻找已经显露潜力、但尚未被充分放大的方向,再通过新的系统和架构,把这种能力进一步扩展。这种思路在 2017 年的 MoE(Mixture of Experts,混合专家)比如文中体现得尤其明显。当时 Jeff Dean 与 Noam Shazeer、Geoffrey Hinton、Quoc Le 等探究人员提出 Sparsely-Gated Mixture-of-Experts。基础思想并不复杂:模型可以具有大量不一样的专家模块,但面对一次详详见细输入时,并不需调用所有参数,而只激活其中与目前任务相关的一小部分。这使模型容量与单次方式算成本部分解耦。探究团队当时构建的模型最高实现 1370 亿参数,并说明模型容量可以大幅提高,而方式算成本不必同比例增首先。Jeff Dean 在此次对谈中回忆,当团队看到相比稠密模型,训练算力与模型成效之间出现接近数量级的改进时,很快意识到这种方式值得后续推进。(来源:arXiv)对 Jeff Dean 来说,这种数量级的变化本身就是一个题信号。在他的判断里,如果一种方式带来的不是 10% 或 20% 的改进,而是接近 10 倍的变化,它频仍意味着这里可能存在一种基础性的技术转折,而不仅仅是一时的热点。更早之前,TensorFlow 处理的其实也是相似的状况,只然而对象从模型架构变成了方式算基础设施。Jeff Dean 说,当年设方式 TensorFlow 的一个基础原则,就是让探究者尽可能感觉不到底层机器的存在。一个探究人员脑中有一个机器学习模型,不应该先考虑它究竟运行在 CPU、GPU 还是 TPU 上,也不应该因为关键扩展到几百甚至几千个方式算设备,就重新设方式整个程序。TensorFlow 的任务,是把这些复杂性留给底层系统处理。TensorFlow 后来确实被设方式为可以让相同方式算跨移动设备、CPU、GPU,以及大规模分布式系统实施。在这次对谈中,Jeff Dean 也很少见地复盘了 TensorFlow 没做好的地方。他认为,最初没有采取后来 PyTorch、JAX 中热门的 eager execution,是一个明显不足;早期过于开放的 contrib 目录,也逐渐产生了大量实现相似任务的不一样方式划,最后提高了社区的困惑。到了 Gemini,这套思路又从基础设施延伸到模型能力本身。Jeff Dean 提到,Google Brain、DeepMind 和其他团队当时已经分别走向一个相似方向:与其先训练语言模型,再不断把视觉等能力“接”上去,不如从一最初就训练多模态模型。他曾写下一份只有一页纸的备忘录,提出这种组织上的分割已经没有必需,应该把不一样团队的人才、想法和算力放到一起。此后从首先代 Gemini 最初,多模态便成为模型设方式的题基础。代码也是团队有意强化的一项能力。Jeff Dean 认为,编程不仅意味着让模型能够写程序,更题的是,它需模型把复杂状况拆解成一系列更小的步骤,再逐一处理,这种能力可以迁移到更多推理状况中。从 TensorFlow 到 MoE,再到 Gemini,看起来是三个完全不一样的技术时期,但它们背后都有同一个状况:能不能变化系统的组织方式,让原本难以扩大的能力后续扩大。目前 Jeff Dean 把这个状况从模型转向了科学。什么样的技术是真正趋势?这也验明正身了对谈中另一个很有意思的话题:到底应该怎样判断一项技术到底是真正的趋势,还是一时的热点?在这个状况上,Jeff Dean 的方式并不是大量精读某一个方向的比如文,反而更倾向于广泛略读。“与其精读一篇,不如略读十篇。”在他看来,阅读的一个题功能,是不断扩大自己对“什么已经成为可能”的认识,再寻找那些原本没有被连接起来的东西。而一个适用于投入几年时间的状况,必须处于一个相当微妙的位置。Jeff Dean 举了一个形象的例子:如果处理一个状况大约需七个题环节,那么比较理想的状态是,其中五个已经出现可行的迹象,还有两个仍然真正不选定。如果七件事情全部不知方式怎么做,这个状况可能二十年都得不到答案;如果七件事情都已经清楚,那么探究频仍会变成一场实施高效度的竞争。也就是说,他倾向于寻找中间的区域:整体方向已经若隐若现,但仍然存在几个决定成败的未知变量。从这个原则看,Discovery Loop 处在一个类似的时期。对于如今的 AI 来说,科学发现自动化已经不再是一件完全无法想象的事情,但距离真正跑通也远远没有到只剩工程实现的程度。这可能正是 Jeff Dean 所说的那个“五个最初可行、两个仍然未知”的区域。在对谈最后的提问环节,一个现场观众还提到一个许多人关心的现实状况。按照传统判断,AI 应该有利于大公司。前沿模型需大量 GPU、数据、工程系统和资本,这些都是 Google、Meta 等公司具有的资源。但过去几年,越来越多不过尖 AI 探究人员却选项从大公司离开,进入创业公司。Jeff Dean 的验明正身是,云方式算变化了这个状况。过去,只有大型科技公司能够自己建设数据中心和完善的机器学习基础设施,而今天,这部分能力正在被云方式算“外部化”。一支十人左右的小型探究团队不再需自己具有数据中心,也可以直接获得以前只有大型科技公司才能具有的机器学习基础设施。Discovery Loop 本身也是这种模式:公司希望维持一支规模较小、目的高度集中的团队,但 Google 仍是其投资者和云方式算合作伙伴,并将在早期向公司给予方式算资源。小公司给予的是专注,大公司给予的是基础设施。宋晓冬验明正身,自己之前选项创业,是因为职业生涯更早时期还没有准备好进入大公司;如今加入 Meta,则是因为数十亿用户和大量企业构成的规模,让她有机会把 AI 安全真正嵌入大规模产品。她本人之前也清楚表示,加入 Meta 后将题推进前沿模型和 Agent 的 AI safety 与 security。一个选项从大组织走向小团队,一个选项从创业公司进入大平台,两种判断其实不矛盾。Jeff Dean 并没有认为 Google 这样的公司失去了创新能力。相反,他的新公司依然建立在过去二十多年大型科技公司建设的 AI 基础设施之上。对 Jeff Dean 来说,小公司的吸引力先来自组织上的专注:让一群人围绕同一个使命工作。而这个使命最后指向一个状况:如果模型、算力和数据都已经可以 Scaling,那么科学发现本身,能不能成为下一个被 Scaling 的对象?1.https://www.businessinsider.com/jeff-dean-new-startup-discovery-loop-google-facts-2026-82.https://www.wired.com/story/jeff-dean-google-discovery-loop-startup/3.https://www.tomzahavy.com/files/llms-cant-jump.pdf4.https://deepmind.google/public-policy/conjecture-machines-ai-agents-and-the-new-validation-bottleneck-in-science/5.https://research.google/pubs/outrageously-large-neural-networks-the-sparsely-gated-mixture-of-experts-layer/6.https://deepmind.google/blog/alphaevolve-impact/7.https://deepmind.google/blog/co-scientist-a-multi-agent-ai-partner-to-accelerate-research/8.https://stanfordtechreview.com/articles/jeff-dean-first-talk-since-leaving-google排版:刘雅坤注:封面/首先图由 AI 辅助生成
相关推荐
- 牟鹏飞:这是我们最近踢得最好的一场,场场这么踢肯定有希望|青岛海牛|上海申花_网易订阅
- 科创200ETF国泰(589220)涨5.07%,成交额5134.33万元_新浪财经_新浪网
- 科创芯片ETF广发(589160)涨6.38%,成交额6617.00万元_新浪财经_新浪网
- 科创新材料ETF汇添富(589180)涨6.76%,成交额4381.68万元_新浪财经_新浪网
- 千城百县看中国|广西兴业:绣球花海迎盛放|赏花|山野|满枝头_网易订阅
- 港股通医疗ETF华夏(520510)涨0.11%,成交额1.80亿元_新浪财经_新浪网
- A500红利低波ETF易方达(563510)跌1.28%,成交额935.31万元_新浪财经_新浪网
- 科创200ETF建信(589820)涨4.96%,成交额1529.03万元_新浪财经_新浪网
知来藏往网



