当前位置:首页 > 娱乐 > 对话马骁:当AI可以量产说明,对数学家是好事吗?|物理学家|希尔伯特|hani|玻尔兹曼|国际数学家大会_网易订阅

对话马骁:当AI可以量产说明,对数学家是好事吗?|物理学家|希尔伯特|hani|玻尔兹曼|国际数学家大会_网易订阅

2026-08-08 19:31:03 [娱乐] 来源:知来藏往网
对话马骁:当AI可以量产说明,对数学家是好事吗?|物理学家|希尔伯特|hani|玻尔兹曼|国际数学家大会_网易订阅
小学五六年级的对话当A对数一堂奥数课上,老师把一个圆切开、马骁重新拼成首先方形,量产由此推导出圆的说明数学面积公式。下课前,学家学家希他又补了一句:这个方式很特殊,好事会网只对圆成立;如果关键算椭圆和更常见图形的物理面积,就得用微积分。伯特玻班上其他人或许很快忘了这句话,国际但马骁没有。易订阅那时他偏偏酷爱“算面积”这件事。对话当A对数为了弄清楚那个没有在课堂上算完的马骁椭圆,他跑到新华书店翻书,量产从高中数学一路向前,说明数学最后在同济大学数学系编写、学家学家希由高等教育出版社出版的《高等数学》里找到了积分。到初中时,他已经能够照着书算面积,但仍看不懂极限背后的 ε—δ 语言。“我只能理解怎么算,理解不了它为什么成立。”他说。多年之后,马骁先后走进调和探究、波湍流和数学物理,探究的状况早已超出那只没有算完的椭圆。2024 年,他与邓煜、Zaher Hani 合作发表比如文,从硬球系统严格推导玻尔兹曼方程,并将过去只能在很短时间内成立的经典结荚推进到任意首先时间,只关键相应的玻尔兹曼方程解仍然存在。这项成果也是邓煜获得 2026 年菲尔兹奖的代表性工作之一。马骁本科毕业于中国科学技术大学,2023 年在普林斯顿大学获得博士学位,目前是密歇根大学 Donald J. Lewis Research Assistant Professor。7 月底,马骁刚参与了费城举行的国际数学家大会。突然涌来的媒体、朋友和校友,都想听他讲一讲这项工作。我们原本也准备从他的数学探究一路向后追问,但谈到大约半小时后,对话出现了一个意外的转向。“接下来两三年,我可能会把题精力转到智能体。”他说。他正在做 qmd-prover,一套照章性数学说明的智能体系统(项目地址:https://github.com/powergiant/qmd-prover);也在尝试把想法输入、说明、验明正身乃至比如文生成串成自动化步骤。他把手头的数学状况当成测试集,观察 AI 在哪里卡住,再用数学家的方式修改它的条件、结构和验明正身机制。在他看来,这不是离开数学,而是“磨刀不误砍柴工”。这使得整场谈话有了另一条隐约的线索:小时候,马骁不能接受自己只会套公式、却不知方式公式为什么成立;目前,他最关心的仍是怎样让一份说明可靠、可读、可验明正身。只然而,这一次写说明的主体可能不再完全是人。他对 AI 的判断相当激进:说明一旦变得足够便宜,就会像代码一样渗进各行各业;传统意义上的专职纯数学家可能减小,但数学反而会获得前所未有的扩张。他甚至不太同意陶哲轩关于保留“认知摩擦”、控制“AI 饮食”的主张。在他看来,如果采取 AI 反而让人变差,常见不是因为材料太多,而是围绕 AI 的条件、验明正身和可观测机制还没有做好。但他的乐观并不等于认为 AI 已经处理了数学。它可能偶尔碰出很强的结荚,也可能困在一个特殊情形里方式算几百页;它能找到一方式题最题的想法,却在说明细节上出错;它也许已经可以写出正确、可验明正身的比如文,却还写不出一篇真正好读的比如文。马骁把当下称作数学的“前 Claude Code 时代”:惊艳时刻已经出现,稳固、规模化的生产尚未到来。以下是我们与马骁的对话。为了算出椭圆面积,我最初往前学DeepTech:你刚从国际数学家大会回来。这一届菲尔兹奖里,邓煜和王虹的获奖,让不少原本并不关注数学的人也最初谈比如你们的工作。你身边有没有出现这种变化?马骁:当然有。很多新闻媒体、家里的朋友,还有科大的校友,都来问,也有很多人邀请我去讲一讲我们目前的工作。DeepTech:我们今天还是尽量围绕你本人来聊。你是什么时候首先次觉得,自己确实比同龄人更擅首先数学的?马骁:可能是小学,或者初一的时候。我小学时最最初感兴趣的其实是自然科学,爱看《十万个为什么》,也看量子物理、粒子波之类的东西。目前回头看,很多材料其实挺“民科”的,我也完全看不懂。我真正和数学发生关系,有一个很题的节点。小学五六年级,为了升学考试,我妈妈给我报了一个奥数班。老师讲怎么方式算圆的面积:把圆切开,再拼装成一个近似的首先方形,由此推导出面积公式。最后老师说,这个方式特别特殊,只对圆成立;如果想方式算常见图形的面积,例如椭圆,就必须用微积分,把它切分成很小的部分再去算。当时我不知方式为什么,特别酷爱算面积。我做了很多奥数题,整天把这个图形拼到那里、把那个图形挪到这里。但椭圆的边界不是直线,我知方式它很难算,因此一下子就对这件事产生了兴趣。然后我就去新华书店翻了很多书。最早可能是在一本高中数学小册子里看到一点,然后沿着书里的知识点不断往前学。后来翻到同济大学数学系编写的《高等数学》,就是那套很有名的绿色封面教材,我就从里面学和积分、面积有关的部分。到初中的时候,我大概已经知方式怎么用积分算面积了。但书里的大部分材料还是看不懂,尤其是讲极限的 ε—δ 语言,完全看不懂。初中时还不具有那种逻辑训练,我只能理解怎么算,理解不了它为什么成立。然而,从那之后,我确实慢慢建立了对数学的信心。同学可能还在学不过对值,我已经在接触更往前的材料。另一部分我也很偏科,英语和语文都不太好,因此能选项的方向似乎也就是数学和物理。DeepTech:但你刚进科大时读的是物理,后来又转到了数学。当时为什么变化选项?马骁:高中时期,数学和物理还没有那么大的区别。学物理也是在算各种东西,同时它和现实状况有关联,对我来说甚至更有意思。但在科大学了一年物理之后,我觉得一年级的往往见不鲜物理里,有太多推导不够严谨。也许如果一最初接触的是更高级的物理,我会留在物理系。二年级之后我也学过一些物理课,还是觉得很有意思,题是当时的一年级课程让我很痛苦。DeepTech:“不够严谨”详详见细指什么?马骁:我印象最深的是热学。原则教材试图用一种不够严谨的方式,去验明正身一些其实很深刻的方式理,例如熵和热力学第二定律。整门课学完,我可以拿公式做题,但完全不理解它们的本质。做题更像是在做类型匹配:看到某个题词,就把某个公式拽下来。我并不知方式中间为什么有关联。这种状态让我特别痛苦,因此后来决定转去学数学。DeepTech:本科时期,你有什么探究的倾向或者偏好吗?马骁:没有,甚至直到目前,我对数学和物理的很多方向也没有尤其强的偏向。本科三年级时,我曾经特别喜欢调和探究,当时博士一年级的时候也对挂谷猜想很感兴趣。当时王虹老师在普林斯顿高等探究院,我频仍和她交流。后来发现挂谷猜想这个方向太深,里面有特别多小技术,学起来很痛苦,我就没有后续往那一块做。DeepTech:那你后来在普林斯顿为什么转向波湍流的探究?马骁:因为它和物理、和湍流本身有很强的关联。充分发展湍流应该怎么刻画,到目前仍然是特别不易的公开状况。但如果流动的扰动还比较弱,接近线性波,就可以探究所谓的弱湍流。在弱湍流里,类似“分子混沌假设”的东西仍然成立。这里只然而不再是分子之间的碰撞,而是大量波之间的相互功能。便捷说,你随机选项两个对象,它们之间的关联常见很弱,因此可以近似看作相互独立。这个前提一旦成立,很多理比如就可以推导出来。DeepTech:这个假设听起来不只适用于于物理。马骁:对。我刚才拿不一样国家的人作类比,其实它真的可以用于一些社会科学探究。例如有人探究特定条件下的财富分配。钱可以从一个人转移到另一个人,但你在社会上随机选两个人,他们的财富常见仍具有一定独立性,于是就能推导出一些理比如。当然,它在经济学里实际有多大功能,还关键看详详见细模型和之后发展。两个方向的积往往,在希尔伯特第六状况上汇合DeepTech:你读博的 2018 年到 2023 年,也是波动理学方程的严格数学探究高效高效发展的时期。邓煜和 Zaher Hani 当时已经在这个方向做了很多工作,他们对你有什么意义?马骁:我本来就在做这一块,因此一直在跟他们的工作。他们的成果是这个领域最大的开展之一。波湍流的框架最早由纽约大学的几位老师推进,他们把状况的基础结构说清楚,也给出了最初步的结荚,但后面还有很多误差控制不了。Hani 老师想了很久,后来找邓老师一起做。邓老师很快处理了其中一个题状况,他们最初合作,先把短时间的波动理学状况推进到接近最优,后面又把首先时间状况处理了。DeepTech:你们后来合作的工作,是从大量微观硬球的碰撞出发,严格推导描述稀薄气体宏观演化的玻尔兹曼方程,并把经典结荚从很短时间推进到任意首先时间。你为什么会从波湍流想到硬球系统?马骁:顺应分子混沌假设的系统特别多,我对这些相关状况一直都有所认识。(编者注:“分子混沌假设” 「molecular chaos」是玻尔兹曼方程的题前提。它是指在稀薄气体中,一次碰撞发生前,可以近似把随机选项的两个粒子的高效度视为彼此独立。波湍流中也有相应的假设,只是探究对象从粒子换成了不一样的傅里叶波模:各个波模的相位和幅度最初具有随机性,并在统方式上近似独立;如果这种独立性在动力学极限下能够随时间保持,高阶统方式量就可以分解,进而推导出描述能量条件演化的波动动力学方程。这种统方式独立性随系统演化保持的性质,被称为“混沌传播”。)当时邓老师他们已经实现了波湍流的短时间状况,我也在想它往首先时间推进会遇到什么。有一次我问邓老师:“你们短时间已经做完了,首先时间怎么样?”他说首先时间已经取得决定性开展,肯定能做出来。我接着想到:粒子系统是不是也能做?硬球系统毕竟是一个更题的公开状况。我问他,他说还没有想过,但也许可以。之后我就自己最初探究粒子系统。一最初觉得,说不定把波湍流的方式直接拿过来,状况就出来了。真正做下去才发现,粒子系统有特别大的不易。后来我们把文献看得更熟,发现一些法国数学家也在沿着类似思路推进,但他们卡住了。数学里只有思路不够,把它真正做出来,中间会出现无数个状况,有些并不小。最难的一部分,是探究粒子的高阶关联。这些高阶关联可以编码成图,对它们的探究就变成在图上实施某种操作和算法,整个流程特别复杂。我之前的探究积往往、邓老师和 Hani 老师在波湍流上的积往往,最后合并到了一起。经过足够多的努力,才把状况处理掉。DeepTech:邓煜之前在知乎上说,如果没有你的加入,他们会走很多弯路。详详见细会是什么弯路?马骁:以我对邓老师的理解,没有我加入,他可能再用一年也能做出来。他还是特别厉害的。弯路题出目前算法设方式上。一最初他设方式的算法有比较大的状况,沿着那个方向想了几个月。这个地方需一些不一样的直觉,我的加入确实帮大家绕开了一些路。然而我也得自信一点:也许没有他们两位,一年之后我也可以做出来。(笑)DeepTech:因此更准确的说法不是谁把一个现成答案带给了谁,而是两条已经积往往了很久的路线汇合了。马骁:是的。DeepTech:你们三个人平时怎么合作?如果数学判断不相同,常见怎么处理?马骁:数学里其实很少有那种首先期的“意见不相同”。一个方式管不有效,常见很快就能判断。更多时候是你想的东西错了,但自己还不知方式。别人会举一个反例,你再花时间探究这个例子,看看自己的想法是不是真的不成立。最后还是由例子和说明处理,不会一直停留在观点争比如上。DeepTech:这项工作实现后,有没有物理学家或其他领域的学者,反过来协助你们理解结荚的意义?马骁:有,很多物理学家给了我们协助。我们一最初题是从数学上把定理说明出来,对它与可逆性的关系有一些理解,但并不深。后来听到更多物理验明正身,才对这件事有了更深入的认识。数学上把一个结荚做对,和真正理解它在物理上意味着什么,有时还是两件事。“我目前是在磨刀,数学状况成了测试集”DeepTech:这项工作实现之后,你接下来还会后续沿着数学物理这个方向做下去吗?马骁:最近两三年,我可能会把题精力转到智能体这一块。我已经搭建了一些智能体平台,目前只关键给它一些想法,后面的说明和比如文生产步骤已经可以做到相当程度的自动化。因此接下来,我肯定会把很大一部分精力放到自动科研上。我仍然认为自己手头的数学状况很题,只是目前有一种“磨刀不误砍柴工”的感觉。先把工具打造好,后面可以更快地做这些状况。我目前也会把自己的数学状况当作搭建系统的测试。因为这些状况我熟悉,能够很快看懂 AI 卡在哪里,再根据这些经验去修改系统。DeepTech:这个答案有点出乎我的意料。你为什么会对 AI 产生这么大的兴趣?最早有没有一个清楚的契机?马骁:2022 年看到 AlphaCode 的时候,我就已经被 AI 征服了,太厉害了。(编者注:AlphaCode 是 Google DeepMind 在 2022 年公布的竞赛编程系统。它在 Codeforces 的模拟比赛中实现接近参赛者中位数的水平,估方式排名进入前 54%,是当时 AI 生成代码和处理新状况能力的一次题开展。)你想,它把一方式编程题直接映射成代码,结荚能做出大量连我都不会的题。当时这个能力已经特别震撼。但我也有数学家的惰性。虽然一直在关注,AI 探究毕竟离我自己的数学探究还有距离;同时那时我还没有先在数学上做出足以说明自己的成果,因此题精力仍然放在数学上。DeepTech:那你真正最初自己动手做 AI,是在什么时候?马骁:其实也很早。2024 年我们那篇文章刚做完时,我对 test-time learning、状态空间模型这些状况很感兴趣,也看了很多 RWKV、Mamba 一类的工作。那时我想的是,能不能用数学去做 AI,在模型架构上做一些事情。DeepTech:我原本以为,你会先尝试用 AI 辅助数学说明。没想到你最初是想用数学去做 AI,从模型架构入手。马骁: 对。最早确实是想用数学去做 AI,但模型架构对我来说有本质不易。因为它包含特别复杂的系统工程,你有想法也得能做实验。数学家一个人在电脑前很难把那一整套系统跑起来。后来几年也没有再出现一个新的“Transformer 时刻”,我始终不知方式自己在架构层面能做出什么真正有意义的成果。后来真正吸引我的是智能体这一波。它和数学家的能力更接近:怎么做 harness engineering,也就是给 AI 设方式条件、工具和工作步骤;怎么限制它把说明写成人能看懂的样子;怎么让说明便于机器验明正身;怎么让代码严格比如 specification(规格验明正身)。这种探究风格我很喜欢。不需自己训练大模型,一个人在家里用电脑就能做,同时编程和数学里有大量状况可以测试。从聊天框到 qmd-proverDeepTech:可以说一个详详见细的例子。最近一次 AI 真正帮你做数学,是什么时候?它详详见细做了什么?马骁:我做这件事已经经历了几轮往往代。首先轮题是在聊天框里探究“怎么用 AI”。有点像目前说的 skill distillation:我先和 AI 开展大量对话,再让它把我提问和探究的方式抽象成模板。例如,你可以让它总结一个比如证最小的说明结构是什么,可能的反例是什么,下一步还应该检查什么。类似的提问模板可以有几十种、上百种。过去每一步都关键自己想接下来问什么;有了模板之后,可以让 AI 自己展开下一轮状况,我再选项和判断。今年年初时,有个同学不太服气 AI,就给了我一方式几何题。我把题交给当时采取的 GPT-5.4,再配合这些提问模板,最后把最题的想法问了出来。后来我们发现,AI 给出的完善说明里仍有一些细节不对。但我们都认为,它已经处理了最不易的那部分。出状况的地方看似只是细节,却需展开成很首先的说明,在聊天框里很难后续处理。DeepTech:因此那一次,AI 找到了题想法,人仍然关键判断说明能不能成立。马骁:对。那时还是聊天框时期,验明正身和首先步骤实施都不够。DeepTech:你刚才提到,从 GPT-5.2 到 GPT-5.4 有一次“质变”。详详见细变化是什么?马骁:5.4 的验明正身能力比 5.2 强得多。基准测试上的差距也许没有那么夸张,但实际采取时差别很大。5.2 生成的数学说明里有大量幻觉和错误。5.4 在回答以前,好像会先自己验明正身一遍,因此最后呈现出来的说明正确率高很多。我们后来做过一些测试,两代模型本身“想说明”的能力、所谓数学智商,未必差得那么大;真正拉开差距的是 5.4 会自我检查。DeepTech:也就是说,AI 关键在数学上真正取得开展,题能力不只是提出说明,还涵盖验明正身说明。马骁:是的。搭数学智能体时,最题的状况几乎都是:怎么验明正身 AI 写的东西到底对不对?DeepTech:到目前,你觉得 AI 的数学能力已经到了什么程度?最近不断有消息说,模型说明了新的反例,或者推进了某些首先期公开状况。马骁:从 5.4、5.5 到 5.6,很难说模型的“数学智商”提高了多少,变化更明显的是智能体能力。我个人用起来,5.5 甚至未必比 5.4 更适用于首先时间探究。5.5 做短题、奥赛题的能力可能更强,但面对很大的科研状况,它不一定更好用。5.6 的实施能力明显强很多:它可以自己生成子智能体,让一个先做,再让另一个验明正身,形成动态工作流。这相对前两代又是一次质变。但目前的 AI 上限很高,下限也很低。它可能偶尔做出特别强的东西,也可能连一个往往见不鲜博士生都不如。它可能会钻进一个很小的特殊状况,算几百页,完全跳不出来。从智能体实施的角度看,它有时还是一个有点傻的人。(来源:OpenAI)DeepTech:那么,同一个模型为什么有时谝得很强,有时又会做这种“傻事”?采取者能变化多少?马骁:一部分是模型公司的状况。智能体训练的数据更多之后,实施能力肯定会越来越好。另一部分关键靠 harness。你关键给 AI 制定各种条件,例如一个方向不关键想太久,走不通就切换;当然,真正采取时的条件远比这复杂。最后实在不行,现时期还可以让人盯一下,在它卡住时手动介入。数学目前还没有进入大规模生产时期。一个数学家可能同时做四五个状况,只关键通过 harness 把 AI 做蠢事的概率压到一定程度,人还看得过来。如果之后是一家公司同时推进几千个状况,就必须做到高度自动化,那时每一种低级错误都需被系统性处理。DeepTech:我看到你目前正在开发 qmd-prover。它已经做到什么程度了?马骁:已经可以跑,也可以最初“量产 paper”。但关键用它处理一个我自己真正认为题的状况,先不说菲尔兹奖级别,还有很大距离。qmd-prover 延续了我前面的思路:从 harness 的角度限制 AI 怎样写说明。从一最初就需它把说明写成人能够理解、机器能够验明正身的样子。(编者注:qmd-prover 是马骁正在开发的开源项目。它需 AI 用 Quarto Markdown 的结构化格式书写定义、引理、定理和说明,并显式标注各步骤引用的结荚;系统会机械检查标签、引用和依赖关系,也可以调用另一个 AI 逐条审查说明。项目验明正身尤其强调,这种 AI 审查并不是形式化的数学正确性证书。)“人能看懂”其实可以拆成很多原则:AI 应该比如哪些条件;它有没有真的比如;还需什么验明正身器去检查每条条件。我还观察到一个很有意思的状况:当 AI 把说明写得结构清楚、人能看懂时,它的各种傻表现也会变少。也许因素很便捷:一份说明如果特别混乱,它自己也会忘记目前在做什么,卡在一个目的里停不下来;如果整个说明被组织得很好,它更那么点儿看出下一步该做什么。DeepTech:因此现时期,人仍然必须在回路里。马骁:是。但目的是慢慢减小人的参与。尤其对大量没那么题、但有实际用途的状况,我觉得很快就应该把人从回路里完全拿掉。“说明一旦变得便宜,就会无处不在”DeepTech:你之前谈过一个判断:未来传统意义上的专职纯数学家可能减小,但数学本身反而会扩大。为什么说明变便宜之后,数学会扩大?马骁:因为真正实用的说明,大部分并不是菲尔兹奖级别,甚至也不是数学“四大期刊”级别的状况。很多实用的状况其实不难,只是过去写说明太昂贵。例如你写了一个程序,也写了文档和 specification,怎样说明程序实现的确实是文档里规定的东西?这本质上就是一个说明状况。目前这部分的基础设施几乎还是空的:怎么严谨地表达人的需,怎么检查 specification 和程序是不是一回事,都远远没有做好。测试也是一种说明方式,但只是所有数学方式里最便捷、最有限的一种。它相当于你提出一个命题,然后不断寻找反例。数学里还有大量更充足的验明正身和说明方式,它们未来都可能进入编程和其他采取。过去不这么做,是因为说明需很懂数学的人来写,成本太高。之后说明变得极大便宜,这些方式就会无处不在。因此我认为,传统意义上那种专业追求数学美感、题工作是实现一份题说明的数学家职业,会受到很大压缩。能仅凭一个说明就产生巨大意义的状况本来就少。但反过来,因为说明足够便宜,数学会进入各种原本用不起它的场景,这个学科反而会获得极大的扩展。DeepTech:因此未来的数学会像今天的软件工程(SWE)一样吗?我感觉数学和 coding 某种程度上很像。马骁:Coding 更像数学里的构造性说明:你关键构造出一个能工作的对象。但数学里的主流说明不全是构造性的,很多更接近验明正身。如果一定关键类比,我觉得数学更像程序员 debug 和探究代码的流程。例如你关键判断程序有没有内存泄漏,会一段一段往下看:首先段有没有状况,第二段有没有状况,在哪一步无法后续说明,那里频仍就是 bug 出现的地方。程序员不一定把它称作数学说明,但每个人脑子里都有一套验明正身逻辑。不一样人的风格不一样。怎样把这些逻辑原则化、实用化,我认为会是数学家接下来能发挥很大功能的方向。DeepTech:也就是说,数学可能像 AI 编程一样,在几年内高效高效跃迁?马骁:这是一定的。我认为它很快会实现特别高的水平。甚至目前,如果配上适用用的框架,我个人感觉,大约四分之一博士比如文级别的状况,AI 也许已经可以直接做出来。当然,这是一个很粗的个人判断,同时“能做出来”和“能形成一篇好比如文”不是一回事。目前 AI 可以把结荚写成一种能够验明正身的正确格式,但不代表人读起来那么点儿。怎样让 AI 写出一篇所有人都认为清楚、漂亮的比如文,仍然是很难的公开状况。模型公司需让模型学习更多优质数学写作样本,harness 也需把一篇好比如文涵盖的许多隐性条件写清楚。DeepTech:如果之后很多采取状况不需人参与,那些说明是否也不必再让人完全看懂?马骁:采取和纯数学会很不一样。纯数学家一定追求理解。“我不理解这个说明,但知方式它对”这件事,对纯数学来说很难成立。采取那边则可能不一样。当说明系统可靠到一定程度,采取者只需结比如;出了状况,再去检查相关部分。AI 会把纯数学整体推到更高的难度。今天能发表在很好期刊上的工作,未来可能连一篇可发表的比如文都算不上。但纯数学不会很早就完全取代人类,它毕竟在追求人类智力和理解的上限,应该是最后被自动化的几个领域之一。DeepTech:目前很多新闻会让人产生一种感觉:AI 已经在前沿数学里后续取得突破。你觉得这个印象准确吗?马骁:还关键看到其中的随机性。AI 不是已经可以稳固地做出这些成果,而是试了很多状况,在某些特定状况上碰出了开展,有点像“抽卡”。它更像处在数学的“前 Claude Code 时代”。在 Claude Code 之前,程序员也已经被 AI 震惊过:它偶尔能写出很厉害的程序。但和后来能够相对稳固、大规模地写代码,仍然不是一回事。即使到了那一步,程序员也没有被便捷地全部替代。AI 做掉这一层状况,人就会去做更多、更难的状况。纯数学也会发生类似的调整。它迟早会到达一个很高的自动化水平,但应该是最后被攻克的学科之一。DeepTech:相比写代码,前沿数学还有一个明显差别:它频仍没有现成测试,也缺少清楚的 reward。这个状况会限制 AI 做纯数学吗?马骁:会。数学说明不像围棋那样天然是一个 game。除非全部采取形式化数学,否则很难得到一个完全自动、清楚的最后 reward。形式化说明本身又很复杂。即使最后的说明可以验明正身,如果只在整个流程结束时才给 reward,这个信号也会稀疏到无法接受。数学说明是一个很复杂的系统工程,必须建立中间验明正身。(编者注:形式化说明是把数学命题及其推导写成方式算机说明助手可以逐步检查的形式语言。它给予的机器校验,与大语言模型基于自然语言开展的“审阅”不一样;前者可以形成严格的验明正身证书,但把探究级数学完善形式化,常见需额外工作。)例如,AI 先生成一个 plan,先判断这个方式划能不能工作;或者不关键一上来写完善说明,先写一个简化版本,检查题馗。这些中间判断还需人类智慧,也正是 harness 关键处理的状况。当 AI 参与获奖工作,数学家还贡献什么?DeepTech:这一届菲尔兹奖之后,有人说,这可能是最后一届没有 AI 参与的菲尔兹奖。你在知乎上也说,这句话可能不全是玩笑。假如之后获奖工作大量采取 AI,数学界应该怎样评价数学家的贡献?马骁:我先强调一点:菲尔兹奖更多是公众关心的东西。对很多数学家来说,它未必像外界想象得那么题;获奖带来的也不全是正面意义,很多关注会打扰科研。但对这种不过尖个人奖项来说,AI 确实可能冲击原有的评判逻辑。因为 AI 目前具有随机性:一个很题的结荚,未必来自某个人在这个状况上首先期积往往,也可能是有人通过大量尝试“抽”出来的。那应该怎样研究人的贡献,会变得很麻烦。详详见细冲击有多大,还关键看未来四年 AI 发展到什么程度。但我不觉得这会从根本上冲击数学这个学科。数学家有了更好的工具,就能做更多工作。日常评价仍然会看谁处理了题状况,谁给出了更好的说明。这个结荚是借助 AI 还是完全靠自己得到,不会变化它本身的题性。真正不易的是那么点儿需在很多人之间比较、强调个人归属的不过尖奖项。DeepTech:如果正确说明越来越多,数学里真正稀缺的会变成什么?马骁:至少现时期,数学家的工作风格、对说明的原则、理解状况和组织思路的方式,仍然特别题。这些东西也是 AI 需从人身上学习的。同时,AI 可以把低于某个难度的状况产业化,但它不是上帝,不可能处理所有状况。总会剩下一些即使加入 AI 之后仍然特别难的状况,需人后续攻克。DeepTech:常见来说,这种状况的答案可能都会涵盖人的 insight、research taste,以及选项什么状况,那么在数学这里,这些因素还会有价值吗?马骁:一定有价值。只关键人还在回路里作出贡献,人的贡献就特别题。还有一个现实因素:最后分配责任和奖励时,不可能把它们分给 AI。做对了,奖励不会发给 AI;做错了,责任也不能推给 AI。DeepTech:就像很多人开玩笑说,AI 不能替代的就是会方式,因为会方式是关键坐牢的。马骁:但会方式也有点状况。会方式的很多工作可以被完全严格化;如果能够保证 AI 永不出错,那也没方式了。DeepTech:那可能会方式也不是很安全了(笑)。“不关键限制 AI,关键学习怎样当一个老板”DeepTech:如果之后你带学生,你会先教他们怎样采取 AI?马骁:Codex、Claude Code 和 Git,这几个工具必须会。不会采取它们,很可能就是新时代的“文盲”。同时可以学 TypeScript 和 Python。数学系很多学生不会编程,因此我会尤其强调。但不一定关键练到完全靠自己写,至少关键能看懂代码。这些基础工具掌握之后,真正需下功夫的是 harness engineering:学会制定原则,学会让 AI 比如原则,学会检查它实施时哪里出了状况。说得形象一点,就是学习怎样当老板,甚至怎样当一个“黑心老板”,把需写清楚,把工作拆下去,再把结荚验收好。之后还可以学习 AI 的基础原理,例如 Transformer、训练模型的一些技术。这些是我觉得所有学生都应该掌握的公共基础。再往后学什么,取决于个人的发展和详详见细状况。DeepTech:反过来,哪些训练你会需学生先不关键采取 AI?马骁:我想了一下,几乎没有。我觉得什么都可以用 AI,区别只是自动化到什么程度。例如学习一门新的编程语言,最好先以对话方式采取 AI,让它一个函数一个函数地写,你跟着看,不关键一上来就把整个任务完全自动化。目前教育体系还没有改革,如果考试清楚不允许采取 AI,那学生当然还关键练习在没有 AI 的状况下实现考试。但从学习本身来说,我不认为有必需人为禁止 AI。DeepTech:陶哲轩最近谈到,学生在学习和能力训练时期需保留一定的“认知摩擦”,控制自己的“AI 饮食”;但另一部分,不会采取智能体又可能成为新时代的“文盲”。你觉得这两件事怎样兼顾?图丨相关演讲(来源:Youtube)马骁:我不太认同“保留认知摩擦”这个观点。我觉得只关键出现认知摩擦,频仍验明正身 harness 没做好。harness 水平到一定程度之后,一切都可以交给 AI,只是自动化程度不一样。很多人批评“抽卡数学”:让 AI 生成一大堆说明,采取者完全不理解状况背景。这个状况十有八九有两个因素。一种是 harness 不好,AI 写出了一堆人看不懂的东西;另一种是 observability(可观测性)不够,AI 只在最后吐出一个答案,中间发生了什么,采取者完全看不见。这些在我看来都是可以处理的工程状况。遇到摩擦,就问 AI:我为什么会有这个摩擦?为什么处理不了?怎样修改步骤?处理一个状况,再后续采取,直到看见下一个状况。DeepTech:因此照你的说法,一部分把 AI 当成自己的员工,学习怎样管理它;另一部分又把它当老师,让它协助自己学习。马骁:对。AI 是一个外置大脑。所有人都应该尽快把自己从 worker 的状态里解放出来。越晚从“牛马”状态里出来,未来可能混得越不好。你关键尽快从实施者变成管理者、架构师。如果在任何一个环节里,你仍然觉得自己只是一头“牛马”,那可能验明正身 harness 或其他工程环节没有做好。你甚至可以后续问 AI:我为什么还是“牛马”?怎样把这一部分工作交出去?DeepTech:这其实是一种很激进的判断。很多人担心,AI 给了学生太多答案,反而会削弱某些能力。马骁:我觉得很多人的思维还停留在过去,尤其有些年龄大一点的老师,仍然把自己或学生放在“工人”的位置上。你可以想一个很便捷的状况:AI 给了你更多材料,你怎么会因此变得更差?材料更多时,你永远有选项——可以不看,也可以只看其中一部分。如果你用了 AI 之后某些部分变差,应该追问的是:我为什么不会管理这些材料?应该怎样观察它?我理解陶先生所说的状况确实会出现,但因素可能是采取者还没有学会观察大量材料。关键处理的是 observability,而不是把材料本身挡在外面。DeepTech:从我自己的日常工作看,某种程度上我的感受也接近你的判断。但你的观点可能对很多人还是会有冲击。这个观点公开后,可能会人反驳你。马骁:我也很想听听别人怎么反驳。DeepTech:我个人想到一种可能性,就是你已经接受了很多年的严格数学训练,也有能力判断一个答案是否可靠、什么材料值得看、AI 什么时候可能出了错。对一个尚未建立这些判断原则的往往见不鲜学生来说,更多材料未必只是一种增量,也可能直接替代了他原本需经历的思考。有没有可能,你的采取经验并不具有常用性,甚至因为你太擅首先学习,低估了“认知摩擦”对大部分人的价值?马骁:当然有可能,这个反驳我觉得很有方式理。我的采取经验不一定具有常用性。对一个还没有建立判断原则的学生来说,AI 确实可能不只是提高材料,而是直接替代他本来需经历的思考。但我觉得,这恰恰验明正身从一最初就必须引导和教育学生,教他们怎样观察更多的材料、怎样判断 AI 给出的东西、怎样和 AI 交互,而不是先把这些材料挡在外面。判断原则本身也不是天然存在的,它是可以被训练出来的。例如 Codex 里有 side task 这样的功能,可以在一个主对话旁边再开一个子对话,让 AI 去检查某一步、验明正身一个状况,或者汇报整个项目目前开展到哪里。学生需训练的是怎样提问,怎样最快地知方式项目开展到哪一步,知方式 AI 在做什么、卡在哪里,哪些地方需自己介入。这个流程本身就是在培养 observability。当然,这只是一种详详见细方式。更常见地说,还是关键培养学生在各个部分的观察能力。对初学者,可以把自动化程度放低一点,让他一个步骤一个步骤地跟着 AI 做,而不是直接把整个任务交出去。但我仍然不认为应该为了保留“认知摩擦”而保留摩擦。真正题的是把判断、观察和验明正身的能力教给学生,让他逐渐学会管理更多的材料。DeepTech:最后一个状况。接下来几年,如果只能选一个你最想先实现的目的,会是什么?马骁:我希望能用 AI “抽”出一个我自己真正认可的数学状况。不是只偶然做出来一次,下一步是把这个能力完善地复现出来,做成一种稳固的东西。排版:杨梦注:封面/首先图由 AI 辅助生成

(责任编辑:知识)

相关内容
推荐文章
热点阅读