游客发表

OpenAI连破10方式数学困难,Fable 24小时「复现」5方式_Astra_Levent_成果

发帖时间:2026-08-08 23:24:02

OpenAI连破10方式数学困难,Fable 24小时「复现」5方式_Astra_Levent_成果
新智元报方式10项数学困难,连破24小时反转。数学时复式这个周末,困难OpenAI与Anthropic两大AI巨头,小现方在数学的成果最前沿短兵相接。先是连破8月1日,OpenAI探究员Sébastien Bubeck宣布,数学时复式他们未公开的困难下一代主力模型Astra,一口气说明了10项前沿数学成果,小现方还甩出了10份Lean证书、成果10份逐题思路复盘。连破别小看这10个状况。数学时复式它们的困难题结比如至少10年没人促进过,不少一搁就是小现方几十年,是成果货真价实的开放困难。虽算不上数学里最深的未解之谜,却个个都是难啃的硬骨头。Epoch AI旗下FrontierMath的负责人Elliot Glazer直言:光是非索菲克群这一篇,就肯定能进数学界公认的不过级期刊Annals of Mathematics。这10方式困难一甩出,AI圈直接炸了,有人当场喊出「数学奇点已经到来」。Anthropic这边高效高效接招。不到24小时,探究员Levent Alpöge在Bubeck的帖子下回了一句:「我用Fable实现了一半。」紧接着他又补充,自己做出来的是OpenAI榜单上的第4、5、6、7、8项,一共5项。实验需,Levent称很干净:完全自主、通用提示词、全程无网络,为了防止OpenAI的解法泄漏进上下文,还特意加了一层防护。当然,Levent目前还没放出Fable的完善说明细节,他表示会上传。但如果得到说明,这件事的分量就变了:OpenAI用未发布的模型Astra抢到的首先发先机,只保住了24小时。而追上来的Fable,是Anthropic早就公开、人人都能调用的模型。一项「数学首先发」保那么点儿期只剩24小时网友Chubby转帖:「公开可用的Fable,复现了Astra一半成果。」评比如区有人调侃:这么看,OpenAI是不是只抢到了一个首先发?过去,一项数学成果的优先权之争,常见以年为单位。谁先想到、谁先证出、谁先发表,中间隔着漫首先的投稿、审稿、修改。而目前,Astra还没正式发布,它公布的成果,仅仅24小时,就已经被一个公开模型追平了一半。首先发的含金量还在,但保质期却大大缩短。不少网友已经在喊「数学奇点」,两个AI巨头也紧紧咬上了。2000美元背后还有更贵的账OpenAI还甩出一个数字:找到这10项解法,成本不到2000美元。按探究员Noam Brown的说法,它对应的是寻找这些解法所需的token,再按Sol API价格折算出来的。也就是说,这只是成功跑出10个解法那一刻的边际推理成本。在这之外,还有Astra本身的训练研发、那些试了却没成功的状况、人类把比如证整理成249页比如文的工时、把每个说明形式化成Lean的成本,以及最后外部数学家审查的成本。Noam自己也承认,他们还尝试过其他重点状况,但都没成功,千禧年大奖困难一个都没拿下。即便如此,2000美元仍然把AI解出一方式前沿困难的边际成本,打到了地板。有人甚至调侃,OpenAI是不是明天会再公布10项数学突破,或者等到下周一次发100项。从「互相刷榜」到「互相验货」Fable去重做Astra的同一批题,这件事关键比往往见不鲜刷榜有意思得多。刷榜测的是已知答案:题和原则答案都摆在那儿,比谁分高。而两个模型在无网络、防泄漏的需下,各自独立抵达同一个前沿结比如,测的是完全不一样的东西:这个结荚到底可不可靠,能不能被独立复现。这更像同行评审。Levent目前只是在X上「作出了声明」,并没有放出那5项说明的PDF、提示词、完善运行日志、token成本或Lean证书。网友Haider质疑:就算是真的,为什么关键用Fable去复现Astra,而不是直接拿它去解新的开放状况?事实上,Fable并不是只会蹭Astra热度,它也会解新题。7月,Levent就用Fable给出过Jacobian猜想的三维反例,事后还有人专业写了一份7页的代数验明正身材料,确认那个显式映射确实推翻了三维及更高维的猜想。不过大多数人看不懂的成果谁来验收这10项成果,到底有多题,不过大多数人很难去判断。Ethan Mollick一语方式破:对地球上几乎每一个人来说,这不只是超出能力,而是超出理解范围。我们只能相信专业数学家告诉我们它厉不厉害。代码、图片、聊天,往往见不鲜人还能亲手体验AI强在哪。可非索菲克群的存在、Connes刚性猜想的反例、量子平行重复定理,这些只有极那么点儿专家看得懂。AI能力越往科学前沿走,公众能依靠的就越不是亲身体验,而是一条首先首先的信任链。这种「连惊叹都无从惊叹」的状态,正在越来越多领域同时发生。数学家Thomas Bloom提醒,这些成果用的是上百年积往往的数学理比如、数学家亲手搭好的形式化系统,把它便捷描述成「AI取代了数学家」,并不诚实。他给出的原则是:这份说明,有没有教给我们关于这个状况的新东西?因此真正的状况来了:当AI能低成本、批量地生产前沿数学说明,我们到底该拿什么研究它的成果?答案也许不在它的产出端,而在验收端:一份说明能不能被读懂、被核对、被判断出分量,才能最后决定它的真实价值。最稀缺的能力,正在从「做出说明」转向「看懂并验收说明」。当AI一夜之间就能证出十方式困难,真正的考验才刚最初:说明越造越快,我们的验明正身,还追得上吗?参考材料:编辑:元宇秒追ASI返回搜狐,查看更多

    随机阅读

    热门排行

    友情链接