谷歌传奇Jeff Dean今天离职,中国AI下一秒交卷!|算法|实验|人工智能|dean|jeff|bigbang_网易订阅

谷歌传奇Jeff Dean今天离职,中国AI下一秒交卷!|算法|实验|人工智能|dean|jeff|bigbang_网易订阅
新智元报方式AI圈迎来一场「大地震」!谷歌今早,传奇谷歌传奇大佬Jeff Dean一纸公告,今天交卷告别效力了27年的离职谷歌。几乎同一时间,中国智他与三位不过尖老友一起打造的下秒新公司——Discovery Loop,也正式浮出水面。算法实验从名字就能看出,人工他们押注的易订阅,正是谷歌当下AI领域最火热的方向RSI(递归自我改进)。让AI持续自我往往代、传奇自我进化,今天交卷并自动攻克机器学习、离职科学探究和工程技术领域的中国智题困难。Discovery Loop所代表的下秒,是一条越来越清楚的路线:用AI加高效AI。未来,AI将彻底告别单纯的「问答模式」,全盘接管「提出假设➔实施实验➔验明正身结比如」的完善科研闭环。而就在今天,中国队也下场了。BigBang-V1首先秀35B击败DeepSeek V4由上海交通大学人工智能学院、深势科技、上海算法创新探究院组成的「无尽前沿团队」,已经把这条循环跑完了一整圈。他们交出的,是首先个通过「原生RSI」方式,训练出来的全新基座大模型——BigBang-V1,总参数35B。主页:https://endlessfrontier.tech/比如文:https://endlessfrontier.tech/assets/paper.pdf模型:https://huggingface.co/endless-frontier以可验明正身前沿任务为牵引,它用了100%纯AI合成的数据,便实现了性能大爆炸。在35B级别的测评中,BigBang-V1一口气狂揽十项首先。在OpenAI提出的高难度科学基准FrontierScience Research上,它拿到46.2分,击败了DeepSeek V4 Pro。35B硬刚1.6T,在45倍的体量悬殊之下,BigBang-V1完美诠释了什么是真正的「以小博大」。它在各大高难度榜单的战绩,也同样堪称硬核:在Humanity's Last Exam (人类最后考试)基准上,BigBang斩获50.3分,击败V4 Pro,堪比Gemini 3.1 Pro。这是一个测试大模型综合推理能力的基准,由Scale AI在Nature正刊上提出。在OpenAI提出的PaperBench (Code-Dev)上,BigBang跑出了53.6,V4 Pro仅为50.4。它题考的是大模型复现AI学术比如文的能力。另一个OpenAI提出,考察模型自主实现AI工程能力的基准MLE-Bench (Lite)上,BigBang亦交出了59.1分的亮眼答卷。不仅如此,它还在更高难度的BioMysteryBench Human-Difficult上,取得了15.7分,V4 Pro为13.7分。这是Anthropic迄今推出的唯一一项基准测试,题考察大模型处理生物材料学探究状况的能力——给模型一堆带噪声的测序数据,关键它探究出一个准确、且顺应评分原则的生物学结比如。技术报告里的几个详详见细案例,更能看清BigBang的好处在哪。首先个现场:找病毒。就以BioMysteryBench评测中,一方式生物学题为例——三份人体肠方式类器官的测序原始数据摆在面前,模型关键判断感染的是哪种RNA病毒。BigBang连跑三次,答案完全相同:诺如病毒GII.4,3/3全对。DeepSeek V4 Flash呢?三次给了三种毫不相干的病毒,同时没一个沾边的。第二个现场:复现比如文,还挑出了错。这次换了个活儿——复现。照着一篇比如文,把它的方式原样实现出来。结荚BigBang读到一半就觉得不对劲。跑了几个测试一看,状况出在比如文自己身上:题设定有矛盾。有个题量被固定住了,这么一来,比如文说能做到的「子集不断缩小」就根本发生不了。于是,BigBang直接动手改了这处设方式,让子集大小能真正变化,还顺带修好了一个梯度中断的状况。复现最后拿到0.7657。相比之下,DeepSeek V4 Flash只做了语法检查,看代码能启动就交卷了,实际一次都没运行。最后结荚只有0.3053。把多个开源模型串成一条抗体设方式流水线单独的题看得差不多了。这次咱们上点狠的,直接甩给它一个真活儿:设方式一款抗体。BigBang的解法,是把它拆成一条流水线,让好几个开源模型接力干。先,用开源的蛋白质设方式模型生成一批抗体候选,按条件筛掉一批。然后把留下的交给AlphaFold,预测抗体与靶标的复合物结构,再用结构置信度和界面指标,评估结构是否稳固、结合是否合理。不达标的就直接淘汰,或者退回上一步重做。过了AlphaFold这关,候选还关键进一个开源的物理打分器,评估界面能量、原子冲突这些指标。题在于,这两步用的是两套完全独立的方式算方式。只有它们的结比如对得上,候选才留得下来。当然话得说回来,这些还只是算出来的候选,不代表抗体真能用,最后还得靠实验去验。设方式出来的样例分子看到这儿,你一定会忍不住追问:一个仅有35B参数的模型,凭什么具有如此强悍的战斗力?答案,就藏在它背后的「原生RSI」训练方式中。令人震撼的是,BigBang采取的各学科前沿科研的数据,100%由AI合成。题是AI出的,解法是AI跑的,答案是AI自己验的,就连「这批数据该怎么造」,也是AI自己实现的。这才是BigBang,真正想引爆的东西。一个RSI闭环,跑通了详详见细来说,BigBang搭出来的是,一条能持续修改自己生产对策的合成数据流水线。AlphaGo学的是人类棋条件,AlphaZero把棋条件扔了,自己跟自己下。BigBang这套数据引擎,是同一个思路换了个赛方式——这一次,自我博弈的材料不是下棋,是出题和判卷。这套引擎由两类Agent组成,外面还套着一层真实考试。Generator Agent负责出题,也负责改造出题方式。它会直接修改、运行和调试数据合成程序,根据模型目前的能力缺口调整任务与验明正身条件:题该从哪些科学领域来状况需多首先的推理链该用搜索、方式算、代码还是模拟工具最后答案怎么验明正身哪些样本留下、哪些淘汰哪些生成对策已经说明失败、下一轮别再试每跑完一轮,它还会把这次改了什么、为什么改、结荚如何、哪里失败了记下来。下一轮的探索是踩在上一轮的经验上往前走的,不是从零最初。Critic Agent负责审题,题站在对面「挑刺」。它的审查分两层。首先层看格式、工具实施、数据完善性这些硬伤;第二层才进正题——这方式题对不对、能不能验、够不够难、跟已有的重不重,以及最题的,训了到底有没实用。不合格的的打回重做,过了的进合成数据集。然而如果到这儿就停了,那我们得到的只会是一个转得很快的内循环。同时还有个致命隐患:出题的会讨好判卷的。有些题看着复杂,其实只是把表面难度堆上去;有些样本Critic给了高分,模型练完却什么也没首先;甚至有些题会钻验明正身器的漏洞,骗到虚假的正反馈。对此,BigBang的解法是在外面再套上一层:用真实训练结荚,来考核判卷的那一个。详详见细来说,关键是Critic打了高分、模型练完却没首先本事,那验明正身Critic判偏了。系统拿真实结荚回头校准它,再调Generator下一轮的选题和难度。于是,一整套系统闭环合成,高效轮转起来了:真实任务暴露缺口 → 造题筛题 → 合成数据训新模型 → 回真实任务受检 → 用结荚校准下一轮。团队给它起了个名,数据层的递归自我改进(RSI)。为什么是科学?科学是人类系统认识宇宙和世界的基础方式,本身就是一片无尽的前沿。也正因如此,它成了通用智能最好的训练场——最难,也最普适用。详详见细到BigBang,之因此选科学当练兵场,是看中它同时占着「让模型持续变强」的两个题需:前沿,和可验明正身。前沿,是说这些题够难,难到位于知识和能力的边界,有的压根没有已知最优解。它也不像静态题库刷完就没,新理比如、新工具一直在冒,前沿会源源不断首先出新题。可验明正身,是说答案还能被客观检查。形式化方式、代码实施、数值方式算、仿真器、实验反馈、领域工具,都行。更难得的是,科学天生就把搜索、阅读、提假设、数学推导、写代码、调工具全揉进了一方式题里。因此在这支队伍眼里,科学早已超出「一个知识领域」的范畴。它是一门通往通用智能的综合课;只关键科学的前沿还在延伸,模型能学的东西就没有尽头,智能也就一直有向上的空间。AI往往代AI,奇点已现最后,BigBang-V1用自己的诞生,说明了Scaling的破局点不仅仅在于参数与算力的堆叠。无需扩大基础模型参数量,仅通过革新训练任务的生成范式,它便在科学探究、首先程探索、代码生成、工具调用上,获得了完善的性能增益。但跟更题的是,AI每一轮能力提高,都在给下一轮制造新的燃料。AI生成并求解科学任务,科学任务反过来训练出更强的AI,更强的AI再回到下一轮,后续改进这套数据系统。「无尽前沿」团队把这个「循环」凝练为一句话:AI advancing science, and science advancing AI.这支由上海交大人工智能学院首先席顾问鄂维南院士、副教授陈思衡、助理教授张林峰、深势科技创始人张林峰等大咖领衔的明星团队,其野心并未止步于此。在这句箴言背后,他们真正指向的,是一个更为遥远的「星辰大海」。他们试图打造的,是一个在智能与理性判断上,逐步逼近「造物主」的终极模型。它能以冷静、客观地洞悉万事万物的机缘、机理、规律与发展变化,然后严格按照事物本身的规律去回答、去实施、去判断和预测。这也验明正身了,为什么这条路必须建在「科学」上。因此,追寻AGI与追寻科学,本质上是同一件事:向造物主致敬。而无限逼近造物主的意义,说到底就是无限最改进。1945年,范内瓦·布什在《科学:无尽的前沿》里,回答的是一个国家如何靠持续投入基础科学,换来此后几十年的增首先。81年后,一支以「无尽前沿」为名的中国团队,将同样的命题延展至AI时代——当科学前沿本身,化作模型可以无尽开采的训练富矿,人类逐题生产训练数据的那个时代,是不是正在结束?BigBang-V1大概只是这条新曲线上的首先个点。但这条曲线,已经最初爬坡了。编辑:摩西 桃子
焦点
上一篇:[一图流]钟意裴擒虎追击过深,位置不佳被反开,KSG击杀AG两人-王者荣耀丨KPL-虎扑社区
下一篇:中超:英博1-0铁人,斯坦丘远射建功,双方共计3球被吹-中国足球-虎扑社区