谷歌传奇Jeff Dean今天离职,中国AI下一秒交卷!

浏览11次 点赞0次 收藏0次

AI圈迎来一场「大地震」!

今早,谷歌传奇大佬Jeff Dean一纸公告,告别效力了27年的谷歌。

几乎同一时间,他与三位顶尖老友一起打造的新公司——Discovery Loop,也正式浮出水面。

从名字就能看出,他们押注的,正是当下AI领域最火热的方向RSI(递归自我改进)。

让AI持续自我迭代、自我进化,并自动攻克机器学习、科学研究和工程技术领域的重要难题。


Discovery Loop所代表的,是一条越来越清晰的路线:用AI加速AI。

未来,AI将彻底告别单纯的「问答模式」,全盘接管「提出假设➔执行实验➔验证结论」的完整科研闭环。

而就在今天,中国队也下场了。

BigBang-V1首秀

35B击败DeepSeek V4

由上海交通大学人工智能学院、深势科技、上海算法创新研究院组成的「无尽前沿团队」,已经把这条循环跑完了一整圈。

他们交出的,是第一个通过「原生RSI」方式,训练出来的全新基座大模型——BigBang-V1,总参数35B。


主页:https://endlessfrontier.tech/

论文:https://endlessfrontier.tech/assets/paper.pdf

模型:https://huggingface.co/endless-frontier

以可验证前沿任务为牵引,它用了100%纯AI合成的数据,便实现了性能大爆炸。

在35B级别的测评中,BigBang-V1一口气狂揽十项第一。

在OpenAI提出的高难度科学基准FrontierScience Research上,它拿到46.2分,击败了DeepSeek V4 Pro。

35B硬刚1.6T,在45倍的体量悬殊之下,BigBang-V1完美诠释了什么是真正的「以小博大」。


它在各大高难度榜单的战绩,也同样堪称硬核:

在Humanity's Last Exam (人类最后考试)基准上,BigBang斩获50.3分,击败V4 Pro,堪比Gemini 3.1 Pro。

这是一个测试大模型综合推理能力的基准,由Scale AI在Nature正刊上提出。

在OpenAI提出的PaperBench (Code-Dev)上,BigBang跑出了53.6,V4 Pro仅为50.4。它主要考的是大模型复现AI学术论文的能力。

另一个OpenAI提出,考察模型自主完成AI工程能力的基准MLE-Bench (Lite)上,BigBang亦交出了59.1分的亮眼答卷。

不仅如此,它还在更高难度的BioMysteryBench Human-Difficult上,取得了15.7分,V4 Pro为13.7分。

这是Anthropic迄今推出的唯一一项基准测试,主要考察大模型解决生物信息学研究问题的能力——

给模型一堆带噪声的测序数据,要它分析出一个精确、且符合评分标准的生物学结论。


技术报告里的几个具体案例,更能看清BigBang的优势在哪。

第一个现场:找病毒。

就以BioMysteryBench评测中,一道生物学题目为例——

三份人体肠道类器官的测序原始数据摆在面前,模型要判断感染的是哪种RNA病毒。

BigBang连跑三次,答案完全一致:诺如病毒GII.4,3/3全对。

DeepSeek V4 Flash呢?三次给了三种毫不相干的病毒,而且没一个沾边的。


第二个现场:复现论文,还挑出了错。

这次换了个活儿——复现。照着一篇论文,把它的方法原样实现出来。

结果BigBang读到一半就觉得不对劲。跑了几个测试一看,问题出在论文自己身上:核心设定有矛盾。

有个关键量被固定住了,这么一来,论文说能做到的「子集不断缩小」就根本发生不了。

于是,BigBang直接动手改了这处设计,让子集大小能真正变化,还顺带修好了一个梯度中断的问题。复现最后拿到0.7657。

相比之下,DeepSeek V4 Flash只做了语法检查,看代码能启动就交卷了,实际一次都没运行。最终结果只有0.3053。


把多个开源模型串成一条抗体设计流水线

单独的题看得差不多了。这次咱们上点狠的,直接甩给它一个真活儿:设计一款抗体。

BigBang的解法,是把它拆成一条流水线,让好几个开源模型接力干。

首先,用开源的蛋白质设计模型生成一批抗体候选,按规则筛掉一批。

然后把留下的交给AlphaFold,预测抗体与靶标的复合物结构,再用结构置信度和界面指标,评估结构是否稳定、结合是否合理。不达标的就直接淘汰,或者退回上一步重做。

过了AlphaFold这关,候选还要进一个开源的物理打分器,评估界面能量、原子冲突这些指标。

关键在于,这两步用的是两套完全独立的计算方法。只有它们的结论对得上,候选才留得下来。

当然话得说回来,这些还只是算出来的候选,不代表抗体真能用,最后还得靠实验去验。


设计出来的样例分子

看到这儿,你一定会忍不住追问:一个仅有35B参数的模型,凭什么拥有如此强悍的战斗力?

答案,就藏在它背后的「原生RSI」训练方式中。

令人震撼的是,BigBang使用的各学科前沿科研的数据,100%由AI合成。

题目是AI出的,解法是AI跑的,答案是AI自己验的,就连「这批数据该怎么造」,也是AI自己完成的。

这才是BigBang,真正想引爆的东西。

一个RSI闭环,跑通了

具体来说,BigBang搭出来的是,一条能持续修改自己生产策略的合成数据流水线。

AlphaGo学的是人类棋谱,AlphaZero把棋谱扔了,自己跟自己下。

BigBang这套数据引擎,是同一个思路换了个赛道——

这一次,自我博弈的内容不是下棋,是出题和判卷。


这套引擎由两类Agent组成,外面还套着一层真实考试。

Generator Agent负责出题,也负责改造出题方法。

它会直接修改、运行和调试数据合成程序,根据模型当前的能力缺口调整任务与验证规则:

  • 题目该从哪些科学领域来

  • 问题需要多长的推理链

  • 该用搜索、计算、代码还是模拟工具

  • 最终答案怎么验证

  • 哪些样本留下、哪些淘汰

  • 哪些生成策略已经证明失败、下一轮别再试

每跑完一轮,它还会把这次改了什么、为什么改、结果如何、哪里失败了记下来。下一轮的探索是踩在上一轮的经验上往前走的,不是从零开始。


Critic Agent负责审题,主要站在对面「挑刺」。

它的审查分两层。第一层看格式、工具执行、数据完整性这些硬伤;第二层才进正题——

这道题对不对、能不能验、够不够难、跟已有的重不重,以及最关键的,训了到底有没有用。不合格的的打回重做,过了的进合成数据集。

然而如果到这儿就停了,那我们得到的只会是一个转得很快的内循环。并且还有个致命隐患:出题的会讨好判卷的。

有些题看着复杂,其实只是把表面难度堆上去;有些样本Critic给了高分,模型练完却什么也没长;甚至有些题会钻验证器的漏洞,骗到虚假的正反馈。

对此,BigBang的解法是在外面再套上一层:用真实训练结果,来考核判卷的那一个。


具体来说,要是Critic打了高分、模型练完却没长本事,那说明Critic判偏了。系统拿真实结果回头校准它,再调Generator下一轮的选题和难度。

于是,一整套系统闭环合成,飞轮转起来了:

真实任务暴露缺口 → 造题筛题 → 合成数据训新模型 → 回真实任务受检 → 用结果校准下一轮。

团队给它起了个名,数据层的递归自我改进(RSI)。

为什么是科学?

科学是人类系统认识宇宙和世界的基本方式,本身就是一片无尽的前沿。

也正因如此,它成了通用智能最好的训练场——最难,也最普适。

具体到BigBang,之所以选科学当练兵场,是看中它同时占着「让模型持续变强」的两个关键条件:前沿,和可验证。

前沿,是说这些题够难,难到位于知识和能力的边界,有的压根没有已知最优解。它也不像静态题库刷完就没,新理论、新工具一直在冒,前沿会源源不断长出新题。

可验证,是说答案还能被客观检查。形式化方法、代码执行、数值计算、仿真器、实验反馈、领域工具,都行。

更难得的是,科学天生就把搜索、阅读、提假设、数学推导、写代码、调工具全揉进了一道题里。

所以在这支队伍眼里,科学早已超出「一个知识领域」的范畴。

它是一门通往通用智能的综合课;只要科学的前沿还在延伸,模型能学的东西就没有尽头,智能也就一直有向上的空间。

AI迭代AI,奇点已现

最终,BigBang-V1用自己的诞生,证明了Scaling的破局点不仅仅在于参数与算力的堆叠。

无需扩大基础模型参数量,仅通过革新训练任务的生成范式,它便在科学研究、长程探索、代码生成、工具调用上,获得了全面的性能增益。

但跟更重要的是,AI每一轮能力提升,都在给下一轮制造新的燃料。


AI生成并求解科学任务,科学任务反过来训练出更强的AI,更强的AI再回到下一轮,继续改进这套数据系统。

「无尽前沿」团队把这个「循环」凝练为一句话:

AI advancing science, and science advancing AI.

这支由上海交大人工智能学院首席顾问鄂维南院士、副教授陈思衡、助理教授张林峰、深势科技创始人张林峰等大咖领衔的明星团队,其野心并未止步于此。

在这句箴言背后,他们真正指向的,是一个更为遥远的「星辰大海」。

他们试图打造的,是一个在智能与理性判断上,逐步逼近「造物主」的终极模型。

它能以冷静、客观地洞悉万事万物的机缘、机理、规律与发展变化,然后严格按照事物本身的规律去回答、去执行、去判断和预测。

这也解释了,为什么这条路必须建在「科学」上。

因此,追寻AGI与追寻科学,本质上是同一件事:向造物主致敬。而无限逼近造物主的意义,说到底就是无限最优化。

1945年,范内瓦·布什在《科学:无尽的前沿》里,回答的是一个国家如何靠持续投入基础科学,换来此后几十年的增长。

81年后,一支以「无尽前沿」为名的中国团队,将同样的命题延展至AI时代——

当科学前沿本身,化作模型可以无尽开采的训练富矿,人类逐题生产训练数据的那个时代,是不是正在结束?

BigBang-V1大概只是这条新曲线上的第一个点。但这条曲线,已经开始爬坡了。

编辑:摩西 桃子

声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯