GPT-6登顶第一!AlphaFold之后最大震撼,成抗体预测最强AI
AlphaFold之后的最大震撼来了。
刚刚,OpenAI 总裁 Greg Brockman转发的一条消息,足以引爆整个科技与医药圈。
知名科学家 Andrew Aiginin 在X上发布了激动人心的消息——
在严苛的独立基准测试中,GPT-6 Astra 刚刚击败了所有前沿模型,成为了抗体可开发性预测的最强AI!

不仅拿到了跑分第一,Astra 还在短短 1 小时内,直接手搓出了复杂的抗体机理交互式可视化页面。
一直以来,圈内都有一个共识:「AI for Science,必须是用专用的模型,打专用的问题。」
比如 AlphaFold 之于蛋白质折叠,LLM通常只被当成写代码和读文献的辅助工具。
但今天,GPT-6 Astra 将这个共识撕开了一道巨大的口子!
它依靠通用智能,直接切入了生物医药研发中最难量化、最令人头疼的临床前死穴。
而这一切并非偶然。构建该测试基准的顶尖 AI 制药团队Insilico Medicine在 arXiv 上放出一篇21页重磅论文。

标题:Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis
论文:https://arxiv.org/pdf/2608.18940
这篇论文,不仅首次揭开了测试 GPT-6 Astra 的 DDD Benchmark 的严苛性,更向我们展示了:从小分子化学合成,到大分子抗体预测,通用大模型正在全面接管最硬核的科学边界!
AlphaFold 之后的科学范式转移,或许才刚刚开始。
37.98分!GPT-6登顶权威「DDD基准测试」
实测结果显示:GPT-6 Astra 接入 DDD Benchmark 中的抗体可开发性测试模块(综合了 6 种不同的抗体实验数据)后,拿下了惊人的 37.98 分,碾压了所有受测模型。

AI 学者 Rim Shayakhmetov 发出难以置信的惊叹:
「专用模型在这个任务上的常规分数是多少?这结果太有趣了,你很难在药物发现的基准测试中,看到前沿的大语言模型在『不依赖外部专用工具』的情况下如此闪耀!」

没有专业生物信息学插件、没有专门做抗体数据微调的情况下,一个通用大模型,居然直接切中了抗体成药性的命脉,这太令人兴奋了。
发现抗体只是开始,「成药」才是真正的死亡之谷
要理解 GPT-6 Astra 这一成绩的含金量,我们首先得弄懂一个医药界的残酷现实。
Andrew写下了一句直击灵魂的话:「找到一个能结合的抗体仅仅只是开始。它会聚集吗?它能保持稳定吗?它真的能像一个药物那样发挥作用吗?」
这句话,道出了全球无数新药研发人员的血泪史。
在过去,当我们谈论抗体药物研发时,大家最关注的是「结合力」。
通俗点说,就是这个抗体能不能精准地像钥匙插进锁孔一样,识别并结合到病毒或癌细胞的靶点上。
早期的AI模型(比如AlphaFold)已经在「预测结合」这件事上做得非常出色了。
但是!能结合 ≠ 能变成药。
这就好比谈恋爱。男女双方看对眼了,一见钟情,这只是第一步。你们能不能走进婚姻的殿堂?能不能经受住柴米油盐的考验?
在药物研发中,这个「柴米油盐的考验」被称为「成药性」。

现实中,无数看似结合力极强的「完美抗体」,一旦进入真实的生理环境或工业生产环节,就会暴露出致命缺陷:
它会不会聚集成团?
它的结构稳不稳定?
它到底能不能表现得像一款真正的「药」?
这些属性统称为抗体可开发性。
这是整个生物制药界的「死亡之谷」。
它导致了一个极其惨烈的局面:全球每年有成千上万个抗体分子在实验室里表现优异,但最终倒在了「成药性」的评估阶段。
药企为此烧掉了几十亿美金,耗费了几年甚至十几年时间,最终颗粒无收。
而今天,GPT-6 Astra 宣布,它能比目前世界上任何其他前沿模型,更精准地预测这些成药性特征。
揭秘试金石:GPT-6 Astra 面对的「地狱级」基准测试
有人可能会问:这会不会又是一个「刷榜」成绩?
绝对不是。
Bogdan A. Zagribelnyy 博士指出,Astra 登顶的平台是他们构建的 DDD Benchmark。
在他们发布的论文中,我们看到了这个测试体系多么硬核。
虽然推文讨论的是「大分子抗体」,但这篇论文展示了该团队在「小分子化学」领域建立评测标准的恐怖深度。了解了这个背景,你才会明白 Astra 的夺冠有多么不可思议。
在论文中,研究团队聚焦了另一个制药界的世纪难题:单步逆合成。

简单来说,逆合成就是「化学界的倒推法」——给你一个目标药物分子,你需要倒推出可以用哪些现成的、便宜的化学原料来合成它。
过去的 AI 评测是怎么做的?
给 AI 一个目标分子,AI 吐出一个合成路径,如果跟已有的专利数据库(比如 USPTO)里的一模一样,就算 100 分。
但这在真实世界里几乎行不通。因为合成路径天生就是「一对多」的,传统的「单一标准答案」评估法,极大地限制了 AI 探索未知的能力。
为此,Insilico 团队构建了令人发指的测试环境:
1.URSA-expert-2026 基准:这是一个包含 100 个由机器生成、并由顶尖人类化学专家手动确认合成可及性的全新分子数据集。它与任何公开的训练数据完全隔离,彻底杜绝了模型「背题」的可能性。
2.ChemCensor 打分系统:他们不看模型是不是完美复刻了专利,而是开发了 ChemCensor 框架,从「反应中心映射」、「官能团兼容性」等最底层的化学物理规则出发,去判断模型生成的反应是否具备真正的化学合理性)。
正是在这种「剥壳见骨」的物理/化学规律考核下,传统的 LLM几乎都失败了。
在早期的 Top-1测试中,哪怕是强如 GPT-5.5、Gemini 3.1 Pro,其表现依然无法超越最顶尖的专用传统化学模型(如 MHNreact、LocalRetro)。
「大力出奇迹」的通用 LLM ,似乎碰壁了。
4500万数据,LLM被「逼出」科学直觉的?
通用 LLM 拼不过专用模型,那该怎么办?
论文给出的答案震撼了业界——不要换模型,换一种激发通用模型潜力的方法。
研究团队在论文中提出了三大杀招,彻底解锁了大模型在化学领域的封印:
第一招:Top-K 提示词范式
既然逆合成是「一对多」,那就不要让 LLM 只猜一次。
团队在 Prompt 中明确要求:「给我 15 种不同的答案」。
奇迹出现了,仅仅是切换到 Top-K模式,几乎所有的大模型(GPT-5.5, Claude Opus系列)在化学合理性和多样性上都迎来了爆发式增长。

Gemini 3.1 Pro 在 Top-15 模式下性能飙升,直接成为最强 LLM 基线。
这证明,大模型是有科学知识的,只是过去的提问方式不对。
第二招:构建 4560 万规模的超大核验数据集(CREED-CCV-2+USPTO-XL)
为了训练出专门针对化学限制对齐的语言模型(C3LM),团队不惜算力,利用虚拟合成引擎和 ChemCensor 框架,硬生生构建了一个包含约 4560 万个经过验证的真实化学反应的超大规模数据集。

第三招:强化学习中的「新颖性」奖励
在微调 C3LM 模型时,他们引入了 GRPO 强化学习算法。
奖励函数极其刁钻:模型给出的合成路径不仅要符合 ChemCensor 的化学合理性,而且如果模型能想出一种连 4500 万训练集里都没有、但依然合理的全新反应,将会获得额外的巨大奖励。
结果是什么?
经过这种「地狱级」训练的 C3LM 模型,在 URSA-expert-2026 盲测中,终于一举击败了 MHNreact 等所有传统专用 SSRS 模型!
数据分析显示,C3LM 和其他基础大模型能够探索出与传统模型完全互补的反应空间,生成了大量传统模型想不到的独特路径。

论文的核心结论是:大语言模型不仅能处理自然语言,只要给予正确的环境和激励,它们完全可以掌握最深奥的化学键、官能团和合成逻辑!
降维打击:从 C3LM 到 GPT-6 Astra,通用智能的全面接管
如果你看懂了上面这篇论文,你就会明白 Bogdan 博士为什么会把 GPT-6 Astra 的成绩和这篇论文联系在一起。
在这篇论文中,Insilico 团队费尽九牛二虎之力,用 4500 万条数据微调、用强化学习对齐、用 Top-K提示词引导,才终于让大模型在小分子化学合成上打败了专用模型。
然而,当测试赛道切换到更加复杂、维度更高的大分子可开发性预测时,GPT-6 Astra 居然在「没有使用外部工具」的情况下,直接在同样的 DDD Benchmark 测试体系下登顶,拿下了 37.98 分!
这绝对是降维打击。
过去,我们要解决抗体稳定性问题,需要专业团队设计专门的三维图神经网络。
而现在的 GPT-6 Astra,它的通用世界模型中似乎已经内化了物理、化学、生物的底层逻辑。
它在阅读了人类历史上浩如烟海的论文、专利、实验数据,甚至通过多模态学习了微观世界的物理法则后,已经能像人类专家一样,「直觉」判断出一个蛋白质分子在溶液中为什么会聚集。
此外,Astra 展现出的工程效率同样令人胆寒。
Andrew Aiginin 提到:「顺便提一句,这个展示抗体实际工作原理的交互式可视化页面,也是用 Astra 在大约 1 小时内建好的。」
在传统药企,做这样一个系统,整个流程少说也要两三周。
现在,1个小时,一个人,一个通用大模型,就能解决了。
AlphaFold 之后,真正的范式转移
GPT-6在抗体基准上的跑分第一,宣告着通用大模型已经显出AGI雏形,在人类最顶尖智力活动中取得的实质性统治。
这个榜单第一,宣告了这个新时代的到来——
未来十年,科学发现的核心驱动力,可能不再是为每一个孤立的科学问题定制一个专门的 AI 模型;而是学会如何向一个如同神明般的ASI提出正确的 prompt。
小分子逆合成被突破了,大分子抗体成药性被突破了。
从新药研发到材料科学,从聚变控制到量子物理,通用大模型的外溢红利,即将如海啸般席卷所有硬核行业。
参考资料:
https://arxiv.org/html/2608.18940
https://x.com/gdb/status/2098167375342239957
https://x.com/andrewaiginin/status/2098078245350518884
编辑:Aeneas 大卫
声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!