老黄替OpenAI宣布AGI!出题人当场打脸:换个考场99.9%掉到62.7%
上周四,OpenAI发布GPT-6 Astra。
官网给它的定性是「世界上最智能、最对齐的模型」。
紧接着,黄仁勋在X上发了一条帖子,把这件事推向另一个高度:
AGI已经到来。恭喜OpenAI团队。

反观GPT-6 Astra的官方发布页,通篇找不到「AGI已实现」这样的字眼。
一个卖GPU的,替做模型的,把话说满了。
更有意思的,是出题的人。
OpenAI发布页写着Astra在ARC-AGI-3上拿到99.9%,「饱和」了这个以AGI命名的基准。
负责出卷子的评测机构ARC Prize看完跑分,却一把拒签:「不算。」
ARC Prize基金会当天就发文拆解:
这个分数来自OpenAI定制的测试环境,换成对所有厂商一视同仁的标准环境,只有62.7%。
他们的结论只有一句:Astra在泛化上有实质进展,「但我们不宣称它是AGI」。
芯片供应商直接盖章,模型厂商留了余地,负责出题的基准机构直接拒签。
这大概是过去几天AI圈最魔幻的一幕:AGI这次没有被真正「实现」,而是被各方代言人在社交平台上「宣布」了。
OpenAI自己怎么说?
在发布当天的记者电话会上,总裁Greg Brockman说了一句极具煽动性的话:
欢迎来到AGI时代。
他甚至预言,如果几年后回头看AGI是何时诞生的,「大概就是这个时期,可能就是这个模型。」
听起来像官宣?
但他立刻又补了两个限定词:第一,这是他「个人判断」;第二,AGI是个灰色、模糊的概念,「到底算不算,由用户自己决定。」

在自家最重要的产品发布会上,总裁居然用「个人看法」来给时代定调,甚至还把最终裁定权甩给了网友。
这只能说明一件事:OpenAI内部,也拿不出一份明确、能公示的AGI认定书。
更有意思的是CEO奥特曼的态度。
在Astra发布前,他曾公开吐槽「AGI」是个定义糟糕、接近营销术语的词。
CEO嫌这个词太虚,总裁拿它当「个人看法」,官网干脆闭口不提。
黄仁勋那句AGI的「盖章」和恭喜,恰好就落在了这个微妙的空白里。
99.9%与62.7%
同一张卷子的两套成绩
Astra到底强不强?
OpenAI发布页上写着:
Astra在以AGI命名的基准测试ARC-AGI-3上拿到了99.9%的逆天高分,「饱和」了这个测试。
但打脸来得也快。
当天,负责出题的ARC Prize基金会就发文,把这个「99.9%」当众拆解了。
原来Astra考了两次。

ARC-AGI-3榜单,Astra两套环境的成绩分开标注;同榜Claude Opus 5为30.2%,GPT-5.6 Sol为7.8%。
在OpenAI深度定制的「自带工具」环境下(允许模型保留推理状态、用独家技术管理长对话),它确实考了99.9%,花了近1.9万美元。
但如果换成对所有厂商一视同仁的「裸考」标准环境,它的最高分其实只有62.7%,成本更是飙升到2.6万美元。
ARC Prize的态度很坚决:未来的AGI,必须能在标准条件下解题。带工具拿到的99.9%和裸考拿到的62.7%,完全是两码事。
当然出题人也承认Astra带来了「阶跃式」的惊喜,在96%的关卡里,Astra用的动作数比人类还少,平均少用51.7%。
这是AI第一次在动作效率上全面碾压人类。
可ARC Prize早就把话说在前头:ARC-AGI-3上线那天他们就写明,刷满这个基准不等于「证明达到了AGI」。
理由很简单:测试环境再难也是封闭的,机制确定、目标封闭,代表不了真实世界的复杂与开放。
就像一个学霸,卷子考了满分,到了真实职场未必依然能够开挂。
10万颗炼模型
40万颗卖未来
既然出题人都不认,老黄为什么最急着宣布「AGI已到」?
仔细拆解黄仁勋的那条帖子,你会发现它的信息结构比表面热闹得多。
帖子全文是:
GPT-6 Astra,在约10万颗NVIDIA Grace Blackwell NVLink72上训练。从ChatGPT到o1再到Astra,只用了4年。AGI已经到来。恭喜OpenAI团队。接下来还有40万颗GPU上线。
第一个数字:10万颗。
Astra是OpenAI迄今规模最大的一次训练,用掉了超过10万颗GPU。
第二个数字:4年。
从ChatGPT到o1再到Astra,黄仁勋用一条时间线,把对话模型、推理模型和所谓的AGI连成了一条直线。
第三个数字:40万颗。
「接下来还有40万颗GPU上线。」
这40万颗归谁?什么型号?用来干嘛?黄仁勋在这里留下了悬念。
但当这三个数字与「AGI已到」被塞进同一条帖子里时,读者脑海中就会出现这样一种商业叙事:
10万颗GPU砸出了Astra(也就是AGI),那接下来的40万颗会砸出什么?
在这个语境下,AGI不再是一个抽象的技术终点,而变成了一份最有力的算力需求证明。
一旦AGI被公认「已到」,天价的算力就不再是企业的成本项,而是谁都不敢下牌桌的必需品。
推特上的AGI
进不了商业合同
去年10月,OpenAI和微软的新协议里写了一条:OpenAI宣布AGI之后,还得由一个独立专家小组核验。

今年2月两家又联合重申,合同里AGI的定义和认定流程「均保持不变」。
到了4月,协议再度修订,微软的收入分成改为「与OpenAI技术进展无关」,外界普遍解读为AGI条款对商业利益的触发作用已经大幅弱化。
也就是说,Brockman在记者会上说什么、黄仁勋在X上写什么、ARC-AGI-3跑了多少分,都不构成合同意义上的AGI认定。
眼下正是OpenAI筹备IPO的关键节点,死对头Anthropic也在冲刺上市。
「AGI」这个词早已写进了OpenAI与微软、亚马逊的投资协议里,它牵动的已经超出技术信仰,还有股权定价和商业控制权。
这就能解释,为什么Brockman只敢说是「个人判断」,为什么OpenAI官网严防死守不提AGI。
舆论场上可以尽情欢迎AGI时代,落到合同里,一个字都不能多写。
谁有资格宣布AGI?
Bloomberg一篇长文把这个问题捋了一遍,答案是没人说了算。

先看定义。
OpenAI的版本是「在大多数具有经济价值的任务上超越人类的系统」。
谷歌DeepMind 2023年的论文不看经济价值,看通用性,看能不能用很少的数据学会新技能。
ARC Prize更直接,说经济价值「是衡量智能的错误尺度」,他们的定义是「能高效习得训练数据之外新技能的系统」。
连词也都不一样。
Anthropic的Dario Amodei不爱说AGI,改叫「强大人工智能」(powerful AI)。微软的Mustafa Suleyman造了个「可用人工智能」(artificial capable intelligence)。
Meta和OpenAI最近干脆跳过AGI,直接谈「超级智能」(superintelligence)。
时间表更乱。
2024年9月,奥特曼说「指向AGI的系统正在显现」,甚至说「几千天内」可能有超级智能。

一年后GPT-5发布,他承认「我们还缺一样相当重要的东西」,但没说缺什么。
再一年,Brockman在Astra发布会上说「欢迎来到AGI时代」。
DeepMind那边,Shane Legg从1999年起就押2028年前实现AGI的概率是50%;Demis Hassabis却说还要五到十年,时间线看起来在缩短,只是因为「AGI的定义正在被稀释」。
于是就出了眼下这个局面。
同一个词,四拨人用四种方式定义它。
模型公司握着产品叙事,只晒跑分不下定论;
芯片巨头握着算力叙事,急着宣布时代降临;
基准机构握着测试标尺,死死咬住底线,不承认;
微软这样的大金主握着合同条款,稳坐钓鱼台,按规则算账。
过去四年,全行业争的是谁最先做出AGI。
最近,叙事时态变了,从「还要一到三年」「最快半年」,直接跳到「已经到来」。
可一套公认的AGI验收标准,至今没人拿得出来。
参考资料:
https://x.com/JensenHuang/status/2096700264569090384
https://www.bloomberg.com/news/features/2026-09-04/what-is-agi-openai-anthropic-race-for-artificial-general-intelligence
https://www.axios.com/2026/09/03/openai-astra-gpt-6-agi-brockman
编辑:元宇
声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!