GPT-6来了,立摘ASI坐标系今日金牌!

浏览15次 点赞0次 收藏0次

终于,Astra 来了!

今天,OpenAI 正式发布 GPT-6 Astra。ARC-AGI-3 打到 99.9%,FrontierMath Tier 4 拿下 97.6%。

数字在这里开始有些苍白。

OpenAI 总裁 Greg Brockman 在发布会上喊出:「Welcome to the AGI era.」


Fable 5.1 的 SOTA 只有可怜的两天。

9 月 1 日,Anthropic 刚把 Claude Fable 5.1 推上王座:Ramp 让它连续跑了 38 小时,中途发现训练数据标签有错,自己改掉,自己开六组实验,自己写结论。

9 月 2 日,谷歌发了 Gemini 3.8 Flash,外部实测在多项编码基准上够到 Claude Opus 5 那一档。

DeepMind 核心研究员姚顺宇评价:「对模型是一小步,对递归自我改进是一次巨大的飞跃。」

9 月 3 日,GPT-6 Astra 落地。

三天,三颗炸弹。放在两年前,随便哪一颗都够行业消化一个月。

而这还不是最让人紧张的部分。

GPT-6 Astra 的发布背后,藏着一段略显坎坷的故事。

8 月 7 日,OpenAI 发了一篇措辞罕见的声明——

它能独立发现此前无人知晓的系统漏洞,独立编写攻击代码,独立完成从入侵到深层渗透的全过程。

为此,OpenAI 甚至暂停了两周的强化学习训练。

Altman 发表长文:「我们暂停了一些前沿 RL 训练,以确保达到新能力水平所需的对齐、安全和监控标准。」

刹车本身就是信号。

就在 GPT-6 发布的前两天,马斯克和 Altman 在 G20 峰会上的发言,几乎可以当作这一周的注脚。

马斯克视频连线,原话是:「AI will just crush all humans at software.」(人工智能将会在软件领域彻底碾压)

他给了一个明确的时间表——未来 12 到 18 个月,AI 在软件上将达到「Stockfish 级别」,像国际象棋引擎碾压顶尖棋手一样碾压人类程序员,并且「在所有形式的工程和一切数字事务上都会极其出色」。

AI不仅会击败人类,还将训练人类。


Altman 把 AI 比作电力:「说一个国家不要 AI,其糟糕程度大约相当于一百多年前说我们不要电。」

但紧接着他也说了另一句话:「担忧是有道理的。担忧是我们预判问题的方式。除非人们非常紧急地行动,否则网络安全方面会出很大问题。」

然后 GPT-6 落地了。ExploitBench 满分。

奇点已过,进入 ASI 冲刺期

去年是十周年,我们说 2027 年 AI 抵达 ASI 临界点。

一年过去了。METR 那条「AI 独立完成任务的时长每七个月翻一番」的曲线不但没有放缓,最新数据显示翻倍速度可能已经加快到每三到五个月。


38 小时的连续自主运行已经是事实。ARC-AGI-3 满分已经是事实。ExploitBench 满分已经是事实。

我们未必已经抵达 ASI。但我们已经进入通往 ASI 的超高加速段。

奇点已至。现在是 ASI 冲刺期。

的 logo 像一个黑洞的视界。十一年,我们站在视界边缘,记下所看见的。

今天再往前看,像走到了地图失效的地方。再往前,旧的刻度、旧的榜单、旧的更新周期,都不够用了。


十一年前我们点燃第一束烛光时,ASI 还是遥远的词。那时候,把看见的记下来就够了。

这个时代,媒体得先有一套观测工具,才谈得上记录。

模型的坐标散在几十个地方。跑分在 LMArena、Vals.ai、MathArena、SWE-bench 这些榜上,价格在各家定价页和 OpenRouter 上,社区在全球各处吵。

同一张榜,单 Agent 和多 Agent 并行的分能差好几个点,厂商发布稿只挑高的那个写。

结果就是两种:每天焦虑地刷消息,越刷越乱;一种干脆不跟了,等别人告诉他结论。

不过,两种都不该是 2026 年的读法。

所以我们干脆让 Agent 来干这件事。让它持续追踪、整理、校准来自不同数据源的变化,不睡觉,不漏拍。落点只有一条——

你不用自己刷遍全网,也不会错过 ASI 重要的坐标变化。

我们决定做一个 ASI 坐标系

所以我们决定做一套新的 ASI 观测系统。

不是半年更新一次的榜单。不是发布后就静止的文章。是一张每天重新变化的坐标图。

它叫 ASI 坐标系

十几家独立数据源、29 个二级指标,归到 7 个维度——智能、推理、知识、编码、Agent、经济、效率,合成一个 0 到 100 的总分。

十几张榜换算到同一把尺上,才有得比。多源交叉验证,任何单一数据源在全体系里不超过 15%,没有哪张榜说了算。


其中,核心模块叫ASI 今日看板。回答的是:今天全球模型坐标发生了什么变化?

谁上升,谁下降。能力、价格、速度有什么新动静。每天一张,看完就知道今天该重新认识谁。

重点在「今日」,它一直在更新中。

为什么GPT-6 Astra

能拿89.1分?

GPT-6 Astra 是今天刚官宣的,OpenAI 的开发者文档才挂上去,它就已经进了我们的看板,分算完了,排在第一。

昨天这一轮里它还只是「GPT-6 灰测」的传闻,今天一官宣,几路证据一凑齐,立即直接进官网。


它只盯最近 7 天新上线的文本大模型。

数据来源一共五路。第一路,是OpenRouter 模型目录,看上架时间、价格、上下文长度。第二路,LMArena 周榜快照,看模型第一次出现在哪周。第三路,我们自己的模型库,有发布日期的以它为准。第四路,公众号当天和前一天的文章,按厂商名和「发布、上线、版本号」这类关键词筛标题,拉正文,再从里面提取模型能力信息。

能力图七个维度就是坐标系那七维:智能、推理、知识、编码、Agent、生态、经济。

今天的排名:

  • GPT-6 Astra 89.1 分第一;

  • Claude Fable 5.1 84.9 第二;

  • Gemini 3.8 Flash 81.5 第三;

  • Muse Spark 1.3 78.9 第四。




GPT-6 Astra的89.1分怎么算出来的?

这里一共关注四项:能力、 关注度、可用度、新鲜度。


其中,能力占大头,贡献 47.5 分。

关注度贡献 22.6 分, 公众号的发文数和阅读量全部拉满。可用度只贡献 9 分,是四项里最低的,因为GPT-6 Astra刚刚官宣,普通用户还用不到。新鲜度 10 分, 今天上线,所以满分。

过去是模型发布、编辑看新闻、等第三方评测,评测出来热点已经过了。

现在是它一官宣,早上机器自己把证据凑齐、图画好、分算好推到官网上。GPT-6 上线第一个早上,我们已经在分析它了。

其他栏目,包括秒追 ASI,回答的是:刚刚发生了什么?

新模型发布,版本上线,跑分更新,价格变化,实验室关键动向。机器人逐秒抓取,人类编辑一分钟内裁定。抓到即成条,最近三天滚动。

ASI 爆点,回答的是:今天全球 AI 社区在争论什么?不看谁声量大,看什么最热,每小时同步一次。

三个模块,三个时间尺度。秒追管秒,爆点管小时,看板管天。

ASI 启示录放每日深度和 Top 10 热文,视频和直播也在。上线之后,慢慢逛。

9 月 7 日,见

9 月 7 日,十一周年。ASI 坐标系官网正式上线。

有些东西值得等,我们想让你先知道它。

所以这条评论区,也是这套系统上线前的需求入口。

在 ASI 官网正式开放之前,我们想知道一件事——

面对越来越快的模型迭代,你最希望每天看到什么?最新跑分?价格变化?模型能力的升降?还是社区里真正的爆点?

欢迎留言告诉我们。

这一次,我们不再按月回望AI。从今天开始,按秒追踪 ASI。

编辑:所罗门

声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯