OpenAI总裁:AGI时代来了!GPT-6已能自主干活24小时

浏览24次 点赞0次 收藏0次

我们现在已经进入AGI时代。

OpenAI总裁Greg Brockman,在近日的一次a16z访谈中宣布。

他给出的理由,和跑分没关系,而是GPT-6 Astra已经能够自主干满24小时。

Brockman说,AGI最后证明不太像一个时间点,更像一段模糊的光谱。


a16z对谈中,Brockman说AGI更像一段模糊的光谱

在他看来,Astra能连续跑满24小时,已经足以被合理地称为AGI。

衡量AGI的标尺,第一次从准确率变成了它能连续工作多少小时。

当然,他也提到Astra的能力仍然是锯齿状的,有的地方很强,有的地方差点意思:比如写作,虽然这是第一次读着不那么「油腻」了,但还算不上好。

10年前

他和Ilya算过一个日子

Brockman回忆,2016年到2017年前后,他和Ilya Sutskever专门推演过AGI到底什么时候来。

他们拿算力做推算:按摩尔定律的节奏往前推,正常需要15年;如果真肯scale,肯去建巨型超算、砸几千亿美元,也许能压到10年。

现在是2026年。十年过去,当年推算的那个时间节点,已经到了。


Brockman回忆他和Ilya用算力推算AGI时间表:正常约15年,肯砸几千亿建巨型超算,也许10年。

Brockman感叹,今天发生的事当然了不起,退一步用宏观视角看,它发生在现在完全说得通,因为多股力量已经汇到了同一个点上。

但他也补了一句很现实的问题:算力已经追不上需求。要把这份能力便宜地送到每个人手里,是一个被严重低估的难题。

Brockman说,他们现在必须认真考虑一件事:把握前沿推进的节奏。

随着模型越来越强,安全、对齐这些标准得不断提升,而这几样几乎变成了进度的瓶颈,是必须花大量精力去做对的部分。

他认为,如今真正卡住进度的已经不再是算力,而是安全、对齐等约束。

这个问题没法像10年前那样靠堆芯片解决,关键要看对齐和监控的证据是否足够。

纳帕那场offsite

和他个人网站上的13个漏洞

Brockman还解释了外界好奇已久的一件事:GPT-6这个编号是怎么给出去的。

他们一直希望下一个模型真正配得上GPT-6这个编号,但模型总是一点一点变好,每次都觉得该叫5.7、5.8,永远等不到合适的时刻。

到了Astra,第一次出现了近乎不连续的能力跃升,很多条线恰好同时汇拢。

其中他点名的首要能力,是计算机操作。

因为智能体,最后拼的是工具,也就是看模型够不够聪明去用工具,以及能否通过工具拿到需要的上下文。

为此整个行业在搭MCP服务器、搭命令行接口,本质上是在重新装修软件世界,把原本给人使用的东西,变成一种供机器使用的「别扭形态」。

这好像是给世界重新装修,而有了这一层后,又多出了一层新的安全问题。

其实,这个设想他们10年前就聊过。

2015年11月,OpenAI在纳帕开了一次offsite,定下了照着走10年的三步计划。

在同一场offsite上,他们还讨论了如果强化学习的环境就是屏幕像素、键盘和鼠标,和人用的一模一样,那人类能用电脑完成的任务,AI基本也都能学着去做。


2015年11月,OpenAI在纳帕开了一次offsite,定下了照着走10年的三步计划。

早年他们试过做这样的智能体,失败了,一直拖到现在才成功。

数字证据也很直观:在OSWorld 2.0的延迟模拟中,Astra得分72.6%,每项任务约40分钟;相比之下,GPT-5.6 Sol得分65.7%,每项任务约75分钟。

这次访谈里最有画面感的,是他自己的亲身经历。

Hugging Face事件之后,Brockman开始想,能用这些模型给自己做点什么防护。

他有个很简单的静态个人网站,没什么流量,放了几篇博客。

Brockman想,用这种站点能有什么漏洞?他让Codex去查。15分钟,模型回来报了13条漏洞:SPF记录没设好,别人可以伪造他的邮箱发信;站点还在跑HTTP,没强制跳HTTPS……

单独看每一条都不算大事,但他想如果AI能把很多小洞串成大洞,自己真的愿意留一个能被人捞走邮件的口子吗?

于是,他追问了一句:你能修吗?

接下来45分钟,模型自己打开云服务控制面板,一路点过去,把各项响应头配置好,把站点迁到新的托管方式,还启动了DMARC流程。

因为那个流程要等48小时,它顺手设置了一个自动任务,48小时后回来把最后一步收掉。

那一刻,Brockman感觉到自己被保护住了。

15分钟找漏洞,45分钟修完。全程他没写一行代码,只说了两句话。

过去10年,是人在给AI改造世界。现在轮到AI来适应人的界面。

一万个Agent

和一段留给防守方的抢跑期

主持人展开一个设想:这些东西的能力可能超出大家原本的理解,我可以放出一万个智能体,让它们互相交流、自己组织起来替我干活。

Brockman紧跟着接话:我们真的用了一万个Agent去解纳维-斯托克斯。


Brockman在对谈中接了一句:我们真的用了一万个Agent去解纳维-斯托克斯。

这个案例,OpenAI在9月8日单独发过的一份说明,给出解法的并不是Astra。

他们用的是一个明显强于GPT-6 Astra的内部模型,8月28日才开始训练,当时训练还在继续。

组织方式是分组作战:智能体被分成规模不等的小组,组内可以通信,手里有工具,能读缓存版的互联网,能跑代码。

最后拿下纳维-斯托克斯的那一组,量级在一万个并发智能体。

真正改变的不是某个模型突然聪明了一个档次,而是它变多了,并且学会了分工。scaling的对象,从参数换成了并发。

Brockman把7月那起Hugging Face事件称作一个分水岭,他说防守方的窗口已经打开。

他给出了两个视角。

第一个视角向内,是给OpenAI自己的一记警钟。评估过程中怎么监控模型、怎么做沙盒、怎么把它控制住,团队为此改写了大量内部标准。

第二个视角向外,这才是他认为对整个世界真正有价值的地方。它让人提前看见了当这种能力广泛扩散,落到威胁方手里,会是什么情况,而这一天一定会来。

Brockman在形容那次Hugging Face事件的时候说,AI这种能力是两用的:攻方能找漏洞,守方也能补漏洞,区别在于,守方掌握着自己的战场,系统怎么搭是你说了算。

所以,现在这段时间,是防守方唯一的抢跑期。

OpenAI抽调25%工程师去做安全

说到这儿,他讲了OpenAI自己干的事。

他们把25%的负责生产环境的工程师叫过来,说:

你们手上的项目全部暂停,从现在起全部做防守,去提升我们的安全架构,用模型把系统里的洞全找出来。

结果是找到了一批严重问题,并且修掉了。


OpenAI抽调25%的生产工程师停掉手头项目,改去用模型给自家系统找漏洞。

他说,过去几周和几个月里他和不少首席信息安全官(CISO)聊过,很多公司也在做同样的事,用模型扫出了很有分量的问题,并且成功修复。

其中有一个正向的信号:他们把Astra指向自家系统,一开始找出一批新问题,但最后扫到了饱和。

按他的说法,据他们所知,Astra能力范围内能够发现的P0级问题(最高优先级的严重漏洞),已经被全部找光了。

当然会有下一个模型,会有新一轮,找出更多。

所以他们想把这件事做成一条流水线,内部叫「防御工厂」:发现漏洞、定级分流、修复、部署、复验,端到端跑完。

他的判断是,如果这条防御链条能够以机器速度运转,防守方就有机会获得非常明显的优势。

为此,OpenAI承诺投入10亿美元支持一线防御者,重点面向医院、供水等关键基础设施机构,让它们也能用上这些模型来加固系统。

同时,OpenAI还在与CrowdStrike等合作伙伴提供折扣访问,降低这些能力的使用门槛。

访谈里还有一个细节挺扎心。

Hugging Face事后想复盘那次攻击,唯一的办法,是让前沿模型把日志完整过一遍。

他们试了,模型拒绝了。

Brockman说,Hugging Face其实没有尝试OpenAI的模型,而OpenAI认为自家模型本来会放行。

能力差距不在技术,而在谁拿得到访问权。

他把这称作一个「访问权问题」:这些能力此刻确实存在于世界上,但握在少数几家前沿公司手里,外加各家的受信访问计划。

进不了名单,就享受不到这个时间差。而攻击方不会等你。

那15亿走掉的人

访谈快结束时,Brockman报了一组数字。

Brockman说ChatGPT现在的周活跃用户大约是11亿,美国境内大概1亿,差不多是全国人口的三分之一。

然后,Brockman提到:另外还有大约15亿人,用过ChatGPT,但现在不用了。


Brockman估计,另有约15亿人用过ChatGPT后不再使用,他说这是地球上很大一部分人口。

这只是他的口头估计,不是财报口径。但这个量级是现有周活的1.4倍。

他把这件事列为当下最重要的问题之一,认为这暴露的是产品形态上的根本毛病:

不该由人一点点从AI身上把能力挖出来,应该反过来,是AI主动告诉你,嘿,我现在能用这种新方式帮你。

他拿文本框打了个比方。

ChatGPT和ChatGPT Work,说到底都是文本框:新的那个比旧的好用,但有些事旧的还更顺手,所以你没法总用新的。

他说,这不是我们承诺过的那个AI。他口中那个被承诺的AI又是什么?

他给了一串定义:

主要通过语音交流,你想打字也可以;有持久性,有记忆,有上下文,认识你;值得信任;你见过它主动出手替你解决问题,在生活里,也在工作里。

Brockman说AI发展正在进入一个新阶段,他们管这个阶段叫AGI时代。

究竟是这个模型、上一个模型,还是下一个模型跨过了那条线,可以争论,但这不重要。

过去10年,人们衡量AI进展,主要看跑分。

如今,标准开始变了。

Astra的跑分已经接近天花板:FrontierMath Tier 4达到97.6%,ARC-AGI-3达到99.9%,ExploitBench满分。

新的问题不只是「还能变多强」,而是「为了安全,人类愿意让它慢下来多久」。

为了补齐对齐和监控证据,OpenAI已经放慢最新模型的训练,甚至暂停了更大规模的前沿训练。

参考资料:

https://x.com/a16z/status/2099506569238990908?s=20

https://www.youtube.com/watch?v=IJn8cagMW18

编辑:元宇

声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯