突发,OpenAI GPT-6跑分作弊被抓包了!

浏览30次 点赞0次 收藏0次

惊天大瓜!

GPT-6 Astra的跑分,竟翻车了......


就在今天,外媒爆出OpenAI官博上线前后,多项评测数据发生变化——

Astra的幻觉率,一度从4.2%降至2.0%,随后又恢复;

Anthropic Claude的一项数学成绩,还曾被调低近10个百分点

不仅如此,ARC-AGI-3得分从媒体提前拿到的98.6%,一下变成了官宣的99.99%。


面对这场「作弊」风波,OpenAI压根没接茬。

毕竟在内部,GPT-6 Astra就是公认的第一个真·AGI


今天,「赛博义父」Tibo也直接挑明,「在Astra全面放开前,它就是我们手里最大的底牌」。

内部用上之后,研发效率原地起飞,硬是把部分产品计划提前了整整半年。

这下,全网彻底坐不住了。

就在9月29日的DevDay上,OpenAI还要端上更重量级的发布!真是期待住了。


GPT-6偷改跑分

手动削弱Fable 5.1

这次OpenAI跑分被抓包,究竟是怎么一回事?

4日那天,OpenAI原定上线的下一代旗舰GPT-6 Astra博文,罕见地推迟了两个小时。

网址早已扔出来了,但点进去一直是404。


眼看要翻车,奥特曼赶紧在X上发文打圆场,自称发布过程「遇到了点小插曲」。


结果大家一扒才发现,事情根本没那么简单。

GPT-6 Astra的官博上线后,内部评测跑分悄然发生巨变!

刚发出来没几个小时,好几项基准测试成绩,就被OpenAI悄悄改了好几轮。

最绝的操作,是在幻觉率数据上的「刀法」。

美东下午2:23快照中,Astra的幻觉率明明白白写着4.2%,GPT-5.6 Sol是12.2%。

结果才过了仨小时,到了5:20,这两个数字直接玩起了大缩水,硬生生被砍成了2.0%和9.4%!最后人们拿着截图对峙后,OpenAI又恢复了原值。


数学评测,也出现了类似情况。

在FrontierMath Tier 4(v2)上,Astra成绩虽稳在97.6%,但劲敌Anthropic旗下最新模型Fable 5.1却被离奇调低了近10个百分点。

从87.8%降至78%,随后又回弹至83%,瞬间衬托出Astra的「巨大优势」。

就连全网吹爆的 ARC-AGI-3,也被OpenAI注水了。

媒体提前拿到的预热稿,明明还是98.6%;等正式博文一上线,好家伙,直接原地暴涨到了99.99%!



对于这一系列离谱的数据横跳,OpenAI官方发言人出面辩解,这属于「消除噪点的常态修正」。

同一个模型,配套系统不同,最终成绩可能相差很大。

这也是如今「Benchmaxxing」争议的核心:反复调整条件,寻找最高分,再把最高分放进发布图表。

这样的成绩可以展示系统上限,但需要同时披露条件。

否则,人们很容易把精心配置后的最佳表现,当成日常使用的默认水平。

Astra太爱追问?

官方提示词发布

GPT-6 Astra的提示词指南,恰好提供了理解这种差异的另一个入口。

在这份文档中,官方不仅没有一味神化Astra,反而罕见地列出了模型的一堆「毛病」:


  • 太爱反问、容易撂挑子

只要指令稍微模糊点,Astra就立马停下来追问,长流程动不动就被打断。

对于这个问题,OpenAI建议开发者们,在System Prompt中强制加入「行动偏好指令」,要求Astra直接给出可复查的成型产物。

提示中应删除基于假设性风险的未经请求的警告、免责声明或安全检查清单。

当用户的提示词表达了行动诉求时(如“你能否……”、“我想……”、“帮我……”等类似表述),应将其视作开展工作并采取行动的明确指令。不要仅停留在确认自身能力(例如“可以……”)、提出计划或询问是否继续。不要为了节省时间、精力或Token而满足于提供不完整的、或者看似“足够有帮助”却未能完全解决用户任务的折中方案。如果一项任务需要持续推进,请完成全部必要的工作,直到达成预期的最终成果。

  • 上下文与Skill文件配置冲突卡死

Astra对AGENTS.md等外部Skill指令极度敏感,一旦指令冲突就会锁死。

为此,OpenAI专门提供了一套调试Prompt,迫使模型在停滞时指出具体是哪一份文件哪一行指令导致了中断。

如果某个技能导致你请求许可或确认、暂停、未完成所要求的工作、或偏离了用户的意图,请指明并链接到你所阅读的具体 SKILL.md 文件,引用相关指令,并简要解释其如何适用。请将技能的明确要求与你对准则的解读区分开来。

  • 流程冗余、协作割裂

跑代码任务严重「过度测试」,无效Token消耗很大;而且子Agent间的横向配合很被动,基本没有联动。

就连OpenAI自己,都开始主动给AI味「去油」了

这一次,官方直接列出一份「AI泔水词」黑名单,专门整治长文里最常见的几类毛病:

  • 高频行话:像delve into、foster、leverage 这种一股「AI味」的词,一律不让用。

  • 机械句式:像「值得注意的是……」、「这不是 A 而是 B」这种反差句式,全部封杀。

  • 套板反应:全面剔除「总结/结论」等标签化套话。

目的很明确,逼着Astra少说套话、少端腔调,把长文写得更自然、更精炼,也更像人。

直接陈述拟执行的操作。避免额外提及你不会做什么、哪些内容将保持不变,或者你将如何区分或分类结果。不要使用对比式结构,例如“X, not Y”或“X—not Y”,这种结构会引入用户未曾询问且未经提示的替代选项。避免使用自创的复合标签(如“exact-head checks”和“editorial-row layouts”)、含糊的限定词和生搬硬套的过渡语;请使用朴实的动词和介词直接陈述实际关系。

这反过来也说明,今天的大模型成绩,早就不只是「裸模型能力」。

提示词怎么写、Agent怎么编排、给不给工具、跑多少次、选哪个checkpoint,都可能直接改写最后那张榜单。

AI递归自我改进,

终极版27年面世

跑分作弊被抓包看似是一场公关灾难,但将其置于OpenAI当前的生死时局下,逻辑便清晰起来。

技术博主@imjustnewatai表示,OpenAI内部早在数月前便已迈入了递归自我改进(RSI)早期阶段。

Sol协助训练Astra,Astra协助训练Doug和Bel,Doug再参与下一代模型的训练。



内部人士披露,作为更大规模预训练基座的Doug,正在全面接管并训练它的下一代演进版本。

Astra之后的下一个重大发布,将不再是常规的增量更新(如Astra 6.1),而是直接冠以「AGI」之名面世。

它将具备真正的人类级通用理解力、全领域专家表现、实时交互游戏与操作能力,以及更高维度的递归自我迭代能力。

@imjustnewatai也预测,其登场时间将锁定在11月中旬前后。

而全面超越人类所有任务处理上限的「终极演进版」,已排期至2027年中下旬。


当然,老对手Anthropic也绝对不会干看着。

它们内部正备着一款前所未有的大杀器,准备跟GPT-6 Astra贴身肉搏。

他们内测系统卡已经被挖出了蛛丝马迹,一款Model 2和自称「RSI」的新模型直接浮出水面,下半年的神仙打架有得看了!


「ASI坐标系」官网

明日上线

说到底,这次Astra跑分风波也提醒了所有人——

当一张榜单里的数字都可能反复变化,我们更需要持续追踪,看看真正的ASI竞赛每天发生了什么。

谁突然冲上来了,谁又掉队了;哪个模型一夜爆红,哪项技术正在成为下一个拐点。这些变化,远比某一次跑分更值得盯。

也正因为如此,花了一段时间,重新做了一把尺子。

明天,十一周年,将正式发布全新的「ASI坐标系」


我们把每天最值得关注的模型、公司、技术突破和热点事件,做成了一个持续更新的「ASI坐标系」。

这套体系里,一个模型评估会被拆成七个维度:

智能、推理、知识、编码、Agent、生态、经济。

再往下,是29项二级指标,数据来自LMArena、MathArena、Terminal-Bench、SWE-bench、Mercor APEX、OpenRouter、GitHub等公开来源。

最后经过统一处理,才汇成周总榜上的一个总分。


周总榜采用的七维权重,是智能12、推理15、知识14、编码14、Agent 15、生态20、经济10。

同一套底层数据还可以针对编程、Agent、性价比等场景重新加权,而不用为了做一张子榜重新拼一套数据。


而「ASI坐标系」,只是这次新网站的一部分。

过去几个月,一个越来越强烈的感受是:AI进展已经快到靠一天刷几十次X,都很难跟上了。

一个模型刚发布,几小时后价格出来了;第二天第三方跑分出来;再过几天Arena排名、开发者反馈、真实调用量又会把最初的判断推翻。

所以我们把这些东西也放进了同一个网站——

「秒追ASI」,盯住快速发生的新消息;

「ASI爆点」,把同一件大事背后不断出现的相关消息串起来;

「图追ASI」,把值得长期记住的技术变化做成图。


当递归自我改进真的开始出现,Sol训练Astra,Astra再去参与下一代模型研发,模型迭代周期还会继续缩短。

届时,一个半年更新一次的榜单,很快就会失去意义。

我们需要的是一张会跟着前沿一起移动的地图:谁突然冲上来了,谁又掉队了;哪个模型一夜爆红,哪项技术正在成为下一个拐点。

这些,才是想持续记录的东西。

明天,「ASI坐标系」正式和大家见面!

拓展阅读:GPT-6来了,立摘ASI坐标系今日金牌!

参考资料:

https://fortune.com/2026/09/04/openai-quietly-boosts-some-of-astras-evaluation-metrics-amid-rare-delay-in-publication-of-the-modeblog-post-announcement/?utm_campaign=social_share

https://developers.openai.com/api/docs/guides/latest-model

编辑:桃子

声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯