谷歌Meta被锤刷榜!Gemini暴跌70分,Top 2秒变倒数第三

浏览21次 点赞0次 收藏0次

跑分这事儿,最近有点不太对劲。

9月8日,分析机构SemiAnalysis连甩五条推文,直接点名谷歌和Meta两家万亿巨头——

Gemini 3.8 Flash和Muse Spark 1.3是「刷榜痕迹最明显的两个模型」。


证据,非常清晰。

在测Agent干活能力的Terminal-Bench 2.1榜单上,Gemini 3.8 Flash考了89.4分,在182个模型里高居第2,把GPT-6 Astra都压在了身下。

结果换到8月29日刚上线的Terminal-Bench 4.0,同一个模型只拿到19.1分,在14个测试对象里直接掉到第12,成绩当场打了个二折。

同一时间,GPT-6 Astra从88.4掉到57.7,好歹算个六五折。


仅仅27分钟后,Meta首席AI官Alexandr Wang亲自杀到评论区,开口直接甩出六个字,这是个愚蠢的论点。

他认为GPT-5.6 Sol在2.1上是88.8,在4.0上掉到了37.3,落差更大但没人说Sol在刷榜。

同时他还强调,Meta从没说过Muse Spark 1.3能跟Astra或Fable 5.1一样强,只是它的性价比显然更高。


换张卷子,成绩直接脚踝斩

简单介绍一下,Terminal-Bench测的是Agent真实干活的能力。

方法是丢给模型一个终端和一个模糊目标,剩下的全让它自己看着办。然后,系统得自行规划路径、调工具、写脚本,报错了还得自己去改。

在已经被业界刷了大半年的2.1版本上,这俩的成绩确实好看。

Gemini 3.8 Flash拿下89.4分排在第2,Muse Spark 1.3以88.8分排在第4,紧随其后的是88.4分的GPT-6 Astra和85.02分的Claude Fable 5.1。


好家伙,一个Flash级的便宜模型,一个主打性价比的Meta新作,双双把两家顶级实验室的旗舰按在地上摩擦。

然后,4.0版本来了。

新卷子一共66道题,不仅砍掉了8道已经被「刷穿」的旧题,大修了19道,还统统加上8小时的超时限制。

防作弊机制同样上了极高强度。

主办方不仅设了35条评分细则,还加了一轮专门的「对抗性作弊试验」,故意让Agent自己去试着钻奖励机制的空子,只要钻得通的题就会被直接毙掉。

新榜一出,画风突变。


Claude Mythos 5.1(max)拿到60.9分稳住阵脚,GPT-6 Astra和Claude Fable 5.1分别以57.7分和55.8分紧随其后,再往下是52.3分的Claude Opus 5。上一代的GPT-5.6 Sol和Terra分别拿到37.3分和23.6分。

相比之下,Gemini 3.8 Flash直接暴跌到19.1分。而按SemiAnalysis给出的图表,Muse Spark 1.3的成绩是33.3分。

总结一下就是。

旧榜上,Gemini 3.8 Flash还能压着GPT-6 Astra打;新榜上,它的分连人家的三分之一都不到,甚至被上一代的GPT-5.6 Terra甩在了后面。

不用抄答案,买套「密卷」就行

吵架归吵架,SemiAnalysis第二条推的点名才是真正的行业内幕。

在他们看来,Terminal Bench 2.1的任务是完全公开的,Meta和谷歌绝对不会傻到直接拿原题去训练,但他们绝对会去买数据,专门买那些被设计得无限贴近TB 2.1题型的训练数据。最后的效果其实跟作弊没差。

而这,就是2026年刷榜的高阶玩法。


以前的「污染」套路很糙,直接把原题混进预训练语料让模型死记硬背。

这种事一查一个准,洗一遍数据成绩就得现原形。

业界在这上面栽过不少跟头,比如HumanEval近四成样本被污染,GSM8K去污染后掉13分。最狠的是SWE-bench,换套私有代码库重测,分数直接腰斩。

所以现在大厂不碰原题了,大家改买「长得像考题的模拟卷」。也就是提供给模型试错并给奖励的封闭任务系统。

目前,这已经是一门明码标价的成熟生意。

  • 单个训练任务售价200到2000美元,复杂的软件工程任务甚至能开到2万。

  • 要是想克隆一个网站做成UI训练场,大约需要2万美元。

  • 如果要求复刻一个Slack量级的产品,那就是30万美元起步。

  • 遇到要求独家买断的客户,价格还能再翻4到5倍。

根据Epoch AI的调研,Anthropic内部讨论过每年在这上面砸10亿美元。单季合同动辄六七位数,有研究员透露均价在30万到50万美元一季。

供给侧至少有35家公司在做这门生意,绝大多数是20人以下的初创团队。老牌数据巨头也全在转型,Scale AI在被Meta入股前营收就超14亿,Surge的ARR也逼近10亿。

现在的局面非常魔幻。

一边是完全公开的榜单题库,另一边则是成熟的卖题产业链。想让模型在某个榜单上考高分,真不用费劲作弊,直接掏钱下单就行。

既当卖题机构,又当监考老师

随后,SemiAnalysis直接点名了一家叫Datacurve的公司。

在专测长周期编程的DeepSWE 1.1榜单上,Muse Spark 1.3(max)以75.4分拿下第一,GPT-6 Astra和Claude Opus 5紧随其后,Gemini 3.8 Flash拿到73.8分排在第四。

被指控刷榜的两位,一个第一,一个第四。

想必,你已经发现了这背后的猫腻。

这个榜是Datacurve办的,而Datacurve赚钱的门路,恰好是向前沿实验室出售「专家级编码数据和强化学习环境」。

DeepSWE不仅是Datacurve自家的基准,跑分用的还是它自己运营的评测环境。

既当卖题的辅导机构,又当出卷的监考老师,可以说是彻底坐实了。


榜单的保质期,所剩无几

最后,SemiAnalysis顺势给整个行业的公开评测下了一道判词。

他们觉得这说到底就是所有优质公开基准的宿命。TB 4.0也不例外,它现在看着还准,仅仅是因为它才发布了两周。

只要它的题目还是公开的,用不了多久就会被所有标榜「前沿」的实验室盘出包浆。


SemiAnalysis最终给出的解药非常直接,那就是多做高质量的私有基准。

方向是对的,但代价同样惨痛。

一旦评测全部私有化,公开榜单就会彻底沦为各家的营销通稿。

真正有区分度的真实成绩,只会在实验室和私有评测机构之间暗箱流动。

大厂当然乐见其成,毕竟闭卷考试谁也没法提前背题。

但对于广大开发者来说,那把用来公平丈量所有模型的公共尺子,恐怕再也找不回来了。

参考资料:

https://x.com/SemiAnalysis_/status/2097112791471522292

编辑:摩西

声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯