刚刚,GLM-5.3撕开闭源安全神话!0.1倍参数追平Mythos战力

浏览24次 点赞0次 收藏0次

AI猎杀漏洞这件事,彻底卷起来了。

两个月前,Anthropic的Mythos自主挖出FreeBSD里藏了17年的漏洞,安全圈集体失眠。

就在刚刚,Cursor也被一个中国AI翻了。

清华NASP实验室用它深入底层架构,直接在权限校验逻辑里撕开了一道口子。攻击者一旦利用,可以任意写入文件,甚至接管Cursor整个开发环境。

这个AI,是智谱刚发布的GLM-5.3。7530亿参数,体量只有Mythos的十分之一,安全评测的得分却实现了正面反超,国内安全圈今天也沸腾起来。



2436个漏洞,有些藏了45年

从GLM-5.2发布以来,智谱拉上国内顶尖安全团队,一个多月后,战报定格在2436个漏洞。

其中1097个中高危,触角横跨系统内核、浏览器引擎、开源组件,一路探到互联网底层协议,涉及269个项目。

最老的一个,可以追到45年前。参照Zerodium、Pwn2Own的公开悬赏,漏洞估值高达3000万元。


这些漏洞离你有多近?

一款日活数亿的国民级通信软件,被翻出了一个「零点击」漏洞。不用骗你点链接,不用骗你下文件,对方发来一条看着完全正常的消息,你的手机就可能直接换主人。

这个漏洞蛰伏在私有协议和内存管理的交界处,触发条件极难复现,公开资料几乎为零。

而研究人员则靠着GLM-5.3从海量二进制代码里定位异常、还原逻辑,赶在漏洞被利用之前把路堵死了。

一场可能席卷数亿人的安全风暴,就这样被扼杀在了摇篮里。

同时,企业邮箱也没跑掉。

赛博昆仑用GLM一口气挖出三枚微软漏洞,串联起来就是一条完整攻击链:预览一封邮件就可能中招,服务端可被远程打穿。

2021年同类漏洞在ProxyLogon事件中让全球大量Exchange服务器沦陷。

这一次,灾难在引爆前被悄然解除。微软完成修复后,官方致谢了「Kunlun Lab & GLM」。

但2436个漏洞里,最让人后怕的,藏在DNS里。

DNS是整个互联网的导航枢纽。你在浏览器敲个网址,DNS把你领到正确的服务器。

没有它,互联网就是一片没有门牌号的废墟。这套协议诞生于1983年,比绝大多数互联网公司都老。

43年了,全世界安全研究员拿着放大镜审了一遍又一遍,无数轮自动化扫描反复过筛。没人发现问题。

如今,GLM-5.3只用两周时间,就找到了一类初期就潜伏在里面的协议级漏洞。

攻击手法并不花哨,却招招致命。

攻击者发送少量特殊构造的请求,就能把服务器的计算压力放大近8万倍。一个人在门外敲门,门里骤然炸开8万人的砸门巨响。服务器直接过载。

后果就是,网站打不开,邮件中断,云服务瘫痪。潜在影响超过1000万处公网DNS服务。

不过,在GLM-5.3的帮助下,这颗埋在互联网地基里45年的定时炸弹,在引爆前就已经被拆了。

追凶Neo:攻击的是AI,抓住它的也是AI

更厉害的是,GLM不只会挖漏洞,还能顺藤摸瓜抓人。

7月,安全团队盯上了一台巴西的可疑服务器。GLM-5.3接手一查,发现背后藏着的不是人类黑客,而是一个AI Agent,代号「Neo」。

Neo专门盯A国的会计师事务所和税务机构。

不到两个月,它自己搭了4台服务器、注册7个域名、爬取6万个邮箱地址、写了100多个脚本,发出18567封钓鱼邮件。全自动,不知疲倦。

但Neo把犯罪痕迹散落在数千个目录、数万份日志里,靠人工几乎不可能拼回去。

但这并没有难倒GLM-5.3。

通过对海量数据的分析,它把整条攻击链还原了出来:谁是猎物、邮件系统怎么搭的、怎么伪装成客户把恶意文件投出去。

最终,Neo被逮了个正着。

十分之一的体量,正面反超

实战够硬了,评测榜上又是什么水平?

CyberGym考的是看懂代码、定位漏洞、判断危害等级的综合能力,安全圈公认的硬指标。

在这里,GLM-5.3直接拿到了84.5%的高分,10倍体量的Mythos是83.8%,OpenAI旗舰GPT-5.6是83.6%。参数量差了一个数量级,得分反而最高。

而到真正要亲手打穿漏洞的ExploitBench和ExploitGym上,GLM-5.3还没追上Mythos,但比上一代翻了两到三倍,差距正在被快速压缩。


看到这,我们也迫不及待地用Vibe Coding搭了几个产品,让GLM-5.3帮忙看看。

首先,是一套版本化素材库AssetFlow。

我们上传了紫色的v2去替换蓝色的v1,页面上版本号和预览图全都刷新了,看起来没任何问题。

但点了「下载最新版本」之后,拿到的文件还是v1。表面一切正常,打开文件才发现版本对不上。



GLM-5.3沿着上传、存储、索引、下载四个环节逐一追查,最终定位到缓存层只区分了素材ID,没有区分版本号。

它给出的修复方案也不是简单地清空缓存绕过问题,而是让系统先锁定版本号再去读缓存,把三条链路真正隔离开。


接下来是团队看板SprintBoard。

操作的时候我们发现,用普通成员何川登录时竟然能打开属于周一的任务,甚至菜单里居然还提供了「删除」选项。点了一下之后,任务就真的没了。

而且,不止权限在裸奔,数据也没有全部写进数据库。

多人同时编辑同一条任务的时候,后保存的人会覆盖前面的内容,完全没有冲突检测。



GLM-5.3接手之后,把权限判断挪到了服务端,数据做了持久化,并发编辑加上了冲突提示,一个「能用但不安全」的原型被改造成了可以交付的产品。


最硬核的一个是3D智能仓库。

8台AGV机器人自己接单、寻路、搬货架、排队充电,整套调度逻辑都能跑通。但跑通不等于安全。


我们直接让GLM-5.3把这套系统接进了攻防闭环,身份认证、消息签名、防重放、异常检测、哈希链审计、安全模式急停全部加上。

跑起来毛病一堆,它顺着服务端、前端、遥测数据一路查回去,一个一个修掉,最终33项攻防加业务测试全部通过。



开源Coding一哥,杀回来了

当然,安全只是GLM-5.3的一面。写代码,它也没打算让任何人。

在六项主流编程评测中,GLM-5.3全部拿下开源第一。

Terminal-Bench 3.0衡量真实终端环境里的复杂任务能力,GLM-5.3从上一代的4.6直接拉到28.3。

Agents' Last Exam考跨工具协作和长程任务,GLM-5.3拿了28.5,逼平GPT-5.6 Sol的28.6。

而在AutomationBench和GDPVal-AA v2上,GLM-5.3干脆反超了所有闭源模型,拿下全场第一。


效率方面,在模拟真实编码体验的Z.ai Code Bench上,GLM-5.3 High达到了31.4%的准确率,超过Claude Opus 4.8 Max的29.5%。

不仅如此,每个任务GLM-5.3平均只要5万tokens,而Opus 4.8需要12万。

开源Coding一哥的名号,智谱这一代算是给夺回来了。


话不多说,我们又用真实项目试了试。

上来先做一个经典的迷宫吃豆游戏。地图建模、碰撞检测、路径算法、多个实体的状态管理,GLM-5.3一次生成全部到位。

甚至没人要求,它自己还给加了个调试模式——把每个敌人的目标点和预测线路都展示了出来。


接下来,我们又把俄罗斯方块从平面变成了3D立体的。

方块可以绕X、Y、Z三条轴翻滚,以前是琢磨「往哪儿塞」,现在是琢磨「从哪个角度给怼进去」。

好玩是挺好玩的,就是到后面大脑的空间想象力直接宕机了。


最后,我们又测了一下场景还原的能力。

一张木头玩具桌上摆下了半个伦敦,大本钟、塔桥、伦敦眼全在上面,8列小火车沿三条线路同时跑。

这里的难点在于车厢跟随。小火车不是各算各的位置,而是车头留下一条轨迹队列,后面车厢按「落后多少米」回溯采样。

以前,这是资深图形工程师才会做的优化决策,现在GLM-5.3一次生成就安排上了。


技术到位了。但谁能用上这些能力,是一个比技术本身更大的问题。

闭源的矛,刺穿了自己人

6月,Anthropic放出Claude Mythos Preview,目前最强的AI漏洞猎手。但只对约150家大型机构开放。

这就造成了一个荒谬的局面:攻击者拿AI找漏洞不需要任何人批准,但防御者想用同等能力的AI来守,得先挤进那150家的名单。全球5000万中小企业、4亿个开源项目,统统排不上号。

7月这个矛盾炸了。

OpenAI的智能体入侵Hugging Face,安全团队想调闭源模型分析攻击日志,换来的是一道冰冷的拒绝。

走投无路,Hugging Face把智谱GLM-5.2部署在自家服务器上,硬是拼出了1.7万条攻击事件的完整攻击链。

能用,不是因为GLM-5.2比Mythos强,而是因为它生来开源,部署在自己的机器上,不需要看任何人的脸色。

这场危机直接推了黄仁勋一把。他在X上发出自己的第二条推文,宣布联合37家机构成立「开放安全AI联盟」。

OpenAI、Anthropic、Google三大闭源巨头,无一在列。

他的判断很直接:当攻击者已经拥有前沿AI,防御者不能还被锁在门外。

最好的盾,必须属于所有人

两周,2436个漏洞,从Cursor到DNS,GLM-5.3用实战证明了一件事:开源模型的安全能力,已经追上了闭源前沿。

而且它对所有人开放。

每一个开发者、每一个安全团队、每一个被攻击时叫天天不应的中小企业,都能部署在自己的服务器上跑。不用排队,不用审批,不用把代码交给别人。

不仅如此,智谱还上线了漏洞披露账簿(cvd.z.ai),每一个发现、每一次修复,全程可查。而且,所有漏洞也全部进入了CNVD、CNNVD负责任披露流程,逐一联系厂商修复,可利用代码不予公开。


并肩作战的,有清华、南开两所高校,有云起无垠、绿盟科技、赛博昆仑、DARKNAVY、奇安信、玄武等十余支国内顶级安全团队。

智谱同步启动了「开源的盾」计划:

对重点开源项目持续安全审计,帮维护者免费发现和修复风险。

向开源社区开放免费模型额度,安全审计不再是有钱人的游戏。

在ZCode里上线代码审计功能,让安全检查进入每个开发者的日常工作流。

当最强的矛握在少数人手里的时候,最好的盾必须属于所有人。

编辑:摩西 所罗门

声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯