智能AI
morning
刚刚,GLM-5.3撕开闭源安全神话!0.1倍参数追平Mythos战力
摘要
新智元报道 AI猎杀漏洞这件事,彻底卷起来了。 两个月前,Anthropic的Mythos自主挖出FreeBSD里藏了17年的漏洞,安全圈集体失眠。 就在刚刚,Cursor也被一个中国AI翻了。 清华NASP实验室用它深入底层架构,直接在权限校验逻辑里撕开了一道口子。攻击者一旦利用,可以任意写入文件,甚至接管Cursor整个开发环境。 这个AI,是智谱刚发布的GLM-5.3。7530亿参数,体量只...
GLM
新智元报道
AI猎杀漏洞这件事
彻底卷起来了
两个月前
Anthropic的Mythos自主挖出FreeBSD里藏了17年的漏洞
安全圈集体失眠
就在刚刚
Cursor也被一个中国AI翻了
清华NASP实验室用它深入底层架构
2026-08-15
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 AI猎杀漏洞这件事,彻底卷起来了。 两个月前,Anthropic的Mythos自主挖出FreeBSD里藏了17年的漏洞,安全圈集体失眠。 就在刚刚,Cursor也被一个中国AI翻了。 清华NASP实验室用它深入底层架构,直接在权限校验逻辑里撕开了一道口子。攻击者一旦利用,可以任意写入文件,甚至接管Cursor整个开发环境。 这个AI,是智谱刚发布的GLM-5.3。7530亿参数,体量只有Mythos的十分之一,安全评测的得分却实现了正面反超,国内安全圈今天也沸腾起来。 2436个漏洞,有些藏了45年 从GLM-5.2发布以来,智谱拉上国内顶尖安全团队,一个多月后,战报定格在2436个漏洞。 其中1097个中高危,触角横跨系统内核、浏览器引擎、开源组件,一路探到互联网底层协议,涉及269个项目。 最老的一个,可以追到45年前。参照Zerodium、Pwn2Own的公开悬赏,漏洞估值高达3000万元。 这些漏洞离你有多近? 一款日活数亿的国民级通信软件,被翻出了一个「零点击」漏洞。不用骗你点链接,不用骗你下文件,对方发来一条看着完全正常的消息,你的手机就可能直接换主人。 这个漏洞蛰伏在私有协议和内存管理的交界处,触发条件极难复现,公开资料几乎为零。 而研究人员则靠着GLM-5.3从海量二进制代码里定位异常、还原逻辑,赶在漏洞被利用之前把路堵死了。 一场可能席卷数亿人的安全风暴,就这样被扼杀在了摇篮里。 同时,企业邮箱也没跑掉。 赛博昆仑用GLM一口气挖出三枚微软漏洞,串联起来就是一条完整攻击链:预览一封邮件就可能中招,服务端可被远程打穿。 2021年同类漏洞在ProxyLogon事件中让全球大量Exchange服务器沦陷。 这一次,灾难在引爆前被悄然解除。微软完成修复后,官方致谢了「Kunlun Lab & GLM」。 但2436个漏洞里,最让人后怕的,藏在DNS里。 DNS是整个互联网的导航枢纽。你在浏览器敲个网址,DNS把你领到正确的服务器。 没有它,互联网就是一片没有门牌号的废墟。这套协议诞生于1983年,比绝大多数互联网公司都老。 43年了,全世界安全研究员拿着放大镜审了一遍又一遍,无数轮自动化扫描反复过筛。没人发现问题。 如今,GLM-5.3只用两周时间,就找到了一类初期就潜伏在里面的协议级漏洞。 攻击手法并不花哨,却招招致命。 攻击者发送少量特殊构造的请求,就能把服务器的计算压力放大近8万倍。一个人在门外敲门,门里骤然炸开8万人的砸门巨响。服务器直接过载。 后果就是,网站打不开,邮件中断,云服务瘫痪。潜在影响超过1000万处公网DNS服务。 不过,在GLM-5.3的帮助下,这颗埋在互联网地基里45年的定时炸弹,在引爆前就已经被拆了。 追凶Neo:攻击的是AI,抓住它的也是AI 更厉害的是,GLM不只会挖漏洞,还能顺藤摸瓜抓人。 7月,安全团队盯上了一台巴西的可疑服务器。GLM-5.3接手一查,发现背后藏着的不是人类黑客,而是一个AI Agent,代号「Neo」。 Neo专门盯A国的会计师事务所和税务机构。 不到两个月,它自己搭了4台服务器、注册7个域名、爬取6万个邮箱地址、写了100多个脚本,发出18567封钓鱼邮件。全自动,不知疲倦。 但Neo把犯罪痕迹散落在数千个目录、数万份日志里,靠人工几乎不可能拼回去。 但这并没有难倒GLM-5.3。 通过对海量数据的分析,它把整条攻击链还原了出来:谁是猎物、邮件系统怎么搭的、怎么伪装成客户把恶意文件投出去。 最终,Neo被逮了个正着。 十分之一的体量,正面反超 实战够硬了,评测榜上又是什么水平? CyberGym考的是看懂代码、定位漏洞、判断危害等级的综合能力,安全圈公认的硬指标。 在这里,GLM-5.3直接拿到了84.5%的高分,10倍体量的Mythos是83.8%,OpenAI旗舰GPT-5.6是83.6%。参数量差了一个数量级,得分反而最高。 而到真正要亲手打穿漏洞的ExploitBench和ExploitGym上,GLM-5.3还没追上Mythos,但比上一代翻了两到三倍,差距正在被快速压缩。 看到这,我们也迫不及待地用Vibe Coding搭了几个产品,让GLM-5.3帮忙看看。 首先,是一套版本化素材库AssetFlow。 我们上传了紫色的v2去替换蓝色的v1,页面上版本号和预览图全都刷新了,看起来没任何问题。 但点了「下载最新版本」之后,拿到的文件还是v1。表面一切正常,打开文件才发现版本对不上。 GLM-5.3沿着上传、存储、索引、下载四个环节逐一追查,最终定位到缓存层只区分了素材ID,没有区分版本号。 它给出的修复方案也不是简单地清空缓存绕过问题,而是让系统先锁定版本号再去读缓存,把三条链路真正隔离开。 接下来是团队看板SprintBoard。 操作的时候我们发现,用普通成员何川登录时竟然能打开属于周一的任务,甚至菜单里居然还提供了「删除」选项。点了一下之后,任务就真的没了。 而且,不止权限在裸奔,数据也没有全部写进数据库。 多人同时编辑同一条任务的时候,后保存的人会覆盖前面的内容,完全没有冲突检测。 GLM-5.3接手之后,把权限判断挪到了服务端,数据做了持久化,并发编辑加上了冲突提示,一个「能用但不安全」的原型被改造成了可以交付的产品。 最硬核的一个是3D智能仓库。 8台AGV机器人自己接单、寻路、搬货架、排队充电,整套调度逻辑都能跑通。但跑通不等于安全。 我们直接让GLM-5.3把这套系统接进了攻防闭环,身份认证、消息签名、防重放、异常检测、哈希链审计、安全模式急停全部加上。 跑起来毛病一堆,它顺着服务端、前端、遥测数据一路查回去,一个一个修掉,最终33项攻防加业务测试全部通过。 开源Coding一哥,杀回来了 当然,安全只是GLM-5.3的一面。写代码,它也没打算让任何人。 在六项主流编程评测中,GLM-5.3全部拿下开源第一。 Terminal-Bench 3.0衡量真实终端环境里的复杂任务能力,GLM-5.3从上一代的4.6直接拉到28.3。 Agents' Last Exam考跨工具协作和长程任务,GLM-5.3拿了28.5,逼平GPT-5.6 Sol的28.6。 而在AutomationBench和GDPVal-AA v2上,GLM-5.3干脆反超了所有闭源模型,拿下全场第一。 效率方面,在模拟真实编码体验的Z.ai Code Bench上,GLM-5.3 High达到了31.4%的准确率,超过Claude Opus 4.8 Max的29.5%。 不仅如此,每个任务GLM-5.3平均只要5万tokens,而Opus 4.8需要12万。 开源Coding一哥的名号,智谱这一代算是给夺回来了。 话不多说,我们又用真实项目试了试。 上来先做一个经典的迷宫吃豆游戏。地图建模、碰撞检测、路径算法、多个实体的状态管理,GLM-5.3一次生成全部到位。 甚至没人要求,它自己还给加了个调试模式——把每个敌人的目标点和预测线路都展示了出来。 接下来,我们又把俄罗斯方块从平面变成了3D立体的。 方块可以绕X、Y、Z三条轴翻滚,以前是琢磨「往哪儿塞」,现在是琢磨「从哪个角度给怼进去」。 好玩是挺好玩的,就是到后面
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱