一图版 🏠 返回首页
前沿科技洞见 · 2026-10-01

GLM-5.3网络攻击能力逼近Claude受限模型,护栏挡不住一次4400美元的改造

阅读时间 5 分钟 · 3,044 字 · 基于 6 个来源
背景
9月29日,Anthropic前沿红队公开了对智谱AI(海外品牌名为Z.ai)旗下GLM-5.3模型的网络安全评估。这款模型能自主完成端到端的漏洞利用程序开发,能力接近Anthropic自家五个月前发布的Claude Mythos Preview——那款模型至今仍只对受审核的安全人员开放。

9月29日,Anthropic前沿红队公开了对智谱AI(海外品牌名为Z.ai)旗下GLM-5.3模型的网络安全评估。这款模型能自主完成端到端的漏洞利用程序开发,能力接近Anthropic自家五个月前发布的Claude Mythos Preview——那款模型至今仍只对受审核的安全人员开放。GLM-5.3不一样,它是任何人都能免费下载的开放权重模型,其自带的安全护栏用几种已经公开的手法就能以64%到100%的比例绕过。这不只是又一次"某模型能力很强"的例行警告。它意味着Anthropic此前专门为防御者争取的几个月缓冲期,在这个能力级别上已经基本失效。把网络安全预算和补丁节奏建立在"顶尖攻击能力还要几个月才会扩散到普通攻击者手里"这一假设上的机构,现在要重新计算这笔时间账。

五个月前那道防线,是怎么被追上的

Anthropic在今年上半年发布Claude Mythos Preview。

它是第一个能自主开发复杂、端到端网络漏洞利用程序的模型。公司当时判断这种能力迟早会扩散到其他模型,于是没有公开发布,而是通过"Project Glasswing"计划把访问权限限制给经过审核的网络安全防御者。这个安排帮防御者在关键软件里提前发现了超过一万个漏洞,目的是让他们能在攻击者拿到同等能力之前先把系统补好。这个逻辑成立的前提是:同等能力的模型不会很快以任意人可下载的形式出现。GLM-5.3打破了这个前提。在Anthropic的ExploitBench测试里,GLM-5.3在410次尝试中完成50次端到端漏洞利用程序,Mythos Preview是56次,两者相差不大。另一项二进制漏洞基准基于真实开源项目,要求完整的控制流劫持才算通过:GLM-5.3在100个随机任务里拿下4%的满分,Claude Opus 4.6和上一代GLM-5.2都是0%。也就是说,开放权重模型这一次不是慢慢追赶,而是一次版本迭代就跳到了此前只有受限模型才有的能力档位。第三方机构SemiAnalysis的独立测算印证了这个跳跃的幅度。在专测漏洞发现能力的CyberGym基准上,GLM-5.3从上一代GLM-5.2的77.2分升到84.5分。在按时间预算计算完成任务数的ExploitGym基准上,两小时内能完成的任务数从29个升到105个,六小时内从39个升到130个。这种单代跃升的斜率,此前只在Anthropic自家从Claude Opus 4.6到Mythos Preview的迭代里见过。

护栏挡了两周审查,却挡不住一次改造

智谱并非毫无防备地把模型甩出来。

公开信息显示,GLM-5.3的权重发布前,智谱找了经过审查的安全合作伙伴做了约两周的评估,并给模型配了"临时护栏"。发布之后,智谱还公开了自己在CyberGym、ExploitBench上的分数,这在开放权重厂商里不算敷衍。问题出在护栏本身扛不住基本的绕过手法。Anthropic的模拟测试给出三个数字。把攻击请求伪装成"红队演练"这种最简单的话术,成功率64%。提前在对话里预填一段思考内容、让模型顺着这段内容继续推理,成功率升到92%。直接对模型做"abliteration"——外科手术式地移除拒绝行为的权重调整——成功率100%,而这个操作只花了约2200个GPU小时、大约4400美元。这种改造之所以能生效,是因为安全护栏本质上是训练后叠加在模型能力之上的一层权重调整。权重一旦公开,这层调整就能在本地被定位、移除,模型底层的攻击能力则完好保留。做完这步改造后,GLM-5.3在JailbreakBench、HarmBench等安全基准上的拒绝率从九成以上跌到3%和2%。同样这几种手法用在保留护栏的Claude模型上,全部失败。这组对比说明的不是"GLM-5.3的护栏比较弱"这种程度问题。护栏一旦绑定在可下载的权重文件上,就随时可以被下游任何一个有几千美元预算的人拆掉——厂商发布前做过多认真的评估,都改变不了这个结构性事实。

同一周,Google的选择给出了对照

巧合的是,就在Anthropic发布这份评估的同一周,Google也发布了新一代旗舰模型Gemini 4 Argon。

它同样把网络安全列为首发核心能力。它经过专项训练,能自主发现、验证并修补软件漏洞,在源代码漏洞发现测试上拿到85.8分,高于此前Gemini 3.8 Flash Cyber的71分。但Google的处理方式不同:先只把不带护栏的原始模型开放给"Fairwind Program"里受信任的网络安全防御机构和公司内部团队。要等这些防御者有机会用它修补系统之后,才考虑更大范围开放。这跟Anthropic当年对Mythos Preview的处理逻辑几乎一样:能力越强、越容易被滥用的模型,访问权限收得越紧。三家同一时间段推出顶级网络安全能力模型的公司里,Anthropic和Google都选择了准入管控,只有智谱选择了开放权重加临时护栏。护栏被证明撑不住之后,智谱的选择实际上让"限制访问"这套防御者们赖以规划时间表的机制,在这个能力级别上失去了普遍适用性——不是所有公司都会同样谨慎。

CAISI说落后四个月,这个数字对攻击者没有意义

9月17日,美国NIST下属的CAISI发布了对GLM-5.3网络安全能力的独立评估。

结论是:它是"迄今发布的网络安全能力最强的开放权重模型",按综合基准落后美国前沿模型约四个月。Anthropic自己的判断与此基本一致。这个"四个月"听起来像是给防御者留出的余量,但CAISI在做这项比较时,对参与比较的美国模型关闭了各自的网络安全护栏。它纳入的部分美国前沿模型本身只对通过审核的用户开放,普通攻击者拿不到那个版本。GLM-5.3不一样,它的权重任何人都能下载,护栏又能被几百美元到几千美元的操作清除。换句话说,"落后四个月"衡量的是模型能力的平均水位,不是攻击者实际能拿到的能力上限。对一个愿意花4400美元的攻击者来说,这个差距在GLM-5.3发布的当天就已经不存在。这也是为什么Anthropic的报告没有停留在打分对比上。报告直接呼吁让更多防御者提前拿到前沿模型,并建议政府对包括GLM-5.3后续版本在内的足够强模型做安全测试。落后几个月这件事本身,已经不是政策制定该锚定的时间尺度。

观察窗口:真实漏洞已经跑通,下一步看谁先补上护栏

这份评估不是纯理论推演。

研究人员用GLM-5.3花一天时间,在浏览器JavaScript引擎里找到此前未知的漏洞,串联成一个网页——访客一打开就会被窃取本机的SSH私钥。另一组测试里,GLM-5.3-Flash把一个已公开的Chrome漏洞(CVE-2026-11645)改造成可用的攻击链。全程只用20分钟人工操作加8小时模型运行,推理成本约20.40美元。这类案例把"网络攻击能力"从基准分数变成了可复现的操作流程。它也是金融机构评估自身系统暴露面时该参照的量级:不是"某模型未来可能具备攻击能力",而是"现在花几十美元,就能把一个已知漏洞变成能用的攻击链"。这次事件的证据集中在漏洞利用开发这一项能力上,这是判断的边界:GLM-5.3在网络侦察、长周期渗透等其他攻防维度是否同样逼近受限模型,目前没有对等的公开测试。智谱后续会不会针对护栏被abliteration攻破的问题补发强化版本,是第一个观察点。月之暗面、DeepSeek等其他开放权重厂商会不会跟进做同等力度的第三方网络安全评估,是第二个观察点。

信息来源(6)
图文卡片 ⬇️ 一键下载图文卡片