📡 最新洞见
10月1日
GLM-5.3网络攻击能力逼近Claude受限模型,护栏挡不住一次4400美元的改造
Anthropic在今年上半年发布Claude Mythos Preview。它是第一个能自主开发复杂、端到端网络漏洞利用程序的模型。公司当时判断这种能力迟早会扩散到其他模型,于是没有公开发布,而是通过"Project Glasswing"计划把访问权限限制给经过审核的网络安全防御者。这个安排帮防御者在关键软件里提前发现了超过一万个漏洞,目的是让他们能在攻击者拿到同等能力之前先把系统补好。这个逻辑成立的前提是:同等能力的模型不会很快以任意人可下载的形式出现。GLM-5.3打破了这个前提。在Anthropic的ExploitBench测试里,GLM-5.3在410次尝试中完成50次端到端漏洞利用程序,Mythos Preview是56次,两者相差不大。另一项二进制漏洞基准基于真实开源项目,要求完整的控制流劫持才算通过:GLM-5.3在100个随机任务里拿下4%的满分,Claude Opus 4.6和上一代GLM-5.2都是0%。也就是说,开放权重模型这一次不是慢慢追赶,而是一次版本迭代就跳到了此前只有受限模型才有的能力档位。第三方机构SemiAnalysis的独立测算印证了这个跳跃的幅度。在专测漏洞发现能力的CyberGym基准上,GLM-5.3从上一代GLM-5.2的77.2分升到84.5分。在按时间预算计算完成任务数的ExploitGym基准上,两小时内能完成的任务数从29个升到105个,六小时内从39个升到130个。这种单代跃升的斜率,此前只在Anthropic自家从Claude Opus 4.6到Mythos Preview的迭代里见过。