🖼️ 图文卡片 🏠 返回首页
前沿科技洞见 · 2026-06-29

GLM-5.2 在漏洞挖掘评测上与 Claude Mythos 持平,Coinbase CEO 宣布将中国开源模型设为工程师默认

资料提供:前沿科技研究部
正在发生的事很多,这件帮你看过了

GLM-5.2 在漏洞挖掘评测上与 Claude Mythos 持平,Coinbase CEO 宣布将中国开源模型设为工程师默认

2026/06/29

Semgrep 是一家专注代码安全扫描的公司,6 月 28 日发布了一篇题为《We Have Mythos at Home》的博客,声称其内部网络安全基准测试中,智谱 AI(Z.ai)新发布的开权重模型 GLM-5.2 超越了 Claude Mythos。同一天,Coinbase CEO Brian Armstrong 在 X 上公开宣布,公司已将 GLM 5.2 和 Kimi 2.7 通过内部 LLM 网关设为工程师的默认模型——原因是成本,不是能力上的领先。《华尔街日报》随后报道,部分研究者批评美国对中国开源模型出口管制过于宽松。三件事发生在同一天,各自来自不同机构、不同立场,放在一起读才能看出这件事真正的含义。

GLM-5.2 安全基准的测试结论与边界

Semgrep 的测试聚焦于一个具体的垂直场景:网络安全漏洞挖掘(bug finding)。他们在自己的评测基准上,将 GLM-5.2 与 Claude Mythos 进行了对比,结论是"GLM-5.2 在我们的网络安全基准中超越了 Claude"。The Verge 的报道补充了重要限定:GLM-5.2 在通用任务上仍然落后于 Anthropic 和 OpenAI 的模型——它的能力不是全面赶上,而是在特定垂直场景的专项评测上追平了顶级模型。

这一测试有几个值得注意的边界条件:第一,Semgrep 的评测是单一公司的内部基准,不是经过第三方广泛验证的通用结论;第二,"漏洞挖掘"这一场景对代码理解和模式匹配的要求与通用推理不完全重叠,特定领域的训练数据和精调策略能产生明显效果;第三,GLM-5.2 是开权重模型,任何人都可以下载和部署,这与 API 访问受限的闭源模型有本质不同。

WSJ(经 Techmeme 转述)报道的批评角度提供了补充:部分研究者认为美国对中国开源模型的出口管制政策"过于宽松",因为一旦开权重模型公开发布,就无法通过管制渠道限制其传播和使用——Semgrep 的测试本身就是一个证明,任何拥有计算资源的团队都可以在本地运行 GLM-5.2 并在自己的基准上测试。

Coinbase 的选择:成本驱动,而非性能领先

Coinbase CEO Brian Armstrong 的公开表态用词很直接:公司通过内部 LLM 网关将 GLM 5.2 和 Kimi 2.7 设为工程师的默认选项。华尔街见闻的报道给出了驱动力:随着顶级美国模型 API 成本持续攀升,中国开源模型在不压制使用量的前提下大幅降低了 AI 支出。这不是 GLM-5.2 在所有任务上超越了 Claude,而是在日常编程辅助这类高频低复杂度任务上,GLM-5.2 已经"足够好",而且便宜得多。

这两个事实叠加起来呈现的逻辑是:Coinbase 的切换不是一次能力评测的结论,而是一次成本结构的优化。但它的信号意义在于——中国开源模型已经越过了"企业生产环境可用"的门槛,在真实的 B 端采购决策中出现了。

三个视角叠加的信息增量

单看任何一个视角,信息是片面的。Semgrep 的测试说的是一个特定场景的能力比较;Coinbase 的切换说的是成本逻辑驱动的采购行为;WSJ 批评说的是出口管制政策的结构性漏洞。合起来看,指向同一个结构问题:

美国对中国 AI 的出口管制,在开源模型面前出现了政策工具的失效点——芯片出口管制的设计假设是"没有 Nvidia GPU 就无法训练顶级模型",开源模型访问限制的设计假设是"限制 API 调用就能限制能力传播",但 GLM-5.2 的情况表明,通过替代硬件方案和开源发布的组合,至少在部分专项能力上已经绕过了这两道闸门。

需要说明的是:这里能确认的事实是 Semgrep 自己的基准测试结论,以及 Coinbase CEO 的公开表态;GLM-5.2 是否在更广泛的安全任务上普遍达到 Mythos 水平,仍需要更多独立评测来验证。Coinbase 切换的规模和具体场景细节也未公开披露。在上述信息范围内,这三件事放在同一天出现,是一个值得关注的信号——但不应该被读成"中国 AI 全面超越美国"的结论。

参考资料

图文卡片 ⬇️ 一键下载图文卡片