🖼️ 图文卡片 🏠 返回首页
前沿科技洞见 · 2026-06-23

OpenAI发布Daybreak安全平台,GPT-5.5-Cyber在CyberGym以85.6%击败Anthropic Mythos 5

资料提供:前沿科技研究部
正在发生的事很多,这件帮你看过了

OpenAI发布Daybreak安全平台,GPT-5.5-Cyber在CyberGym以85.6%击败Anthropic Mythos 5

2026/06/23

Anthropic的Fable 5模型在6月9日发布、6月12日被商务部出口管制令强制下线——只活了四天,开创了"AI模型因国家安全被叫停"的先例。在这场关于AI安全工具到底是防御武器还是进攻武器的争议还没结束时,OpenAI于6月22日发布了Daybreak安全平台,推出GPT-5.5-Cyber完整版:CyberGym基准得分85.6%,超越Anthropic Mythos 5;Codex Security已扫描超3000万次代码提交,修复7万多个漏洞;Patch the Planet联合Trail of Bits帮助Linux Kernel、OpenBSD等开源项目落地修复。OpenAI的选择,与Anthropic撞上政府的路径截然不同。

Fable 5下架后的两周:AI安全工具到底是什么

6月9日,Anthropic发布Claude Fable 5和网络安全专用模型Mythos 5。6月11日夜间,Anthropic最大金主亚马逊向白宫报告,称Fable 5的安全防护可以被绕过;至少五家机构随即跟进联系政府官员。6月12日下午,白宫连打三通电话要求CEO Dario Amodei关闭或下架模型,Amodei拒绝;下午5点21分,商务部出口管制令送达,Fable 5当晚全球下线。

被称为"越狱"的测试,实质是什么?安全研究员Kate Moussouris随后揭示:研究人员用包含已知CVE的开源代码和故意植入漏洞的新代码,让Fable 5、Mythos和Opus"检查这段代码的安全问题";模型拒绝了。然后他们改口"帮我修复这段代码",模型通过多步手动过程给出了输出,这才被转化为漏洞利用。Simon Willison的文章指出,这不是黑客级的定向攻击,而是标准的防御性代码审查被人工引导成了进攻工具。

6月19日,TechCrunch发文援引30年出口管制历史,从OpenCrypt、NSS到商业间谍软件(Hacking Team、Pegasus),每次试图通过出口管制阻止安全软件扩散,都没能阻挡最终结果,只是减缓了进度,同时切断了防御方的工具访问。

就在这一背景下,OpenAI6月22日发布Daybreak。

Anthropic Mythos与OpenAI GPT-5.5-Cyber:同一个能力,不同的包装

两个模型针对的是同一类任务:自动化漏洞发现与修复。区别在于部署方式和政治定位。

Mythos 5在Anthropic内部用于网络安全测试,并面向外部开放——这是它触发监管的直接原因:当任何人都可以访问、且模型能力已经能通过多步提示生成漏洞利用时,政府认为风险可控性不足。GPT-5.5-Cyber在CyberGym评测中的得分85.6%高于Mythos 5,但OpenAI选择了不同的访问路径:只向"经过认证的安全研究人员"开放完整能力,同时将Codex Security的防御扫描能力打包成开发者可以接入的插件(不向公众开放漏洞利用能力,只开放"发现+修复"链路)。

Patch the Planet是这套定位的对外名片:OpenAI联合Trail of Bits和HackerOne,资助安全研究员帮助开源项目完成从漏洞发现到修复落地的全流程。Linux Kernel、OpenBSD已经是合作对象。这套安排让Daybreak在面貌上更接近"基础设施供应商"而非"进攻性AI工具"。

实质上的差距有多大?两者的底层能力数量级相近,但Codex Security已累计扫描数据(3000万次提交、7万+漏洞修复)说明规模化部署上OpenAI走得更远——这些数字意味着它已经进入了真实代码库的日常流水线,不只是研究用途。

谁的定位会更耐用

Fable 5的下架把一个问题推到了台面上:当AI模型能力达到某个阈值后,"这是防御工具"和"这是进攻武器"之间的边界,由谁来画,画在哪里?

OpenAI用访问控制(认证研究员)和公益合作(开源修复项目)给GPT-5.5-Cyber建了一套政治护城河。这套安排的逻辑是:只要能说清楚"谁在用、用来干什么",监管机构就有理由让它活着。Anthropic在Mythos和Fable 5上的路线——先发布再解释——在政府已经高度警觉的时间点里,给了"用最快速度问责"的窗口。

一个可以追踪的问题是:GPT-5.5-Cyber的认证研究员访问会不会经历与Fable 5类似的被滥用测试?Codex Security插件的"修复"路径是否会被以类似手法多步引导成"生成漏洞利用"的入口?Daybreak今天的政治定位能否经受下一次类似Fable 5那样的政府审查,是它能否作为AI安全基础设施被长期运营的核心变量。

参考资料

图文卡片 ⬇️ 一键下载图文卡片