Anthropic 阻断五起潜在生物武器用途案例:账户长期行为与跨模型调用链能否提高双用途研究识别率
9 月 10 日,Anthropic 披露了 2025 年 12 月至 2026 年 8 月间发现的五起高风险双用途生物研究活动。双用途研究指同一套知识或实验既可能用于疫苗、监测和药物,也可能提高病原体或毒素的危害。Anthropic 封禁了相关账户,在第一案中还与合作方拆除了部分中继网络,并向其他模型公司和政府部门分享线索;但运营者数日内即以新身份恢复访问,研究也继续推进。因此,“阻断五起”不是五个项目都被终止,更不等于确认了五起生物武器计划。
模型名称需要先拆清。
- Claude Fable 5 是面向一般用户开放、带较强生物与网络安全限制的前沿模型;
- Claude Mythos 5 与 Fable 5 使用同一底层模型,但仅向核验机构开放,并可按获批用途放宽相应限制;
- Claude Opus 5 是生物研究能力低于 Mythos 5、限制相对较少的通用模型,也是 Fable 5 的生物分类器命中后当前使用的回退模型。
报告覆盖的五起生物案例使用的是 Haiku、Sonnet 或 Opus 系列,没有使用 Fable 5 或 Mythos 5。这个能力边界很关键:报告展示的是旧模型和通用模型流量中的风险发现,不是最强生物能力已被现实攻击攻破。
中心判断是:账户长期行为为双用途研究增加了单次提示中不存在的项目级证据,但公开材料没有给出统一样本、误报率和漏报率,尚不能证明识别率已经提高;跨模型调用链的证据更弱,目前只证明单个平台可从中继代码和后续调查还原部分路由,不能证明不同供应商能持续拼出完整任务链。
演进线: 旧模型的防护重点是阻止新手获得已知生物武器知识;Fable 5 用宽泛分类器限制更强能力并保留 30 天流量;真实案例又要求把会话、账户、地区和机构放在一起判断。
比较线: 单次内容分类、单个 Agent 轨迹、跨会话账户监测和生物设计阶段审查看见的对象不同,公开分数不能直接排高低。
结论边界: “发现更多可疑项目”只有在相同合法科研误报率下带来更高危险项目召回、更早告警且复核成本可控,才能算检测能力提升。
从旧模型拒答到项目级监测,安全系统多看见了什么
这条时间线解释了五案为何不能只按“模型有没有拒答”来阅读。
Anthropic 逐步扩大的是检测上下文和访问控制,而不是用一个更大的分类器取代所有防线。
| 时间 | 防护对象与动作 | 新增能力 | 尚未解决的问题 |
|---|---|---|---|
| 2025 年旧模型 | 对当前输入和输出做内容判断,重点阻止新手复现已知生物武器 | 能即时挡住明确危险请求 | 专业人员可把项目拆成表面正常的小步骤 |
| 2026 年 6 月 Fable 5 发布 | 分类器命中生物或化学请求时回退到 Opus 4.8;Fable 5 与受限开放的 Mythos 5 共用底层模型 | 不让一般用户直接取得最强生物能力;30 天留存可支持跨请求调查 | 宽泛规则误伤健康、教学和正当科研,留存也与企业隐私要求冲突 |
| 7—8 月 | 回退模型更新为 Opus 5;Anthropic 重写规则并重训分类器 | 测试中生物相关回退较 Fable 5 首发时减少约 85% | 85% 是回退次数降幅,不是合法科研误报率下降 85%,也没有公布危险任务召回变化 |
| 9 月 | Anthropic 宣布 Enterprise Frontier Safeguards(EFS)将分析滚动流量窗口,把告警交给客户自己的安全团队复核 | 可关联多会话、多账户,并把日志留在客户控制的云环境 | EFS 要到秋季分阶段上线,尚无生物安全准确率、提前量和人工复核量 |
这段演进把判断单位由“一次问答”扩大到“一个主体在一段时间内积累了什么能力”。它也把新问题带进系统:主体关联错了会误伤用户,日志不足会漏掉跨账户行为,日志过多又会暴露研究数据和身份。
五起案例把“内容、行为和处置”拆成了三层
五案最有价值的增量不是病原体名单,而是同一内容分类器在不同项目上出现了三种结果:明确高风险内容被降级,双用途内容被正常回答,账户最后又因地区规避或关联调查被封。
所谓跨模型调用链,是同一任务经中继被转给多个模型或供应商形成的路由;公开材料只在第一案给出了明确的转发证据。
| 案例 | 单次内容层 | 长期行为新增的信号 | 处置结果与限定 |
|---|---|---|---|
| 基孔肯雅病毒功能增强 | 资助申请中的高风险请求被分类器挡下 | 军事研究机构关联、受限地区经美国基础设施中转、零数据留存通道,以及把 Claude 拒绝的请求转给更宽松竞品的代码 | 账户和部分中继被处置,但运营者迅速恢复;这是最明确的跨模型路由证据,却不是供应商共享的完整调用记录 |
| 禽流感哺乳动物适应 | 高风险步骤被限制在 Sonnet 4、Haiku 4.5 等较弱模型 | 数周、数千条消息,匿名邮箱、代理和疑似实体样本访问能力 | 项目仍处早期;Anthropic 估计 Claude 主要提供文书、数据分析和实验排序,能力增益有限 |
| 正痘病毒免疫逃逸 | 研究以病毒减毒为目标,Opus 5 在约一小时内完成整份申请,分类器未拦 | 随机邮箱、匿名代理、与封禁账户农场共用基础设施;中继服务十余名客户、数日产生数万条消息 | 风险判断主要来自项目与账户背景,不能由一次提示复现 |
| 毒液肽优化 | 镇痛和抗抑郁目标可以成立,分类器基本放行 | 同一管线也优化麻痹靶点,成果属于国家支持项目 | 账户因规避地区限制被封,不能据此推导研究者具有武器意图 |
| 毒素重设计 | 治疗性描述与潜在伤害用途难以区分,分类器基本放行 | 进展报告刻意淡化毒素与病毒蛋白身份,研究属于国家优先计划 | 同样因地区政策封号;机构、国家和完整交互未公开,外部无法独立复核归因 |
长期记录确实补上了机构、基础设施、持续时间和规避动作,却没有构成识别率实验。五案是厂商选出的显著案例,没有未被发现的危险活动作分母,也没有合法研究对照组;最近一次针对特定国家机构的 30 天筛查约发现 35 项研究,其中多数仍是普通民用科学。《大西洋月刊》采访的两名病毒学研究者还称,查询流感基因特征或紫外线灭活等正当问题也会频繁被 Claude 或 ChatGPT 中断;这不是正式误报率,却说明扩大监测必须把合法科研受阻作为一等指标。
同口径实验支持“跨会话有增益”,但尚未支持“跨供应商可识别”
公开方案必须按检测单元对齐。
- NVIDIA Nemotron 3.5 Content Safety 读取一次文字、图片和回答;
- AgentDoG 1.5 读取单个 Agent 的连续工具轨迹;
- Magnet 把同一用户跨会话获得的具体能力汇总;
- BioFirewall 则在基因编辑计划进入合成前审查设计及多次调用。
它们分别覆盖内容、执行、主体和生物设计环节。
| 方案 | 同口径证据 | 能回答本题的部分 | 不能外推的边界 |
|---|---|---|---|
| Nemotron 3.5 | 多语种、多模态内容安全测试平均准确率约 85% | 说明单次内容守卫可低延迟部署 | 测试并非生物专用,也没有账户、机构或跨会话信息 |
| AgentDoG 1.5 | 4B 版本在通用 Agent 轨迹基准 ATBench 上 F1 为 74.3 | 说明完整执行轨迹可成为独立检测单元 | 不含双用途生物项目、真实身份或跨供应商路由 |
| Magnet | 在同一组 336 个场景中,单会话检测召回率为 44.6%、F1 为 61.0;跨会话能力汇总的召回率为 75.0%、F1 为 84.0 | 直接支持“跨会话信息可补回漏检”这一机制 | 只测试网络钓鱼和燃烧装置两个领域,按单一用户 ID 关联,未测试多账户或跨模型供应商 |
| BioFirewall | 危险代理样本在 1% 误报率下识别率为 72%;288 个合法计划无一被拒,并拦截拆分到多次调用的攻击 | 给出最接近生物场景的固定误报率结果 | 预印本样本较小,依赖安全代理任务,判断的是设计计划而非机构意图 |
| Anthropic 项目监测 | 五案与 EFS 架构说明了滚动窗口、账户关联和机构核验如何进入调查 | 证明现实流量中确有单次内容无法定性的项目 | 没有统一基准、阈值、误报率、漏报率、提前识别时间和成本 |
这组比较把中心判断限定得更准确:账户长期行为的增益在通用安全任务上已有受控证据,在生物设计的多次调用上也有早期结果,但两条证据都不能替 Anthropic 的现实五案给出准确率。OpenAI 对高能力生物模型也采用身份、机构、研究用途和内部治理核验,说明同行目前同样把可信访问作为内容分类器之外的一层控制,而非宣称分类器可以判断研究意图。
跨模型调用链则连同口径实验都没有。
- Anthropic 在第一案看到了中继代码,并把情报分享给相关实验室;
- Frontier Model Forum 也建立了自愿共享机制,但公开规则没有表明各供应商会共享原始提示、稳定身份映射或完整路由。
隐私、数据主权和误关联会让这条链天然不完整。
下一步应验证项目级召回,而不是继续统计封号数量
可执行的评测单位应是“研究项目”,而不是单条提示。
评测集需要同时包含合法疫苗研究、病原体监测、模糊双用途项目和明确危险任务,再依次测试单次提示、单会话轨迹、同平台账户序列与跨供应商最小信号共享。
- 四项结果必须同时公布:固定合法科研误报率下的危险项目召回率;
- 首次告警提前了多少次请求或多少天;
- 降级、封号与人工复核分别阻断了多少正当研究;
- 移除地区标签、既有黑名单和跨平台身份信息后,增益还剩多少。
未来 3—6 个月最值得观察的是 EFS 上线后的实测数据,以及供应商是否提出不交换原始科研内容的路由来源证明。如果 Anthropic 只公布新告警或封号数量,账户级方案仍只能算调查能力;若它在相同误报率下提高项目召回、缩短告警时间,且客户侧人工复核量可承受,才足以升级为可验证的安全能力。跨模型调用链还需证明供应商之间能够可靠关联同一任务,同时不把敏感科研数据和错误身份扩散到更多机构。
信息来源(12)
- Anthropic:Countering misuse of AI,September 2026
- Anthropic:Claude Fable 5 and Claude Mythos 5
- Anthropic:Improving Fable 5's biology safeguards
- Anthropic:Introducing Claude Opus 5
- Anthropic:Developing Enterprise Frontier Safeguards with our customers
- Frontier Model Forum:Preliminary Taxonomy of AI-Bio Misuse Mitigations
- Magnet:Detecting Cross-Session AI Misuse Through Capability Accumulation
- AgentDoG 1.5:项目与 ATBench 评测
- NVIDIA:Nemotron 3.5 Content Safety
- BioFirewall:Design-stage biosecurity screening
- OpenAI:Trusted Access for Biology Research
- The Atlantic:合法病毒学研究遭遇防护中断的案例