一图版 🏠 返回首页
前沿科技洞见 · 2026-09-12

Anthropic 阻断五起潜在生物武器用途案例:账户长期行为与跨模型调用链能否提高双用途研究识别率

阅读时间 6 分钟 · 3,745 字 · 基于 12 个来源
背景
9 月 10 日,Anthropic 披露了 2025 年 12 月至 2026 年 8 月间发现的五起高风险双用途生物研究活动。双用途研究指同一套知识或实验既可能用于疫苗、监测和药物,也可能提高病原体或毒素的危害。
今日事件
模型名称需要先拆清。
核心判断
中心判断是:账户长期行为为双用途研究增加了单次提示中不存在的项目级证据,但公开材料没有给出统一样本、误报率和漏报率,尚不能证明识别率已经提高;跨模型调用链的证据更弱,目前只证明单个平台可从中继代码和后续调查还原部分路由,不能证明不同供应商能持续拼出完整任务链。

9 月 10 日,Anthropic 披露了 2025 年 12 月至 2026 年 8 月间发现的五起高风险双用途生物研究活动。双用途研究指同一套知识或实验既可能用于疫苗、监测和药物,也可能提高病原体或毒素的危害。Anthropic 封禁了相关账户,在第一案中还与合作方拆除了部分中继网络,并向其他模型公司和政府部门分享线索;但运营者数日内即以新身份恢复访问,研究也继续推进。因此,“阻断五起”不是五个项目都被终止,更不等于确认了五起生物武器计划。

模型名称需要先拆清。

报告覆盖的五起生物案例使用的是 Haiku、Sonnet 或 Opus 系列,没有使用 Fable 5 或 Mythos 5。这个能力边界很关键:报告展示的是旧模型和通用模型流量中的风险发现,不是最强生物能力已被现实攻击攻破。

中心判断是:账户长期行为为双用途研究增加了单次提示中不存在的项目级证据,但公开材料没有给出统一样本、误报率和漏报率,尚不能证明识别率已经提高;跨模型调用链的证据更弱,目前只证明单个平台可从中继代码和后续调查还原部分路由,不能证明不同供应商能持续拼出完整任务链。

演进线: 旧模型的防护重点是阻止新手获得已知生物武器知识;Fable 5 用宽泛分类器限制更强能力并保留 30 天流量;真实案例又要求把会话、账户、地区和机构放在一起判断。

比较线: 单次内容分类、单个 Agent 轨迹、跨会话账户监测和生物设计阶段审查看见的对象不同,公开分数不能直接排高低。

结论边界: “发现更多可疑项目”只有在相同合法科研误报率下带来更高危险项目召回、更早告警且复核成本可控,才能算检测能力提升。

从旧模型拒答到项目级监测,安全系统多看见了什么

这条时间线解释了五案为何不能只按“模型有没有拒答”来阅读。

Anthropic 逐步扩大的是检测上下文和访问控制,而不是用一个更大的分类器取代所有防线。

时间防护对象与动作新增能力尚未解决的问题
2025 年旧模型对当前输入和输出做内容判断,重点阻止新手复现已知生物武器能即时挡住明确危险请求专业人员可把项目拆成表面正常的小步骤
2026 年 6 月 Fable 5 发布分类器命中生物或化学请求时回退到 Opus 4.8;Fable 5 与受限开放的 Mythos 5 共用底层模型不让一般用户直接取得最强生物能力;30 天留存可支持跨请求调查宽泛规则误伤健康、教学和正当科研,留存也与企业隐私要求冲突
7—8 月回退模型更新为 Opus 5;Anthropic 重写规则并重训分类器测试中生物相关回退较 Fable 5 首发时减少约 85%85% 是回退次数降幅,不是合法科研误报率下降 85%,也没有公布危险任务召回变化
9 月Anthropic 宣布 Enterprise Frontier Safeguards(EFS)将分析滚动流量窗口,把告警交给客户自己的安全团队复核可关联多会话、多账户,并把日志留在客户控制的云环境EFS 要到秋季分阶段上线,尚无生物安全准确率、提前量和人工复核量

这段演进把判断单位由“一次问答”扩大到“一个主体在一段时间内积累了什么能力”。它也把新问题带进系统:主体关联错了会误伤用户,日志不足会漏掉跨账户行为,日志过多又会暴露研究数据和身份。

五起案例把“内容、行为和处置”拆成了三层

五案最有价值的增量不是病原体名单,而是同一内容分类器在不同项目上出现了三种结果:明确高风险内容被降级,双用途内容被正常回答,账户最后又因地区规避或关联调查被封。

所谓跨模型调用链,是同一任务经中继被转给多个模型或供应商形成的路由;公开材料只在第一案给出了明确的转发证据。

案例单次内容层长期行为新增的信号处置结果与限定
基孔肯雅病毒功能增强资助申请中的高风险请求被分类器挡下军事研究机构关联、受限地区经美国基础设施中转、零数据留存通道,以及把 Claude 拒绝的请求转给更宽松竞品的代码账户和部分中继被处置,但运营者迅速恢复;这是最明确的跨模型路由证据,却不是供应商共享的完整调用记录
禽流感哺乳动物适应高风险步骤被限制在 Sonnet 4、Haiku 4.5 等较弱模型数周、数千条消息,匿名邮箱、代理和疑似实体样本访问能力项目仍处早期;Anthropic 估计 Claude 主要提供文书、数据分析和实验排序,能力增益有限
正痘病毒免疫逃逸研究以病毒减毒为目标,Opus 5 在约一小时内完成整份申请,分类器未拦随机邮箱、匿名代理、与封禁账户农场共用基础设施;中继服务十余名客户、数日产生数万条消息风险判断主要来自项目与账户背景,不能由一次提示复现
毒液肽优化镇痛和抗抑郁目标可以成立,分类器基本放行同一管线也优化麻痹靶点,成果属于国家支持项目账户因规避地区限制被封,不能据此推导研究者具有武器意图
毒素重设计治疗性描述与潜在伤害用途难以区分,分类器基本放行进展报告刻意淡化毒素与病毒蛋白身份,研究属于国家优先计划同样因地区政策封号;机构、国家和完整交互未公开,外部无法独立复核归因

长期记录确实补上了机构、基础设施、持续时间和规避动作,却没有构成识别率实验。五案是厂商选出的显著案例,没有未被发现的危险活动作分母,也没有合法研究对照组;最近一次针对特定国家机构的 30 天筛查约发现 35 项研究,其中多数仍是普通民用科学。《大西洋月刊》采访的两名病毒学研究者还称,查询流感基因特征或紫外线灭活等正当问题也会频繁被 ClaudeChatGPT 中断;这不是正式误报率,却说明扩大监测必须把合法科研受阻作为一等指标。

同口径实验支持“跨会话有增益”,但尚未支持“跨供应商可识别”

公开方案必须按检测单元对齐。

它们分别覆盖内容、执行、主体和生物设计环节。

方案同口径证据能回答本题的部分不能外推的边界
Nemotron 3.5多语种、多模态内容安全测试平均准确率约 85%说明单次内容守卫可低延迟部署测试并非生物专用,也没有账户、机构或跨会话信息
AgentDoG 1.54B 版本在通用 Agent 轨迹基准 ATBench 上 F1 为 74.3说明完整执行轨迹可成为独立检测单元不含双用途生物项目、真实身份或跨供应商路由
Magnet在同一组 336 个场景中,单会话检测召回率为 44.6%、F1 为 61.0;跨会话能力汇总的召回率为 75.0%、F1 为 84.0直接支持“跨会话信息可补回漏检”这一机制只测试网络钓鱼和燃烧装置两个领域,按单一用户 ID 关联,未测试多账户或跨模型供应商
BioFirewall危险代理样本在 1% 误报率下识别率为 72%;288 个合法计划无一被拒,并拦截拆分到多次调用的攻击给出最接近生物场景的固定误报率结果预印本样本较小,依赖安全代理任务,判断的是设计计划而非机构意图
Anthropic 项目监测五案与 EFS 架构说明了滚动窗口、账户关联和机构核验如何进入调查证明现实流量中确有单次内容无法定性的项目没有统一基准、阈值、误报率、漏报率、提前识别时间和成本

这组比较把中心判断限定得更准确:账户长期行为的增益在通用安全任务上已有受控证据,在生物设计的多次调用上也有早期结果,但两条证据都不能替 Anthropic 的现实五案给出准确率。OpenAI 对高能力生物模型也采用身份、机构、研究用途和内部治理核验,说明同行目前同样把可信访问作为内容分类器之外的一层控制,而非宣称分类器可以判断研究意图。

跨模型调用链则连同口径实验都没有。

隐私、数据主权和误关联会让这条链天然不完整。

下一步应验证项目级召回,而不是继续统计封号数量

可执行的评测单位应是“研究项目”,而不是单条提示。

评测集需要同时包含合法疫苗研究、病原体监测、模糊双用途项目和明确危险任务,再依次测试单次提示、单会话轨迹、同平台账户序列与跨供应商最小信号共享。

未来 3—6 个月最值得观察的是 EFS 上线后的实测数据,以及供应商是否提出不交换原始科研内容的路由来源证明。如果 Anthropic 只公布新告警或封号数量,账户级方案仍只能算调查能力;若它在相同误报率下提高项目召回、缩短告警时间,且客户侧人工复核量可承受,才足以升级为可验证的安全能力。跨模型调用链还需证明供应商之间能够可靠关联同一任务,同时不把敏感科研数据和错误身份扩散到更多机构。

信息来源(12)
图文卡片 ⬇️ 一键下载图文卡片