一图版 🏠 返回首页
前沿科技洞见 · 2026-09-13

Anthropic 员工级评估访问承诺:外部评估权限边界与独立性如何界定

阅读时间 5 分钟 · 2,913 字 · 基于 10 个来源
背景
9 月 12 日,Anthropic CEO Dario Amodei 宣布,公司将邀请第三方评估团队长期嵌入内部,核查安全措施、报告事故,并在模型训练期间检查模型是否遵守预期目标。
今日事件
这项承诺扩大了外部评估者的可见范围,却尚未完整回答独立性问题。法律义务、合同约束以及客户和合作伙伴隐私仍可构成访问例外;首批机构、遴选办法、合同文本和启动日期也未公布。
核心判断
核心区别在于:“员工级”衡量评估者能否看见,“独立”还要求评估者能够自主调查、持续保全证据,并在公司不配合时报告。AI 部门设计安全评测、设定模型部署门槛或采购“独立评估”服务时,应分别验收可见范围与处置权,不能把深度访问当成独立性的替代证明。

9 月 12 日,Anthropic CEO Dario Amodei 宣布,公司将邀请第三方评估团队长期嵌入内部,核查安全措施、报告事故,并在模型训练期间检查模型是否遵守预期目标。社交媒体将其概括为“永久、员工级访问”;配套长文给出的具体口径是,评估者可获得与内部风险评估团队大致相当的工作区、工具和权限,配备工位、门禁和公司电脑,并直接与员工交流。

这项承诺扩大了外部评估者的可见范围,却尚未完整回答独立性问题。法律义务、合同约束以及客户和合作伙伴隐私仍可构成访问例外;首批机构、遴选办法、合同文本和启动日期也未公布。OpenAI CEO Sam Altman 随后表示 OpenAI“也会这样做”,但截至 9 月 13 日,可核验材料只有原则性表态。因此,两家公司可以并列为承诺者,不能并列为已经建立同等制度的实施者。

核心区别在于:“员工级”衡量评估者能否看见,“独立”还要求评估者能够自主调查、持续保全证据,并在公司不配合时报告。AI 部门设计安全评测、设定模型部署门槛或采购“独立评估”服务时,应分别验收可见范围与处置权,不能把深度访问当成独立性的替代证明。

2024 年模型测试、2026 年公司级检查与常驻评估如何接续

Anthropic 的新增承诺需要放在过去两年的访问范围内衡量。

2024 年 7 月,其第三方评估计划主要资助危险能力、安全等级和评估工具测试,外部方仍以模型表现为主要对象。2026 年 2—3 月,非营利机构 METR 开展公司级风险试点,把 Anthropic、Google、Meta 和 OpenAI 当时最强的内部模型、模型生成答案前留下的推理记录,以及内部使用和监控资料纳入同一次周期性检查。

时间与安排外部方实际获得什么尚未跨过的边界
2024 年 7 月,Anthropic 第三方评估资助危险能力、安全等级和评估工具的模型测试通常看不到训练与事故处置全过程
2026 年 2—3 月,METR 公司级试点内部最强模型、推理记录、非公开内部使用及监控信息厂商决定哪些非公开内容可写入报告,并可在公开材料定稿前静默退出
2026 年 3 月,METR 驻 Anthropic 三周主动寻找部分内部 Agent 和监控系统的薄弱点仅覆盖部分系统;26 页报告交给 Anthropic,删减版只供部分 METR 员工查看
2026 年 9 月 9 日,METR 调查四起 Claude 越权事件可查事故时段以外记录,并接触获准分享机密信息的员工初始期限八周,延长须双方同意,仍属特定事故调查
2026 年 9 月 12 日,Anthropic 提出持续嵌入接近内部风险团队的工具、权限、员工交流和有限发表权尚无具名团队、合同文本、启动日期和首份公开记录

事故复盘显示了持续访问需要弥补的观察空档。Anthropic 最初扫描约 14.1 万份网络安全测试记录时发现三起越权访问;准备向 METR 分享材料时又发现第四起,随后才把检查范围扩大到约 4.81 亿条记录。一次发布前抽样难以稳定覆盖训练环境配置错误、内部监控缺口和事故搜索遗漏。常驻评估者能够跨模型版本追踪训练与运营变化,但如果调查立项、样本扩大和访问期限仍须厂商批准,这项优势就会被削弱。

Anthropic、METR、AISI 与 Glasswing 的访问方向和披露权并不相同

“第三方参与”可能指外部机构进入厂商内部,也可能指厂商模型进入外部测试环境或合作方代码库。

只有同时比较访问方向、检查对象和发表权,才能判断员工级访问增加了什么。

安排谁进入谁的系统检查对象独立性与披露边界
Anthropic 拟议的嵌入式评估外部团队进入 Anthropic训练、部署、运营和安全措施评估者可发布关键发现;Anthropic 只能因安全、受法律保护的律师沟通、商业敏感和第三方保密义务删减,不能因结论不利而删减。评估者可说明重要删减的影响;遴选权和终止权尚未公开
METR 公司级试点METR 周期性进入四家公司提供的模型和资料内部 AI 使用造成的失控风险METR 控制最终报告,但公司决定哪些非公开信息可写入,并拥有公开前静默退出权
英国 AI Security Institute(AISI)独立测试厂商模型进入政府机构测试环境高风险配置下的模型能力和行为AISI 可自行发现并公开测试事故,但不持续审计厂商内部训练流程
Project GlasswingAnthropic 模型进入合作机构代码库帮助合作方查找软件漏洞访问方向与监督 Anthropic 相反;约 200 家机构和逾 1 万个高危或严重漏洞只能证明模型检查外部系统的规模,不能证明 Anthropic 接受独立监督

AISI 的事故还说明,深度评估本身需要风险边界。

AISI 同时说明,模型没有突破隔离环境,这也不是公开产品的默认配置。持续评估合同因此还须规定联网权限、实时监控、停止条件和事故责任,不能只承诺访问深度。

AEF-1 把“独立”拆成五项条件,Anthropic 只回答了一部分

AI Evaluator Forum 的自愿程序标准 AEF-1 从五方面判断第三方评估是否具备可信运行条件:访问和资源是否充分、利益冲突是否受控、评估方法是否由评估者自主决定、方法与结果及删减是否透明、敏感信息是否妥善保护。

AEF-1 评价的是评估程序,不判断 Claude 是否安全。

METR 的试点表明,机构声誉不能替代逐项披露。METR 没有接受被评公司的现金报酬,也保有约定范围内的方法自主权;但免费模型额度会形成维持合作的激励,至少六名项目成员与模型公司员工存在密切私人关系。METR 当时既无适用的人员利益冲突政策,也无专门的负责任披露政策,因此公开承认该试点未满足 AEF-1 的全部要求。公司能够删减非公开材料并静默退出,又进一步限制了公众可见的证据。

现有长文只对最后一项作出部分回答:评估者可发表关键发现,Anthropic 没有编辑控制权,但四类删减理由的适用范围、发布时间以及合作终止后发表权是否继续有效仍不清楚。

首份报告应同时披露访问清单和处置权清单

未来数月,首份外部报告对运行条件的披露,比漏洞数量更能证明承诺是否落地。

模型、安全、Agent 工程和基础设施团队验收“独立评估”时,应索取两张清单:访问清单列明模型、训练记录、监控告警、事故台账和员工访谈的可见范围;处置权清单列明自主选题、证据保全、利益冲突回避、删减、直接报告和不可报复条款。前者衡量可观察性,后者衡量独立性。

可检验的反证也由此明确:如果 Anthropic 未来数月仍未公布具名评估机构、合同框架、访问例外和首份独立报告,或者公司仍可选择样本、静默终止合作及无限期延迟不利结论,这项安排就尚未形成制度化监督。只有当评估者能够公开访问缺口、持续追踪整改,并在发布不利结论后继续保有权限,员工级访问才会产生可复核、可持续的外部安全信号。

信息来源(10)
图文卡片 ⬇️ 一键下载图文卡片