Anthropic 给评测者“员工级访问”:至少 20 亿美元能买到视野,还买不到独立性
2026 年 9 月 18 日,Anthropic 与 Accenture 宣布组建驻场评测团队。驻场评测是指外部评测人员长期进入被评机构,持续观察模型开发和部署。所谓“员工级访问”,是指评测者可像内部员工一样接触训练过程、决策记录并询问员工。双方未来五年各投入至少 10 亿美元。这项合作把第三方评测的对象扩大到模型形成过程和公司的部署决策,但公开信息还不足以把它视为真正独立的安全审计。对 AI 部门来说,判断一家实验室是否可审计,不能只看它是否请了外部红队,还要看评测者能看到什么、能否自行发声、能否推动整改。外部红队是由机构外部人员模拟攻击者,主动寻找模型或系统漏洞的评测团队。
员工级访问补上了快照评测看不到的决策链
驻场评测最重要的增量是访问对象变了。
快照评测是在某个时间点测试特定模型版本,通常只能看到当时开放的接口和行为。决策链是模型从训练到上线期间,风险如何被讨论、接受和处理的连续过程。Anthropic 称,Faculty 团队将获得接近员工的访问权限。评测者可以观察模型在训练中如何成形,跟踪构建与部署决策,并直接询问员工。他们还可以核验安全承诺、识别盲点和报告事故。传统外部红队通常拿到若干模型快照、API 或受控界面,擅长发现模型会做什么。驻场团队若按上述范围运作,还能追问公司为何接受某项残余风险。
这一区别在 Agent 时代更重要。模型风险已经很难由单次输出完整表示。同一个基础模型接入不同工具、权限、监控器和业务数据,能够执行的动作会明显不同。训练团队何时提高模型权限,产品团队怎样处理失败样本,安全团队能否阻止上线,都会改变实际风险。只测发布候选版本,可能发现危险能力,却看不到风险如何在组织内部被接受、修补或绕过。
METR 今年的行业评估显示了这类证据长什么样。它追问员工能否扩大 Agent 权限,Agent 能否配置算力或修改访问控制,以及公司怎样审查日志和升级异常事件。这些问题无法靠跑一次基准回答,评测者需要查看工作流、内部记录和实际权限。员工级访问的技术意义就在这里:证据可以从“模型通过了多少任务”,扩展到“控制措施在真实流程中有没有生效”。
Accenture 还带来企业部署视角。Faculty 不只测试基础模型,也可以把金融、政府、医疗和基础设施中的真实工作流带入评测。它有机会发现实验室基准没有覆盖的权限组合与失败路径。不过,行业经验只有进入测试设计和部署决策,才构成安全增量。新闻稿尚未披露团队规模、首批模型、测试窗口或整改权限,因此当前成立的是一种更深的访问安排,还不是已经验证过的审计效果。
三年演进把评测推进到公司内部,瓶颈也随之改变
外部评测过去三年的演进,解释了 Anthropic 为什么要把评测者请进公司。
每一步都提高了可见度,但也暴露出新的约束。
- 2023 年:政府提出全生命周期外部评测。英国政府列出的实践已覆盖训练中、部署前和部署后的检查,并主张让第三方接触无安全缓解版本、模型家族、内部指标和完整系统组件。这套框架已经把目标写得很深,但能否获得这些访问,仍取决于实验室合作。
- 2024 年:预部署测试暴露时间和接口约束。英国 AI Security Institute 总结,可靠测试需要无安全限制版本、开关防护的能力、微调接口,以及与模型团队持续技术交流。该机构也承认,部署时点会压缩测试和质量保证窗口,使用较早的代理模型又会带来“是否足够相似”的新问题。
- 2026 年:独立评估开始接触内部信息。2 月至 3 月,METR 开展了行业级风险评估。参与评估的公司包括 Anthropic、Google、OpenAI 和 Meta。它称这是这些公司首次向独立评估开放最强模型和内部信息。METR 保留最终报告编辑权,但公司仍可控制哪些非公开信息进入报告,并可选择静默退出。
驻场模式沿着这条路线继续向前。评测者不必等发布窗口打开,理论上可以更早看到训练迹象、权限变化和内部争议。这会把评测从一次发布关卡变成持续观察。新的瓶颈落在评测者能否自主选题、接触负面证据,并把分歧带到公司之外。访问更深,并不会自动生成这些权利。
四种评测模式的差别在权力配置,不在测试数量
把现有安排放在相同维度下比较,驻场评测填补的空白很清楚。
它首次尝试同时获得持续访问和外部视角,但最关键的治理条件仍未公开。
| 模式 | 能看到什么 | 谁控制范围 | 结果如何流出 | 主要价值与边界 |
|---|---|---|---|---|
| 公司内部安全团队 | 训练数据、模型状态、内部日志和决策流程 | 公司管理层与内部治理机构 | 通常进入内部决策,部分写入系统卡。系统卡是公司公开说明模型能力、风险和缓解措施的文档 | 信息最深、修复最快,但无法独立核验公司自己的判断 |
| 外部红队与发布前测试 | 模型快照、API、受控产品或指定任务 | 公司与评测方共同约定,窗口通常靠近发布 | 结果多由公司选择写入系统卡 | 能发现新行为,难以持续观察训练与部署取舍 |
| 政府或非营利风险评估 | 可包含无安全限制模型、思维链、内部问卷和安全材料 | 评测方自主性较高,仍受保密和访问协议约束 | 可独立发布,但敏感信息可能被删减 | 独立性较强,频率、技术接口和公司配合仍有限 |
| 驻场式独立评测 | 目标是员工级访问、训练过程、部署决定和事故 | 尚无统一标准,本次合同细节未公开 | Anthropic 称可报告事故,但发布权和节奏未定 | 有望持续纠偏,也最容易出现客户关系和组织同化。组织同化是指外部团队长期嵌入后,逐渐接受被评公司的默认假设 |
这张表也解释了 Faculty 与 METR 的互补关系。Faculty 依靠 Accenture 的行业项目和人员规模,可以测试企业环境中的实际用法。METR 则不接受前沿模型公司的现金资助,并公开记录访问、冲突、编辑权和删减条件。前者更接近业务现场,后者更强调程序独立。Anthropic 已表示合作并非排他,也在与 METR 等非营利机构讨论由评测者自筹资金的驻场试点。多家评测者只有采用可比标准,才能形成交叉核验;否则,公司仍可挑选最宽松的结论对外展示。
至少 20 亿美元因此不能直接解释为 20 亿美元的安全保障。它首先说明双方愿意建立长期人员、算力和行业测试能力。安全价值还取决于合同是否把访问权、编辑权和异议权交给评测者。缺少这些安排,规模越大的驻场团队也可能更像深度咨询项目,难以约束被评对象。
先看报告权和整改权,再判断“独立”是否成立
最强反证来自资金关系。
Anthropic 将直接支付 Accenture 的工作费用,而评测者又要长期嵌入被评公司。客户可以续约、调整任务或限制信息,团队也可能逐渐接受内部默认假设。Anthropic 自己承认,行业尚无驻场评测的访问标准、报告规范和稳定资金机制。其 2026 年 6 月政策框架反而建议使用政府或共同资金、披露利益冲突,并在高风险情形下随机分配合格评测者。这些建议与本次直接付费安排之间存在真实缺口。
这项反证限定了判断,却没有抹去驻场访问的技术价值。访问深度与程序独立是两条不同的轴。本次合作已经改善前一条轴,后一条轴要靠可验证权利补齐。衡量进展要看团队进驻之后,能否留下公司不能单方面改写的记录,并让问题影响训练或部署。
接下来应观察三类具体证据。评测者若要主动发现风险,Anthropic 需要说明他们能否自行选择风险问题。Anthropic 还要交代,评测者是否可以接触内部评测、事故日志和未加安全限制的模型。团队还要能把发现带到公司之外。因此,双方需要公布报告频率、删减规则、编辑权和利益冲突处理办法。尤其要说明 Anthropic 能否阻止不利结论公开。报告只有推动行动才有价值。评测结论还需与复测、延迟部署、降低权限或升级事故响应等动作相连。Anthropic 预告未来数周还会宣布其他评测方,METR 也计划在 2026 年晚些时候开展下一轮行业评估。届时若出现共同标准、相互独立的报告和可追踪整改,驻场评测才会成为新的安全基础设施;若只增加人员与预算,它仍是一次高投入但难验证的咨询合作。
信息来源(7)
- Anthropic:Partnering with Accenture on embedded evaluation
- Accenture:Accenture and Anthropic Partner to Build Team of Embedded Evaluators at Anthropic
- Anthropic:Advanced AI Framework(2026 年 6 月)
- 英国政府:Emerging processes for frontier AI safety
- 英国 AI Security Institute:Early lessons from evaluating frontier AI systems
- METR:Frontier Risk Report,2026 年 2—3 月
- METR:Funding update,2026 年 8 月