Demis Hassabis 提出把发布前测试接到美国市场准入
Demis Hassabis 提出把发布前测试接到美国市场准入
2026/07/15
7 月 14 日,Demis Hassabis 提议设立一个由美国联邦政府监督、行业主要出资,并包含独立技术专家和开源代表的前沿 AI 标准机构。前沿实验室初期可自愿在模型发布前最多 30 天送审,测试网络、生物等高风险能力,以及绕过护栏或欺骗行为;待测试协议成熟后,模型需通过测试才能在美国市场部署。[S1]
这份提案的新增量,是把厂商内部风险报告、保密的外部测试和未来部署资格接到一条制度路径上。现有证据支持前沿模型治理已进入更具体的外部准入设计阶段,但不支持美国已经建立强制制度,也不支持现有测试足以可靠决定模型能否部署。金融机构因此可以提前拆分供应商证据要求,却不能把提案中的 30 天送审当成现行义务。[S1][S2][S3][S4]
30 天送审让外部评估进入模型发布流程
厂商公开安全政策解决的是“企业承诺如何管理风险”,Hassabis 的方案进一步回答“谁在发布前检查,以及检查结果有什么后果”。根据能力变化更新的前沿阈值决定哪些模型应送审,最长 30 天的窗口把外部测试安排到公众接触模型之前;未来若测试结果与美国市场部署资格挂钩,评估便不再只是咨询意见,而可能触发缓解、复测或限制部署。[S1]
对采购方而言,30 天的决策意义不在于多了一个固定倒计时,而在于供应商必须为独立评估预留模型访问、风险材料和测试时间。金融机构在尽调时可以分别询问:供应商是否接受发布前独立测试,评估方实际获得了什么访问权限,测试覆盖了哪些高风险能力,以及不通过后如何处置。提案尚未给出授权机构、正式程序和申诉安排,所以这些问题目前是采购证据要求,不是法定合规清单。[S1]
内部风险报告提供输入,不能替代独立判断
内部框架已经在细化。Anthropic 7 月 8 日更新的 Responsible Scaling Policy 3.4 调整了风险报告的内部披露、删节说明和外部审阅覆盖要求,但它仍是由企业自行制定、解释和更新的自愿政策。它能提供风险阈值、内部判断和缓解记录,却不能为其他实验室建立共同准入标准,也不能单独证明执行效果。[S2]
外部评估还需要独立的技术条件。3 月,NIST 下属 CAISI 与 OpenMined 合作研究隐私保护评估,使模型、数据或基准因知识产权、隐私或国家安全原因不能公开时,仍可在受控条件下测量。英国 AI Security Institute 此前也已开展多次发布前测试,同时把模型访问、风险模型、能力阈值、测试时间和结果解释列为开放问题。[S3][S4]
这两类机制承担不同责任:厂商风险报告让评估者知道应检查什么,受控访问和独立测试则用另一套方法验证厂商主张。对金融机构来说,供应商内部框架及其执行记录、独立评估的访问范围与覆盖范围应当分开索取;只看一份模型卡或安全政策,会把材料提供者与判断者混为一体。[S2][S3][S4]
未完成的是把测试结论变成一致的准入后果
当前最明确的收敛,是风险报告、发布前访问和外部评估已分别出现在实验室政策与政府评估实践中。真正缺失的仍是把测试结果转成共同后果:谁有权否决部署,怎样设定可重复的通过阈值,评估失败后如何缓解、复测和申诉,以及开放权重或海外模型如何适用。[S1][S3][S4]
边界也集中在这里。Hassabis 的文本是个人政策主张,不代表 Google DeepMind、美国政府或其他实验室已经接受;英国与美国评估机构的权限和法律环境不能直接互换。现有材料也没有统一测试的成本、误判率、跨模型复现结果或真实部署风险降低数据。因而可以确认的是治理部件正在被连接,不能确认的是新制度已经形成,或外部评估能够消除部署风险。[S1][S3][S4]
面向未来一个季度,金融机构更稳妥的建设顺序是把高风险模型准入拆成三层:供应商内部风险框架及执行记录、独立发布前评估证据、机构自身按业务场景进行的上线测试与持续监控。这一要求只适用于会接触敏感数据、执行工具调用或影响重大决策的模型;普通低风险用途可以按比例降低要求。若美国出现机构授权或规则草案、主要实验室签署统一访问协议,或首个模型受到部署条件约束,再把提案升级为正式监管变更;若发布前测试持续无法复现或实验室拒绝统一访问,则应继续依赖机构自身准入和双边供应商协议。[S1][S2][S3][S4]