🖼️ 图文卡片 🏠 返回首页
前沿科技洞见 · 2026-07-01

ICML 2026 论文推翻大模型"唯一机制"假说:同一任务可由多个不重叠电路完成

资料提供:前沿科技研究部
正在发生的事很多,这件帮你看过了

ICML 2026 论文推翻大模型"唯一机制"假说:同一任务可由多个不重叠电路完成

2026/07/01

大模型可解释性领域有一个默认为真的前提:模型完成某项任务时,内部存在一条"专属电路",找到它就能理解模型是怎么做到的。ICML 2026 一篇论文用实验把这个前提推翻了。研究者发现,同一任务可以由多个结构几乎完全不重叠的电路独立完成,甚至核心组件可以被绕开——这意味着过去几年主流电路发现方法找到的,可能只是随机采样到的其中一个版本。

一个被默认了四年的假设,终于被系统性质疑

机制可解释性的核心目标,是像拆开闹钟一样拆开神经网络,找出哪组神经元负责哪项能力。这个方向从 2022 年 Anthropic 提出"玩具模型"(toy model)上的电路分析开始,到 2024 年成为 AI 安全领域的主流路线,背后一直有一个未经充分检验的假设:功能各向异性假说——模型对同一种能力对应着唯一的内部电路。

这个假设不是没人质疑过,但此前缺乏系统性的实验证据。ICML 2026 接收的这篇论文,来自一个跨机构研究团队,他们提出了 OASR(重叠感知的 sheaf 排斥方法),专门用来在同任务上找多个独立电路。结果发现,不同电路之间交并比极低,且都具有同样高的任务能力。更关键的是,在实验中移除某个电路的核心组件后,模型表现几乎没有变化——说明有其他电路在"兜底"。

研究者进一步从理论上证明,这种非唯一性不是 bug,而是模型内部分布式稠密电路特征的必然结果,即叠加性。叠加性意味着同一个神经元同时参与多个功能的编码,不同功能之间没有清晰的物理边界。

主流方法全中招:结构不一致是普遍现象

论文对当前主流的电路发现方法做了横向对比,包括 Attribution Patching、Activation Patching、Causal Scrubbing 等。结果发现,这些方法在同一任务上找到的电路结构存在显著差异——不是细节上的差异,而是核心组件都不一致。

举个例子,用 Attribution Patching 找到的"重要神经元"集合,和用 Activation Patching 找到的集合,重叠度很低。如果电路是唯一的,不同方法应该收敛到同一个结构。但实验结果表明,每种方法都在"挑选"一个可用的电路,而不是"发现"唯一的电路。

这就像让五个侦探去调查同一个案子,结果每个人锁定的嫌疑人都不一样,但每个嫌疑人都有作案能力。问题不是侦探不行,而是"唯一嫌疑人"这个前提本身就错了。

对 AI 安全意味着什么:从"拆电路"到"看行为"?

如果电路不是唯一的,那么"我们找到了模型在某个任务上用的电路"就不再是一个可靠的结论。这对 AI 安全领域的直接影响是:基于电路发现的模型审计方法,可能无法保证覆盖所有潜在风险。

目前主流的安全审计思路是:找到模型执行危险能力的电路,然后对其进行监控或移除。但 OASR 的结果表明,移除一个电路后,模型可能通过其他电路继续执行同一任务。这意味着"电路级安全"的概念需要重新审视。

论文作者没有给出替代方案,但提出了一个方向性判断:未来的可解释性研究可能需要从"找电路"转向"理解分布式表征的叠加机制",即不再试图把每个功能映射到一组固定神经元,而是理解同一功能如何在多个重叠的分布式模式中被编码和调用。

这个转变的难度远高于当前的电路发现范式。分布式稠密电路的特征分析需要全新的数学工具和实验框架,短期内可能无法产出像电路可视化那样直观的成果。但这是必须面对的问题——如果理论基础不成立,在此之上构建的所有应用都是空中楼阁。

参考资料

图文卡片 ⬇️ 一键下载图文卡片