
可解释性需要的是交互,不是特征
BAIR Berkeley 的 SPEX 与 ProxySPEX 在大规模上识别大型语言模型中具有影响力的交互,而特征归因只能看到单个特征。Honest Architect 的解读更深一层:一个特征不是机制。交互才是。在电车难题里,SHAP 把锅甩给 "trolley" 这个词,把它换成同义词却毫无作用;SPEX 找到了四词协同(trolley×2 + pulling + lever),把这四个换掉,失败率几乎降到零。机制是交互,特征是一条假线索。
关键结论
- SPEX(Spectral Explainer)与 ProxySPEX 在大规模上识别 LLM 中具有影响力的交互,把交互发现的范围从几十扩展到几千个组件(BAIR Blog, "Identifying Interactions at Scale for LLMs", 2026)。
- 一个特征不是机制。在电车难题里,GPT-4o mini 只有 8% 的时候答对;SHAP 把锅甩给 "trolley" 这个词,但 SPEX 找到了四词协同(trolley×2 + pulling + lever),把这四个换成同义词,失败率几乎降到零。
- ProxySPEX 在 sparsity 和 low-degreeness 之外加上 hierarchy 这一结构性属性,以约 10 倍更少的 ablation 匹配 SPEX 的表现。
- Theorem 3:一个属性当且仅当其机制被实现并测量时才得到保证——faithfulness 是属性,sparse recovery 是机制,而交互才是机制所测量的东西。
SHAP 找到了特征;SPEX 找到了机制
2026 年,BAIR Blog 发布了 "Identifying Interactions at Scale for LLMs",描述 SPEX(ICML 2025)和 ProxySPEX(NeurIPS 2025),用 ablation 与 sparse recovery 识别 LLM 中具有影响力的交互。最干净的演示是电车难题。一个修改版里 "True" 显然是正确答案,GPT-4o mini 却只有 8% 的时候答对。标准的特征归因(SHAP)把单个 "trolley" 词实例识别为驱动错误回答的主因。把 "trolley" 换成 "tram" 或 "streetcar" 几乎没有影响——特征被点名了,预测却没变,因为特征不是机制。
SPEX 讲了一个更丰富的故事。它发现了一个主导的高阶协同,发生在两个 "trolley" 实例与 "pulling"、"lever" 之间——四个词的联合出现驱动了失败,而其中任何一个单独出现都不行。当这四个词被换成同义词,模型的失败率几乎降到零。这就是 Honest Architect 在一个例子里讲的区分:特征归因说哪个特征与输出相关;交互归因说哪个机制产生了它。SHAP 测了一个特征;SPEX 测了机制,而机制是交互。
对可解释性的含义,和 Theorem 3 对任何属性所划的线是一样的。一个属性当且仅当其机制被实现并测量时才得到保证。"我们知道什么驱动模型" 是一个属性,它当且仅当测量捕获了交互而不是特征时才成立。一个错过交互的特征归因是在测量错误的东西,而测量错误的东西比不测量更糟,因为它让模型看起来被解释了,其实没有。电车案例就是证明:SHAP 说 "trolley",团队把 "trolley" 换了,什么都没变,因为机制是四个词共同作用。
Sparsity、low-degreeness、hierarchy:让恢复变得可处理的结构
SPEX 能在大规模上工作,靠的是一个结构性观察,不是更大的算力。模型中交互的总数随特征、数据点、组件数指数增长,但具有影响力的交互其实很少。SPEX 用两条属性把它形式化:sparsity(真正驱动输出的交互相对很少)和 low-degreeness(有影响力的交互通常只涉及一小部分特征)。这两条把一个不可处理的搜索问题转成一个可解的 sparse recovery 问题,借用 signal processing 与 coding theory 的工具——精心选择的 ablation 把许多候选交互叠加在一起,再用高效的 decoding 把它们解开。
ProxySPEX 加上了第三条属性:hierarchy。当一个高阶交互重要时,其低阶子集很可能也重要。这条额外的结构带来了戏剧性的改进:ProxySPEX 以大约 10 倍更少的 ablation 匹配 SPEX 的表现。在一个每次 ablation 都是一次昂贵推理调用或重训练的问题上,10 倍更少的 ablation 是研究时间能跑和生产时间能跑的差别。SPEX 把交互发现从几十扩展到几千个组件,ProxySPEX 让那几千个变得可及。
Honest Architect 的解读是:这是一个围绕属性的形状来设计的测量机制。Sparsity、low-degreeness、hierarchy 都是关于 "有影响力的交互" 这个属性如何被结构的断言,而算法就是被造来精确测量那种结构的。一个无视结构的机制——穷举 ablation,或把交互平均掉的边际归因——测量的是错误的东西,且代价团队扛不起。原文点名了这点:边际方法(LIME、Banzhaf)可以在几千个特征上跑,但 faithfulness 显著更低,因为它们没捕获驱动输出的复杂交互。Faithfulness 是属性;结构感知的机制是支撑它的东西。
Oracle 测的是交互,不是 Sister
[PERSONAL EXPERIENCE] HAI Engine 自 2016 年在生产中运行,而我们维护的 ensemble 测量与 SPEX 的交互恢复同形。Oracle 在唯一一个地方归一化概率,sum-to-one 与 ensemble 的熵在每个 merge 上被验证。熵就是交互测量:它告诉我们 Sisters 何时分歧到值得在意,低熵 merge 是冗余交互(Sisters 在说同一件事),高熵 merge 是协同交互(Sisters 贡献了不同的证据)。这正是原文给 data attribution 画的区分——冗余交互强化一个概念,协同交互定义一个 decision boundary——而我们保留熵,而不是 per-Sister 分数。
一个 per-Sister 分数是 ensemble 的特征归因。它说哪个 Sister 贡献了哪一块概率质量;它不说 Sister 之间的哪个交互产生了校准的 forecast。Oracle 的 merge 是机制,熵是它的测量,正如 SPEX 的 sparse recovery 是机制、faithfulness 是它的测量。我们把 Oracle 的校准标记为 Production ✅,因为机制被实现、测量在每个 merge 上,而不是因为我们单独信任某个 Sister。Sisters 是模型;merge 才是属性。
原文的 data attribution 结果是同一个教训在训练数据层。ProxySPEX 在一个 CIFAR-10 上训练的 ResNet 上找到了协同交互——语义上不同的类协同工作来定义一个 decision boundary(一辆 automobile 与一个 sports car、一辆 truck、一辆 delivery vehicle 共享视觉特征),以及冗余交互——视觉副本强化一个概念(一个 horse 预测被一群轮廓相似的 dog 图片影响)。这种细粒度的分析让保留必要的协同、安全地移除冗余成为可能。在 ensemble 上的等价物是:保留承载不同证据的高熵 merge;砍掉承载副本的低熵 merge。熵就是区分这两者的测量。
拓扑是有影响力交互所在之处
[UNIQUE INSIGHT] 原文的交互发现运作在三层层级——特征、数据、模型组件——并漏掉了对任何生产系统都重要的第四层:拓扑。The space is the router。一个 network、community、room 的拓扑在任何东西响应之前就决定了谁看到什么,而这个路由决定就是一个交互——在请求、room 的范围与被触发的 agent 之间。有影响力的交互并不总在模型内部;它常常在模型与拓扑把它路由到的 room 之间。一个停在特征层的可解释性方法,会漏掉那个决定了模型甚至看到哪些特征的路由交互。
这是 Honest Architect 给原文议程的补充。原文在结尾点出了那个开放问题——把三个视角(特征、数据、组件)统一成对机器学习系统的整体理解。那个统一视角需要第四层:把请求路由到模型本身的拓扑。一个在两个 room 里行为不同的模型不是两个模型;它是一个模型,其有影响力的交互包含了 room,而拓扑是产生那个交互的机制。忽略拓扑的可解释性会解释模型,却漏掉系统。
civil-e-defensivo 范围限制在我们这里是一个拓扑层的交互。它是一条写下的策略,决定哪些请求路由到哪些 agent,而测量是我们婉拒的那笔交易,可在 pipeline 中观察。客户主权——你的 network、你的 brand、你的 data——是另一条:路由规则让拓扑保持你的,export log 是测量。两者都是请求与拓扑之间的交互,两者都是当且仅当其机制被实现并测量时才成立的属性——同一个 SPEX 应用在特征上的测试,应用在更高一层。
Theorem 3:faithfulness 是属性,sparse recovery 是机制
[ORIGINAL DATA] 21 篇论文的系列规定了 Theorem 3:一个属性当且仅当其机制被实现并测量时才得到保证。把它读成对每个可解释性断言的测试。"我们能解释模型的输出" 是一个属性,当且仅当测量机制捕获了有影响力的交互——不是特征,不是边际贡献,是交互——时才成立。SPEX 的 faithfulness 分数是测量;基于 sparsity、low-degreeness、hierarchy 的 sparse recovery 是机制;当机制被实现、faithfulness 分数在一个有人看的 dashboard 上时,属性才成立。
这就是为什么我们的诚实标签不是形容词。Production ✅ 意味着机制被实现、其测量被观察。Oracle 的熵是 Production ✅,因为它在每个 merge 上被验证。拓扑的路由是 Production ✅,因为 network、community、room 在任何东西响应之前就路由。一个可解释性分数本身不是一个标签;它是一个测量,而没有机制的测量只是一个数字,不是属性。原文对此诚实——它用 faithfulness 评估 SPEX,即所恢复的归因是否在未见过的 test ablation 上预测模型输出,这是正确的测试,因为它测的是机制是否真的捕获了属性。
同一条定理也是我们不会承诺 Wallet & Token、Super App、Community Credit 结果的原因——这些是 Roadmap 🔵,机制还没被实现并测量,一个我们测不了的 forecast 不是一个我们能诚实卖的 forecast。只有 civil 与 defensivo 范围,没有 token 或 community-credit 结果承诺,因为 Howey review 没在一个还不存在的机制上跑。把一个 Roadmap 项贴上可解释性结果的光泽,和把特征归因叫做机制是同一个错——测量了错误的东西,却当成属性来呈现。
常见问题
在电车难题里 SPEX 找到了什么 SHAP 漏掉的东西?
GPT-4o mini 在修改过的电车难题上只有 8% 的时候答对。SHAP 把单个 "trolley" 词实例识别为驱动因素,但把 "trolley" 换成同义词毫无作用。SPEX 找到了四词协同(trolley×2 + pulling + lever),把这四个换成同义词,失败率几乎降到零。SHAP 测了特征;SPEX 测了机制,而机制是交互。
为什么 SPEX 能扩展而穷举 ablation 不能?
靠三条结构性属性:sparsity(真正驱动输出的交互很少)、low-degreeness(有影响力的交互只涉及一小部分特征)、hierarchy(高阶交互意味着其低阶子集也重要)。这三条把指数级搜索变成可解的 sparse recovery 问题。ProxySPEX 加上 hierarchy,以约 10 倍更少的 ablation 匹配 SPEX。
Oracle 的熵如何与 SPEX 的交互恢复同形?
两者都测交互,不测个体。SPEX 恢复特征间有影响力的交互;Oracle 的熵在每个 merge 上测 Sister 间的交互。低熵 merge 是冗余交互(重复证据);高熵 merge 是协同交互(不同证据)。per-Sister 分数是 ensemble 的特征归因;熵是机制的测量。
Theorem 3 如何应用于可解释性?
一个属性当且仅当其机制被实现并测量时才得到保证。"我们能解释输出" 是一个属性,当且仅当测量捕获了有影响力的交互时才成立。SPEX 的 faithfulness 是测量;sparse recovery 是机制。一个错过交互的特征归因是在测量错误的东西,而测量错误的东西比不测量更糟。
这如何映射到 Everythink 的诚实标签?
Production ✅ 意味着机制被实现并测量——Oracle 的熵在每个 merge 上、拓扑的路由、World Monitor 的自禁用。一个可解释性分数是一个测量,不是一个标签。Roadmap 🔵 意味着机制还没被实现,没有任何可解释性结果能提升它。标签是机制的测量,不是对模型的某种感觉。
来源
- BAIR Blog, "Identifying Interactions at Scale for LLMs"(SPEX / ProxySPEX),2026,检索于 2026-08-23,https://bair.berkeley.edu/blog/2026/03/13/spex/
- Tsai et al., "SPEX: Spectral Explainer",ICML 2025,经 BAIR Blog 引用,https://openreview.net/forum?id=pRlKbAwczl
- ProxySPEX,NeurIPS 2025,经 BAIR Blog 引用,https://openreview.net/forum?id=KI8qan2EA7
如果你的 network 准备好一个能捕获交互而不是特征的测量,创建你的 network——拓扑路由请求,Sisters 产出草稿,Oracle 在每个 merge 上测协同。



