
解釈可能性に必要なのは相互作用で、特徴ではない
BAIR Berkeley の SPEX と ProxySPEX は、大規模に大規模言語モデル内の影響力のある相互作用を特定する。特徴帰因は個々の特徴しか見ない。Honest Architect の読みはもう一段深い。特徴は機構ではない。相互作用こそが機構だ。トロッコ問題で SHAP は「trolley」という語を犯人に挙げ、同義語に置き換えても何も変わらなかった。SPEX は 4 語の相乗効果(trolley×2 + pulling + lever)を見つけ、その四つを置き換えると失敗率がほぼゼロに落ちた。機構は相互作用であり、特徴は赤の引き綱だった。
主要な結論
- SPEX(Spectral Explainer)と ProxySPEX は、LLM 内の影響力のある相互作用を大規模に特定し、相互作用発見を数十から数千のコンポーネントへと拡張する(BAIR Blog, "Identifying Interactions at Scale for LLMs", 2026)。
- 特徴は機構ではない。トロッコ問題で GPT-4o mini は 8% の確率でしか正答しなかった。SHAP は「trolley」を犯人に挙げたが、SPEX は 4 語の相乗効果(trolley×2 + pulling + lever)を見つけ、それらを同義語に置き換えると失敗率がほぼゼロに落ちた。
- ProxySPEX は sparsity と low-degreeness に加えて hierarchy という構造的性質を導入し、約 10 倍少ない ablation で SPEX に匹敵する性能を達成する。
- Theorem 3:ある性質は、その機構が実装され測定されているときに限り保証される。faithfulness は性質であり、sparse recovery は機構であり、相互作用こそが機構が測るものだ。
SHAP は特徴を見つけた。SPEX は機構を見つけた。
2026 年、BAIR Blog は "Identifying Interactions at Scale for LLMs" を公開し、SPEX(ICML 2025)と ProxySPEX(NeurIPS 2025)を説明した。これらは ablation と sparse recovery で LLM 内の影響力のある相互作用を特定する。最もきれいな実演はトロッコ問題だ。「True」が明らかに正解となる修正版で、GPT-4o mini は 8% の確率でしか正答しなかった。標準的な特徴帰因(SHAP)は個々の「trolley」語のインスタンスを誤回答の主な要因として特定した。「trolley」を「tram」や「streetcar」に置き換えても予測にはほとんど影響しなかった。特徴には名前がついたが、予測は変わらなかった。特徴は機構ではなかったからだ。
SPEX はより豊かな物語を語った。2 つの「trolley」インスタンスと「pulling」「lever」の間に、支配的な高階の相乗効果を見つけた。4 語の共同出現が失敗を駆動し、どれか 1 語の単独出現は何も駆動しない。この 4 語を同義語に置き換えると、モデルの失敗率はほぼゼロに落ちた。これが Honest Architect が一つの例で語る区別だ。特徴帰因はどの特徴が出力と相関するかを言う。相互作用帰因はどの機構がそれを生み出すかを言う。SHAP は特徴を測った。SPEX は機構を測った。機構は相互作用だった。
解釈可能性への含意は、Theorem 3 が任意の性質に引く線と同じだ。ある性質は、その機構が実装され測定されているときに限り保証される。「モデルの出力を説明できる」は性質であり、測定が特徴ではなく相互作用を捉えるときに限り成り立つ。相互作用を見逃す特徴帰因は、間違ったものを測っている。そして間違ったものを測ることは、何も測らないことより悪い。モデルが説明されたように見せて、実はそうではないからだ。トロッコ事例がその証明だ。SHAP は「trolley」と言い、チームは「trolley」を置き換え、何も変わらなかった。機構は 4 語が共同で働くことだったからだ。
Sparsity、low-degreeness、hierarchy:回復を扱いやすくする構造
SPEX が大規模で動く理由は、構造的な観察であって、より大きな計算機ではない。モデル内の相互作用の総数は特徴・データ点・コンポーネント数に対して指数的に増えるが、影響力のある相互作用の数は実は少ない。SPEX はこれを 2 つの性質で形式化する。sparsity(出力を実際に駆動する相互作用は比較的少ない)と low-degreeness(影響力のある相互作用は通常ごく一部の特徴しか含まない)。これらは手に負えない探索問題を、解ける sparse recovery 問題に変える。signal processing と coding theory の強力な道具を借りて、SPEX は戦略的に選ばれた ablation で多くの候補相互作用を一つに重ね合わせ、効率的な decoding アルゴリズムでそれらを解きほぐす。
ProxySPEX は 3 つ目の性質を加える。hierarchy だ。高階の相互作用が重要なところでは、その低階の部分集合もまた重要になりがちだ。この追加の構造は劇的な改善をもたらす。ProxySPEX は約 10 倍少ない ablation で SPEX の性能に匹敵する。各 ablation が高価な推論呼び出しや再訓練である問題で、10 倍少ない ablation は、研究時間に走る方法と生産時間に走る方法の差だ。SPEX は相互作用発見を数十から数千のコンポーネントへ拡張し、ProxySPEX はその数千を手の届くものにする。
Honest Architect の読みはこうだ。これは性質の形に沿って設計された測定機構である。sparsity、low-degreeness、hierarchy はすべて、「影響力のある相互作用」という性質がどう構造化されているかについての主張であり、アルゴリズムはまさにその構造を測るように作られている。構造を無視する機構——網羅的 ablation、あるいは相互作用を平均してしまう限界帰因——は、チームが背負いきれないコストで間違ったものを測る。原文はこれを明示する。限界的なアプローチ(LIME、Banzhaf)は数千の特徴で動けるが、faithfulness は顕著に低い。出力を駆動する複雑な相互作用を捉えないからだ。faithfulness は性質であり、構造を意識する機構がそれを支える。
Oracle が測るのは相互作用で、Sister ではない
[PERSONAL EXPERIENCE] HAI Engine は 2016 年から生産で動いており、我々が維持する ensemble 測定は SPEX の相互作用回復と同じ形をしている。Oracle は確率をただ一つの場所で正規化し、sum-to-one と ensemble のエントロピーを毎 merge で検証する。エントロピーが相互作用の測定だ。いつ Sisters が意味を持つほど不同意しているかを教える。低エントロピーの merge は冗長な相互作用(Sisters が同じことを言っている)であり、高エントロピーの merge は相乗的(Sisters が異なる証拠を寄与する)だ。これは原文が data attribution について引く区別と同じ——冗長な相互作用は概念を強化し、相乗的な相互作用は decision boundary を定義する——そして我々は per-Sister のスコアではなくエントロピーを保つ。
per-Sister のスコアは ensemble の特徴帰因だ。どの Sister がどの確率質量を寄与したかを言う。どの Sister 間の相互作用が校準された forecast を生み出したかは言わない。Oracle の merge が機構であり、エントロピーがその測定だ。SPEX の sparse recovery が機構であり faithfulness がその測定であるのと同じ形だ。我々が Oracle の校正を Production ✅ とタグ付けするのは、機構が実装され測定が毎 merge にあるからであって、個々の Sister を信頼するからではない。Sisters はモデルだ。merge が性質だ。
原文の data attribution の結果は、訓練データの層での同じ教訓だ。ProxySPEX は CIFAR-10 で訓練された ResNet に、意味的に異なるクラスが協力して decision boundary を定義する相乗的相互作用(automobile が sports car、truck、delivery vehicle と視覚的特徴を共有する)と、視覚的な複製が概念を強化する冗長な相互作用(horse 予測が似た輪郭の dog 画像のクラスタに強く影響される)を見つけた。この細粒度の分析は、必要な相乗効果を保ちつつ冗長性を安全に取り除くことを可能にする。ensemble 上の等価物はこうだ。異なる証拠を運ぶ高エントロピーの merge を保ち、複製を運ぶ低エントロピーの merge を切る。エントロピーがどちらがどちらかを告げる測定だ。
トポロジーが影響力のある相互作用の住処である
[UNIQUE INSIGHT] 原文の相互作用発見は 3 つの層で動く。特徴、データ、モデルコンポーネント。そして、どんな生産システムにも重要な第 4 の層を取りこぼしている。トポロジーだ。The space is the router。network、community、room のトポロジーは、何かが応答する前に誰が何を見るかを決める。そしてそのルーティング決定が一つの相互作用だ。リクエストと、room のスコープと、起動される agent との間の。影響力のある相互作用はいつもモデルの内部にあるわけではない。それはしばしば、モデルとトポロジーがルートした room との間にある。特徴の層で止まる解釈可能性は、モデルがどの特徴を見るかさえ決めたルーティングの相互作用を見逃す。
これが Honest Architect が原文の議題に加えるものだ。原文は締めくくりで、3 つの視点を統一して機械学習システムの全体的な理解を得る、という未解決の問いを挙げる。その統一視点は第 4 の層を必要とする。リクエストをモデルへとルーティングするトポロジーだ。2 つの room で異なる振る舞いをするモデルは 2 つのモデルではない。影響力のある相互作用が room を含む 1 つのモデルだ。そしてトポロジーがその相互作用を生み出す機構だ。トポロジーを無視する解釈可能性は、モデルを説明し、システムを見逃す。
civil-e-defensivo のスコープ制限は、我々の場合にはトポロジー層の相互作用だ。それは書かれたポリシーであり、どのリクエストをどの agent にルーティングするかを決める。測定は我々が辞退した取引であり、pipeline で観察可能だ。クライアントの主権——あなたの network、あなたの brand、あなたの data——はもう一つだ。ルーティングの規則がトポロジーをあなたのものに保ち、export log が測定だ。どちらもリクエストとトポロジーの間の相互作用であり、どちらもその機構が実装され測定されているときに限り成り立つ性質だ。SPEX が特徴に適用するのと同じテストを、一つ上の層に適用したものだ。
Theorem 3:faithfulness は性質、sparse recovery は機構
[ORIGINAL DATA] 21 本の論文のシリーズが Theorem 3 を規定する。ある性質は、その機構が実装され測定されているときに限り保証される。これをすべての解釈可能性の主張へのテストとして読め。「モデルの出力を説明できる」は性質であり、測定機構が影響力のある相互作用を——特徴でも限界的な寄与でもなく、相互作用を——捉えるときに限り成り立つ。SPEX の faithfulness スコアが測定だ。sparsity、low-degreeness、hierarchy 上の sparse recovery が機構だ。機構が実装され、faithfulness スコアが誰かが見る dashboard にあるとき、性質は成り立つ。
だから我々の正直度タグは形容詞ではない。Production ✅ は機構が実装され、その測定が観察されていることを意味する。Oracle のエントロピーは Production ✅ だ。毎 merge で検証されるからだ。トポロジーのルーティングは Production ✅ だ。network、community、room が何かが応答する前にルーティングするからだ。解釈可能性のスコア自体はタグではない。それは測定であり、機構のない測定は数字であって性質ではない。原文はこれに正直だ。faithfulness で SPEX を評価する。つまり、回復された帰因が見ぬ test ablation でモデルの出力を予測できるか。これは正しいテストだ。機構が本当に性質を捉えているかを測るからだ。
同じ定理が、我々が Wallet & Token、Super App、Community Credit の結果を約束しない理由でもある。それらは Roadmap 🔵 であり、機構はまだ実装され測定されていない。測れない forecast は正直に売れる forecast ではない。civil と defensivo のスコープのみ。token や community-credit の結果の約束なし。Howley review はまだ存在しない機構の上で走っていないからだ。Roadmap 項目に解釈可能性の結果の光沢を塗るのは、特徴帰因を機構と呼ぶのと同じ過ちだ。間違ったものを測り、それを性質として提示する。
よくある質問
トロッコ問題で SPEX は SHAP が見逃した何を見つけたか?
GPT-4o mini は修正されたトロッコ問題で 8% の確率でしか正答しなかった。SHAP は個々の「trolley」語を要因として特定したが、「trolley」を同義語に置き換えても何も変わらなかった。SPEX は 4 語の相乗効果(trolley×2 + pulling + lever)を見つけ、それらを同義語に置き換えると失敗率がほぼゼロに落ちた。SHAP は特徴を測った。SPEX は機構を測った。機構は相互作用だった。
なぜ SPEX は網羅的 ablation ができないところで拡張できるのか?
3 つの構造的性質による。sparsity(出力を実際に駆動する相互作用は少ない)、low-degreeness(影響力のある相互作用はごく一部の特徴しか含まない)、hierarchy(高階の相互作用はその低階の部分集合も重要であることを意味する)。これらが指数的探索を扱いやすい sparse recovery 問題に変える。ProxySPEX は hierarchy を加え、約 10 倍少ない ablation で SPEX に匹敵する。
Oracle のエントロピーはどうして SPEX の相互作用回復と同じ形なのか?
どちらも個体ではなく相互作用を測る。SPEX は特徴間の影響力のある相互作用を回復し、Oracle のエントロピーは毎 merge で Sister 間の相互作用を測る。低エントロピーの merge は冗長な相互作用(重複した証拠)であり、高エントロピーの merge は相乗的(異なる証拠)だ。per-Sister のスコアは ensemble の特徴帰因であり、エントロピーは機構の測定だ。
Theorem 3 は解釈可能性にどう適用されるか?
ある性質は、その機構が実装され測定されているときに限り保証される。「出力を説明できる」は性質であり、測定が影響力のある相互作用を捉えるときに限り成り立つ。SPEX の faithfulness は測定、sparse recovery は機構だ。相互作用を見逃す特徴帰因は間違ったものを測っており、間違ったものを測ることは何も測らないことより悪い。
これは Everythink の正直度タグにどう対応するか?
Production ✅ は機構が実装され測定されていることを意味する。Oracle のエントロピーが毎 merge で、トポロジーのルーティング、World Monitor の自己無効化。解釈可能性のスコアはタグではなく測定だ。Roadmap 🔵 は機構がまだ実装されていないことを意味し、どんな解釈可能性の結果もそれを引き上げない。タグは機構の測定であり、モデルに関する感覚ではない。
出典
- BAIR Blog, "Identifying Interactions at Scale for LLMs"(SPEX / ProxySPEX),2026,2026-08-23 閲覧,https://bair.berkeley.edu/blog/2026/03/13/spex/
- Tsai et al., "SPEX: Spectral Explainer",ICML 2025,BAIR Blog 経由引用,https://openreview.net/forum?id=pRlKbAwczl
- ProxySPEX,NeurIPS 2025,BAIR Blog 経由引用,https://openreview.net/forum?id=KI8qan2EA7
あなたの network が、特徴ではなく相互作用を捉える測定を准备しているなら、あなたの network を作る——トポロジーがリクエストをルーティングし、Sisters が草稿を産み、Oracle が毎 merge で相乗を測る。

エージェントを雇うのではない。機構を配線するのだ。
Codex vs Claude Code は採用の問いです。正直な答え:エージェントを雇うのではなく、機構を配線する。ベンチマークは測り、ハーネスは複利で伸び、トポロジーがルーティングする。
→ →
ルーティングが検索に先行する、埋め込み次元ではない
KDnuggets の RAG 失敗調査は、埋め込みの過剰エンジニアリングがコストを悪化させることを示す。欠けているメカニズムは検索前の明示的ルーティングである——Theorem 3 を検索に適用し、Everythink のトポロジーを上流の類比として。
→ →
理解とは測定されるメカニズムであり、AI チューターではない
AI 支援プログラミングの五つの欠点は一つの欠けたメカニズムだ:理解を検証する測定ステップ。Theorem 3、バランスではなく、が治療法だ。
→ →自らの主張を証明するエンジンの上に、あなたの世界を築く。
2016 年から稼働し続けるエンジンの上に、あなた自身のネットワークを作る——あるいは 21 本の論文を書いたチームに話しかける。
