
Interpretierbarkeit braucht die Interaktion, nicht das Feature
SPEX und ProxySPEX der BAIR Berkeley identifizieren einflussreiche Interaktionen in großen Sprachmodellen im Maßstab, wo Feature-Attribution nur einzelne Features sieht. Die Lese des Honest Architect geht eine Ebene tiefer: Ein Feature ist kein Mechanismus. Die Interaktion ist es. Beim Trolley-Problem gab SHAP dem Wort "trolley" die Schuld, und sein Ersetzen durch Synonyme bewirkte nichts; SPEX fand eine 4-Wort-Synergie (trolley×2 + pulling + lever), und das Ersetzen dieser vier senkte die Fehlerquote auf fast null. Der Mechanismus war die Interaktion, und das Feature war eine falsche Fährte.
Kernergebnisse
- SPEX (Spectral Explainer) und ProxySPEX identifizieren einflussreiche Interaktionen in LLMs im Maßstab und erweitern die Interaktionsentdeckung von Dutzenden auf Tausende von Komponenten (BAIR Blog, "Identifying Interactions at Scale for LLMs", 2026).
- Ein Feature ist kein Mechanismus. Beim Trolley-Problem antwortete GPT-4o mini nur in 8% der Fälle richtig; SHAP machte das Wort "trolley" zum Haupttreiber, aber SPEX fand eine 4-Wort-Synergie (trolley×2 + pulling + lever), und das Ersetzen dieser vier senkte die Fehlerquote auf fast null.
- ProxySPEX fügt zu sparsity und low-degreeness die Eigenschaft hierarchy hinzu und erreicht die Leistung von SPEX mit etwa 10-mal weniger Ablationen.
- Theorem 3: Eine Eigenschaft ist genau dann garantiert, wenn ihr Mechanismus implementiert und messend ist — faithfulness ist die Eigenschaft, sparse recovery ist der Mechanismus, und die Interaktion ist, was der Mechanismus misst.
SHAP fand das Feature; SPEX fand den Mechanismus
2026 veröffentlichte der BAIR Blog "Identifying Interactions at Scale for LLMs" und beschrieb SPEX (ICML 2025) und ProxySPEX (NeurIPS 2025), Algorithmen, die einflussreiche Interaktionen in LLMs mit Ablation und sparse recovery identifizieren. Die sauberste Demonstration ist das Trolley-Problem. Eine modifizierte Version, in der "True" eindeutig die richtige Antwort ist, wird von GPT-4o mini nur in 8% der Fälle richtig beantwortet. Standard-Feature-Attribution (SHAP) identifizierte einzelne Instanzen des Worts "trolley" als primäre Treiber der falschen Antwort. Das Ersetzen von "trolley" durch Synonyme wie "tram" oder "streetcar" hatte wenig Einfluss — das Feature war benannt, aber die Vorhersage änderte sich nicht, weil das Feature nicht der Mechanismus war.
SPEX erzählte eine reichere Geschichte. Es fand eine dominante Synergie höherer Ordnung zwischen den zwei Instanzen von "trolley" und den Wörtern "pulling" und "lever" — vier Wörter, deren gemeinsames Auftreten den Fehler antrieb, und deren einzelnes Auftreten es nicht tat. Als diese vier Wörter durch Synonyme ersetzt wurden, sank die Fehlerquote des Modells auf fast null. Das ist die Unterscheidung, die der Honest Architect in einem Beispiel zieht: Feature-Attribution sagt, welches Feature mit dem Output korreliert; Interaktions-Attribution sagt, welcher Mechanismus ihn erzeugt. SHAP maß ein Feature; SPEX maß den Mechanismus, und der Mechanismus war die Interaktion.
Die Implikation für Interpretierbarkeit ist dieselbe, die Theorem 3 für jede Eigenschaft zieht. Eine Eigenschaft ist genau dann garantiert, wenn ihr Mechanismus implementiert und messend ist. "Wir wissen, was das Modell antreibt" ist eine Eigenschaft, und sie gilt genau dann, wenn die Messung die Interaktion erfasst, nicht das Feature. Eine Feature-Attribution, die die Interaktion verpasst, misst das Falsche, und das Falsche zu messen ist schlimmer als nichts zu messen, weil es das Modell erklärt erscheinen lässt, obwohl es das nicht ist. Der Trolley-Fall ist der Beweis: SHAP sagte "trolley", das Team ersetzte "trolley", und nichts änderte sich, weil der Mechanismus vier gemeinsam wirkende Wörter waren.
Sparsity, Low-Degreeness, Hierarchy: die Struktur, die die Wiederherstellung handhabbar macht
Dass SPEX im Maßstab funktioniert, beruht auf einer strukturellen Beobachtung, nicht auf größerer Rechenleistung. Während die Gesamtzahl der Interaktionen in einem Modell mit der Zahl der Features, Datenpunkte und Komponenten exponentiell wächst, ist die Zahl der einflussreichen Interaktionen tatsächlich klein. SPEX formalisiert das mit zwei Eigenschaften: sparsity (relativ wenige Interaktionen treiben den Output wirklich) und low-degreeness (einflussreiche Interaktionen umfassen typischerweise nur eine kleine Teilmenge der Features). Diese wandeln ein unlösbares Suchproblem in ein lösbares sparse-recovery-Problem, mit Werkzeugen aus Signalverarbeitung und Codierungstheorie — strategisch ausgewählte Ablationen, die viele Kandidaten-Interaktionen zusammenfassen, und effiziente Decodierung, um sie wieder zu entwirren.
ProxySPEX fügt eine dritte Eigenschaft hinzu: hierarchy. Wo eine Interaktion höherer Ordnung wichtig ist, sind ihre Teilmengen niedrigerer Ordnung wahrscheinlich auch wichtig. Diese zusätzliche Struktur bringt eine dramatische Verbesserung: ProxySPEX erreicht die Leistung von SPEX mit etwa 10-mal weniger Ablationen. In einem Problem, in dem jede Ablation ein teurer Inferenzaufruf oder ein Retraining ist, ist 10-mal weniger Ablationen der Unterschied zwischen einer Methode, die in Forschungszeit läuft, und einer, die in Produktionszeit läuft. SPEX erweitert die Interaktionsentdeckung von Dutzenden auf Tausende von Komponenten, und ProxySPEX macht diese Tausende zugänglich.
Die Lese des Honest Architect ist: Dies ist ein Messmechanismus, der um die Form der Eigenschaft herum entworfen ist. Sparsity, low-degreeness und hierarchy sind Behauptungen darüber, wie die Eigenschaft "einflussreiche Interaktion" strukturiert ist, und der Algorithmus ist gebaut, um genau diese Struktur zu messen. Ein Mechanismus, der die Struktur ignoriert — erschöpfende Ablation oder marginale Attribution, die Interaktionen mittelt — misst das Falsche zu Kosten, die das Team nicht tragen kann. Der Text benennt das: Marginale Ansätze (LIME, Banzhaf) können auf Tausenden von Features operieren, zeigen aber deutlich niedrigere faithfulness, weil sie die komplexen Interaktionen, die den Output antreiben, nicht erfassen. Faithfulness ist die Eigenschaft; der struktur-bewusste Mechanismus ist, was sie trägt.
Das Oracle misst die Interaktion, nicht die Sister
[PERSONAL EXPERIENCE] Das HAI Engine läuft seit 2016 in Produktion, und die Ensemble-Messung, die wir pflegen, hat dieselbe Form wie die Interaktionswiederherstellung von SPEX. Das Oracle normalisiert Wahrscheinlichkeiten an genau einer Stelle, und sum-to-one und Entropie des Ensembles werden bei jedem Merge verifiziert. Die Entropie ist die Interaktionsmessung: Sie sagt uns, wann Sisters genug uneinig sind, um zu mattered, und ein niedrig-Entropie-Merge ist eine redundante Interaktion (die Sisters sagen dasselbe), während ein hoch-Entropie-Merge synergistisch ist (die Sisters tragen unterschiedliche Evidenz bei). Das ist dieselbe Unterscheidung, die der Text für Data-Attribution zieht — redundante Interaktionen verstärken ein Konzept, synergistische definieren eine Decision Boundary — und es ist, warum wir die Entropie behalten, nicht einen per-Sister-Score.
Ein per-Sister-Score ist die Feature-Attribution des Ensembles. Er sagt, welche Sister welche Wahrscheinlichkeitsmasse beigetragen hat; er sagt nicht, welche Interaktion zwischen Sisters die kalibrierte Vorhersage erzeugt hat. Der Merge des Oracle ist der Mechanismus, und die Entropie ist seine Messung, genauso wie SPEX' sparse recovery der Mechanismus und faithfulness seine Messung ist. Wir taggen die Kalibrierung des Oracle als Production ✅, weil der Mechanismus implementiert ist und die Messung bei jedem Merge steht, nicht weil wir einzelnen Sisters vertrauen. Sisters sind Modelle; der Merge ist die Eigenschaft.
Das Data-Attribution-Ergebnis des Textes ist dieselbe Lektion auf der Trainingsdaten-Ebene. ProxySPEX fand auf einem auf CIFAR-10 trainierten ResNet synergistische Interaktionen, bei denen semantisch unterschiedliche Klassen zusammenarbeiten, um eine Decision Boundary zu definieren (ein automobile teilt visuelle Züge mit einem sports car, einem truck, einem delivery vehicle), und redundante Interaktionen, bei denen visuelle Duplikate ein Konzept verstärken (eine horse-Vorhersage wird von einem Cluster dog-Bilder mit ähnlichen Silhouetten beeinflusst). Diese feinkörnige Analyse erlaubt es, notwendige Synergien zu bewahren, während Redundanzen sicher entfernt werden. Das Äquivalent im Ensemble ist: Behalte hoch-Entropie-Merges, die unterschiedliche Evidenz tragen; schneide niedrig-Entropie-Merges ab, die Duplikate tragen. Die Entropie ist die Messung, die sagt, welches welches ist.
Die Topologie ist, wo die einflussreichen Interaktionen leben
[UNIQUE INSIGHT] Die Interaktionsentdeckung des Textes operiert auf drei Ebenen — Feature, Daten und Modellkomponente — und verpasst eine vierte, die für jedes System in Produktion wichtig ist: die Topologie. The space is the router. Eine Topologie aus network, community und room entscheidet, wer was sieht, bevor etwas antwortet, und diese Routing-Entscheidung ist eine Interaktion — zwischen der Anfrage, dem Scope des room und dem Agent, der ausgelöst wird. Die einflussreiche Interaktion ist nicht immer im Modell; sie ist oft zwischen dem Modell und dem room, an den die Topologie es geroutet hat. Eine Interpretierbarkeitsmethode, die auf der Feature-Ebene stehen bleibt, verpasst die Routing-Interaktion, die entschied, welche Features das Modell überhaupt sah.
Das ist, was der Honest Architect der Agenda des Textes hinzufügt. Der Text schließt mit der offenen Frage, die drei Perspektiven — Feature, Daten, Komponente — zu einem ganzheitlichen Verständnis eines Machine-Learning-Systems zu vereinigen. Diese vereinigte Sicht braucht eine vierte Ebene: die Topologie, die die Anfrage überhaupt an das Modell routet. Ein Modell, das sich in zwei Räumen unterschiedlich verhält, ist nicht zwei Modelle; es ist ein Modell, dessen einflussreiche Interaktion den room umfasst, und die Topologie ist der Mechanismus, der diese Interaktion erzeugt. Interpretierbarkeit, die die Topologie ignoriert, erklärt das Modell und verpasst das System.
Die civil-e-defensivo-Scope-Beschränkung ist in unserem Fall eine Interaktion auf Topologie-Ebene. Sie ist eine niedergeschriebene Policy, die entscheidet, welche Anfragen an welche Agents geroutet werden, und die Messung ist der Deal, den wir ablehnen, beobachtbar in der Pipeline. Die Souveränität des Kunden — dein network, deine brand, deine data — ist eine andere: Die Routing-Regel hält die Topologie deine, und das export log ist die Messung. Beides sind Interaktionen zwischen Anfrage und Topologie, und beides sind Eigenschaften, die genau dann gelten, wenn ihr Mechanismus implementiert und messend ist — derselbe Test, den SPEX auf Features anwendet, eine Ebene höher angewandt.
Theorem 3: faithfulness ist die Eigenschaft, sparse recovery ist der Mechanismus
[ORIGINAL DATA] the 21 papers spezifiziert Theorem 3: Eine Eigenschaft ist genau dann garantiert, wenn ihr Mechanismus implementiert und messend ist. Lies das als Test für jeden Interpretierbarkeits-Anspruch. "Wir können den Output des Modells erklären" ist eine Eigenschaft, und sie gilt genau dann, wenn der Messmechanismus die einflussreichen Interaktionen erfasst — nicht die Features, nicht die marginalen Beiträge, die Interaktionen. Der faithfulness-Score von SPEX ist die Messung; die sparse recovery über sparsity, low-degreeness und hierarchy ist der Mechanismus; die Eigenschaft gilt, wenn der Mechanismus implementiert ist und der faithfulness-Score auf einem Dashboard steht, das jemand ansieht.
Deshalb sind unsere Ehrlichkeits-Tags keine Adjektive. Production ✅ bedeutet, dass der Mechanismus implementiert und seine Messung beobachtet ist. Die Entropie des Oracle ist Production ✅, weil sie bei jedem Merge verifiziert wird. Das Routing der Topologie ist Production ✅, weil network, community und room routen, bevor etwas antwortet. Ein Interpretierbarkeits-Score ist selbst kein Tag; er ist eine Messung, und eine Messung ohne Mechanismus ist eine Zahl, keine Eigenschaft. Der Text ist dazu ehrlich — er bewertet SPEX an faithfulness, also ob die wiederhergestellten Attributionen den Output des Modells auf ungesehenen Test-Ablationen vorhersagen, und das ist der richtige Test, weil er misst, ob der Mechanismus die Eigenschaft wirklich erfasst.
Dasselbe Theorem ist, warum wir keine Ergebnisse für Wallet & Token, Super App oder Community Credit versprechen — diese sind Roadmap 🔵, der Mechanismus ist noch nicht implementiert und messend, und eine Vorhersage, die wir nicht messen können, ist keine, die wir ehrlich verkaufen können. Nur civil- und defensivo-Scope, und keine token- oder community-credit-Ergebnisversprechen, weil der Howey-Review nicht auf einem Mechanismus lief, der noch nicht existiert. Ein Roadmap-Element mit dem Glanz eines Interpretierbarkeits-Ergebnisses zu taggen, ist derselbe Fehler wie eine Feature-Attribution einen Mechanismus zu nennen — das Falsche gemessen und als Eigenschaft präsentiert.
Häufige Fragen
Was fand SPEX, das SHAP beim Trolley-Problem verpasste?
GPT-4o mini antwortete beim modifizierten Trolley-Problem nur in 8% der Fälle richtig. SHAP identifizierte einzelne "trolley"-Wortinstanzen als Treiber, aber das Ersetzen durch Synonyme bewirkte nichts. SPEX fand eine 4-Wort-Synergie (trolley×2 + pulling + lever), und das Ersetzen dieser vier senkte die Fehlerquote auf fast null. SHAP maß das Feature; SPEX maß den Mechanismus, und der Mechanismus war die Interaktion.
Warum skaliert SPEX, wo erschöpfende Ablation das nicht tut?
Durch drei strukturelle Eigenschaften: sparsity (wenige Interaktionen treiben den Output wirklich), low-degreeness (einflussreiche Interaktionen umfassen eine kleine Teilmenge der Features) und hierarchy (Interaktionen höherer Ordnung implizieren, dass ihre Teilmengen niedrigerer Ordnung wichtig sind). Diese wandeln eine exponentielle Suche in ein handhabbares sparse-recovery-Problem. ProxySPEX fügt hierarchy hinzu und erreicht SPEX mit etwa 10-mal weniger Ablationen.
Wie ist die Entropie des Oracle dieselbe Form wie die Interaktionswiederherstellung von SPEX?
Beide messen die Interaktion, nicht das Individuum. SPEX stellt einflussreiche Interaktionen zwischen Features wieder her; die Entropie des Oracle misst bei jedem Merge die Interaktion zwischen Sisters. Ein niedrig-Entropie-Merge ist eine redundante Interaktion (duplizierte Evidenz); ein hoch-Entropie-Merge ist synergistisch (unterschiedliche Evidenz). Ein per-Sister-Score ist die Feature-Attribution des Ensembles; die Entropie ist die Messung des Mechanismus.
Wie wendet sich Theorem 3 auf Interpretierbarkeit an?
Eine Eigenschaft ist genau dann garantiert, wenn ihr Mechanismus implementiert und messend ist. "Wir können den Output erklären" ist eine Eigenschaft, die genau dann gilt, wenn die Messung die einflussreichen Interaktionen erfasst. SPEX' faithfulness ist die Messung; sparse recovery ist der Mechanismus. Eine Feature-Attribution, die die Interaktion verpasst, misst das Falsche, und das Falsche zu messen ist schlimmer als nichts zu messen.
Wie mappt das auf die Ehrlichkeits-Tags von Everythink?
Production ✅ bedeutet, dass der Mechanismus implementiert und messend ist — die Entropie des Oracle bei jedem Merge, das Routing der Topologie, die Selbst-Deaktivierung des World Monitor. Ein Interpretierbarkeits-Score ist eine Messung, kein Tag. Roadmap 🔵 bedeutet, dass der Mechanismus noch nicht implementiert ist, und kein Interpretierbarkeits-Ergebnis hebt das an. Die Tags sind die Messung des Mechanismus, kein Vibe über das Modell.
Quellen
- BAIR Blog, "Identifying Interactions at Scale for LLMs" (SPEX / ProxySPEX), 2026, abgerufen 2026-08-23, https://bair.berkeley.edu/blog/2026/03/13/spex/
- Tsai et al., "SPEX: Spectral Explainer", ICML 2025, referenziert über BAIR Blog, https://openreview.net/forum?id=pRlKbAwczl
- ProxySPEX, NeurIPS 2025, referenziert über BAIR Blog, https://openreview.net/forum?id=KI8qan2EA7
Wenn dein network bereit ist für eine Messung, die die Interaktion erfasst, nicht das Feature, erstelle dein network — die Topologie routet die Anfrage, die Sisters erzeugen die Entwürfe, und das Oracle misst die Synergie bei jedem Merge.

Du stellst keinen Agenten ein. Du verdrahtest einen Mechanismus.
Codex vs Claude Code ist eine Einstellungsfrage. Die ehrliche Antwort: du stellst keinen Agenten ein — du verdrahtest einen Mechanismus. Der Benchmark misst; der Harness compoundiert; die Topologie routet.
→ →
Das Routing geht der Retrieval voraus, nicht der Embedding-Dimension
KDnuggets' Umfrage zu RAG-Fehlern zeigt, dass Over-Engineering der Embeddings die Kosten treibt. Der fehlende Mechanismus ist explizites Routing vor der Retrieval — Theorem 3 angewendet auf Suche, mit Everythinks Topologie als vorgelagertem Analogon.
→ →
Verstehen ist der gemessene Mechanismus, nicht der KI-Tutor
Die fünf Nachteile der KI-gestützten Programmierung sind ein fehlender Mechanismus: ein Messschritt, der Verstehen verifiziert. Theorem 3, nicht Ausgleich, ist das Heilmittel.
→ →Baue deine Welt auf einer Engine, die beweist, was sie behauptet.
Erstelle dein eigenes Netzwerk auf der Engine, die seit 2016 läuft — oder sprich mit dem Team hinter den 21 Papieren.
