
L'interprétabilité a besoin de l'interaction, pas de la feature
SPEX et ProxySPEX de BAIR Berkeley identifient les interactions influentes dans les grands modèles de langage à l'échelle, là où la feature attribution ne voit que les features individuelles. La lecture du Honest Architect va un niveau plus bas : une feature n'est pas un mécanisme. L'interaction l'est. Dans le dilemme du tramway, SHAP a désigné le mot « trolley » comme coupable, et le remplacer par des synonymes n'a rien fait ; SPEX a trouvé une synergie de 4 mots (trolley×2 + pulling + lever), et remplacer ces quatre a fait chuter le taux d'échec presque à zéro. Le mécanisme était l'interaction, et la feature était une fausse piste.
Conclusions-clés
- SPEX (Spectral Explainer) et ProxySPEX identifient les interactions influentes dans les LLM à l'échelle, étendant la découverte d'interactions de dizaines à des milliers de composants (BAIR Blog, "Identifying Interactions at Scale for LLMs", 2026).
- Une feature n'est pas un mécanisme. Dans le dilemme du tramway, GPT-4o mini a répondu correctement seulement 8% du temps ; SHAP a désigné le mot « trolley » comme moteur principal, mais SPEX a trouvé une synergie de 4 mots (trolley×2 + pulling + lever), et remplacer ces quatre a fait chuter le taux d'échec presque à zéro.
- ProxySPEX ajoute la propriété de hierarchy à sparsity et low-degreeness, et égale la performance de SPEX avec environ 10 fois moins d'ablations.
- Theorem 3 : une propriété est garantie exactement quand son mécanisme est implémenté et mesurant — faithfulness est la propriété, sparse recovery est le mécanisme, et l'interaction est ce que le mécanisme mesure.
SHAP a trouvé la feature ; SPEX a trouvé le mécanisme
En 2026, le BAIR Blog a publié "Identifying Interactions at Scale for LLMs", décrivant SPEX (ICML 2025) et ProxySPEX (NeurIPS 2025), des algorithmes qui identifient les interactions influentes dans les LLM par ablation et sparse recovery. La démonstration la plus propre est le dilemme du tramway. Une version modifiée où « True » est clairement la bonne réponse n'obtient la bonne réponse de GPT-4o mini que 8% du temps. La feature attribution standard (SHAP) a identifié les instances individuelles du mot « trolley » comme les moteurs principaux de la réponse incorrecte. Remplacer « trolley » par des synonymes comme « tram » ou « streetcar » a eu peu d'impact — la feature était nommée, mais la prédiction n'a pas changé, parce que la feature n'était pas le mécanisme.
SPEX a raconté une histoire plus riche. Il a identifié une synergie d'ordre supérieur dominante entre les deux instances de « trolley » et les mots « pulling » et « lever » — quatre mots dont la présence conjointe poussait à l'échec, et dont la présence individuelle ne poussait à rien. Quand ces quatre mots ont été remplacés par des synonymes, le taux d'échec du modèle a chuté presque à zéro. C'est la distinction que le Honest Architect trace dans un seul exemple : la feature attribution dit quelle feature corrèle avec la sortie ; l'interaction attribution dit quel mécanisme la produit. SHAP a mesuré une feature ; SPEX a mesuré le mécanisme, et le mécanisme était l'interaction.
L'implication pour l'interprétabilité est la même que le Theorem 3 trace pour toute propriété. Une propriété est garantie exactement quand son mécanisme est implémenté et mesurant. « Nous savons ce qui pousse le modèle » est une propriété, et elle se vérifie exactement quand la mesure capture l'interaction, pas la feature. Une feature attribution qui rate l'interaction mesure la mauvaise chose, et mesurer la mauvaise chose est pire que ne rien mesurer, parce que cela fait paraître le modèle expliqué alors qu'il ne l'est pas. Le cas du tramway en est la preuve : SHAP a dit « trolley », l'équipe a remplacé « trolley », et rien n'a changé, parce que le mécanisme était quatre mots agissant ensemble.
Sparsity, low-degreeness, hierarchy : la structure qui rend la récupération traitable
La raison pour laquelle SPEX fonctionne à l'échelle est une observation structurelle, pas un plus gros calculateur. Alors que le nombre total d'interactions dans un modèle croît exponentiellement avec le nombre de features, de points de données et de composants, le nombre d'interactions influentes est en fait petit. SPEX le formalise avec deux propriétés : sparsity (relativement peu d'interactions poussent vraiment la sortie) et low-degreeness (les interactions influentes impliquent typiquement un petit sous-ensemble de features). Celles-ci transforment un problème de recherche intraitable en un problème de sparse recovery résoluble, en empruntant des outils de signal processing et de coding theory — des ablations stratégiquement sélectionnées qui combinent de nombreuses interactions candidates, puis un décodage efficace pour les démêler.
ProxySPEX ajoute une troisième propriété : hierarchy. Quand une interaction d'ordre supérieur est importante, ses sous-ensembles d'ordre inférieur sont probablement importants aussi. Cette structure supplémentaire apporte une amélioration dramatique : ProxySPEX égale la performance de SPEX avec environ 10 fois moins d'ablations. Dans un problème où chaque ablation est un appel d'inférence coûteux ou un réentraînement, 10 fois moins d'ablations est la différence entre une méthode qui tourne en temps de recherche et une qui tourne en temps de production. SPEX étend la découverte d'interactions de dizaines à des milliers de composants, et ProxySPEX rend ces milliers accessibles.
La lecture du Honest Architect est que c'est un mécanisme de mesure conçu autour de la forme de la propriété. Sparsity, low-degreeness et hierarchy sont des affirmations sur la façon dont la propriété « interaction influente » est structurée, et l'algorithme est construit pour mesurer exactement cette structure. Un mécanisme qui ignore la structure — ablation exhaustive, ou attribution marginale qui moyenne les interactions — mesure la mauvaise chose à un coût que l'équipe ne peut pas porter. Le texte le nomme : les approches marginales (LIME, Banzhaf) peuvent opérer sur des milliers de features mais montrent une faithfulness nettement plus basse, parce qu'elles ne capturent pas les interactions complexes qui poussent la sortie. Faithfulness est la propriété ; le mécanisme conscient de la structure est ce qui la soutient.
L'Oracle mesure l'interaction, pas la Sister
[PERSONAL EXPERIENCE] Le HAI Engine tourne en production depuis 2016, et la mesure d'ensemble que nous maintenons a la même forme que la récupération d'interactions de SPEX. L'Oracle normalise les probabilités à exactement un endroit, et la somme-à-un et l'entropie de l'ensemble sont vérifiées à chaque merge. L'entropie est la mesure d'interaction : elle nous dit quand les Sisters divergent assez pour compter, et un merge à basse entropie est une interaction redondante (les Sisters disent la même chose) tandis qu'un merge à haute entropie est synergique (les Sisters contribuent une évidence distincte). C'est la même distinction que le texte trace pour la data attribution — les interactions redondantes renforcent un concept, les synergiques définissent une decision boundary — et c'est pourquoi nous gardons l'entropie, pas un score par-Sister.
Un score par-Sister est la feature attribution de l'ensemble. Il dit quelle Sister a contribué quelle masse de probabilité ; il ne dit pas quelle interaction entre Sisters a produit la prévision calibrée. Le merge de l'Oracle est le mécanisme, et l'entropie est sa mesure, de la même façon que le sparse recovery de SPEX est le mécanisme et faithfulness est sa mesure. Nous taguons la calibration de l'Oracle comme Production ✅ parce que le mécanisme est implémenté et la mesure est à chaque merge, pas parce que nous faisons confiance aux Sisters individuellement. Les Sisters sont des modèles ; le merge est la propriété.
Le résultat de data attribution du texte est la même leçon à la couche des données d'entraînement. ProxySPEX a trouvé sur un ResNet entraîné sur CIFAR-10 des interactions synergiques où des classes sémantiquement distinctes collaborent pour définir une decision boundary (un automobile partage des traits visuels avec un sports car, un truck, un delivery vehicle) et des interactions redondantes où des duplicatas visuels renforcent un concept (une prédiction horse est fortement influencée par un cluster d'images de dog aux silhouettes similaires). Cette analyse fine permet de préserver les synergies nécessaires tout en retirant les redondances en sécurité. L'équivalent dans l'ensemble est : gardez les merges à haute entropie qui portent une évidence distincte ; coupez ceux à basse entropie qui portent des duplicatas. L'entropie est la mesure qui dit lequel est lequel.
La topologie est où vivent les interactions influentes
[UNIQUE INSIGHT] La découverte d'interactions du texte opère sur trois couches — feature, données et composant de modèle — et en rate une quatrième qui compte pour tout système en production : la topologie. The space is the router. Une topologie de network, community et room décide qui voit quoi avant que quoi que ce soit réponde, et cette décision de routage est une interaction — entre la requête, le périmètre du room et l'agent qui se déclenche. L'interaction influente n'est pas toujours à l'intérieur du modèle ; elle est souvent entre le modèle et le room vers lequel la topologie l'a routé. Une méthode d'interprétabilité qui s'arrête à la couche de feature rate l'interaction de routage qui a décidé quelles features le modèle a même vues.
C'est ce que le Honest Architect ajoute à l'agenda du texte. Le texte clôt en nommant la question ouverte d'unifier les trois perspectives — feature, données, composant — en une compréhension holistique d'un système de machine learning. La vue unifiée a besoin d'une quatrième couche : la topologie qui route la requête vers le modèle en premier lieu. Un modèle qui se comporte différemment dans deux rooms n'est pas deux modèles ; c'est un modèle dont l'interaction influente inclut le room, et la topologie est le mécanisme qui produit cette interaction. L'interprétabilité qui ignore la topologie expliquera le modèle et ratera le système.
La limite de périmètre civil-e-defensivo est, dans notre cas, une interaction au niveau topologie. C'est une politique écrite qui décide quelles requêtes routent vers quels agents, et la mesure est le deal que nous déclinons, observable dans le pipeline. La souveraineté du client — ton network, ta brand, tes data — en est une autre : la règle de routage maintient la topologie tienne, et l'export log est la mesure. Les deux sont des interactions entre la requête et la topologie, et les deux sont des propriétés qui se vérifient exactement quand leur mécanisme est implémenté et mesurant — le même test que SPEX applique aux features, appliqué une couche plus haut.
Theorem 3 : faithfulness est la propriété, sparse recovery est le mécanisme
[ORIGINAL DATA] the 21 papers spécifie le Theorem 3 : une propriété est garantie exactement quand son mécanisme est implémenté et mesurant. Lis-le comme le test pour chaque revendication d'interprétabilité. « Nous pouvons expliquer la sortie du modèle » est une propriété, et elle se vérifie exactement quand le mécanisme de mesure capture les interactions influentes — pas les features, pas les contributions marginales, les interactions. Le score de faithfulness de SPEX est la mesure ; le sparse recovery sur sparsity, low-degreeness et hierarchy est le mécanisme ; la propriété se vérifie quand le mécanisme est implémenté et le score de faithfulness est sur un dashboard que quelqu'un regarde.
C'est pourquoi nos tags d'honnêteté ne sont pas des adjectifs. Production ✅ signifie que le mécanisme est implémenté et sa mesure observée. L'entropie de l'Oracle est Production ✅ parce qu'elle est vérifiée à chaque merge. Le routage de la topologie est Production ✅ parce que le network, la community et le room routent avant que quoi que ce soit réponde. Un score d'interprétabilité n'est pas lui-même un tag ; c'est une mesure, et une mesure sans mécanisme est un nombre, pas une propriété. Le texte est honnête là-dessus — il évalue SPEX sur faithfulness, c'est-à-dire si les attributions récupérées prédisent la sortie du modèle sur des ablations de test non vues, et c'est le bon test, parce qu'il mesure si le mécanisme capture réellement la propriété.
Le même théorème est pourquoi nous ne promettrons pas de résultats pour Wallet & Token, Super App, ou Community Credit — ceux-ci sont Roadmap 🔵, le mécanisme n'est pas encore implémenté et mesurant, et une prévision que nous ne pouvons pas mesurer n'est pas une prévision que nous pouvons vendre honnêtement. Seulement un périmètre civil et defensivo, et aucune promesse de résultat token ou community-credit, parce que le review Howey n'a pas couru sur un mécanisme qui n'existe pas encore. Tagger un élément Roadmap avec l'éclat d'un résultat d'interprétabilité est la même erreur que d'appeler une feature attribution un mécanisme — la mauvaise chose mesurée, présentée comme une propriété.
Questions fréquentes
Qu'est-ce que SPEX a trouvé que SHAP avait manqué dans le dilemme du tramway ?
GPT-4o mini a répondu au dilemme modifié correctement seulement 8% du temps. SHAP a identifié les instances individuelles du mot « trolley » comme moteurs, mais remplacer « trolley » par des synonymes n'a rien fait. SPEX a trouvé une synergie de 4 mots (trolley×2 + pulling + lever), et remplacer ces quatre a fait chuter le taux d'échec presque à zéro. SHAP a mesuré la feature ; SPEX a mesuré le mécanisme, et le mécanisme était l'interaction.
Pourquoi SPEX passe à l'échelle là où l'ablation exhaustive ne le peut pas ?
Par trois propriétés structurelles : sparsity (peu d'interactions poussent vraiment la sortie), low-degreeness (les interactions influentes impliquent un petit sous-ensemble de features) et hierarchy (une interaction d'ordre supérieur implique que ses sous-ensembles d'ordre inférieur comptent). Celles-ci transforment une recherche exponentielle en un problème de sparse recovery traitable. ProxySPEX ajoute hierarchy et égale SPEX avec environ 10 fois moins d'ablations.
Comment l'entropie de l'Oracle est-elle de la même forme que la récupération d'interactions de SPEX ?
Les deux mesurent l'interaction, pas l'individu. SPEX récupère les interactions influentes entre features ; l'entropie de l'Oracle mesure à chaque merge l'interaction entre Sisters. Un merge à basse entropie est une interaction redondante (évidence dupliquée) ; un merge à haute entropie est synergique (évidence distincte). Un score par-Sister est la feature attribution de l'ensemble ; l'entropie est la mesure du mécanisme.
Comment le Theorem 3 s'applique-t-il à l'interprétabilité ?
Une propriété est garantie exactement quand son mécanisme est implémenté et mesurant. « Nous pouvons expliquer la sortie » est une propriété qui se vérifie exactement quand la mesure capture les interactions influentes. Faithfulness de SPEX est la mesure ; sparse recovery est le mécanisme. Une feature attribution qui rate l'interaction mesure la mauvaise chose, et mesurer la mauvaise chose est pire que ne rien mesurer.
Comment cela se mappe-t-il aux tags d'honnêteté d'Everythink ?
Production ✅ signifie que le mécanisme est implémenté et mesurant — l'entropie de l'Oracle à chaque merge, le routage de la topologie, l'auto-désactivation du World Monitor. Un score d'interprétabilité est une mesure, pas un tag. Roadmap 🔵 signifie que le mécanisme n'est pas encore implémenté, et aucun résultat d'interprétabilité ne l'élève. Les tags sont la mesure du mécanisme, pas une vibe sur le modèle.
Sources
- BAIR Blog, "Identifying Interactions at Scale for LLMs" (SPEX / ProxySPEX), 2026, récupéré le 2026-08-23, https://bair.berkeley.edu/blog/2026/03/13/spex/
- Tsai et al., "SPEX: Spectral Explainer", ICML 2025, référencé via BAIR Blog, https://openreview.net/forum?id=pRlKbAwczl
- ProxySPEX, NeurIPS 2025, référencé via BAIR Blog, https://openreview.net/forum?id=KI8qan2EA7
Si ton network est prêt pour une mesure qui capture l'interaction, pas la feature, crée ton network — la topologie route la requête, les Sisters produisent les brouillons, et l'Oracle mesure la synergie à chaque merge.

Vous n'embauchez pas un agent. Vous câblez un mécanisme.
Codex vs Claude Code est une question de recrutement. La réponse honnête : vous n'embauchez pas un agent — vous câblez un mécanisme. Le benchmark mesure ; le harness compose ; la topologie route.
→ →
Le routage précède la récupération, pas la dimension d'embedding
L'enquête de KDnuggets sur les défaillances RAG montre que la sur-ingénierie des embeddings aggrave le coût. Le mécanisme absent est le routage explicite avant la récupération — Theorem 3 appliqué à la recherche, avec la topologie d'Everythink comme analogue en amont.
→ →
La compréhension est le mécanisme mesuré, pas le tuteur IA
Les cinq inconvénients de la programmation assistée par IA sont un mécanisme manquant : une étape de mesure qui vérifie la compréhension. Theorem 3, non l'équilibre, est le remède.
→ →Construisez votre monde sur un moteur qui prouve ce qu'il affirme.
Créez votre propre réseau sur le moteur qui tourne depuis 2016 — ou parlez à l'équipe derrière les 21 articles.
