
La interpretabilidad necesita la interacción, no la feature
SPEX y ProxySPEX de BAIR Berkeley identifican interacciones influyentes en large language models a escala, donde la feature attribution ve solo features individuales. La lectura del Honest Architect es un nivel más profunda: una feature no es un mecanismo. La interacción lo es. En el trolley problem, SHAP culpó a la palabra "trolley" y cambiarla por sinónimos no hizo nada; SPEX encontró la sinergia de 4 palabras (trolley×2 + pulling + lever), y cambiar esas cuatro bajó la tasa de fallo a casi cero. El mecanismo era la interacción, y la feature era una pista falsa.
Conclusiones clave
- SPEX (Spectral Explainer) y ProxySPEX identifican interacciones influyentes en LLMs a escala, extendiendo el descubrimiento de interacciones de docenas a miles de componentes (BAIR Blog, "Identifying Interactions at Scale for LLMs", 2026).
- Una feature no es un mecanismo. En el trolley problem, GPT-4o mini respondió correctamente solo el 8% de las veces; SHAP culpó a la palabra "trolley", pero SPEX encontró la sinergia de 4 palabras (trolley×2 + pulling + lever), y reemplazar esas cuatro bajó el fallo a casi cero.
- ProxySPEX iguala a SPEX con ~10x menos ablations al añadir la propiedad de hierarchy a sparsity y low-degreeness.
- Theorem 3: una propiedad se garantiza exactamente cuando su mecanismo está implementado y medido — faithfulness es la propiedad, sparse recovery es el mecanismo, y la interacción es lo que el mecanismo mide.
SHAP encontró la feature; SPEX encontró el mecanismo
En 2026, el BAIR Blog publicó "Identifying Interactions at Scale for LLMs," describiendo SPEX (ICML 2025) y ProxySPEX (NeurIPS 2025), algoritmos que identifican interacciones influyentes en LLMs usando ablation y sparse recovery. La demostración más limpia es el trolley problem. Una versión modificada donde "True" es la respuesta claramente correcta aún obtiene la respuesta correcta de GPT-4o mini solo el 8% de las veces. La feature attribution estándar (SHAP) identificó instancias individuales de la palabra "trolley" como los drivers primarios de la respuesta incorrecta. Reemplazar "trolley" con sinónimos como "tram" o "streetcar" tuvo poco impacto — la feature fue nombrada, pero la predicción no cambió, porque la feature no era el mecanismo.
SPEX contó una historia más rica. Identificó una sinergia de alto orden dominante entre las dos instancias de "trolley" y las palabras "pulling" y "lever" — cuatro palabras cuya presencia conjunta impulsaba el fallo, y cuya presencia individual no. Cuando esas cuatro palabras se reemplazaron con sinónimos, la tasa de fallo del modelo bajó a casi cero. Esa es la distinción del Honest Architect en un ejemplo: una feature attribution te dice qué feature correlaciona con el output; una interaction attribution te dice qué mecanismo lo produce. SHAP midió una feature; SPEX midió el mecanismo, y el mecanismo era la interacción.
La implicación para la interpretabilidad es la misma que el Theorem 3 traza para cualquier propiedad. Una propiedad se garantiza exactamente cuando su mecanismo está implementado y medido. "Sabemos qué impulsa al modelo" es una propiedad, y se cumple exactamente cuando la medición captura la interacción, no la feature. Una feature attribution que pierde la interacción es una medición de la cosa equivocada, y una medición de la cosa equivocada es peor que ninguna medición, porque hace que el modelo parezca explicado cuando no lo está. El caso del trolley es la prueba: SHAP dijo "trolley", el equipo cambió "trolley", y nada cambió, porque el mecanismo eran cuatro palabras actuando juntas.
Sparsity, low-degreeness, hierarchy: la estructura que hace tractable la recuperación
La razón de que SPEX funcione a escala es una observación estructural, no una computadora más grande. Mientras el número total de interacciones en un modelo crece exponencialmente con el número de features, data points y componentes, el número de interacciones influyentes es en realidad pequeño. SPEX formaliza esto con dos propiedades: sparsity (relativamente pocas interacciones realmente impulsan el output) y low-degreeness (las interacciones influyentes típicamente involucran solo un subconjunto pequeño de features). Estas vuelven una búsqueda intratable en un problema resoluble de sparse recovery, tomando herramientas de signal processing y coding theory — ablations estratégicamente seleccionadas que combinan muchas interacciones candidatas, luego decoding eficiente para desentrañarlas.
ProxySPEX añade una tercera propiedad: hierarchy. Donde una interacción de alto orden es importante, sus subconjuntos de bajo orden probablemente también lo sean. Esa estructura adicional da una mejora dramática: ProxySPEX iguala el rendimiento de SPEX con alrededor de 10x menos ablations. En un problema donde cada ablation es una llamada de inferencia costosa o un retraining, 10x menos ablations es la diferencia entre un método que corre en tiempo de investigación y uno que corre en tiempo de producción. SPEX extiende el descubrimiento de interacciones de docenas a miles de componentes, y ProxySPEX hace los miles asequibles.
La lectura del Honest Architect es que este es un mecanismo de medición diseñado alrededor de la forma de la propiedad. Sparsity, low-degreeness y hierarchy son reclamos sobre cómo está estructurada la propiedad de interacción influyente, y el algoritmo está construido para medir exactamente esa estructura. Un mecanismo que ignora la estructura — ablation exhaustiva, o marginal attribution que promedia las interacciones — mide la cosa equivocada a un costo que el equipo no puede cargar. El texto lo nombra: los enfoques marginales (LIME, Banzhaf) pueden operar a miles de features pero exhiben faithfulness significativamente menor, porque no capturan las interacciones complejas que impulsan el output. Faithfulness es la propiedad; el mecanismo consciente de la estructura es lo que la sostiene.
El Oracle mide la interacción, no la Sister
[PERSONAL EXPERIENCE] El HAI Engine corre en producción desde 2016, y la medición de ensemble que conservamos tiene la misma forma que la recuperación de interacciones de SPEX. El Oracle normaliza probabilidades en exactamente un lugar, y la suma-a-uno y la entropía del ensemble se verifican en cada merge. La entropía es la medición de interacción: nos dice cuándo las Sisters discrepan lo suficiente para importar, y un merge de baja entropía es una interacción redundante (las Sisters están diciendo lo mismo) mientras uno de alta entropía es sinérgico (las Sisters contribuyen evidencia distinta). Esa es la misma distinción que el texto traza para data attribution — las interacciones redundantes refuerzan un concepto, las sinérgicas definen un decision boundary — y es por lo que conservamos la entropía, no un score per-Sister.
Una medición per-Sister es la feature attribution del ensemble. Te dice qué Sister contribuyó qué masa de probabilidad; no te dice qué interacción entre Sisters produjo el forecast calibrado. El merge del Oracle es el mecanismo, y la entropía es su medición, de la misma forma en que el sparse recovery de SPEX es el mecanismo y faithfulness es su medición. Tagueamos la calibración del Oracle como Production ✅ porque el mecanismo está implementado y la medición está en cada merge, no porque confiemos en las Sisters individualmente. Las Sisters son modelos; el merge es la propiedad.
El resultado de data attribution del texto es la misma lección en la capa de training data. ProxySPEX en un ResNet entrenado en CIFAR-10 encontró interacciones sinérgicas donde clases semánticamente distintas trabajan juntas para definir un decision boundary (un automobile compartiendo rasgos visuales con un sports car, un truck, un delivery vehicle) e interacciones redundantes donde duplicados visuales refuerzan un concepto (una predicción de horse influenciada por un cluster de imágenes de dog con siluetas similares). El análisis fino te permite preservar sinergias necesarias mientras remueves redundancias de forma segura. El equivalente en ensemble es: conserva los merges de alta entropía que cargan evidencia distinta; poda los de baja entropía que cargan duplicados. La entropía es la medición que te dice cuál es cuál.
La topología es donde viven las interacciones influyentes
[UNIQUE INSIGHT] El descubrimiento de interacciones del texto opera en tres capas — feature, data y model component — y pierde una cuarta que importa para cualquier sistema desplegado: la topología. The space is the router. Una topología de network, community y room decide quién ve qué antes de que cualquier cosa responda, y esa decisión de ruteo es una interacción — entre la petición, el scope del room y el agente que se dispara. La interacción influyente no siempre está dentro del modelo; está a menudo entre el modelo y el room al que la topología lo ruteó. Un método de interpretabilidad que se detiene en la capa de feature pierde la interacción de ruteo que decidió qué features el modelo vio siquiera.
Esta es la adición del Honest Architect a la agenda del texto. El texto cierra nombrando la pregunta abierta de unificar las tres perspectivas — feature, data, component — en un entendimiento holístico de un sistema de machine learning. La vista unificada necesita una cuarta capa: la topología que rutea la petición al modelo en primer lugar. Un modelo que se comporta distinto en dos rooms no son dos modelos; es un modelo cuya interacción influyente incluye el room, y la topología es el mecanismo que produce esa interacción. La interpretabilidad que ignora la topología explicará el modelo y perderá el sistema.
El límite de alcance civil-y-defensivo es una interacción a nivel de topología en nuestro caso. Es una política escrita que decide qué peticiones rutean a qué agentes, y la medición es el deal que declinamos, observable en el pipeline. La soberanía del cliente — tu network, tu brand, tu data — es otra: la regla de ruteo que mantiene la topología tuya, con el export log como medición. Ambas son interacciones entre la petición y la topología, y ambas son propiedades que se cumplen exactamente cuando su mecanismo está implementado y medido — la misma prueba que SPEX aplica a las features, aplicada una capa arriba.
Theorem 3: faithfulness es la propiedad, sparse recovery es el mecanismo
[ORIGINAL DATA] the 21 papers especifica el Theorem 3: una propiedad se garantiza exactamente cuando su mecanismo está implementado y medido. Léelo como la prueba para cada reclamo de interpretabilidad. "Podemos explicar el output del modelo" es una propiedad, y se cumple exactamente cuando el mecanismo de medición captura las interacciones influyentes — no las features, no las contribuciones marginales, las interacciones. El score de faithfulness de SPEX es la medición; el sparse recovery sobre sparsity, low-degreeness y hierarchy es el mecanismo; la propiedad se cumple cuando el mecanismo está implementado y el score de faithfulness está en un dashboard que alguien mira.
Por esto nuestras etiquetas de honestidad no son adjetivos. Production ✅ significa que el mecanismo está implementado y su medición es observada. La entropía del Oracle es Production ✅ porque se verifica en cada merge. El ruteo de la topología es Production ✅ porque la network, community y room rutean antes de que cualquier cosa responda. Un score de interpretabilidad no es una etiqueta por sí mismo; es una medición, y una medición sin un mecanismo es un número, no una propiedad. El texto es honesto sobre esto — evalúa SPEX por faithfulness, que es si las attributions recuperadas predicen el output del modelo en test ablations no vistas, y esa es la prueba correcta, porque mide si el mecanismo realmente captura la propiedad.
El mismo teorema es por qué no prometeremos resultados de Wallet & Token, Super App, o Community Credit — esos son Roadmap 🔵, el mecanismo no está todavía implementado y medido, y un forecast que no podemos medir no es un forecast que podamos vender honestamente. Solo alcance civil y defensivo, y sin promesas de resultados de token o community-credit, porque el review Howey no ha corrido sobre un mecanismo que aún no existe. Taguear un ítem Roadmap con el brillo de un resultado de interpretabilidad sería el mismo error que llamar a una feature attribution un mecanismo — una medición de la cosa equivocada, presentada como una propiedad.
Preguntas frecuentes
¿Qué encontró SPEX que SHAP perdió en el trolley problem?
GPT-4o mini respondió el trolley problem modificado correctamente solo el 8% de las veces. SHAP identificó instancias individuales de la palabra "trolley" como los drivers, pero cambiar "trolley" por sinónimos no hizo nada. SPEX encontró una sinergia de 4 palabras (trolley×2 + pulling + lever), y reemplazar esas cuatro con sinónimos bajó la tasa de fallo a casi cero. SHAP midió la feature; SPEX midió el mecanismo, y el mecanismo era la interacción.
¿Por qué SPEX escala cuando la ablation exhaustiva no?
Por tres propiedades estructurales: sparsity (pocas interacciones realmente impulsan el output), low-degreeness (las interacciones influyentes involucran un subconjunto pequeño de features), y hierarchy (las interacciones de alto orden implican que sus subconjuntos de bajo orden importan). Estas vuelven una búsqueda exponencial en un problema resoluble de sparse recovery. ProxySPEX añade hierarchy e iguala a SPEX con ~10x menos ablations.
¿Cómo es la entropía del Oracle la misma forma que la recuperación de interacciones de SPEX?
Ambas miden la interacción, no el individuo. SPEX recupera interacciones influyentes entre features; la entropía del Oracle mide la interacción entre Sisters en cada merge. Un merge de baja entropía es una interacción redundante (evidencia duplicada); uno de alta entropía es sinérgico (evidencia distinta). El score per-Sister es la feature attribution del ensemble; la entropía es la medición del mecanismo.
¿Cómo se aplica el Theorem 3 a la interpretabilidad?
Una propiedad se garantiza exactamente cuando su mecanismo está implementado y medido. "Podemos explicar el output" es una propiedad que se cumple exactamente cuando la medición captura las interacciones influyentes. Faithfulness de SPEX es la medición; sparse recovery es el mecanismo. Una feature attribution que pierde la interacción es una medición de la cosa equivocada, y una medición de la cosa equivocada es peor que ninguna medición.
¿Cómo se mapea esto a las etiquetas de honestidad de Everythink?
Production ✅ significa que el mecanismo está implementado y medido — la entropía del Oracle en cada merge, el ruteo de la topología, la auto-deshabilitación del World Monitor. Un score de interpretabilidad es una medición, no una etiqueta. Roadmap 🔵 significa que el mecanismo aún no está implementado, y ningún resultado de interpretabilidad lo sube. Las etiquetas son la medición del mecanismo, no una vibra sobre el modelo.
Fuentes
- BAIR Blog, "Identifying Interactions at Scale for LLMs" (SPEX / ProxySPEX), 2026, retrieved 2026-08-23, https://bair.berkeley.edu/blog/2026/03/13/spex/
- Tsai et al., "SPEX: Spectral Explainer", ICML 2025, referenced via BAIR Blog, https://openreview.net/forum?id=pRlKbAwczl
- ProxySPEX, NeurIPS 2025, referenced via BAIR Blog, https://openreview.net/forum?id=KI8qan2EA7
Si tu network está lista para una medición que capture la interacción, no la feature, crea tu network — la topología rutea la petición, las Sisters producen los drafts, y el Oracle mide la sinergia en cada merge.

No contratas un agente. Cableas un mecanismo.
Codex vs Claude Code es una pregunta de contratación. La respuesta honesta: no contratas un agente — cableas un mecanismo. El benchmark mide; el harness compone; la topología rutea.
→ →
El enrutamiento precede a la recuperación, no a la dimensión del embedding
El sondeo de KDnuggets sobre fallos de RAG muestra que sobreingeniar embeddings agrava el coste. El mecanismo ausente es el enrutamiento explícito antes de la recuperación — Theorem 3 aplicado a la búsqueda, con la topología de Everythink como análogo aguas arriba.
→ →
La comprensión es el mecanismo medido, no el tutor de IA
Las cinco desventajas de programar con IA son un mecanismo ausente: una medición que verifica la comprensión. El Teorema 3, no el equilibrio, es la cura.
→ →Construye tu mundo sobre un motor que demuestra lo que afirma.
Crea tu propia red en el motor que funciona desde 2016 — o habla con el equipo detrás de los 21 artículos.
