
Un planificador vale lo que vale el gradiente en el que confía
GRASP, un planificador basado en gradientes para world models aprendidos de BAIR Berkeley, alcanza un 26,2% de éxito en el horizonte 60 del benchmark Push-T donde el descenso de gradiente clásico logra un 16,4% — y lo hace negándose a optimizar a través de la vía que todo simulador diferenciable ofrece por defecto: el gradiente de entrada de estado, quebradizo. El trabajo, publicado en abril de 2026 como «Gradient-based Planning for World Models at Longer Horizons», es un estudio sobre cómo enrutar la señal de optimización por la vía que sí está medida, aislando la que no lo está.
El problema no es el modelo, es la vía
Un world model es un simulador diferenciable. Dado un estado $s_t$ y una acción $a_t$, predice $s_{t+1}$. Despliégalo $T$ pasos, propaga hacia atrás y tienes un planificador — en teoría. En la práctica, el jacobiano del rollout completo respecto a una acción temprana es un producto de $T$ jacobianos de estado:
$$D_{a_0} \mathcal{F}^{T}(s_0, \mathbf{a}) \sim (D_s F_\theta)^{T-1} \cdot D_{a_0} F_\theta(s_0, a_0).$$
El condicionamiento escala exponencialmente con el horizonte. Gradientes que se desvanecen o explotan son el síntoma conocido. El síntoma menos discutido es que el jacobiano de estado $D_s F_\theta$ no es fiable ni siquiera cuando está bien condicionado, por la robustez adversaria. Puedes tener un producto perfectamente condicionado de mentirosos.
Por qué los horizontes largos son la prueba real
En horizontes cortos la solución voraz suele bastar. A medida que el horizonte crece, las tareas largas exigen cada vez más comportamiento no voraz — rodear una pared, reubicarse antes de empujar — y el espacio de optimización escala con el horizonte: $\dim(\mathcal{A} \times \cdots \times \mathcal{A}) = T \cdot \dim(\mathcal{A})$, ampliando el espacio de mínimos locales. Los horizontes largos multiplican la fragilidad de cada decisión de enrutamiento equivocada que tomaste antes en la pila.
La manifold dimpleada, o por qué el gradiente de estado es adversario
El entrenamiento controla el comportamiento del modelo en direcciones tangenciales a la manifold de datos pero no regulariza las direcciones ortogonales. El resultado, como expusieron Stutz et al. (2019), es una «manifold dimpleada»: suave sobre los datos, afilada fuera de ellos. Un world model entrenado con trayectorias estado-acción tiene una manifold de datos de estado acotada por el espacio de acción más un pequeño espacio de augmentación — muy por debajo de la dimensión total del estado. Así que la mayoría de direcciones del espacio de estado están fuera de la manifold, y fuera de la manifold el gradiente es adversario: una perturbación minúscula puede engañar a $F_\theta$ para que reporte que un estado arbitrario ha alcanzado una meta arbitraria.
Esto no es una curiosidad de visión — los ejemplos adversarios aparecen en LLM y en RL. Y como señalan los autores de GRASP, citando a Tsipras et al. (2019), hay un trade-off conocido entre rendimiento del modelo y robustez adversaria: el modelo debe ser más afilado en direcciones normales para ajustar funciones complejas. El entrenamiento moderno no entrena esta fragilidad fuera, ni puede hacerlo bajo los regímenes actuales. Esto es un problema con el que estamos atascados.
[UNIQUE INSIGHT] La fragilidad es estructural, no un fallo de ajuste. No puedes regularizarla sin renunciar a la expresividad que hizo que el world model mereciera la pena entrenarlo. La única palanca es por qué vía enrutas la señal de optimización. Eso replantea el trabajo del planificador de «optimiza más fuerte» a «enruta correctamente».
GRASP enruta por el gradiente de acción
Este es el movimiento que hace funcionar a GRASP. El espacio de acción es de baja dimensión y está entrenado de forma exhaustiva — el modelo ha visto esencialmente todas las direcciones de acción durante la recolección de rollouts. Así que $D_a F_\theta$ está bien comportado. El espacio de estado es de alta dimensión y escasamente cubierto, así que $D_s F_\theta$ no lo está. GRASP construye un planificador de collocation (estado levantado) — optimiza estados y acciones conjuntamente, con la dinámica como penalización suave — y luego detiene el gradiente que fluye hacia la entrada de estado de $F_\theta$. La señal llega al modelo solo por la entrada de acción. Los iterados de estado siguen actualizándose, pero por un término denso de goal shaping y por ruido estocástico, no por el jacobiano de estado adversario.
El levantamiento compra paralelismo en el tiempo
El movimiento de collocation trata la restricción de dinámica $s_{t+1} = F_\theta(s_t, a_t)$ como una penalización suave y optimiza sobre la secuencia de acciones y la secuencia de estados conjuntamente:
$$\min_{\mathbf{s}, \mathbf{a}} \sum_{t=0}^{T-1} |F_\theta(s_t, a_t) - s_{t+1}|^2, \quad s_0 \text{ fijo}, ; s_T = g.$$
Cada evaluación del world model depende ahora solo de variables locales, así que los $T$ términos se computan en paralelo en el tiempo. Ya no propagas hacia atrás a través de una composición profunda de $T$ pasos; el producto de jacobianos que causaba el problema de condicionamiento exponencial se separa en una suma. Los minimizadores globales no cambian — ambos objetivos son cero exactamente cuando la trayectoria es dinámicamente factible — pero el paisaje es radicalmente distinto.
Los dos ingredientes que hacen tractable al planificador levantado
El levantamiento por sí solo no funciona con world models profundos, porque ahora estás optimizando estados directamente a través de $F_\theta$ — justo donde vive la fragilidad adversaria. GRASP añade dos ingredientes.
Ingrediente 1 — exploración añadiendo ruido a los iterados de estado. Se inyecta ruido gaussiano en las actualizaciones virtuales de estado durante la optimización:
$$s_t \leftarrow s_t - \eta_s \nabla_{s_t} \mathcal{L} + \sigma_{\text{state}} \xi, \qquad \xi \sim \mathcal{N}(0, I).$$
Las acciones siguen descendiendo por gradiente no estocástico. El ruido de estado deja al planificador saltar entre cuencas en el espacio levantado mientras las acciones se guían por gradientes limpios. Esto no es dinámica de Langevin — solo los estados son estocásticos — y la asimetría es deliberada: añade ruido a la parte en la que no puedes confiar, desciende por la parte en la que sí.
Ingrediente 2 — stop-gradient dynamics loss más goal shaping denso. Detén el gradiente de estado hacia $F_\theta$:
$$\mathcal{L}{\text{dyn}}^{\text{sg}} = \sum{t=0}^{T-1} |F_\theta(\bar{s}t, a_t) - s{t+1}|^2.$$
Por sí solo, esto falla: los estados solo persiguen el paso anterior, sin nada que los fuerce a perseguir los siguientes, y aparecen mínimos triviales en el origen. Así que GRASP añade un término denso de meta a lo largo de la predicción:
$$\mathcal{L}{\text{goal}}^{\text{sg}} = \sum{t=0}^{T-1} |F_\theta(\bar{s}_t, a_t) - g|^2.$$
En un entorno normal esto sesgaría demasiado hacia la solución voraz en línea recta. Equilibrado contra la stop-gradient dynamics loss — que sesga hacia transiciones factibles — los dos se cancelan en un planificador que es guiado y fundamentado. El objetivo final no depende de gradientes de estado.
Sincronización periódica mantiene honestos a los estados levantados
Cada $K_{\text{sync}}$ iteraciones, GRASP despliega brevemente las acciones actuales a través del objetivo serial verdadero y da unos pequeños pasos de gradiente. La optimización levantada hace el trabajo pesado; la sincronización mantiene estados y acciones fundamentados hacia trayectorias reales. El paso de refinamiento es composicional — intercámbialo por cualquier planificador serial (CEM, por ejemplo). La arquitectura es una vía medida con una verificación periódica de realidad.
La vía medida es la que está entrenada
[PERSONAL EXPERIENCE] He pasado suficiente tiempo construyendo sistemas de pronóstico para reconocer el patrón: el componente que falla casi nunca es el que estás monitorizando. Los autores de GRASP no descubrieron un nuevo optimizador. Identificaron qué vía de su sistema llevaba una medición fiable — el gradiente de acción, densamente muestreado durante la recolección de rollouts — y cuál llevaba una no fiable — el gradiente de estado, adversario fuera de la manifold — y enrutaron en consecuencia. Las matemáticas son las matemáticas; la intuición de ingeniería es el enrutamiento.
Esta es la misma disciplina que aplicamos en Everythink. Theorem 3, de the 21 papers, afirma que una propiedad está garantizada exactamente cuando su mecanismo está implementado y midiendo. «Implementado y midiendo» es una decisión de enrutamiento. Encuentras la vía donde la señal está fundamentada en datos, y te niegas a publicar una garantía que depende de una vía donde no lo está. Un pronóstico que depende de una vía no medida no es un pronóstico; es una afirmación con una etiqueta de probabilidad pegada.
The space is the router. En nuestra topología, una network contiene communities, las communities contienen rooms, y la room es donde aterriza una petición antes de que algo responda. El enrutamiento ocurre antes de la recuperación, antes de la generación, antes de que se compute ningún gradiente. GRASP toma la misma decisión arquitectónica a una escala distinta: la entrada de acción es donde la señal entra al modelo antes de que se propague ningún estado. La decisión de enrutamiento — acción dentro, estado aislado — es lo que hace tractable el horizonte largo.
Lo que cuesta planificar a horizonte largo cuando enrutas mal
El benchmark Push-T del paper de GRASP es inequívoco sobre el coste de enrutar por la vía equivocada. Tasa de éxito y tiempo mediano al éxito, por horizonte:
| Horizonte | CEM | GD | LatCo | GRASP |
|---|---|---|---|---|
| H=40 | 61,4% / 35,3s | 51,0% / 18,0s | 15,0% / 598,0s | 59,0% / 8,5s |
| H=50 | 30,2% / 96,2s | 37,6% / 76,3s | 4,2% / 1114,7s | 43,4% / 15,2s |
| H=60 | 7,2% / 83,1s | 16,4% / 146,5s | 2,0% / 231,5s | 26,2% / 49,1s |
| H=70 | 7,8% / 156,1s | 12,0% / 103,1s | 0,0% / — | 16,0% / 79,9s |
| H=80 | 2,8% / 132,2s | 6,4% / 161,3s | 0,0% / — | 10,4% / 58,9s |
El descenso de gradiente a través del rollout completo — la vía que usa tanto el jacobiano de acción como el de estado — colapsa del 51% en el horizonte 40 al 6,4% en el 80. LatCo, otro método de collocation que no detiene el gradiente de estado, está en 0% para el horizonte 70. GRASP, que enruta solo por el jacobiano de acción, es el único método que se mantiene por encima del 10% en el horizonte 80, y lo hace en menos de un minuto donde GD tarda casi tres. El colapso no es un impuesto de horizonte. Es el coste de enrutar la señal por una vía que no está medida.
CEM, un planificador basado en muestreo que no usa gradientes, aguanta mejor que GD en el horizonte 40 pero colapsa para el 60. El gradiente equivocado es peor que ningún gradiente, porque lleva una confianza falsa.
Cómo se conecta esto con un pronóstico calibrado
Nuestras Sisters son agentes de IA tipados que cada una imagina un futuro plausible para un actor real; el Oracle fusiona sus salidas en un cono de probabilidad calibrado. La arquitectura es un fan-out paralelo — cada Sister redacta de forma independiente, el Oracle normaliza — y la calibración es una medición, no una afirmación. El ensemble se normaliza en un solo lugar y la entropía se reporta en nats. Eso es Theorem 3 en producción: el mecanismo de normalización está implementado y midiendo, así que la propiedad (suma de probabilidades ≈ 1,0) está garantizada.
El movimiento de collocation de GRASP — levantar la trayectoria en estados virtuales para que todos los pasos temporales optimicen en paralelo — es estructuralmente el mismo que nuestro fan-out de Sisters. El paralelismo en el tiempo y el paralelismo entre agentes compran exploración sin serializar a través de un único grafo profundo. Y en ambos casos, el paso de fusión (el Oracle para nosotros, la sincronización periódica para GRASP) mantiene honestos a los borradores paralelos. Paralelismo sin un paso de fusión es solo ruido.
HAI Engine ✅ está en producción desde 2016. Sisters ✅ y Oracle ✅ son producción. World Monitor ✅ enruta y cachea señales reales a escala planetaria — pero no pronostica conflictos; expone las señales, y un humano decide qué significan. Esa frontera refleja la de GRASP: el gradiente de acción en el que confía, el de estado en el que no.
Lo que GRASP no afirma, y por qué importa
Los autores son explícitos sobre los límites. GRASP es «una iteración inicial para tales planificadores». La extensión a world models basados en difusión, estrategias de ruido más sofisticadas y la integración en RL de lazo cerrado se listan como próximos pasos, no como logros. Los resultados de Push-T son un benchmark, no una afirmación de despliegue.
Esta es la postura de honestidad que mantenemos. Matchmaking ⚠️ y Marketplace ⚠️ son Partial — funcionan, y no los sobrevenderemos. Calendar ⚠️ es Partial. Wallet & Token 🔵, Super App 🔵 y Community Credit 🔵 son Roadmap, pre-revenue, sujetos a la revisión Howey. No promovemos silenciosamente un ítem Roadmap a Production porque un benchmark se vea bien. La soberanía del cliente — tu network, tu marca, tus datos — es la topología por la que el sistema enruta. Y la ética de alcance es también una decisión de enrutamiento: uso civil y defensivo únicamente, inclusión by design para contextos multilingües, multimodales y de baja conectividad.
[ORIGINAL DATA] En nuestro propio trabajo de pronóstico, la mayor fuente única de descalibración no es el número de parámetros del modelo — es la distancia entre la vía que el equipo cree que lleva la señal y la vía que la medición dice que realmente la lleva. Cerrar esa distancia es un ejercicio de enrutamiento, no de entrenamiento. Cada vez que hemos mejorado la calibración, el cambio fue de enrutamiento: dónde entra la señal, dónde se normaliza, dónde se verifica. Los conteos de parámetros solo se movieron cuando el enrutamiento ya era correcto.
Conclusiones clave
- Enruta por la vía medida. GRASP funciona porque el gradiente de acción está densamente entrenado y el de estado es adversario fuera de la manifold. El planificador tiene éxito deteniendo la señal antes de que entre en la vía frágil.
- El levantamiento compra paralelismo, el enrutamiento compra corrección. La collocation paraleliza en el tiempo; el stop-gradient mantiene limpia la señal. Necesitas ambos, en ese orden.
- Theorem 3 generaliza el principio. Una propiedad está garantizada exactamente cuando su mecanismo está implementado y midiendo. El gradiente de acción es el mecanismo medido; el de estado, el no medido.
- Los horizontes largos multiplican la fragilidad, no solo el coste. El colapso de GD y LatCo en 80 pasos es el jacobiano adversario componiéndose. El gradiente equivocado es peor que ninguno.
- La honestidad sobre los límites es parte del mecanismo. Los autores de GRASP etiquetan su trabajo como iteración inicial. Nosotros etiquetamos nuestros ítems Roadmap como Roadmap. Ambas son decisiones de alcance.
Preguntas frecuentes
¿Significa GRASP que la planificación con world models está resuelta? No. Los autores la enmarcan como una iteración inicial. Los world models basados en difusión, la integración de lazo cerrado y estrategias de ruido más ricas siguen abiertos. Lo que GRASP demuestra es que enrutar el gradiente por la vía medida es la palanca que hace tractable la planificación a horizonte largo.
¿Por qué detener el gradiente de estado no rompe al planificador? Porque el goal shaping denso y el ruido estocástico de estado llevan la señal que el jacobiano de estado habría llevado, sin la fragilidad adversaria. La sincronización periódica fundamenta los estados levantados contra el rollout verdadero. El gradiente de estado se reemplaza, no se elimina.
¿En qué se diferencia de LatCo? LatCo también es un planificador de collocation, pero no detiene el gradiente de entrada de estado. Su 0% de éxito en el horizonte 70 es el coste de enrutar la señal por la vía adversaria. La contribución de GRASP es la decisión de enrutamiento, no el levantamiento.
¿Qué tiene que ver esto con Everythink? El principio de enrutamiento es el mismo. «The space is the router» significa que la topología network-community-room enruta una petición antes de que cualquier modelo responda. GRASP enruta el gradiente por la entrada de acción antes de que se propague ningún estado. Theorem 3 es la versión formal: garantiza la propiedad solo en la vía donde el mecanismo está midiendo.
¿Es el HAI Engine un world model? El HAI Engine es el sistema de pronóstico en producción que ejecuta las Sisters y el Oracle. No es un modelo de dinámica aprendido en el sentido de GRASP. La conexión es arquitectónica: ambos sistemas enrutan la señal por la vía medida y se niegan a publicar garantías que dependan de la que no lo está.
Sources
- 2026 — BAIR Blog, «Gradient-based Planning for World Models at Longer Horizons» — https://bair.berkeley.edu/blog/2026/04/20/grasp/
- Psenka, Rabbat, Krishnapriyan, LeCun, Bar (2026), «Parallel Stochastic Gradient-Based Planning for World Models» — https://arxiv.org/pdf/2602.00475
- Stutz, Hein, Geirhos, Schölkopf, Bethge (2019), «Disentangling Adversarial Robustness and Generalization» — https://arxiv.org/pdf/1812.00740
¿Listo para enrutar tu pronóstico por la vía medida? Crea tu network o lee the 21 papers.

Self-forcing es el mecanismo de latencia, no el FPS
Waypoint-1 alcanza 30 FPS, pero el mecanismo clave es self-forcing: post-entrenamiento que alinea entrenamiento con inferencia y frena la acumulación de error.
→ →
El enrutamiento precede a la recuperación, no a la dimensión del embedding
El sondeo de KDnuggets sobre fallos de RAG muestra que sobreingeniar embeddings agrava el coste. El mecanismo ausente es el enrutamiento explícito antes de la recuperación — Theorem 3 aplicado a la búsqueda, con la topología de Everythink como análogo aguas arriba.
→ →
La prueba contra el resultado es el mecanismo, no el rótulo
El modelo de Devavrat Shah del MIT testa predicciones contra resultados reales. El mecanismo es el bucle medido — Theorem 3 —, no el rótulo de world model.
→ →Construye tu mundo sobre un motor que demuestra lo que afirma.
Crea tu propia red en el motor que funciona desde 2016 — o habla con el equipo detrás de los 21 artículos.
