Produtos
Soluções
Empresa
Empresas
EntrarCrie sua rede
AI · World Models · Planning · Forecasting · Mechanism

O planeamento por gradiente encaminha pela via medida

O GRASP funciona encaminhando o sinal de otimização pelo gradiente de ação densamente treinado e isolando o gradiente de estado adversário. A mesma disciplina sustenta Theorem 3 e the space is the router.

Um planejador vale o que vale o gradiente em que confia

O GRASP, um planejador baseado em gradiente para world models aprendidos da BAIR Berkeley, atinge 26,2% de sucesso no horizonte 60 do benchmark Push-T onde o descenso de gradiente clássico consegue 16,4% — e fá-lo recusando-se a otimizar através da via que todo simulador diferenciável oferece por defeito: o gradiente de entrada de estado, frágil. O trabalho, publicado em abril de 2026 como «Gradient-based Planning for World Models at Longer Horizons», é um estudo sobre como encaminhar o sinal de otimização pela via que está realmente medida, isolando a que não está.

O problema não é o modelo, é a via

Um world model é um simulador diferenciável. Dado um estado $s_t$ e uma ação $a_t$, prevê $s_{t+1}$. Desenrola-o $T$ passos, propaga para trás e tens um planejador — em teoria. Na prática, o jacobiano do rollout completo relativamente a uma ação inicial é um produto de $T$ jacobianos de estado:

$$D_{a_0} \mathcal{F}^{T}(s_0, \mathbf{a}) \sim (D_s F_\theta)^{T-1} \cdot D_{a_0} F_\theta(s_0, a_0).$$

O condicionamento escala exponencialmente com o horizonte. Gradientes que se desvanecem ou explodem são o sintoma conhecido. O sintoma menos discutido é que o jacobiano de estado $D_s F_\theta$ não é fiável mesmo quando está bem condicionado, por causa da robustez adversária. Podes ter um produto perfeitamente condicionado de mentirosos.

Porque os horizontes longos são o verdadeiro teste de stress

Em horizontes curtos a solução gananciosa costuma bastar. À medida que o horizonte cresce, as tarefas longas exigem cada vez mais comportamento não ganancioso — contornar uma parede, reposicionar-se antes de empurrar — e o espaço de otimização escala com o horizonte: $\dim(\mathcal{A} \times \cdots \times \mathcal{A}) = T \cdot \dim(\mathcal{A})$, ampliando o espaço de mínimos locais. Horizontes longos multiplicam a fragilidade de cada decisão de encaminhamento errada que tomaste antes na pilha.

A manifold dimpled, ou porque o gradiente de estado é adversário

O treino controla o comportamento do modelo em direções tangenciais à manifold de dados mas não regulariza as direções ortogonais. O resultado, como expuseram Stutz et al. (2019), é uma «manifold dimpled»: suave sobre os dados, afiada fora deles. Um world model treinado com trajetórias estado-ação tem uma manifold de dados de estado limitada pelo espaço de ação mais um pequeno espaço de augmentação — muito abaixo da dimensão total do estado. Logo, a maioria das direções do espaço de estado está fora da manifold, e fora da manifold o gradiente é adversário: uma perturbação minúscula pode enganar $F_\theta$ fazendo-o reportar que um estado arbitrário atingiu um objetivo arbitrário.

Isto não é uma curiosidade de visão — exemplos adversários aparecem em LLMs e em RL. E como notam os autores do GRASP, citando Tsipras et al. (2019), há uma trade-off conhecida entre desempenho do modelo e robustez adversária: o modelo tem de ser mais afiado em direções normais para ajustar funções complexas. O treino moderno não treina esta fragilidade fora, nem pode sob os regimes atuais. Isto é um problema com o qual estamos presos.

[UNIQUE INSIGHT] A fragilidade é estrutural, não uma falha de afinação. Não a podes regularizar sem renunciar à expressividade que tornou o world model worth treinar. A única alavanca é por que via encaminhas o sinal de otimização. Isso redefine o trabalho do planejador de «otimiza mais forte» para «encaminha corretamente».

O GRASP encaminha pelo gradiente de ação

Eis o movimento que faz o GRASP funcionar. O espaço de ação é de baixa dimensão e exaustivamente treinado — o modelo viu essencialmente todas as direções de ação durante a recoleção de rollouts. Logo, $D_a F_\theta$ está bem comportado. O espaço de estado é de alta dimensão e escassamente coberto, logo $D_s F_\theta$ não está. O GRASP constrói um planejador de collocation (estado levantado) — otimiza estados e ações conjuntamente, com a dinâmica como penalização suave — e depois para o gradiente que flui para a entrada de estado de $F_\theta$. O sinal chega ao modelo apenas pela entrada de ação. Os iterados de estado continuam a atualizar-se, mas por um termo denso de goal shaping e por ruído estocástico, não pelo jacobiano de estado adversário.

O levantamento compra paralelismo no tempo

O movimento de collocation trata a restrição de dinâmica $s_{t+1} = F_\theta(s_t, a_t)$ como uma penalização suave e otimiza sobre a sequência de ações e a sequência de estados conjuntamente:

$$\min_{\mathbf{s}, \mathbf{a}} \sum_{t=0}^{T-1} |F_\theta(s_t, a_t) - s_{t+1}|^2, \quad s_0 \text{ fixo}, ; s_T = g.$$

Cada avaliação do world model depende agora apenas de variáveis locais, pelo que os $T$ termos se computam em paralelo no tempo. Já não propagas para trás através de uma composição profunda de $T$ passos; o produto de jacobianos que causava o problema de condicionamento exponencial separa-se numa soma. Os minimizadores globais não mudam — ambos os objetivos são zero exatamente quando a trajetória é dinamicamente viável — mas a paisagem é radicalmente diferente.

Os dois ingredientes que tornam o planejador levantado tratável

O levantamento por si só não funciona com world models profundos, porque agora estás a otimizar estados diretamente através de $F_\theta$ — exatamente onde vive a fragilidade adversária. O GRASP adiciona dois ingredientes.

Ingrediente 1 — exploração adicionando ruído aos iterados de estado. Injeta-se ruído gaussiano nas atualizações virtuais de estado durante a otimização:

$$s_t \leftarrow s_t - \eta_s \nabla_{s_t} \mathcal{L} + \sigma_{\text{state}} \xi, \qquad \xi \sim \mathcal{N}(0, I).$$

As ações continuam a descer por gradiente não estocástico. O ruído de estado deixa o planejador saltar entre bacias no espaço levantado enquanto as ações se guiam por gradientes limpos. Isto não é dinâmica de Langevin — apenas os estados são estocásticos — e a assimetria é deliberada: adiciona ruído à parte em que não podes confiar, desce pela parte em que podes.

Ingrediente 2 — stop-gradient dynamics loss mais goal shaping denso. Pára o gradiente de estado para $F_\theta$:

$$\mathcal{L}{\text{dyn}}^{\text{sg}} = \sum{t=0}^{T-1} |F_\theta(\bar{s}t, a_t) - s{t+1}|^2.$$

Sozinho, isto falha: os estados só perseguem o passo anterior, sem nada que os force a perseguir os seguintes, e aparecem mínimos triviais na origem. Por isso o GRASP adiciona um termo denso de objetivo ao longo da predição:

$$\mathcal{L}{\text{goal}}^{\text{sg}} = \sum{t=0}^{T-1} |F_\theta(\bar{s}_t, a_t) - g|^2.$$

Num contexto normal isto enviesaria demasiado para a solução gananciosa em linha reta. Equilibrado contra a stop-gradient dynamics loss — que enviesa para transições viáveis — os dois cancelam-se num planejador que é guiado e fundamentado. O objetivo final não tem dependência de gradientes de estado.

Sincronização periódica mantém os estados levantados honestos

A cada $K_{\text{sync}}$ iterações, o GRASP desenrola brevemente as ações atuais através do objetivo serial verdadeiro e dá alguns passos pequenos de gradiente. A otimização levantada faz o trabalho pesado; a sincronização mantém estados e ações fundamentados relativamente a trajetórias reais. O passo de refinamento é composicional — troca-o por qualquer planejador serial (CEM, por exemplo). A arquitetura é uma via medida com uma verificação periódica de realidade.

A via medida é a que está treinada

[PERSONAL EXPERIENCE] Passei tempo suficiente a construir sistemas de previsão para reconhecer o padrão: o componente que falha quase nunca é aquele que estás a monitorizar. Os autores do GRASP não descobriram um novo otimizador. Identificaram que via do seu sistema transportava uma medição fiável — o gradiente de ação, densamente amostrado durante a recoleção de rollouts — e que via transportava uma não fiável — o gradiente de estado, adversário fora da manifold — e encaminharam em conformidade. A matemática é a matemática; a intuição de engenharia é o encaminhamento.

Esta é a mesma disciplina que aplicamos na Everythink. Theorem 3, de the 21 papers, afirma que uma propriedade está garantida exatamente quando o seu mecanismo está implementado e a medir. «Implementado e a medir» é uma decisão de encaminhamento. Encontras a via onde o sinal está fundamentado em dados, e recusas publicar uma garantia que depende de uma via onde não está. Uma previsão que depende de uma via não medida não é uma previsão; é uma afirmação com uma etiqueta de probabilidade colada.

The space is the router. Na nossa topologia, uma network contém communities, as communities contêm rooms, e a room é onde aterra um pedido antes de algo responder. O encaminhamento acontece antes da recuperação, antes da geração, antes de qualquer gradiente ser computado. O GRASP toma a mesma decisão arquitetural a uma escala diferente: a entrada de ação é onde o sinal entra no modelo antes de qualquer propagação de estado. A decisão de encaminhamento — ação dentro, estado isolado — é o que torna o horizonte longo tratável.

O que custa planificar a horizonte longo quando encaminhas mal

O benchmark Push-T do paper do GRASP é inequívoco sobre o custo de encaminhar pela via errada. Taxa de sucesso e tempo mediano até ao sucesso, por horizonte:

Horizonte CEM GD LatCo GRASP
H=40 61,4% / 35,3s 51,0% / 18,0s 15,0% / 598,0s 59,0% / 8,5s
H=50 30,2% / 96,2s 37,6% / 76,3s 4,2% / 1114,7s 43,4% / 15,2s
H=60 7,2% / 83,1s 16,4% / 146,5s 2,0% / 231,5s 26,2% / 49,1s
H=70 7,8% / 156,1s 12,0% / 103,1s 0,0% / — 16,0% / 79,9s
H=80 2,8% / 132,2s 6,4% / 161,3s 0,0% / — 10,4% / 58,9s

O descenso de gradiente através do rollout completo — a via que usa tanto o jacobiano de ação como o de estado — colapsa de 51% no horizonte 40 para 6,4% no 80. LatCo, outro método de collocation que não para o gradiente de estado, está a 0% no horizonte 70. O GRASP, que encaminha apenas pelo jacobiano de ação, é o único método que se mantém acima de 10% no horizonte 80, e fá-lo em menos de um minuto onde o GD leva quase três. O colapso não é um imposto de horizonte. É o custo de encaminhar o sinal por uma via que não está medida.

O CEM, um planejador baseado em amostragem que não usa gradientes, aguenta melhor que o GD no horizonte 40 mas colapsa no 60. O gradiente errado é pior que nenhum gradiente, porque transporta uma confiança falsa.

Como isto se liga a uma previsão calibrada

As nossas Sisters são agentes de IA tipados que cada um imagina um futuro plausível para um ator real; o Oracle funde as suas saídas num cone de probabilidade calibrado. A arquitetura é um fan-out paralelo — cada Sister redige de forma independente, o Oracle normaliza — e a calibração é uma medição, não uma afirmação. O ensemble é normalizado num único lugar e a entropia é reportada em nats. Isso é Theorem 3 em produção: o mecanismo de normalização está implementado e a medir, pelo que a propriedade (soma das probabilidades ≈ 1,0) está garantida.

O movimento de collocation do GRASP — levantar a trajetória em estados virtuais para que todos os passos temporais otimizem em paralelo — é estruturalmente o mesmo que o nosso fan-out de Sisters. O paralelismo no tempo e o paralelismo entre agentes compram exploração sem serializar através de um único grafo profundo. E em ambos os casos, o passo de fusão (o Oracle para nós, a sincronização periódica para o GRASP) mantém os rascunhos paralelos honestos. Paralelismo sem um passo de fusão é apenas ruído.

HAI Engine ✅ está em produção desde 2016. Sisters ✅ e Oracle ✅ são produção. World Monitor ✅ encaminha e faz cache de sinais reais à escala planetária — mas não prevê conflitos; expõe os sinais, e um humano decide o que significam. Essa fronteira espelha a do GRASP: o gradiente de ação em que confia, o de estado em que não confia.

O que o GRASP não afirma, e porque importa

Os autores são explícitos sobre os limites. O GRASP é «uma iteração inicial para tais planejadores». A extensão a world models baseados em difusão, estratégias de ruído mais sofisticadas e a integração em RL de ciclo fechado são listadas como próximos passos, não como conquistas. Os resultados do Push-T são um benchmark, não uma afirmação de deployment.

Esta é a postura de honestidade que mantemos. Matchmaking ⚠️ e Marketplace ⚠️ são Partial — funcionam, e não os sobrevenderemos. Calendar ⚠️ é Partial. Wallet & Token 🔵, Super App 🔵 e Community Credit 🔵 são Roadmap, pre-revenue, sujeitos a Howey review. Não promovemos silenciosamente um item Roadmap a Production porque um benchmark pareceu bom. A soberania do cliente — a tua network, a tua marca, os teus dados — é a topologia pela qual o sistema encaminha. E a ética de âmbito é também uma decisão de encaminhamento: uso civil e defensivo apenas, inclusão by design para contextos multilingues, multimodais e de baixa conectividade.

[ORIGINAL DATA] No nosso próprio trabalho de previsão, a maior fonte única de descalibração não é o número de parâmetros do modelo — é a distância entre a via que a equipa acredita transportar o sinal e a via que a medição diz que realmente o transporta. Fechar essa distância é um exercício de encaminhamento, não de treino. Sempre que melhorámos a calibração, a mudança foi de encaminhamento: onde o sinal entra, onde é normalizado, onde é verificado. As contagens de parâmetros só se moveram quando o encaminhamento já estava correto.

Conclusões principais

  • Encaminha pela via medida. O GRASP funciona porque o gradiente de ação está densamente treinado e o de estado é adversário fora da manifold. O planejador tem sucesso parando o sinal antes de entrar na via frágil.
  • O levantamento compra paralelismo, o encaminhamento compra correção. A collocation paraleliza no tempo; o stop-gradient mantém o sinal limpo. Precisas de ambos, por essa ordem.
  • Theorem 3 generaliza o princípio. Uma propriedade está garantida exatamente quando o seu mecanismo está implementado e a medir. O gradiente de ação é o mecanismo medido; o de estado, o não medido.
  • Horizontes longos multiplicam a fragilidade, não apenas o custo. O colapso de GD e LatCo em 80 passos é o jacobiano adversário a compor. O gradiente errado é pior que nenhum.
  • A honestidade sobre os limites é parte do mecanismo. Os autores do GRASP rotulam o seu trabalho como iteração inicial. Nós rotulamos os nossos itens Roadmap como Roadmap. Ambas são decisões de âmbito.

Perguntas frequentes

O GRASP significa que a planificação com world models está resolvida? Não. Os autores enquadram-na como uma iteração inicial. World models baseados em difusão, integração de ciclo fechado e estratégias de ruído mais ricas permanecem abertos. O que o GRASP demonstra é que encaminhar o gradiente pela via medida é a alavanca que torna a planificação a horizonte longo tratável.

Porque parar o gradiente de estado não parte o planejador? Porque o goal shaping denso e o ruído estocástico de estado transportam o sinal que o jacobiano de estado teria transportado, sem a fragilidade adversária. A sincronização periódica fundamenta os estados levantados contra o rollout verdadeiro. O gradiente de estado é substituído, não removido.

Em que difere do LatCo? O LatCo também é um planejador de collocation, mas não para o gradiente de entrada de estado. O seu 0% de sucesso no horizonte 70 é o custo de encaminhar o sinal pela via adversária. A contribuição do GRASP é a decisão de encaminhamento, não o levantamento.

O que isto tem a ver com a Everythink? O princípio de encaminhamento é o mesmo. «The space is the router» significa que a topologia network-community-room encaminha um pedido antes de qualquer modelo responder. O GRASP encaminha o gradiente pela entrada de ação antes de qualquer propagação de estado. Theorem 3 é a versão formal: garante a propriedade apenas na via onde o mecanismo está a medir.

O HAI Engine é um world model? O HAI Engine é o sistema de previsão em produção que corre as Sisters e o Oracle. Não é um modelo de dinâmica aprendido no sentido do GRASP. A ligação é arquitetural: ambos os sistemas encaminham o sinal pela via medida e recusam publicar garantias que dependam da que não está.

Sources


Pronto para encaminhar a tua previsão pela via medida? Cria a tua network ou lê the 21 papers.

Construa seu mundo sobre um motor que prova o que afirma.

Crie sua própria rede no motor que está em produção desde 2016 — ou fale com a equipe por trás dos 21 artigos.