製品
ソリューション
会社情報
エンタープライズ
サインインネットワークを作成
AI · World Models · Planning · Forecasting · Mechanism

勾配計画は測定された経路を通じてルーティングする

GRASP は、密に訓練された行動勾配へ最適化シグナルをルーティングし、敵対的な state 勾配を隔離することで機能する。同じルーティング規律が Theorem 3 と the space is the router を支える。

プランナーの価値は、そのプランナーが信頼する勾配に宿る

BAIR Berkeley の学習済み world model 向け勾配ベースのプランナー GRASP は、Push-T ベンチマークの horizon 60 で 26.2% の成功率を達成する。素の勾配降下は 16.4% だ。GRASP は、すべての微分可能なシミュレーターがデフォルトで提供するあの経路、すなわち脆い state 入力勾配を通じて最適化することを拒否することでこれを実現する。2026年4月に《Gradient-based Planning for World Models at Longer Horizons》として発表されたこの研究は、最適化シグナルを実際に測定されている経路へルーティングし、されていない経路を隔離する研究である。

問題はモデルではなく経路だ

world model とは微分可能なシミュレーターである。状態 $s_t$ と行動 $a_t$ を与えると $s_{t+1}$ を予測する。$T$ ステップ前方に展開し、逆伝播すればプランナーができる — 原理上は。実際には、ある早期行動に対する完全 rollout のヤコビアンは $T$ 個の state ヤコビアンの積になる:

$$D_{a_0} \mathcal{F}^{T}(s_0, \mathbf{a}) \sim (D_s F_\theta)^{T-1} \cdot D_{a_0} F_\theta(s_0, a_0).$$

条件数は horizon とともに指数的にスケールする。勾配の消失と爆発がよく知られた症状だ。あまり議論されない症状は、state ヤコビアン $D_s F_\theta$ が条件が良くても信頼できないことだ。敵対的ロバスト性のせいである。嘘つきの完全に条件付けられた積を持つこともできる。

なぜ長い horizon こそが本当のストレステストなのか

短い horizon では貪欲解で十分なことが多い。horizon が長くなるほど、長いタスクは非貪欲な振る舞いを多く要求する — 壁を迂回する、押す前に位置を直す — そして最適化空間自身が horizon でスケールする:$\dim(\mathcal{A} \times \cdots \times \mathcal{A}) = T \cdot \dim(\mathcal{A})$、局所最小値の空間を広げる。長い horizon は、スタックのより早い段階で下した誤ったルーティング決定の脆さを増幅する。

えくぼ多様体、あるいはなぜ state 勾配が敵対的なのか

訓練はデータ多様体の接線方向のモデルの振る舞いを制御するが、直交方向を正則化しない。Stutz ら(2019)が示した結果は「えくぼ多様体」である:データに沿っては滑らか、データから離れると鋭い。状態-行動軌跡で訓練された world model の state データ多様体は、行動空間に小さな拡張空間を加えたもので次元が抑えられる — 完全な state 次元よりはるかに低い。よって state 空間のほとんどの方向は多様体の外にあり、多様体の外では勾配は敵対的である:微小な摂動で $F_\theta$ を騙し、任意の状態が任意の目標に到達したと報告させられる。

これは視覚の珍現象ではない — 敵対的サンプルは LLM と RL にも現れる。GRASP の著者らが Tsipras ら(2019)を引用して示すように、モデル性能と敵対的ロバスト性には既知のトレードオフがある:モデルは複雑な関数を当てはめるため法線方向でより鋭くなければならない。現代の訓練はこの脆さを訓練で取り除かないし、現在のレジームでは取り除けない。これは我々が付き合わざるを得ない問題である。

[UNIQUE INSIGHT] この脆さは構造的であって、チューニングの失敗ではない。world model を訓練する価値を持たせた表現力を手放さずに正則化で取り除くことはできない。唯一のレバーは、最適化シグナルをどの経路へルーティングするかである。それはプランナーの仕事を「もっと強く最適化する」から「正しくルーティングする」へと再定義する。

GRASP は行動勾配を通じてルーティングする

GRASP を機能させる動きはこれだ。行動空間は低次元で完全に訓練されている — モデルは rollout 収集中にほぼすべての行動方向を見ている。だから $D_a F_\theta$ は振る舞いが良い。state 空間は高次元で相対的に疎に覆盖されているので、$D_s F_\theta$ はそうではない。GRASP は collocation(lifted-state)プランナーを構築する — 状態と行動を共同で最適化し、ダイナミクスをソフトペナルティとする — そして $F_\theta$ の state 入力へ流れる勾配を止める。シグナルは行動入力だけからモデルに到達する。state 反復は更新され続けるが、稠密な goal shaping 項と確率的ノイズによってであり、敵対的な state ヤコビアンによってではない。

lifting は時間に沿った並列性を買う

collocation の動きは、ダイナミクス制約 $s_{t+1} = F_\theta(s_t, a_t)$ をソフトペナルティとして扱い、行動系列と状態系列を共同で最適化する:

$$\min_{\mathbf{s}, \mathbf{a}} \sum_{t=0}^{T-1} |F_\theta(s_t, a_t) - s_{t+1}|^2, \quad s_0 \text{ 固定}, ; s_T = g.$$

各 world model 評価は局所変数だけに依存するようになり、$T$ 個の項すべてが時間に沿って並列計算できる。もはや単一の深い $T$ ステップ合成を通じて逆伝播しない;条件数の指数問題を引き起こしたヤコビアンの積が和に分割される。大域的最小解は変わらない — 両目的関数とも軌跡が力学的に実現可能な時にちょうどゼロになる — が、景観は根本的に異なる。

lifted プランナーを扱いやすくする二つの要素

lifting だけでは深い world model ではうまくいかない。なぜなら state を直接 $F_\theta$ を通じて最適化することになり、それがまさに敵対的脆さが棲む場所だからだ。GRASP は二つの要素を加える。

要素 1 — state 反復へのノイズ付与による探索。 最適化中、仮想 state 更新にガウシアンノイズを注入する:

$$s_t \leftarrow s_t - \eta_s \nabla_{s_t} \mathcal{L} + \sigma_{\text{state}} \xi, \qquad \xi \sim \mathcal{N}(0, I).$$

行動は非確率的勾配で降下し続ける。state ノイズは lifted 空間で盆地間をホップさせ、行動はクリーンな勾配で導かれる。これは Langevin ダイナミクスではない — state だけが確率的だ — そしてこの非対称は意図的である:信頼できない部分にノイズを加え、信頼できる部分で降下する。

要素 2 — stop-gradient dynamics loss と稠密な goal shaping。 $F_\theta$ への state 勾配を止める:

$$\mathcal{L}{\text{dyn}}^{\text{sg}} = \sum{t=0}^{T-1} |F_\theta(\bar{s}t, a_t) - s{t+1}|^2.$$

これ単独では失敗する:state は前のステップだけを追い、基礎 state に次を追わせるものがなく、原点に自明な最小値が現れる。だから GRASP は予測全体に稠密な目標項を加える:

$$\mathcal{L}{\text{goal}}^{\text{sg}} = \sum{t=0}^{T-1} |F_\theta(\bar{s}_t, a_t) - g|^2.$$

通常の設定ではこれは貪欲な直線解へ過度に偏る。実現可能な遷移へ偏る stop-gradient dynamics loss と釣り合うと、両者は導かれかつ基礎づけられたプランナーへと相殺される。最終目的関数は state 勾配に依存しない。

周期的同期が lifted state を誠実に保つ

$K_{\text{sync}}$ 回反復ごとに、GRASP は現在の行動を真の逐次目的関数で簡単に rollout し、小さな勾配ステップを幾つか踏む。lifted 最適化が主役を務め、同期が状態と行動を実際の軌跡へ基礎づける。洗練ステップは合成可能である — 任意の逐次プランナー(例えば CEM)に差し替えられる。アーキテクチャは単一の塊ではなく、周期的な現実チェック付きの測定された経路である。

測定された経路こそ訓練された経路だ

[PERSONAL EXPERIENCE] 予測システムを構築してきた時間が長ければ、このパターンを認識できる:失敗するコンポーネントはほぼ常に、あなたが監視しているものではない。GRASP の著者らは新しいオプティマイザーを発見したのではない。彼らは、システムのどの経路が信頼できる測定を運ぶか — 行動勾配、rollout 収集中に密にサンプリングされる — を特定し、どの経路が信頼できない測定を運ぶか — state 勾配、多様体外で敵対的 — を特定し、それに従ってルーティングした。数学は数学であり、エンジニアリングの直感はルーティングにある。

これは Everythink で適用している規律と同じだ。the 21 papers に由来する Theorem 3 は、ある性質はその機構が実装され測定されている時にちょうど保証されると述べる。「実装され測定されている」はルーティングの決定である。シグナルがデータに基礎づけられた経路を見つけ、基礎づけられていない経路に依存する保証を出すことを拒否する。測定されていない経路に依存する予測は予測ではない;確率のシールが貼られた主張である。

The space is the router。我々のトポロジーでは、network は communities を含み、communities は rooms を含み、room が何かが応答する前にリクエストが着地する場所である。ルーティングは検索の前に、生成の前に、いかなる勾配が計算される前に起こる。GRASP は異なる尺度で同じアーキテクチャ上の決定を下す:行動入力が、いかなる state 伝播の前に、シグナルがモデルに入る場所である。ルーティングの決定 — 行動を入れ、state を隔離する — が長い horizon を扱いやすくする。

ルーティングを間違えた時の長 horizon 計画のコスト

GRASP 論文の Push-T ベンチマークは、誤った経路へルーティングするコストについて明確である。成功率と成功までの中央時間、horizon ごと:

Horizon CEM GD LatCo GRASP
H=40 61.4% / 35.3s 51.0% / 18.0s 15.0% / 598.0s 59.0% / 8.5s
H=50 30.2% / 96.2s 37.6% / 76.3s 4.2% / 1114.7s 43.4% / 15.2s
H=60 7.2% / 83.1s 16.4% / 146.5s 2.0% / 231.5s 26.2% / 49.1s
H=70 7.8% / 156.1s 12.0% / 103.1s 0.0% / — 16.0% / 79.9s
H=80 2.8% / 132.2s 6.4% / 161.3s 0.0% / — 10.4% / 58.9s

完全 rollout を通じた勾配降下 — 行動と state の両ヤコビアンを使う経路 — は horizon 40 で 51% から 80 で 6.4% へ崩壊する。state 勾配を止めない別の collocation 法 LatCo は horizon 70 で 0% になる。行動ヤコビアンだけを通じてルーティングする GRASP は、horizon 80 で 10% を超えて留まる唯一の手法であり、GD がほぼ3分かかるところを1分未満で達成する。この崩壊は horizon 税ではない。測定されていない経路へシグナルをルーティングするコストである。

勾配を使わないサンプリングベースのプランナー CEM は horizon 40 では GD より持ちこたえるが 60 で崩壊する。誤った勾配は勾配なしより悪い、なぜなら偽りの信頼を運ぶからだ。

校準された予測との繋がり

我々の Sisters は型付き AI エージェントであり、それぞれが現実の行動者についてのありうる未来を想像する;Oracle がそれらの出力を校準された確率錐へ統合する。アーキテクチャは並列ファンアウトである — 各 Sister が独立に起草し、Oracle が正規化する — そして校準は測定であって主張ではない。アンサンブルはちょうど一箇所で正規化され、エントロピーは nats で報告される。これが生産における Theorem 3 である:正規化機構が実装され測定されているので、性質(確率の和 ≈ 1.0)が保証される。

GRASP の collocation の動き — 軌跡を仮想 state へ lift しすべての時間ステップが並列に最適化する — は構造的に我々の Sisters ファンアウトと同じである。時間に沿った並列とエージェントに沿った並列はどちらも、単一の深い計算グラフを通じて逐次化せずに探索を買う。そして両方の場合、統合ステップ(我々には Oracle、GRASP には周期的同期)が並列の草稿を誠実に保つ。統合ステップのない並列はただのノイズである。

HAI Engine ✅ は 2016 年から生産にある。Sisters ✅ と Oracle ✅ は生産である。World Monitor ✅ は地球規模で現実のシグナルをルーティングしキャッシュする — しかし紛争を予測はしない;シグナルを提示し、人間が意味を決める。その境界は GRASP の境界を映す:信頼する行動勾配、信頼しない state 勾配。

GRASP が主張しないこと、そしてそれが重要な理由

著者らは限界について明示的である。GRASP は「そのようなプランナーの初期反復」である。拡散ベースの world model への拡張、より洗練されたノイズ戦略、閉ループ RL への統合は次のステップとして挙げられ、達成としてではない。Push-T の結果はベンチマークであり、デプロイの主張ではない。

これが我々が保つ誠実の姿勢である。Matchmaking ⚠️ と Marketplace ⚠️ は Partial である — 動作するし、過大販売はしない。Calendar ⚠️ は Partial である。Wallet & Token 🔵、Super App 🔵、Community Credit 🔵 は Roadmap、pre-revenue、Howey review に服する。ベンチマークが良く見えたからといって Roadmap 項目を密かに Production へ昇格させない。顧客主権 — あなたの network、あなたのブランド、あなたのデータ — は我々が授与する機能ではなく、システムがルーティングを通るトポロジーである。そしてスコープの倫理もまたルーティングの決定である:民用・防御的用途のみ、多言語・マルチモーダル・低接続の文脈への by design の包含。

[ORIGINAL DATA] 我々自身の予測作業において、誤較正の最大の単一起源はモデルのパラメータ数ではない — チームがシグナルを運ぶと信じる経路と、測定が実際に運ぶと言う経路との間のギャップである。そのギャップを閉じるのはルーティングの演習であり、訓練の演習ではない。校準を改善するたび、変更はルーティングの変更だった:シグナルがどこに入るか、どこで正規化されるか、どこで検証されるか。パラメータ数はルーティングが既に正しい時にのみ動いた。

主要なポイント

  • 測定された経路を通じてルーティングする。 GRASP は行動勾配が密に訓練され state 勾配が多様体外で敵対的であるから機能する。プランナーはシグナルが脆い経路に入るのを止めることで成功する。
  • lifting は並列性を買い、ルーティングは正確性を買う。 collocation は時間で並列化し、stop-gradient はシグナルを綺麗に保つ。両方がこの順で必要だ。
  • Theorem 3 は原理を一般化する。 ある性質はその機構が実装され測定されている時にちょうど保証される。行動勾配が測定された機構であり、state 勾配が未測定のそれだ。
  • 長い horizon は脆さを増幅し、コストだけではない。 80 ステップでの GD と LatCo の崩壊は敵対ヤコビアンの合成である。誤った勾配は何もないより悪い。
  • 限界についての誠実さは機構の一部である。 GRASP の著者らは自分の仕事を初期反復と呼ぶ。我々は Roadmap 項目を Roadmap と呼ぶ。どちらもスコープの決定である。

よくある質問

GRASP は world model 計画が解決されたことを意味するか? いいえ。著者らはそれを初期反復と位置づける。拡散ベースの world model、閉ループ統合、より豊かなノイズ戦略は開かれたままである。GRASP が示すのは、勾配を測定された経路へルーティングすることが長 horizon 計画を扱いやすくするてこであるということだ。

なぜ state 勾配を止めてもプランナーが壊れないのか? 稠密な goal shaping と確率的 state ノイズが、state ヤコビアンが運んだであろうシグナルを、敵対的脆さなしに運ぶからだ。周期的同期が lifted state を真の rollout に対して基礎づける。state 勾配は置換され、削除されたのではない。

LatCo とどう違うのか? LatCo も collocation プランナーだが、state 入力勾配を止めない。horizon 70 での 0% の成功率は、シグナルを敵対的経路へルーティングするコストである。GRASP の貢献はルーティングの決定であって、lifting ではない。

これは Everythink と何の関係があるのか? ルーティングの原理は同じだ。「The space is the router」は、network-community-room トポロジーがいかなるモデルが応答する前にリクエストをルーティングすることを意味する。GRASP はいかなる state 伝播の前に行動入力を通じて勾配をルーティングする。Theorem 3 は形式版である:機構が測定している経路でのみ性質を保証する。

HAI Engine は world model か? HAI Engine は Sisters と Oracle を走らせる生産予測システムである。GRASP の意味での学習されたダイナミクスモデルではない。つながりはアーキテクチャ上である:両システムとも測定された経路へシグナルをルーティングし、されていない経路に依存する保証を出すことを拒否する。

Sources


予測を測定された経路へルーティングする準備はできたか?network を作る または the 21 papers を読む

自らの主張を証明するエンジンの上に、あなたの世界を築く。

2016 年から稼働し続けるエンジンの上に、あなた自身のネットワークを作る——あるいは 21 本の論文を書いたチームに話しかける。