製品
ソリューション
会社情報
エンタープライズ
サインインネットワークを作成
AI · Reinforcement Learning · Forecasting · NVIDIA · Mechanism

トークン同一性が RL の正確性メカニズムであり、フレームワークサイズではない

NVIDIA の Molt は 8.6K 行で出荷されるが、荷重を支えるメカニズムは三つの正確性不変量——トークン同一性、ポリシーバージョンゲート、MoE ルーティングリプレイ——三つの Theorem 3 インスタンスだ。

Molt の真の賭け:RL の正確性メカニズムはトークン同一性であり、フレームワークのサイズではない

NVIDIA の NeMo チームは 2026 年 8 月に Molt を公開した——PyTorch ネイティブの agentic 強化学習フレームワークで、同じインポートグラフトレースで計測して約 8.6K 行の RL コード、verl の約 62K 行、slime の約 25K 行、OpenRLHF の約 7.2K 行に対抗する。見出しの数字はコンパクトさだ。荷重を支えるメカニズムはそうではない。Molt の三つの正確性不変量——トークン同一性、ポリシーバージョン意味論、forward 一貫性——が off-policy 更新を有効にするものであり、コンパクトさは研究者(または AI コーディングアシスタント)が実際に検証できるようにするために存在する。リリースを報じる Marktechpost の記事によれば、それが明示的な設計目標である。

コンパクトさは検査性のメカニズムであり、サイズの自慢ではない

RL フレームワークはモデルではない。モデルの周囲の足場であり、どのトークンを数えるか、それらがどのポリシーバージョンから来たか、rollout とトレーナーがモデルの振る舞いについて合意するかを決める。三つのうち一つでも間違えれば、勾配は黙って誤った方向を向く。バグはクラッシュしない。軌跡を腐食する。

Molt の宣言された規模——約 8.6K 行の RL コード、同じトレース手法で verl より約七倍小さい——は、著者たちによって研究 ergonomics の目標として位置づけられる:研究者が頭に保持でき、AI コーディングアシスタントが全体を読んで推論できるほどコンパクト。それは検査性の論拠であり、性能の論拠ではない。[UNIQUE INSIGHT] コンパクトさは正確性不変量を監査可能にするメカニズムである;62K 行のフレームワークは同じ不変量を実装できても、すべてのコードパスでそれらが成り立つことを誰も確認できないほど大きくなりうる。ここでも the space is the router だ——ルーティングの決定は「読者がトークンをサンプルから勾配まで追跡できるか」であり、より小さなコードベースはその追跡をより少ない層で通す。

これは、Everythink HAI Engine ✅ が初めて本番で動いた 2016 年以来私たちが生きてきた原則に写像する。私たちのコアは意図的に小さく検査可能である、なぜなら検証できない属性は持っている属性ではないからだ。[PERSONAL EXPERIENCE] エンジンは 2016 年から本番で動いており、私たちが出荷するすべての保証——確率が厳密に一箇所で正規化される、Oracle のアンサンブルが降順でソートされエントロピーは nats 単位——は、それを課すコードパスが監査できるほど短いからこそ保証である。Molt は別の領域で同じ交換をしている。

エージェントは普通のプログラムである——生成より前のルーティング

Molt は一つの Python モジュールを名指し、それが AgentRunner をエクスポートする。報酬を含め、それ以外はすべて普通のコードだ。二つの形式がサポートされる。Env では、フレームワークが Gymnasium に整合した step() の内側で LLM ループを所有する。ChatAgent では、ユーザーが標準の OpenAI または Anthropic SDK を通じてループを所有する。Molt は両方のワイヤープロトコルを話す loopback サーバーを立ち上げ、各リクエストはサーバー側でトークン正確な蓄積としてデコードされる。長ホライズンのエージェントがコンテキストを圧縮しプレフィックスを書き直すとき、サーバーは現在のセグメントを封印し、自動的に新しいものを開く。

構造的な主張は、エージェントが自分が RL 実行の内側にいることを知る必要がないということだ。フレームワークの仕事はトークンを忠実にルーティングすることであり、エージェントを特別にすることではない。これは Everythink のアーキテクチャで私たちが保持するのと同じ分離だ:the space is the router——ネットワークはコミュニティへルーティングし、コミュニティは room へルーティングし、トポロジーは何かが応答する前にルーティングする。Sisters ✅(私たちの型付き forecast エージェント)はトポロジーを知らない;それらは SisterOutput を返し、Oracle ✅ が永続化しマージする。Molt の AgentRunner は等価な境界だ:エージェントは普通の仕事をし、フレームワークがルーティングと正確性を担う。

loopback サーバーが「普通のプログラム」を真にするメカニズムである。標準の SDK 呼び出しがそのまま訓練できるのは、サーバーがワイヤープロトコルでインターセプトし、サーバー側でトークン正確な軌跡を再構築するからだ。エージェントは自分自身を計装する必要がない。それは実装され測定されているルーティングメカニズムである——私たちの枠組みでの Theorem 3。[ORIGINAL DATA] Theorem 3、the 21 papers からのもの、はある属性がそのメカニズムが実装され測定されているときちょうど保証される、と述べる。ここでの属性は「トレーナーが見る軌跡はエージェントが生成した軌跡である」。メカニズムは loopback サーバーのトークン正確な蓄積である。サーバーを取り除くか、再トークン化を許せば、属性はもはや保証されない——それは単に望まれるだけである。

三つの不変量、三つの Theorem 3 のインスタンス

Molt は三つの正確性不変量の周りに設計を組織する。Theorem 3 を通して読めば、それぞれが実装され測定されている特定のメカニズムによって保証される属性である。一つもフレームワークが速いことや人気があることや大きいことによって保証されるものはない。

トークン同一性——生成しなかったトークンで訓練するな

最初の不変量はトークン同一性である:サンプリングされたトークン id が軌跡を定義し、再トークン化された書き起こしではない。再トークン化する瞬間——生成されたテキストをトークナイザーに戻し、新しい id を軌跡として扱う——モデルがサンプリングしなかったトークンで訓練したことになる。重要度重みが間違っており、勾配が間違っており、何も警告しない。

メカニズムは loopback サーバーのサーバー側蓄積であり、サンプリングされた id を真実の源として保つ。属性(off-policy 正確性)はそのメカニズムが実装され測定されているときちょうど保証される。Molt はそれを実装する;コンパクトさがそれを検査可能にする。これはほとんどの RL フレームワークが静かなままにしておきたい不変量である、なぜなら静かに壊れるものだから。

ポリシーバージョン意味論——シーケンスレベルのゲート

第二の不変量はポリシーバージョン意味論である:訓練可能なトークンはその振る舞いポリシーの対数確率を保ち、非同期使用はシーケンスレベルのゲートの後ろでトークンごとに補正される。非同期設定では、rollout ポリシーと訓練可能ポリシーは、actor が rollout の途中で更新されるにつれて離れていく。素朴な修正は現在のポリシーに対して対数確率を再計算し、比を重要度重みとして扱うことである——それは間違っている、なぜなら振る舞いポリシーが実際にトークンをサンプリングしたものだから。

Molt のメカニズムはシーケンスレベルでゲートされたトークンごとの補正である:各トークンはそれがサンプリングされたポリシーバージョンを担い、ゲートはシーケンスがまだ使用するのに十分に on-policy か、破棄されなければならないかを決める。属性(有効な importance sampling)はゲートが実装され測定されているときちょうど保証される。これは私たちのシステムの Oracle の正規化不変量と同じ形である:確率は厳密に一箇所で正規化され、すべての消費者は sum(probability) ≈ 1.0 に依存できる。保証はメカニズムに宿り、下流のチェックには宿らない。

Forward 一貫性——MoE ルーティングのリプレイ

第三の不変量は forward 一貫性である:rollout と actor はモデルの意味論について合意しなければならない。密なモデルではこれは主に数値精度の懸念である。mixture-of-experts ポリシーでは構造的である:rollout ルーターと訓練ルーターは独立してエキスパートを選択し、小さな数値の違いが top-k の選択を反転させうる。それらが不一致のとき、トレーナーは rollout に一致しない forward パスに対して更新している——勾配はエージェントが実行したことのないモデルに対して正しい。

Molt は rollout routing replay(arXiv 2510.11370)を適用する:vLLM はトークンごとのエキスパート id を返し、訓練の forward がそれらを再生する。メカニズムはリプレイである;属性(MoE ルーティングの rollout-トレーナー合意)はリプレイが実装され測定されているときちょうど保証される。Molt は throughput の注意を開示する——MoE ではリプレイにはコストがかかる——隠すのではなく。その開示は Honest Architect の動きである:メカニズムを名指し、そのコストを名指し、属性が無料であるかのように振る舞わない。

Molt が約束しないもの——研究インフラ、ハードウェアで制限

Marktechpost の報道は Molt が何でないかについて明確である。論文はそれを研究インフラとして位置づけ、本番訓練サービスとしては位置づけない。出荷されたレシピは二つのノード、各ノード八基の H100 GPU を仮定し、八つを訓練に、八つを rollout に分割する。そのハードウェアの門は Molt をフロンティアおよびフロンティア隣接ラボ、資金豊富な post-training スタートアップ、金融・医療・ロボティクスの企業 AI 研究グループ、およびマルチノードの H100/H200 アクセスを持つ学術ラボの範囲に置く。それはラップトップフレームワークではなく、そうであるかのように振る舞わない。

リリースが名指しする応用——マルチターンのツール使用エージェント、コード実行エージェント、視覚-言語環境(出荷された geo3k レシピ)、LLM-as-judge の報酬ループ、より小さな学生への on-policy 蒸留——は研究ワークロードである。フレームワークは Apache 2.0 の下で launch codes、Slurm スクリプト、事前構築コンテナとともに出荷されるので、デプロイ面は本物である。だが誠実な読みはこうだ:これは、GPU を負担でき、62K 行のコードベースをリベースせずに RL ループを修正する必要がある人々のための、コンパクトで検査可能な基盤である。

私たちはその枠組みを尊重する、なぜならそれは私たちが内部で使う枠組みだからだ。HAI Engine ✅ は本番である。World Monitor ✅ は本番である。Sisters と Oracle は本番である。だが Wallet & Token 🔵、Super App 🔵、Community Credit 🔵 は Roadmap である——pre-revenue、Howey 審査対象——そして私たちは毎回、すべての言語でそう言う、なぜなら静かに昇格された Roadmap 項目は嘘だからだ。Molt が「研究インフラ、本番訓練サービスではない」と言うのは同じ規律である。誠実タグはマーケティング上の不便ではない;信頼を監査可能に保つメカニズムである。

これが Everythink にどう繋がるか——ルーティング、正規化、そして the 21 papers

深いつながりは構造的であり、競争的ではない。Molt と Everythink は異なる領域で運営される——agentic RL 訓練 対 惑星規模の forecast——だが両者は同じテーゼの上に構築される:ある属性はそのメカニズムが実装され測定されているときちょうど保証される(Theorem 3、the 21 papers から)。Molt の三つの不変量は三つのインスタンスである。私たちの不変量——Oracle で確率が厳密に一箇所で正規化される、Sisters は直接 Postgres に書き込まない、the space is the router が何かが応答する前にルーティングする——は私たちの領域でのインスタンスである。

Oracle ✅ は Sisters の下書きを正規化されたアンサンブルにマージする:シナリオは降順でソートされ、確率は約 1.0 に合計し、エントロピーは nats 単位である。その正規化不変量は Molt のトークン同一性の forecast 類推である。アンサンブルの二人の消費者がどのシナリオが勝ったかについて不一致なら——一人が forecast の再トークン化された書き起こしを読んだため——下流の決定は静かに間違うだろう。Oracle は唯一の正規化サイトであることによって属性を保証し、ちょうど Molt の loopback サーバーが唯一のトークン同一性サイトであることによって軌跡を保証する。

the space is the router——ネットワークはコミュニティへ、コミュニティは room へ、トポロジーは何かが応答する前にルーティングする——は、vLLM エンジンの前に座る Molt の request router と同じパターンである。ルーティングの決定がどの仕事が起こるかを決める;仕事がルーティングを決めるのではない。私たちの場合、トポロジーがどの Sisters がクエリに応答するかを決める;Molt の場合、ルーターがどのエンジンが rollout リクエストを扱うか、そして partial rollout がどう一時停止し再開するかを決める。どちらのシステムも worker に自身の仕事を選ばせない。その規律が両者を監査可能にする。

顧客主権は同じ根から従う。Everythink 上のネットワークはあなたのものだ——あなたのブランド、あなたのデータ、あなたのトポロジー。ルーティングはあなたの境界の内側で起こる。Molt が Ray、vLLM、NVIDIA AutoModel をどれも fork せずに構成する選択は、同じ原則のより小さな版本である:上流の改善はコンテナのピンとして到着し、リベースとしてではない。あなたは基盤を取り替える能力を保つ。主権は機能ではない;fork に閉じ込められないことの構造的な帰結である。

主要な要点

  • Molt の約 8.6K 行の規模は検査性のメカニズムであり、性能の主張ではない。コンパクトさは正確性不変量が監査可能であるために存在する。
  • 三つの正確性不変量——トークン同一性、ポリシーバージョン意味論、forward 一貫性——は Theorem 3 のインスタンスである:各属性はそのメカニズムが実装され測定されているときちょうど保証される。
  • エージェントは普通のプログラムである。loopback サーバーはサンプリングされたトークン id を真実の源として保つことでそれを真にするルーティングメカニズムである。
  • Molt は研究インフラであり、2×8 H100 でハードウェア制限される。リリースはそう明言する。その誠実タグは私たちが自身の Roadmap 項目に使うのと同じ規律である。
  • Everythink との構造的親縁性は Theorem 3 と「the space is the router」である:両システムとも単一の検査可能なメカニズムを通じてルーティングすることで属性を保証し、下流のチェックがエラーを捕らえることを望まない。

よくある質問

Molt は本番訓練サービスですか? いいえ。論文はそれを研究インフラとして位置づける。出荷されたレシピは二つのノード、各ノード八基の H100 GPU を仮定する。launch codes、Slurm スクリプト、事前構築コンテナとともに Apache-2.0 で出荷されるので、デプロイできる——だが著者たちはそれが本番訓練サービスではないことを明示する。

「生成しなかったトークンで訓練するな」とはどういう意味ですか? トレーナーが更新する対象の軌跡が、モデルが実際にサンプリングしたトークン id によって定義されることを意味する、生成されたテキストの再トークン化された書き起こしではなく。再トークン化は異なる id を生成し、重要度重みを静かに腐食する。Molt の loopback サーバーはサンプリングされた id を真実の源として保つ。

コンパクトさが正確性に重要なのはなぜですか? 監査できない正確性不変量は、あなたが持っている保証ではないから。62K 行のフレームワークは同じ不変量を実装できても、読者がすべてのコードパスで検証するには大きすぎる。Molt の約 8.6K 行は不変量を研究者や AI コーディングアシスタントが追跡可能にする。

これは Theorem 3 とどう関係しますか? Theorem 3、the 21 papers から、はある属性がそのメカニズムが実装され測定されているときちょうど保証される、と述べる。Molt の三つの不変量は三つのインスタンスである:トークン同一性は off-policy 正確性を保証し、ポリシーバージョンゲートは有効な importance sampling を保証し、rollout routing replay は MoE の rollout-トレーナー合意を保証する。一つも throughput や人気によって保証されるものはない。

Everythink とのつながりは何ですか? 構造的であり、競争的ではない。両システムとも単一の検査可能なメカニズムを通じてルーティングすることで属性を保証する——Oracle は厳密に一箇所で確率を正規化し;Molt の loopback サーバーは厳密に一箇所でトークン同一性を固定する。両者とも「the space is the router」に従う:トポロジーは何かが応答する前にルーティングする。


デモを予約して、HAI Engine が Sisters と Oracle を通じて forecast をどうルーティングするかを見て——そしてすべての保証が監査可能なメカニズムであることを確かめてください。

Sources

自らの主張を証明するエンジンの上に、あなたの世界を築く。

2016 年から稼働し続けるエンジンの上に、あなた自身のネットワークを作る——あるいは 21 本の論文を書いたチームに話しかける。