产品
解决方案
公司
企业
登录创建你的网络
AI · Reinforcement Learning · Forecasting · NVIDIA · Mechanism

Token 身份是 RL 正确性机制,而非框架体积

NVIDIA 的 Molt 以 8.6K 行发布,但承载机制是三个正确性不变量——token 身份、策略版本门控、MoE 路由回放——三个 Theorem 3 实例。

Molt 真正的赌注:token 身份是 RL 正确性机制,而非框架体积

NVIDIA 的 NeMo 团队在 2026 年 8 月发布了 Molt——一个 PyTorch 原生的 agentic 强化学习框架,按相同的导入图追踪测量约有 8.6K 行 RL 代码,相比之下 verl 约 62K 行、slime 约 25K 行、OpenRLHF 约 7.2K 行。标题数字是紧凑性。承载机制并非如此。Molt 的三个正确性不变量——token 身份、策略版本语义、前向一致性——才是让一次 off-policy 更新成立的根本,而紧凑性的存在是为了让研究员(或一个 AI 编程助手)能够真正核实它们。根据 Marktechpost 对该发布的报道,这正是明确的设计目标。

紧凑性是可审查性机制,不是体积炫耀

一个 RL 框架不是一个模型。它是围绕模型的脚手架,决定哪些 token 算数、它们来自哪个策略版本、以及 rollout 和训练器是否就模型行为达成一致。任何一个搞错,梯度就静默地指向错误方向。bug 不会崩溃。它腐蚀轨迹。

Molt 声明的体量——约 8.6K 行 RL 代码,按相同追踪方法比 verl 小约七倍——被其作者定位为研究人体工程学目标:足够紧凑让研究员能装进脑子里,也让 AI 编程助手能完整阅读并推理。这是一个可审查性论点,不是性能论点。[UNIQUE INSIGHT] 紧凑性是让正确性不变量可审计的机制;一个 62K 行的框架可以实现同样的不变量,却仍大到没人能在每条代码路径上验证它们成立。在这里 the space is the router 同样适用——路由决策是"读者能否追踪 token 从采样到梯度",更小的代码库让这条追踪穿过更少的层。

这映射到我们自 2016 年以来遵循的一个原则,那一年 Everythink HAI Engine ✅ 首次在生产中运行。我们的核心刻意小而可审查,因为你无法验证的属性不是你拥有的属性。[PERSONAL EXPERIENCE] 引擎自 2016 年在生产中运行,我们交付的每一项保证——概率在唯一一处归一化、Oracle 的 ensemble 降序排列、熵以 nats 计——之所以是保证,是因为施加它的代码路径足够短、可审计。Molt 在不同领域做着同样的权衡。

智能体是一个普通程序——生成之前的路由

Molt 指定一个 Python 模块导出一个 AgentRunner。其余一切,包括奖励,都是普通代码。支持两种形式。用 Env 时,框架在 Gymnasium 对齐的 step() 内拥有 LLM 循环。用 ChatAgent 时,用户通过标准 OpenAI 或 Anthropic SDK 拥有循环。Molt 启动一个 loopback 服务器,同时说两种网络协议,每个请求在服务端解码为逐 token 的精确累积。当长程智能体压缩其上下文并重写前缀时,服务器密封当前段并自动打开一个新段。

结构性主张是:智能体不需要知道自己在 RL 运行内。框架的职责是忠实地路由 token,而非让智能体变得特殊。这与我们在 Everythink 架构中坚守的分离相同:the space is the router——网络路由到社区,社区路由到 room,拓扑在一切响应之前路由。Sisters ✅(我们类型化的 forecast 智能体)不知道拓扑;它们返回一个 SisterOutput,由 Oracle ✅ 持久化并合并。Molt 的 AgentRunner 是等价的边界:智能体做普通工作,框架承载路由与正确性。

loopback 服务器是让"普通程序"成立的机制。一次标准 SDK 调用原样训练,因为服务器在网络协议层拦截并在服务端重建逐 token 精确轨迹。智能体无需自我插桩。这是一个已实现且在测量的路由机制——我们的框架里的 Theorem 3。[ORIGINAL DATA] Theorem 3,来自 the 21 papers,陈述一个属性恰在其机制已实现且在测量时才被保证。这里的属性是"训练器看到的轨迹是智能体产生的轨迹"。机制是 loopback 服务器的逐 token 精确累积。移除服务器,或让它重新分词,属性便不再被保证——它只是被期望。

三个不变量,三个 Theorem 3 实例

Molt 围绕三个正确性不变量组织设计。透过 Theorem 3 阅读,每一个都是被一个已实现且在测量的特定机制所保证的属性。没有一个因为框架快、流行或大而被保证。

Token 身份——永不训练你未生成的 token

第一个不变量是 token 身份:采样的 token id 定义轨迹,而非重新分词的转录。一旦你重新分词——把生成文本拼回穿过分词器并把新 id 当作轨迹——你就在训练模型未采样的 token。重要性权重错了,梯度错了,没有任何警告。

机制是 loopback 服务器的服务端累积,它把采样 id 保持为真相源。属性(off-policy 正确性)恰在该机制已实现且在测量时被保证。Molt 实现了它;紧凑性让它可检查。这是大多数 RL 框架避而不谈的不变量,因为它是静默断裂的那一个。

策略版本语义——序列级门控

第二个不变量是策略版本语义:可训练 token 保留其行为策略的对数概率,异步使用在序列级门控后逐 token 校正。在异步设置中,rollout 策略与可训练策略随着 actor 在 rollout 中途更新而漂移。天真的修正是对当前策略重算对数概率并把比率当作重要性权重——这是错的,因为行为策略才是实际采样 token 的那个。

Molt 的机制是序列级门控的逐 token 校正:每个 token 携带它被采样时的策略版本,门控决定序列是否仍足够 on-policy 可用,或必须丢弃。属性(有效 importance sampling)恰在门控已实现且在测量时被保证。这与我们系统中 Oracle 的归一化不变量形状相同:概率在唯一一处归一化,每个消费者可依赖 sum(probability) ≈ 1.0。保证住在机制里,不在下游检查里。

前向一致性——MoE 路由回放

第三个不变量是前向一致性:rollout 与 actor 必须就模型语义达成一致。对稠密模型这主要是数值精度问题。对 mixture-of-experts 策略这是结构性的:rollout 路由器与训练路由器独立选择专家,微小的数值差异可翻转 top-k 选择。当它们不一致,训练器在针对一个不匹配 rollout 的前向传播更新——梯度对一个智能体从未运行的模型是正确的。

Molt 应用 rollout routing replay(arXiv 2510.11370):vLLM 返回其逐 token 专家 id,训练前向传播回放它们。机制是回放;属性(MoE 路由的 rollout-训练器一致)恰在回放已实现且在测量时被保证。Molt 披露了吞吐量警告——在 MoE 上回放有代价——而非隐藏它。这种披露是 Honest Architect 的做法:命名机制,命名其代价,不假装属性免费。

Molt 不承诺什么——研究基础设施,硬件受限

Marktechpost 的报道清楚说明 Molt 不是什么。论文将其定位为研究基础设施,而非生产训练服务。附带的配方假设两个节点、每节点八张 H100 GPU,八个用于训练、八个用于 rollout。这个硬件门槛把 Molt 置于前沿及前沿邻近实验室、资金充裕的 post-training 初创、金融/医疗/机器人的企业 AI 研究组、以及有多节点 H100/H200 访问的学术实验室的可达范围内。它不是一个笔记本框架,也不假装是。

发布点名的应用——多轮工具使用智能体、代码执行智能体、视觉-语言环境(附带的 geo3k 配方)、LLM 作判定的奖励循环、向更小学生模型的 on-policy 蒸馏——都是研究工作负载。框架以 Apache 2.0 发布,附带 launch codes、Slurm 脚本和预构建容器,所以部署面是真实的。但诚实的解读是:这是一个紧凑、可审查的基底,面向能负担 GPU 且需要修改 RL 循环而不 rebase 一个 62K 行代码库的人。

我们尊重这个框架,因为它是我们内部使用的框架。HAI Engine ✅ 是生产。World Monitor ✅ 是生产。Sisters 和 Oracle 是生产。但 Wallet & Token 🔵、Super App 🔵 和 Community Credit 🔵 是 Roadmap——pre-revenue、须经 Howey 审查——我们每次、每种语言都这么说,因为一个被悄悄提升的 Roadmap 项就是一句谎话。Molt 说"研究基础设施,而非生产训练服务"是同样的纪律。诚实标签不是营销上的不便;它是让信任可审计的机制。

这如何连接到 Everythink——路由、归一化与 the 21 papers

深层连接是结构性的,不是竞争性的。Molt 和 Everythink 在不同领域运营——agentic RL 训练对行星尺度 forecast——但两者构建于同一论点:一个属性恰在其机制已实现且在测量时被保证(Theorem 3,来自 the 21 papers)。Molt 的三个不变量是三个实例。我们的不变量——概率在 Oracle 中唯一一处归一化、Sisters 从不直接写 Postgres、the space is the router 在一切响应之前路由——是我们的实例。

Oracle ✅ 把 Sisters 的草稿合并为归一化 ensemble:场景降序排列、概率和约为 1.0、熵以 nats 计。那个归一化不变量是 Molt token 身份的 forecast 类比。如果 ensemble 的两个消费者对哪个场景胜出意见不一——因为一个读了 forecast 的重新分词转录——下游决策将静默地出错。Oracle 通过成为唯一归一化点来保证属性,恰如 Molt 的 loopback 服务器通过成为唯一 token 身份点来保证轨迹。

the space is the router——网络路由到社区、社区路由到 room、拓扑在一切响应之前路由——与 Molt 的 request router 坐在 vLLM 引擎之前的模式相同。路由决策决定什么工作发生;工作不决定路由。在我们的情形,拓扑决定哪些 Sisters 响应一次查询;在 Molt 的情形,路由器决定哪个引擎处理一次 rollout 请求以及 partial rollout 如何暂停与恢复。两个系统都不让 worker 自选工作。这种纪律是让两者可审计的原因。

客户主权源自同一根。Everythink 上的一个网络是你的——你的品牌、你的数据、你的拓扑。路由发生在你的边界内。Molt 选择组合 Ray、vLLM 和 NVIDIA AutoModel 而不 fork 其中任何一个,是同一原则的较小版本:上游改进以容器固定版本到达,而非 rebase。你保留替换基底的能力。主权不是功能;它是不被锁在 fork 里的结构性后果。

关键要点

  • Molt 约 8.6K 行的体量是可审查性机制,不是性能主张。紧凑性的存在是为了让正确性不变量可审计。
  • 三个正确性不变量——token 身份、策略版本语义、前向一致性——是 Theorem 3 实例:每个属性恰在其机制已实现且在测量时被保证。
  • 智能体是普通程序。loopback 服务器是让这成立的路由机制,把采样 token id 保持为真相源。
  • Molt 是研究基础设施,硬件受限于 2×8 H100。发布如此明言。这个诚实标签与我们对自己 Roadmap 项使用的纪律相同。
  • 与 Everythink 的结构性亲缘是 Theorem 3 与"the space is the router":两个系统都通过唯一、可审查的机制路由来保证属性,而非寄望下游检查捕获错误。

常见问题

Molt 是生产训练服务吗? 不是。论文将其定位为研究基础设施。附带配方假设两个节点、每节点八张 H100 GPU。它以 Apache-2.0 发布,附带 launch codes、Slurm 脚本和预构建容器,所以你可以部署它——但作者明确它不是生产训练服务。

"永不训练你未生成的 token"是什么意思? 意思是训练器更新所依据的轨迹由模型实际采样的 token id 定义,而非生成文本的重新分词转录。重新分词产生不同 id 并静默腐蚀重要性权重。Molt 的 loopback 服务器把采样 id 保持为真相源。

紧凑性为何对正确性重要? 因为你无法审计的正确性不变量不是你拥有的保证。一个 62K 行框架可以实现相同不变量,却仍大到读者无法在每条代码路径上验证。Molt 约 8.6K 行让不变量可被研究员或 AI 编程助手追踪。

这如何与 Theorem 3 相关? Theorem 3,来自 the 21 papers,陈述一个属性恰在其机制已实现且在测量时被保证。Molt 的三个不变量是三个实例:token 身份保证 off-policy 正确性,策略版本门控保证有效 importance sampling,rollout routing replay 保证 MoE 的 rollout-训练器一致。没有一个由吞吐量或流行度保证。

与 Everythink 的连接是什么? 结构性的,非竞争性的。两个系统都通过唯一可审查机制路由来保证属性——Oracle 在唯一一处归一化概率;Molt 的 loopback 服务器在唯一一处固定 token 身份。两者都遵循"the space is the router":拓扑在一切响应之前路由。


预约一次 demo,看看 HAI Engine 如何通过 Sisters 和 Oracle 路由一次 forecast——以及每一项保证都是你可审计的机制。

Sources

在一个能证明其声明的引擎上构建你的世界。

在自 2016 年起持续运行的引擎上创建你自己的网络——或与 21 篇论文背后的团队交流。