
对结果的检验才是机制,而不是「世界模型」这个标签
来自MIT的标题是:Devavrat Shah 教授构建了一个面向表格数据与时序数据的 foundation model,它「在不断用真实结果检验自身预测的过程中学习」。大众媒体把这叫作「世界模型」。真正起支撑作用的机制是对结果的检验——一条有测量的反馈回路,依据实际发生的情况来校准预测。这才是值得复制的那部分。标签不是。
2026年,MIT News 报道了 Shah 在 MIT Laboratory for Information and Decision Systems 的工作,以及已被 Celonis 收购的衍生公司 Ikigai Labs。该系统接收结构化的行列式企业数据,并以有限的算力在「大得多的规模」上产出实时规划。文章对它为何有效毫不掩饰:模型「持续地、规模化地……在不断用真实结果检验自身预测的过程中学习」。这句话就是全部机制。其余的一切——「世界模型」的框定、foundation model 的品牌化——都是包装。
这之所以对我们 Everythink 重要,是因为我们的 HAI Engine ✅ 自 2016 年起就在生产环境中运行一条有测量的预测回路,而我们的 Theorem 3 以一般形式陈述了该原则:一个属性,当且仅当其机制已实现且正在测量时,才被保证。Shah 的企业流程模型是该定理的又一个实例。诚实的框定是:流行词在回路的下游。
机制是对结果的检验,不是标签
Shah 本人在 MIT 文章中精确地命名了这一动态:系统「通过持续、规模化地摄入企业数据,从而在不断用真实结果检验自身预测的过程中学习」,以此「在大规模上提供实时规划」。把语言压缩到底,你得到一个三步回路:预测、观测、更新。这就是校准。这正是我们的 Oracle ✅ 在将 Sisters 的草稿合并为归一化集成并依据已实现结果重新加权时所运行的回路。
[UNIQUE INSIGHT] 「世界模型」这个标签之所以能粘住,是因为一条校准良好的回路从外部看就像一个世界模型——它预判需求、价格弹性、促销响应。但保证并不存在于预判之中。它存在于测量之中。一个只预测不检验的系统是一个叙事生成器;一个只检验不更新的系统是一个仪表盘。「有用预测」这个属性,只有在两半都接通、且更新步骤确实在运行时才被保证。
这就是 the 21 papers 中的 Theorem 3:一个属性,当且仅当其机制已实现且正在测量时成立。「已实现」意味着回路已接通——预测、观测、更新。「正在测量」意味着观测步骤是真实的,而非假设的。Shah 所描述的企业流程模型之所以合格,是因为 Celonis 已经数字化了超过 1,400 家企业的运营——观测层在预测层被叠加上去之前就已存在。这个顺序并非偶然。它是整个栈能工作的根本原因。
表格数据是高性价比的基底
MIT 文章提出了一个大多数 AI 媒体埋没的论点:「我们非常聚焦于该领域中其余世界未予关注的那部分」,即结构化的时域数据。「从这类数据出发」,Shah 说,「它提供了一种非常具有性价比的 AI 版本」。
这是一个诚实的论断,且它支撑一切。表格数据——电子表格所用的行列格式——稠密、有类型,并且已经与所问的问题对齐。一条需求预测行里有 SKU、价格、促销标志、日期。信噪比很高。一个文本与图像的 foundation model 必须先从非结构化输入中重建出这种结构,才能预测任何东西。Shah 的模型从决策实际所在之处开始。
[ORIGINAL DATA] 在奠基 HAI Engine 的 the 21 papers 中,出现了同样的基底选择:带模式的结构化数据是一等公民,预测回路建构于其上。Sisters ✅ 从有类型的画像与观测信号而非仅从自由文本起草场景。Oracle ✅ 在有类型的输出之间归一化。Shah 所描述的成本轮廓——「更窄的聚焦带来更锐利的技术」——正是我们观察到的:有类型的基底让你以同样预算跑更多预测,并在结果到来时重新运行。
为什么「有限算力」才是真正的约束
MIT 的报道反复回到资源限制。Shah:「用少量的资源,你必须做大量的重活。」系统为「在有限算力下秒级决策」而设计。这不是让步。它是迫使回路足够廉价以持续运行的设计约束。
一条太贵而无法重跑的预测回路,是一条会过时的回路。对结果的检验只有在你能负担得起、以业务实际决策的节奏(季度、周、小时)去施加时,才能改进模型。Shah 在文中举的消费电子例子很有说服力:耳机由来自世界各地的部件组装,定价、促销、支持、迭代。「在流程的每一个阶段,都必须做出在时间上有后果的决策。」节奏是连续的,所以回路必须廉价。
[PERSONAL EXPERIENCE] HAI Engine 之所以自 2016 年起在生产中运行,正是因为它被工程化为可廉价重跑。我们从那十年中汲取的教训,正是 Shah 所陈述的:回路的成本才是约束,而非首次预测的成本。一个一次性模型即便某次出色,却因更新太贵而无法重跑,其实不如一个更便宜、能在每次结果到来时重跑的模型有用。
拓扑在模型响应之前先路由
这是 MIT 文章未明说、但可由其自身逻辑推出的部分。Shah 指出,一家公司的所有流程——采购、定价、促销、支持、迭代——「相互依赖」。一个阶段的决策对其他每个阶段都有后果。在预测任何单一阶段之前,你必须把问题路由到业务的正确切片:哪个产品、哪个地区、哪个时间窗、哪类决策。
这就是「the space is the router」。在 Everythink,一个 network 包含 communities,一个 community 包含 rooms。一个 room 是一个有类型的上下文——一个队列、一个市场细分、一条产品线、一个地理区域。在 Sisters 起草、Oracle 合并之前,查询被路由到拥有该决策的 room。预测扎根于该 room 的有类型数据与已观测历史。路由在前,响应在后。
企业的等价物是:Shah 所描述的「数字层」——Celonis 已有的数字化运营——是一个路由层。它告诉模型哪个流程、哪个实体、哪条时间序列。没有这个路由,foundation model 就被要求从原始表格行中推断拓扑,而这恰恰是结构化数据 AI 本应避免的那种昂贵、嘈杂的重建。诚实的解读是:Celonis 通过数字化 1,400 家企业为路由层付了费,而 Ikigai 的预测栈之所以有价值,是因为它运行在一个已路由的基底之上。
Theorem 3 与企业流程模型
把各部分拼起来,「企业流程世界模型」就归约为一个定理形状的陈述:预测当且仅当对结果的检验回路已实现(预测、观测、更新)且正在测量(观测是一个真实的数字化结果,而非假设)时才被校准。去掉更新步骤,你得到一个静态预测器。去掉测量,你得到一个故事。两者齐备,你才得到媒体所称的世界模型。
这正是成熟度顺序为何重要。你无法通过收购一个模型来买下「世界模型」这个属性。你买下它的方式是先有数字化运营层(测量),再把预测与更新的回路叠加上去。Celonis 对 Ikigai 的收购,在机制上,就是第二层叠加到第一层之上。MIT 文章精确地描述了这一点:「一旦这些流程的数字层存在,且这个信息层存在,那么在其之上,我们就可以放上 Ikigai 的栈。」
Everythink 的类比是:HAI Engine ✅ 并非因为是一个聪明的模型而变得校准。它之所以校准,是因为 rooms(路由加测量层)已存在,并持续把已实现的结果回灌进回路。Oracle ✅ 是更新步骤。Sisters ✅ 是预测步骤。rooms 是观测层。Theorem 3 是这样的陈述:三者皆需,已接通、在运行。
我们保留什么、留下什么
来自 MIT 报道的几件事,值得任何构建预测驱动产品的人铭记:
- 基底先于模型。 结构化、有类型的数据是高性价比的基底。从这里开始。非结构化文本的绕行昂贵,且往往对所做决策而言不必要。
- 回路先于标签。 「世界模型」是一个能工作的回路的标签。把回路建起来——预测、观测、更新——标签会自我描述。先把标签建起来,你会把预算花在品牌上。
- 路由先于响应。 相互依赖的流程需要一个拓扑,在模型响应之前把问题路由到正确的上下文。那个拓扑就是 Shah 所描述的数字层;用我们的话说就是「the space is the router」。
- 回路成本才是约束。 相关预算不是一次预测的成本。而是以业务决策的节奏重跑预测的成本。如果回路负担不起,预测就会过时,校准就会破裂。
还有一件我们刻意留下的事:进攻性或针对个人的定向用例。MIT 的例子是消费电子定价与制药预测——民用、商用、防御性。Everythink 持守同样的范围边界。一条为需求规划而校准的预测回路,是同一套机器,我们不会将其改用于针对个人。机制是通用的;范围的伦理不是。
这与 Everythink 的关联
HAI Engine ✅ 是本文以研究形式所描述那条回路的生产实例。它自 2016 年起持续运行。Sisters ✅ 起草有类型的场景;Oracle ✅ 将它们合并为校准、归一化的集成;room 拓扑在任何东西响应之前路由每个查询。World Monitor ✅ 是地理信号的观测层——航班、船舶、地震、火灾、冲突、气象——作为已实现结果回灌。整个栈是 Theorem 3 的一个实例:校准预测这一属性成立,是因为机制(预测、观测、更新,通过 rooms 接通)已实现且正在测量。
将这条回路带入一个 network 的模块成熟度不一,我们不会拔高它们:Social ✅ 与 Campaigns ✅ 在生产中运行该回路;Matchmaking ⚠️、Marketplace ⚠️ 与 Calendar ⚠️ 部分运行;Wallet & Token 🔵、Super App 🔵 与 Community Credit 🔵 属 Roadmap,尚无营收,并须经 Howey 审查——我们不对它们作任何结果承诺。预测回路是处于 Production 的部分。token 层不是,我们如实说明。
要点小结
- 机制是对结果的检验。 Shah 的系统之所以有效,是因为它「持续用真实结果检验自身预测」。「世界模型」标签描述的是结果;回路才是原因。
- 表格数据是高性价比基底。 结构化、有类型的行是决策所在之处。从这里出发,才使 AI「具性价比」,用 Shah 的话说。
- 测量层必须先行。 Celonis 在预测栈被叠加之上前,先数字化了 1,400 家企业。观测步骤必须先存在,更新步骤才能运行。
- 回路成本是真正的约束。 有限算力不是让步;它是使回路在决策节奏下可负担地重跑的设计压力。
- Theorem 3 作出概括。 一个属性当且仅当其机制已实现且正在测量时才被保证。企业流程模型是一个实例;HAI Engine 是另一个。
常见问题
「世界模型」与一条校准的预测回路是同一回事吗? 不是。世界模型是一个系统用以预判结果的标签。一条校准的预测回路是机制——预测、观测、更新——它通过用真实结果检验预测并依据所测更新,才挣得那个标签。没有回路的标签只是营销。
为什么表格数据让 AI 更便宜? 表格行有类型且已与决策对齐:SKU、价格、日期、促销标志。模型无需把算力花在从非结构化输入中重建该结构上。Shah 把这称作「一种非常具性价比的 AI 版本」,数学上不过是每单位输入更高的信噪比。
这里「the space is the router」是什么意思? 在模型响应之前,查询被路由到 room——拥有该决策的有类型上下文。在企业类比中,数字化运营层就是那个路由:它告诉模型哪个流程、哪个实体、哪条时间序列。路由在前,响应在后。
Theorem 3 如何应用于 Ikigai 与 Celonis 的栈? Theorem 3 说,一个属性当且仅当其机制已实现且正在测量时成立。Ikigai 的预测当且仅当对结果的检验回路已接通(预测、观测、更新)且观测是一个真实的数字化结果时才被校准。Celonis 提供了测量层;Ikigai 提供了预测与更新的栈。两者齐备,才是保证。
Everythink 的预测与 Ikigai 的相同吗? 不同,但它们是同一定理的实例。HAI Engine ✅ 自 2016 年起在生产中运行一条有测量的预测回路,通过 rooms 路由,以 Oracle ✅ 作为更新步骤。基底与领域不同;机制——一条以真实结果检验的回路——相同。
阅读 the 21 papers,或创建你的 network,并在你的决策实际所在之处运行这条回路。
Sources
- 2026 — MIT News, "Helping AI models to meet the real world" — https://news.mit.edu/2026/helping-ai-models-meet-real-world-0714



