
从智能体集群到校准的预测
一群有类型的 AI 智能体各自构想一个合理的未来;一个 Oracle 把它们的输出合并成一个你可以查询的归一化概率锥。集群不是预测——合并才是。在 Everythink 上,这些智能体叫做 Sisters,合并者是 Oracle,而概率只在一处归一化。其背后的引擎自 2016 年起就在生产环境运行。
2026 年 7 月,BAIR Blog 指出,随着智能逼近零成本,“针对每个终端用户请求拉起的智能体集群”将成为主导工作负载——更难的问题不再是生成集群的输出,而是协调、持久化并信任它们(BAIR Blog,"Intelligence is Free, Now What? Data Systems for, of, and by Agents",2026 年 7 月)。这篇文章讲的是集群与预测之间发生的事:把五种独立的想象合并成一个校准锥的那次合并。
The Honest Architect 的要点
- 集群负责想象;Oracle 负责合并。概率只在唯一一处归一化——
everythink-oracle::ensemble——因此消费者可以依赖sum(probability) ≈ 1.0、场景按降序排列、熵以 nats 计(Everythink,自 2016 年起在生产环境运行)。- 人格是数据,不是代码:五个 Sisters(analyst、contrarian、disruptor、historian、institutionalist)从 TOML 文件加载,因此编辑人格无需重新编译。
- Sisters 从不写入 Postgres——它们返回
SisterOutput;由 Loom 来持久化。想象与持久化的分离,是让预测可审计的那条不变式。
为什么一个集群需要一个 oracle?
一个集群需要一个 oracle,因为独立的智能体产生独立的输出,而独立的输出不是预测——它们是五种意见。2026 年 3 月,KDnuggets 把 AI 智能体定义为一个用于推理的大语言模型、用于行动的工具、用于上下文的记忆以及一个控制循环,并直白地补充道:"如果你去掉循环和工具,你就不再有一个智能体。你只有一个聊天机器人"(KDnuggets,"10 Agentic AI Concepts Explained in Under 10 Minutes",2026 年 3 月)。五个并行运行的聊天机器人仍是五个聊天机器人。预测是之后才出现的东西。
Oracle 就是那个东西。它接收集群产生的 SisterOutput 记录,把它们合并成一个 Ensemble,并对结果归一化。归一化不是装饰性步骤。没有它,五个各自给自己的场景赋概率的智能体会产生五种不兼容的分布——支撑集不同、尺度不同、没有共享单位。Oracle 通过产生一个概率之和约为 1、场景按降序排列、熵以 nats 计的单一分布来解决这个问题。消费者可以查询这个锥,并相信这些数字是可公度的。
合并之所以与想象分离,就像审稿人与作者分离一样。2026 年 5 月,BAIR Blog 对 Adaptive Parallel Reasoning 的分析把自一致性描述为独立采样多条完整推理轨迹并返回最常见的那条,把 Best-of-N 描述为用一个训练好的验证器选出最好的——两者都简单,两者都"redundant computation across branches since trajectories are sampled independently"(BAIR Blog,"Adaptive Parallel Reasoning: The Next Paradigm in Efficient Inference Scaling",2026 年 5 月)。Everythink 的 Oracle 更接近验证器而非投票器:它不只是数人头,它把不兼容的支撑集调和成单一的归一化分布。
人格怎么是数据而不是代码?
人格是数据而不是代码,因为一个人格是一个在运行时加载的 TOML 文件,而不是一段编译进去的行为。每个 Sister——analyst、contrarian、disruptor、historian、institutionalist——都是一个从 backend/crates/everythink-sisters/personalities/*.toml 加载的 Personality。编辑它无需重新编译。TOML 中的 prompt 版本在每次运行时盖戳,因此一次预测是可复现的:产生它的人格被识别、被版本化、可审计。
[UNIQUE INSIGHT] 人格即数据这一选择,是集群多样性与可审计性背后的机制。大多数智能体框架把人格编码成埋在代码里的系统 prompt 字符串,变更时不带版本戳。Everythink 的 TOML 人格在每次运行都带有盖戳的 prompt 版本,因此一周前后的两次预测可以按产生它们的人格版本进行比较。如果你无法识别产生预测的那颗"心智"的版本,你就无法校准预测。TOML 就是溯源信息。
这五个 Sisters 不是随意选的。它们是有类型的——analyst、contrarian、disruptor、historian、institutionalist——每一个都是对同一个行为者的不同视角。analyst 分解;contrarian 抵制共识;disruptor 建模断裂;historian 锚定先例;institutionalist 建模一个组织所处的约束。如果由五个 analyst 产出预测,方差低、信息量低。五个相互分歧的类型产生更宽的支撑集和更诚实的熵——而熵正是 Oracle 报告的内容之一。
归一化在哪里发生,为什么只发生一次?
归一化只在唯一一处发生——everythink-oracle::ensemble——而且只发生一次,因为在两处归一化会得到一个既不是这两个中任何一个的分布。这是平台的一条声明不变式:概率只在唯一一处归一化,消费者可以依赖 sum(probability) ≈ 1.0、场景按降序排列、熵以 nats 计。任何对它再归一化的消费者都在产生一个不同的分布,而那个分布不是预测。
[ORIGINAL DATA] 单点归一化不变式,是把 the 21 papers 这套学术系列落到机制上。平台的综述论文形式化了 Theorem 3:一个性质当且仅当其机制被实现且被测量时才被保证。归一化就是这样一种性质。机制是 ensemble 模块;测量是概率之和为 1、场景已排序、熵已被计算。如果允许第二个站点再归一化,这个性质就不再由单一机制保证——它会变成第二个站点产出的东西,而消费者无法分辨。这条不变式不是风格偏好。它是一份契约。
实际后果是,每一个下游消费者——API、Console、Ledger——都把 Oracle 的输出当作权威。Sisters 的原始输出不是预测,也不会被当作预测暴露。Loom 持久化的是合并后的 Ensemble,而不是各个草稿,因此一次查询返回的是归一化的锥,而不是五份要靠人手工调和的不兼容分布。
什么让一个概率锥是校准过的?
当一个概率锥的概率是可公度的、其场景是有序的、其熵以定义好的单位报告时,它就是校准过的。在 Everythink 上,这意味着概率之和约为 1、场景按降序排列、熵以 nats 计。锥不是单一点估计;它是对场景的分布,而熵告诉消费者这个分布有多分散——合并之后,这个集群有多不确定。
校准不等于精度,把两者混为一谈正是基准文献反复指出的那个错误。2026 年 4 月,MarkTechPost 对智能体推理基准的综述指出,τ-bench"exposes a reliability crisis that most one-shot benchmarks are completely blind to"——即使最优秀的函数调用智能体也只在不到 50% 的任务上成功,而 pass^8 在零售领域跌破 25%,意味着"an agent that can handle a task in one trial cannot reliably handle the same task eight times in a row"(MarkTechPost,"Top 7 Benchmarks That Actually Matter for Agentic Reasoning in Large Language Models",2026 年 4 月)。一个想象一次就宣布预测的集群,就是那种单次系统。Oracle 让预测成为合并分布的性质,而不是任何单次试验的性质。
Adaptive Parallel Reasoning 的文献从训练侧讲出了同样的观点。BAIR Blog 报道,仅结构奖励"too easy to game"——模型会生成大量短而无用的线程去刷线程数奖励——而并行效率应当"gated by correctness"(BAIR Blog,"Adaptive Parallel Reasoning",2026 年 5 月)。Everythink 的等价做法是:Oracle 不奖励 Sisters 想象更多场景;它归一化她们产出的东西。一个草拟了十个近乎重复场景的 Sister 不会得到十票。合并是加权的,支撑集是被调和的,而熵反映的是真正的分歧,而不是语言上的音量。
集群如何对自己能力的边界保持诚实?
集群对自己边界的诚实方式,和平台其余部分一样:陈述每个组件的真实成熟度,从不拔高状态。HAI engine、Sisters、Oracle 的 ensemble 数学、以及持久化预测的 Loom 都是 ✅ Production——它们在运行,且每个背后的机制都已实现并正在测量,这正是 Theorem 3 的检验。Whitelabel Network 和 Social 是 ✅ Production。Matchmaking 和 Marketplace 是 ⚠️ Partial——有用,未完成。每网的 Wallet & Token、Community Credit 层、以及网络之间的联邦是 🔵 Roadmap——设计阶段的工作、未产生收入、未上线,也未作为 Production 呈现。
这种诚实不是一种语气。它是对预测施加的一项检验。一个概率锥是一项主张,而一项主张只和它背后的机制一样可靠。Oracle 的归一化是机制;sum(probability) ≈ 1.0 检查是测量。如果 Oracle 不在测量,预测就不是 Production,我们会如实说明。这正是 BAIR Blog 所要求的纪律:它警告当今的智能体"exploit the missing specifications to reward-hack their way to a high performance metric",而一种缓解手段是把生成与"auxiliary verification agents"配对(BAIR Blog,"Intelligence is Free, Now What?",2026 年 7 月)。Everythink 的验证不是第二个智能体;它是合并中一条被检查的不变式。
这件事重要,因为只有当买家能审阅推理、而不是审阅形容词时,预测才有用。一个写着"概率 70%,由五个在 TOML 中盖戳版本的有类型人格产出、在单一站点归一化、熵 1.2 nats"的锥,是一项可审阅的主张。机制可见。成熟度有标注。状态没有被拔高。
Loom 是什么,为什么 Sisters 不写 Postgres?
Loom 是持久化预测的编排者,而 Sisters 不写 Postgres,因为负责想象的东西不应是负责记忆的东西。在 Everythink 的架构里,一次模拟这样运行:API 鉴权并校验,Loom 解析档案并插入模拟记录行,每个 Sister 调用 imagine() 并返回一个 SisterOutput,Oracle 对这些输出 merge() 成一个归一化的 Ensemble,再由 Ledger 持久化场景与 foresight。Sisters 返回;它们不写入。
[PERSONAL EXPERIENCE] 这个引擎自 2016 年起在生产环境运行,而想象与持久化的分离是其中最古老的不变式。一个能写 Postgres 的 Sister,就是一个能向记录里撒谎的 Sister。一个把 SisterOutput 返还给 Loom 的 Sister 只能提议;Loom 来处置——它决定持久化什么、以什么形式、带什么溯源。同样这种分离也是人格是数据的原因:想象是可配置的,持久化是固定的,两者不共享代码路径。
BAIR Blog 的"Data Systems Of Agents"那一节给出了相邻的论证:当成千上万的智能体编辑共享状态时,"the effects of the vast majority of these transactions need to be rolled back — with only the one 'correct' transaction's result persisting",而 exactly-once 语义与操作变换是相关的工具箱(BAIR Blog,"Intelligence is Free, Now What?",2026 年 7 月)。Everythink 的 Loom 是同一原则更早、更简单的实例:Sisters 的草稿是试探性的,Oracle 的合并才是算数的那次,而 Ledger 写入的是合并结果。Sisters 各自产出的东西,没有任何一份作为预测被持久化。
预测如何到达一次查询?
预测像平台上任何其他记录一样到达一次查询:通过 API,在 /api/v1/... 之下,由 Eye-Key 机制鉴权并带有每密钥的速率限制。合并后的 Ensemble 被持久化为场景与 foresight;一次查询返回的是归一化锥,而不是原始草稿。消费者要的是分布,而 Ledger 存的就是分布。
正是在这里,单点归一化不变式在下游产生了回报。由于 Oracle 是唯一归一化的站点,每一个消费者——API、Console、第三方 SDK——读到的都是同一个分布。不存在一个可能在读取时漂移的"读时再归一化"步骤。一个月后查询预测的买家,拿到的是当初持久化时的那些概率。
常见问题
Sisters 的各自草稿会作为预测的一部分暴露吗?
不会。Sisters 把 SisterOutput 记录返回给 Loom;Oracle 把它们合并成一个归一化的 Ensemble;Ledger 把合并后的 Ensemble 持久化为场景与 foresight。查询返回的是锥,而不是五份草稿。单点归一化不变式意味着被合并的分布——而非原始草稿——才是权威产物。
修改一个 Sister 的人格需要一次代码发布吗?
不需要。每个 Sister 都是一个从 backend/crates/everythink-sisters/personalities/ 下 TOML 文件加载的 Personality。编辑 TOML 不需要重新编译。prompt 版本在每次运行时盖戳,因此一次预测的溯源信息包含产生它的人格版本。这正是集群多样性与其可审计性背后的机制。
"校准"在这里是什么意思,是精度的保证吗?
校准意味着概率是可公度的——sum(probability) ≈ 1.0、场景按降序排列、熵以 nats 计——由 Oracle 中单一归一化步骤产出。它并不保证预测会与未来相符。正如 MarkTechPost 的基准综述所指出的,智能体分数"highly scaffold-dependent",任何数字都不应孤立解读(MarkTechPost,"Top 7 Benchmarks That Actually Matter for Agentic Reasoning in Large Language Models",2026 年 4 月)。校准让预测可被审阅;它并不让预测正确。
wallet 或 community-credit 层是否用于为预测定价?
没有。每网的 Wallet & Token 与 Community Credit 是 🔵 Roadmap——未产生收入、未实现、在任何上线前须经过 Howey 审查。wallet 或 token 层没有任何东西上线,此处也没有任何金融、投资或法律建议。预测是一个概率锥,不是一个被定价的工具。
能否在不改动 Oracle 的情况下加入或移除一个 Sister?
Oracle 合并的是 Loom 交给它的 SisterOutput 记录。加入一个 Sister 意味着加入一个人格 TOML 并把它接入 fan-out;everythink-oracle::ensemble 中的合并逻辑不随人格改变。归一化站点仍是一处。锥的熵会反映新的类型组合——一组更宽的视角应当产生更宽或权重不同的支撑集,而 Oracle 会诚实地报告它。
集群想象。oracle 合并。预测就是这次合并——在一处归一化、由 Loom 持久化、并为它背后每个组件标注真实成熟度。如果你想看五个有类型的 Sisters 如何在一个自 2016 年起在生产环境运行的平台上演变成一个校准的概率锥,阅读论文 或 预约一次 demo。
Sources
- BAIR Blog, "Intelligence is Free, Now What? Data Systems for, of, and by Agents", retrieved 2026-08-23, https://bair.berkeley.edu/blog/2026/07/07/intelligence-is-free-now-what/
- BAIR Blog, "Adaptive Parallel Reasoning: The Next Paradigm in Efficient Inference Scaling", retrieved 2026-08-23, https://bair.berkeley.edu/blog/2026/05/08/adaptive-parallel-reasoning/
- KDnuggets, "10 Agentic AI Concepts Explained in Under 10 Minutes", retrieved 2026-08-23, https://www.kdnuggets.com/10-agentic-ai-concepts-explained-in-under-10-minutes
- MarkTechPost, "Top 7 Benchmarks That Actually Matter for Agentic Reasoning in Large Language Models", retrieved 2026-08-23, https://www.marktechpost.com/2026/04/26/top-7-benchmarks-that-actually-matter-for-agentic-reasoning-in-large-language-models/



