
エージェントの群れから較正された予測へ
型付けされた AI エージェントの群れがそれぞれもっともらしい未来を想像し、Oracle がその出力をクエリ可能な正規化された確率錐にマージします。群れは予測ではありません——マージこそが予測です。Everythink では、エージェントは Sisters と呼ばれ、マージャーは Oracle で、確率はただ一箇所でのみ正規化されます。その背後にあるエンジンは 2016 年から本番環境で稼働しています。
2026 年 7 月、BAIR Blog は、知能がほぼゼロコストに近づくにつれ、「各エンドユーザーリクエストに応じて立ち上げられるエージェントの群れ」が支配的なワークロードになると論じました。そしてより難しい問題は、群れの出力を生成することではなく、それらを調整し、永続化し、信頼することになりました(BAIR Blog, "Intelligence is Free, Now What? Data Systems for, of, and by Agents", 2026 年 7 月)。この投稿は、群れと予測の間で起こること、つまり 5 つの独立した想像を較正された錐に変えるマージについてのものです。
The Honest Architect の要点
- 群れは想像し、Oracle はマージします。確率はただ一箇所——
everythink-oracle::ensemble——でのみ正規化されるため、利用者はsum(probability) ≈ 1.0、シナリオの降順ソート、nat 単位のエントロピーに依存できます(Everythink、2016 年から本番稼働)。- 人格はコードではなくデータです。5 つの Sisters(analyst, contrarian, disruptor, historian, institutionalist)は TOML ファイルから読み込まれるため、人格の編集に再コンパイルは不要です。
- Sisters は Postgres に書き込みません——彼女たちは
SisterOutputを返し、Loom が永続化します。想像と永続化の分離こそ、予測を監査可能にする不変条件です。
なぜ群れにオラクルが必要なのか?
群れにオラクルが必要なのは、独立したエージェントが独立した出力を生成し、独立した出力は予測ではなく 5 つの意見だからです。2026 年 3 月、KDnuggets は AI エージェントを、推論のための大規模言語モデル、行動のためのツール、文脈のための記憶、そして制御ループと定義し、こう続けました。「ループとツールを取り除けば、もはやエージェントではありません。ただのチャットボットです」(KDnuggets, "10 Agentic AI Concepts Explained in Under 10 Minutes", 2026 年 3 月)。並行して走る 5 つのチャットボットは、やはり 5 つのチャットボットです。予測はその後に来るものです。
Oracle はまさにそれです。群れが生成した SisterOutput レコードを受け取り、それらを Ensemble にマージし、結果を正規化します。正規化は表面的なステップではありません。これがなければ、各自のシナリオに確率を割り当てる 5 つのエージェントが、5 つの互換性のない分布を生み出すでしょう——異なる支持集合、異なるスケール、共有単位なし。Oracle は、確率がほぼ 1 に和算し、シナリオが降順でソートされ、エントロピーが nat 単位の単一の分布を生成することで、これを解決します。利用者はその錐を問い合わせ、数値が比較可能であると信頼できます。
マージが想像と分離されている理由は、校正者が著者と分離されている理由と同じです。2026 年 5 月、BAIR Blog による Adaptive Parallel Reasoning の分析は、自己整合性を「複数の完全な推論トレースを独立にサンプリングし最も一般的なものを返す」とし、Best-of-N を「訓練された検証器を使って最良のものを選ぶ」としました——どちらも単純、どちらも "redundant computation across branches since trajectories are sampled independently" を被る(BAIR Blog, "Adaptive Parallel Reasoning: The Next Paradigm in Efficient Inference Scaling", 2026 年 5 月)。Everythink の Oracle は投票者より検証器に近いです。頭数を数えるだけでなく、互換性のない支持集合を単一の正規化分布に調和させます。
人格はどうやってコードではなくデータになるのか?
人格がコードではなくデータなのは、人格がコンパイルされた振る舞いではなく、実行時に読み込まれる TOML ファイルだからです。各 Sister —— analyst, contrarian, disruptor, historian, institutionalist —— は backend/crates/everythink-sisters/personalities/*.toml から読み込まれる Personality です。ひとつの編集に再コンパイルは要りません。TOML の中のプロンプトバージョンが毎回の実行で刻印されるため、予測は再現可能です。それを生成した人格は識別され、バージョン付きで、監査可能です。
[UNIQUE INSIGHT] 人格をデータとする選択は、群れの多様性とその監査可能性の背後にある機構です。ほとんどのエージェントフレームワークは、人格をコードの奥に埋もれたシステムプロンプト文字列として符号化し、バージョン印なしに変更します。Everythink の TOML 人格は毎回の実行に刻印されたプロンプトバージョンを持ちます。そのため、1 週間離れて生成された 2 つの予測は、どの人格バージョンがそれを生成したかに基づいて比較できます。それを生成した「心」のバージョンを識別できなければ、予測を較正することはできません。TOML が来歴です。
5 つの Sisters は恣意的ではありません。彼女たちは型付けされています —— analyst, contrarian, disruptor, historian, institutionalist —— 同じアクターに対するそれぞれ異なるレンズです。analyst は分解し、contrarian は合意に抵抗し、disruptor は破断をモデル化し、historian は先例に錨を下ろし、institutionalist は組織が直面する制約をモデル化します。5 人の analyst が生成した予測は、分散が低く情報も低いでしょう。意見の合わない 5 つの型は、より広い支持とより正直なエントロピーを生み出します——そしてエントロピーは Oracle が報告するもののひとつです。
正規化はどこで、なぜ一度だけなのか?
正規化はただ一箇所——everythink-oracle::ensemble——で、しかも一度だけ行われます。なぜなら、2 箇所で正規化すると、どちらでもない分布ができるからです。これはプラットフォームの明示された不変条件です。確率はただ一箇所で正規化され、利用者は sum(probability) ≈ 1.0、シナリオの降順ソート、nat 単位のエントロピーに依存できます。再正規化する利用者は異なる分布を生成しており、それは予測ではありません。
[ORIGINAL DATA] 単一サイトの正規化不変条件は、the 21 papers の学術シリーズを機械化したものです。プラットフォームの概論論文は Theorem 3 を形式化します。ある性質は、その機構が実装され測定されているときにのみ保証されます。正規化はそのような性質のひとつです。機構は ensemble モジュール、測定は確率が 1 に和算すること、シナリオがソートされていること、エントロピーが計算されていることです。第 2 のサイトに再正規化を許せば、その性質はもはや単一の機構で保証されなくなります——それは第 2 サイトが生成するものになり、利用者には区別できません。この不変条件は好みの問題ではありません。契約です。
実用的な帰結は、すべての下流利用者——API、Console、Ledger——が Oracle の出力を正典として扱うということです。Sisters の生の出力は予測ではなく、予測として公開されません。Loom が永続化するのは個々の下書きではなくマージされた Ensemble なので、クエリは正規化された錐を返し、誰かが手で調和させる 5 つの互換性のない分布を返すことはありません。
確率錐が較正されているとはどういうことか?
確率錐は、確率が比較可能で、シナリオが順序付けられ、エントロピーが定義された単位で報告されるときに較正されています。Everythink では、確率がほぼ 1 に和算し、シナリオが降順でソートされ、エントロピーが nat 単位であることを意味します。錐は単一の点推定ではなく、シナリオ上の分布であり、エントロピーは利用者に分布がどれだけ広がっているか——マージの後、群れがどれだけ不確かだったか——を伝えます。
較正は精度と同じではなく、両者を混同することはベンチマーク文献が繰り返し指摘する誤りです。2026 年 4 月、MarkTechPost のエージェント推論ベンチマーク調査は、τ-bench が「ほとんどのワンショットベンチマークが完全に盲目である信頼性危機」を露呈すると述べました——トップの関数呼び出しエージェントでも 50% 未満のタスクでしか成功せず、小売ドメインでは pass^8 が 25% を下回り、「1 回の試行でタスクをこなせるエージェントが同じタスクを 8 回連続で確実にこなせるわけではない」ことを意味します(MarkTechPost, "Top 7 Benchmarks That Actually Matter for Agentic Reasoning in Large Language Models", 2026 年 4 月)。1 回想像して予測を宣言する群れは、その種のワンショットシステムです。Oracle は予測を、単一の試行ではなく、マージされた分布の性質にします。
Adaptive Parallel Reasoning の文献は訓練側から同じ点を指摘しています。BAIR Blog は、構造のみの報酬は「too easy to game」——モデルがスレッド数報酬をハックするために短く無駄なスレッドを大量に生成する——と報告し、並行効率は「gated by correctness」であるべきだとしました(BAIR Blog, "Adaptive Parallel Reasoning", 2026 年 5 月)。Everythink の等価物はこうです。Oracle は Sisters により多くのシナリオを想像したことで報いません。彼女たちが生成したものを正規化します。ほぼ重複する 10 個のシナリオを下書きした Sister が 10 票得ることはありません。マージは重み付けされ、支持は調和され、エントロピーは言葉の多さではなく真の不一致を反映します。
群れは自分自身の限界についてどう正直であり続けるのか?
群れはプラットフォームの残りの部分と同じ方法で、自分の限界について正直であり続けます。各コンポーネントの本当の成熟度を述べ、状態を昇格させないことです。HAI engine、Sisters、Oracle の ensemble の数学、予測を永続化する Loom は ✅ Production です——それらは稼働しており、それぞれの背後にある機構は実装され測定されています。それが Theorem 3 の検査です。Whitelabel Network と Social は ✅ Production です。Matchmaking と Marketplace は ⚠️ Partial ——有用だが未完成。ネットワークごとの Wallet & Token、Community Credit 層、ネットワーク間のフェデレーションは 🔵 Roadmap ——設計作業、収益化前、未稼働、Production として提示されません。
この正直さは口調ではありません。予測に適用される検査です。確率錐は主張であり、主張はその背後にある機構と同じだけの価値しかありません。Oracle の正規化が機構であり、sum(probability) ≈ 1.0 チェックが測定です。もし Oracle が測定していなければ、予測は Production ではなく、私たちはそう言います。これが BAIR Blog が求めた規律です。同 Blog は、現代のエージェントが「仕様の欠落を突いてハイパフォーマンス指標を報酬ハックする」と警告し、緩和策のひとつとして生成と「auxiliary verification agents」を組み合わせることを挙げました(BAIR Blog, "Intelligence is Free, Now What?", 2026 年 7 月)。Everythink の検証は第 2 のエージェントではなく、マージにおけるただひとつの検査された不変条件です。
これが重要なのは、買い手が形容詞ではなく推論を審査できるときにだけ予測が有用だからです。「確率 70%、TOML にバージョン印された 5 つの型付き人格で生成、1 箇所で正規化、エントロピー 1.2 nat」と言う錐は審査可能な主張です。機構が見える。成熟度がタグ付けされている。状態は昇格されていない。
Loom とは何か、なぜ Sisters は Postgres に書き込まないのか?
Loom は予測を永続化するオーケストレータであり、Sisters が Postgres に書き込まないのは、想像するものが記憶するものであるべきではないからです。Everythink のアーキテクチャでは、シミュレーションは次のように走ります。API が認証と検証を行い、Loom がプロファイルを解決してシミュレーション行を挿入し、各 Sister が imagine() して SisterOutput を返し、Oracle が出力を正規化された Ensemble に merge() し、Ledger がシナリオと foresight を永続化します。Sisters は返します。書き込みません。
[PERSONAL EXPERIENCE] このエンジンは 2016 年から本番稼働しており、想像と永続化の分離はその中で最も古い不変条件です。Postgres に書き込める Sister は、記録に嘘を書き込める Sister です。Loom に SisterOutput を返す Sister は提案することしかできません。Loom が処分します——何を、どの形で、どの来歴で永続化するかを決めるのです。同じ分離が、人格がデータである理由でもあります。想像は構成可能、永続化は固定、2 つはコードパスを共有しません。
BAIR Blog の「Data Systems Of Agents」節は隣接する論証を行いました。何千ものエージェントが共有状態を編集するとき、"the effects of the vast majority of these transactions need to be rolled back — with only the one 'correct' transaction's result persisting" であり、exactly-once セマンティクスと操作変換が関連するツールキットです(BAIR Blog, "Intelligence is Free, Now What?", 2026 年 7 月)。Everythink の Loom は同じ原則の、より単純でより初期の実例です。Sisters の下書きは暫定的であり、Oracle のマージこそが意味を持ち、Ledger がマージを書き込みます。Sisters が個別に生成したものは、予測として永続化されることはありません。
予測はどうやってクエリに届くのか?
予測はプラットフォーム上の他のレコードと同様にクエリに届きます。API を通じて、/api/v1/... の下で、Eye-Key レジームで認証され、キーごとのレート制限付きです。マージされた Ensemble はシナリオと foresight として永続化され、クエリは生の下書きではなく正規化された錐を返します。利用者が必要とするのは分布であり、Ledger が格納するのも分布です。
ここで単一サイト正規化の不変条件が下流で効いてきます。Oracle が正規化する唯一のサイトであるため、すべての利用者——API、Console、サードパーティ SDK——が同じ分布を読みます。ドリットしうる「読み取り時の再正規化」ステップは存在しません。1 か月後に予測を問い合わせる買い手は、永続化された時と同じ確率を受け取ります。
よくある質問
Sisters の個別の下書きは予測の一部として公開されますか?
いいえ。Sisters は Loom に SisterOutput レコードを返し、Oracle はそれらを正規化された Ensemble にマージし、Ledger はマージされた Ensemble をシナリオと foresight として永続化します。クエリは 5 つの下書きではなく錐を返します。単一サイト正規化の不変条件は、生の下書きではなくマージされた分布が正典であることを意味します。
Sister の人格の編集にコードリリースは必要ですか?
いいえ。各 Sister は backend/crates/everythink-sisters/personalities/ 内の TOML ファイルから読み込まれる Personality です。TOML の編集に再コンパイルは不要です。プロンプトバージョンが毎回の実行で刻印されるため、予測の来歴にはそれを生成した人格バージョンが含まれます。これが群れの多様性とその監査可能性の背後にある機構です。
ここで「較正」とは何を意味し、精度の保証ですか?
較正とは、確率が比較可能であること——sum(probability) ≈ 1.0、シナリオの降順ソート、nat 単位のエントロピー——を意味し、Oracle における単一の正規化ステップで生成されます。予測が未来と一致する保証ではありません。MarkTechPost のベンチマーク調査が指摘したように、エージェントのスコアは「highly scaffold-dependent」であり、数字を単独で読むべきではありません(MarkTechPost, "Top 7 Benchmarks That Actually Matter for Agentic Reasoning in Large Language Models", 2026 年 4 月)。較正は予測を審査可能にします。正しくするわけではありません。
wallet や community-credit 層は予測の評価に使われますか?
いいえ。ネットワークごとの Wallet & Token と Community Credit は 🔵 Roadmap ——収益化前、未実装、ローンチ前に Howey 審査の対象です。wallet や token 層には何も本番環境で動いているものはなく、ここには金融・投資・法的助言は一切ありません。予測は確率錐であり、価格付けされた金融商品ではありません。
Oracle を変えずに Sister を追加・削除できますか?
Oracle は Loom から渡された SisterOutput レコードをマージします。Sister を追加するとは、人格 TOML を追加しファンアウトに接続することです。everythink-oracle::ensemble のマージロジックは人格ごとには変わりません。正規化サイトは 1 つのままです。錐のエントロピーは新しい型の構成を反映します——より幅広いレンズの集合は、より幅広くあるいは異なる重み付けの支持を生み出すべきであり、Oracle はそれを正直に報告します。
群れは想像する。オラクルはマージする。予測はそのマージである——1 箇所で正規化され、Loom によって永続化され、その背後にある各コンポーネントの本当の成熟度がタグ付けされています。5 つの型付き Sisters が、2016 年から本番稼働するプラットフォーム上で較正された確率錐にどうなるかを見たいなら、論文を読むか、デモを予約してください。
Sources
- BAIR Blog, "Intelligence is Free, Now What? Data Systems for, of, and by Agents", retrieved 2026-08-23, https://bair.berkeley.edu/blog/2026/07/07/intelligence-is-free-now-what/
- BAIR Blog, "Adaptive Parallel Reasoning: The Next Paradigm in Efficient Inference Scaling", retrieved 2026-08-23, https://bair.berkeley.edu/blog/2026/05/08/adaptive-parallel-reasoning/
- KDnuggets, "10 Agentic AI Concepts Explained in Under 10 Minutes", retrieved 2026-08-23, https://www.kdnuggets.com/10-agentic-ai-concepts-explained-in-under-10-minutes
- MarkTechPost, "Top 7 Benchmarks That Actually Matter for Agentic Reasoning in Large Language Models", retrieved 2026-08-23, https://www.marktechpost.com/2026/04/26/top-7-benchmarks-that-actually-matter-for-agentic-reasoning-in-large-language-models/

チャットボットは AI のオペレーティングシステムではない
チャットボットは答え、AI のオペレーティングシステムは経路を決める。なぜアシスタントではなく空間がルータでなければならないのか、そしてその違いが、AI が組織を助けるのかそれとも飾るだけなのかを決めるのか。
→ →
応用型の産業インテリジェンスが生の情報に勝る理由
情報だけではサプライチェーンを動かせない。適用し、地理空間化し、意思決定として予測してはじめて動く——それがダッシュボードとオペレーティングシステムの違いである。
→ →
USMCAの不確実性は予測可能なコーンであり、謎ではない
Honest ArchitectによるUSMCA不確実性の読み解き:不確実性はシナリオのコーンを持つ予測可能な変数であり、待つべき謎ではない。定理3 — プロパティ(良好な投資決定)はメカニズム(シナリオ予測 + エントロピー測定)によって保証され、不確実性の不在によって保証されるのではない。
→ →自らの主張を証明するエンジンの上に、あなたの世界を築く。
2016 年から稼働し続けるエンジンの上に、あなた自身のネットワークを作る——あるいは 21 本の論文を書いたチームに話しかける。
