
OWASP GenAI Security Project が 2026 年に発表した報告書は、ほとんどの AI レッドチーム演習が間違ったものを測っていると主張している——効いたジェイルブレイクプロンプト——そしてそれをセキュリティと呼ぶ。現実のリスク表面は機構である:ツール誤用、マルチエージェントシステムでの権限昇格、RAG でのデータ漏洩。報告書の評価フレームワークは、私たちの言葉で言えば、セキュリティに適用された Theorem 3 である:ある性質は、その機構が実装され測定しているときに限って保証される。
ジェイルブレイクのデモは表面であり、保証ではない
OWASP 報告書は、私たちが即座に認識する診断で始まる:組織は、プロンプトベースのテストを実行しただけで「安全」だと信じ、エージェント的アーキテクチャ、ツール統合、ワークフロー自動化が持ち込む体系的リスクを無視している。報告書はこれを「security theater」と呼ぶ——チャット表面を測るデモが、その下にあるシステムについて何も黙認しない。
[UNIQUE INSIGHT] これは Theorem 3 が一般形で名指すのと同じ誤りである:ある性質は、その機構が実装され測定しているときに限って保証される。チャットボットに対して成功するジェイルブレイクは、チャットボットの拒絶機構を測る。それはツール呼び出しパス、検索拡張パス、マルチエージェント引き渡しパス、Model Context Protocol 統合パスを測らない。それぞれが独立した機構であり、独立した故障モードを持つ。一つを認証することは一つを認証することである。
報告書の貢献は、ベンダーがこれらを混同することを止めさせる点にある。単純な GenAI システム——チャットボット、コパイロット、RAG アプリ——を高度なシステム——ツールを呼ぶエージェント、MCP アーキテクチャ、マルチエージェントワークフロー——から区別する。それぞれに異なるリスクプロファイルがある。ハルシネーションが前者を支配し、ツール誤用と権限昇格が後者を支配する。前者だけをテストするレッドチームは、後者のためのレッドチームではない。それはデモである。
なぜデモではなく機構がセキュリティの単位なのか
OWASP フレームワークは評価を十の次元で構成する:技術的コンピテンス、方法論とカバレッジ、敵対的創造性、脅威モデリングの現実性、評価の厳密性と指標、ツールとインフラ、データガバナンス、透明性と説明可能性、カスタマイズと統合、そして法務・コンプライアンス姿勢。注意深く読めば、各次元は実装され測定されなければならない機構である——ベンダーが主張できる形容詞ではない。
指標の次元を考えよ。報告書は pass@k(k 回の独立試行のうち少なくとも一回が成功する確率)と Average Turns to Jailbreak を導入する。これらは虚栄の数ではない。それらは測定機構である:pass@k は故障が稀か単にまだ観測されていないかを教え、Average Turns to Jailbreak はシステムが持続的圧力下で優雅に劣化するか三ターン目で崩壊するかを教える。これらの機構なしに「12 の脆弱性を発見した」と報告するベンダーは、保証ではなく計数を報告している。
[ORIGINAL DATA] Theorem 3 は、Everythink の forecasting エンジンを基礎づける the 21 papers に由来し、原則を一行で述べる:ある性質は、その機構が実装され測定しているときに限って保証される。OWASP 報告書は、セキュリティコミュニティが反対方向から同じ一行に到達したものである——十分な数のジェイルブレイクデモが、その後に本番で失敗したシステムを認証した後、唯一の誠実な応答は、デモがどの機構を測ったか、そしてその機構が配備において性質を保持する機構かどうかを問うことである。
ルーティング境界こそが現実の攻撃面のある場所
報告書は単純なシステムと高度なシステムを区別するが、私たちが名指すであろうものを名指さない:トポロジーがルーティングするとき、攻撃面は移動する。チャットボットは一つの面を持つ——プロンプト。ツールを呼び、コーパスから検索し、第二のエージェントに引き渡すエージェントは、各引き渡しに面を持つ。ツールを呼ぶ権限、検索のスコープ、引き渡しで移転される信頼——それぞれがルーティング決定であり、各ルーティング決定は、相手がフローをリダイレクトしようと図る場所である。
だから「the space is the router」は私たちにとって単なる製品スローガンではない。Everythink のトポロジー——network → community → room——は、何かが応答する前にリクエストをルーティングする。room はスコープ、community は信頼境界、network は主権境界である。エージェントが room 内で行動することを許す権限はルーティング決定であり、それこそ相手が買収したい決定である。プロンプトをテストしルーティング境界をテストしないレッドチームは、金庫ではなくロビーをテストしている。
[PERSONAL EXPERIENCE] HAI Engine は 2016 年から本番で稼働し、私たちにとって重要な敵対的評価は常にルーティング境界にあった——リクエストが到達すべきでない room に届くか、スコープが昇格されるか、引き渡しが権限を漏らすか。OWASP 報告書のマルチエージェント汚染と MCP 誤用への強調は、より広い聴衆に向けられた同じ強調である。機構は境界、デモはプロンプト。
報告書が正しく捉えているもの、そして運用者に残しているもの
報告書は調達のレンズで強い。買手がすぐに使える green flags と red flags、コンサルタント対ツールの比較マトリクス、技術・運用・ガバナンス次元にわたるスコアリングチェックリストを提供する。green flags——完全な攻撃チェーン、エージェントの追跡可能性、再現性、公開ジェイルブレイクライブラリの再利用ではなく新規攻撃の設計——はそれぞれ測定機構である。red flags——見出しとしてのジェイルブレイクデモ、pass@k なし、Average Turns なし、NIST AI RMF や ISO 42001 や EU AI Act へのマッピングなし——はそれぞれ欠けた機構である。
運用者がまだ補わなければならない三つの点で弱い。第一に、ベンダー評価に焦点を当て、内部レッドチーム能力やハイブリッドモデルの構築については手引きが少ない。第二に、規制フレームワークを参照しつつ、基準を具体的なコンプライアンス義務に深くマッピングしない——EU AI Act 下の適合性評価は読者に委ねられる。第三に、比較的高い技術的成熟度を前提とする;AI の旅の初期にある組織は、報告書が提供しないテンプレートを必要とする。
私たちはこれらの隙間を、報告書が自身のスコープについて正直であると読む。それは調達フレームワークであり、運用マニュアルではない。運用者の仕事——報告書が名指すが完了させない——は、測定機構を取り、それらを継続的に実行することであり、調達時に一度ではない。
報告書が指標に求める単一機構の規律
報告書の指標セクションは、私たちの読みでは、最も静かで最も重要な貢献である。pass@k、Average Turns to Jailbreak、再現性、観測可能性、エージェントの追跡可能性を求める。それぞれが測定可能な信号を生む単一機構である。その背後にある規律は、私たちが Oracle について守るのと同じである:確率は正確に一つの場所——ensemble モジュール——で正規化され、すべての消費者は sum(probability) ≈ 1.0 に依存できる。一つの機構、一つの保証。
十の指標を「risk score」に束ねるレッドチーム報告書は、正規化がどこで起きるかを言わずに十のモデルを一つの数に束ねる forecast と同じ問題を持つ。保証は、それを生む単一機構と同じだけ良い。OWASP 報告書の、名前付きで分離可能な指標への固執——pass@k は pass@k であり、スコアの構成要素ではない——は、機構が識別可能であるべきだという固執であり、性質が失敗したときにどの機構が測るのをやめたかが分かるようにするためである。
これが Theorem 3 の運用上の帰結である。保証が「セキュリティ」であり、機構が「ツール呼び出しパス上の pass@k」なら、pass@k が下落したとき、ツール呼び出しパスが保証が弱まった場所だと分かる。束ねられたスコアはそれを教えられない。ある数字が動いたことしか教えられない。報告書は、おそらく意図せず、束ねを解くことへの論拠である。
民事・防御のスコープだけが唯一の誠実なスコープ
報告書は防御的レッドチームについて——修正できるように欠陥を見つける——扱う。攻撃能力については扱わない。これは私たちが明示的に守る境界と一致する:民事・防御の利用のみ。権限昇格の経路を見つけてあなたが閉じるための同じ機構は、別の手にあれば、誰かが搾取するために見つけられる。報告書はこれに留まらないが、調達フレームワークは、買手が欠陥を見つけて修正することを望み、見つけて武装化することを望まないと前提する。
Honest Architect の声がそれを要求するので、私たちはこれを述べる。レッドチーム能力は測定機構であり、測定機構はその運用者の意図に対して中立である。OWASP フレームワークは意図が防御的な運用者に最も有用であり、私たちは他のやり方では売らない。Everythink のトポロジー——ルーティング決定が攻撃面である——は、防御的運用者が経路を見て閉じられるように構築されている。攻撃的運用者がそれらを開くのを助けるために構築されていない。
これが私たちが出荷するものとどう繋がる
Sisters → Oracle パイプラインは、推測ではなく校準された forecast である。各 Sister がもっともらしい未来を起草し、Oracle がそれらを正規化された ensemble に統合する。規律は:一つの正規化機構、一つの測定可能な保証。OWASP 報告書はレッドチームに同じを求める:一つの pass@k 機構、一つの測定可能なセキュリティ信号。形は同じであり、下にある原則が同じだから——Theorem 3 は、セキュリティコミュニティも forecasting コミュニティも所有しないが、両者が再発見し続けるものである。
この規律を担う Production ✅ の能力:HAI Engine(2016 年から稼働するルーティングとマッチングのエンジン)、Sisters と Oracle(校準された ensemble)、World Monitor(決定的 id が再摂取は更新であって重複ではないことを意味するライブ geo-signal ゲートウェイ——データ完全性のための測定機構)、Social と Campaigns(権限スコープがコンテンツが供される前にルーティングする)、そして Whitelabel Network(network、ブランド、データへの主権が運用者が制御するルーティング境界)。
Partial ⚠️ の能力:Matchmaking、Marketplace、Calendar——測定機構は存在するがカバレッジが不完全であり、そうなるまで Production とは呼ばない。Roadmap 🔵:Wallet & Token、Super App、Community Credit——pre-revenue、Howey 審査対象、結果として約束しない。状態を昇格させない。OWASP 報告書の red flags は、事実上、状態を昇格させる故障モードである:ジェイルブレイクデモを「セキュリティ」と呼ぶベンダーは、表面テストをシステム保証へ昇格させている。
主要ポイント
- ジェイルブレイクのデモはチャットボットの拒絶機構を測る。ツール呼び出し、検索、マルチエージェントの機構は測らない。一つを認証することは一つを認証すること。これはセキュリティの衣を着た Theorem 3 である。
- OWASP GenAI Security Project 報告書(2026)は単純な AI システムを高度なものから区別し、十の評価次元を与える——それぞれが実装され測定されなければならない機構であり、主張されるものではない。
- 重要な指標——pass@k、Average Turns to Jailbreak、再現性、エージェントの追跡可能性——は単一で分離可能な機構である。束ねられた「risk score」は、保証が失敗したときにどの機構が測るのをやめたかを隠す。
- 現実の攻撃面はルーティング境界であり、プロンプトではない。Everythink の network → community → room トポロジーは何かが応答する前にルーティングする;各引き渡しの権限は、相手がフローをリダイレクトしようとする場所である。
- 民事・防御のスコープだけが測定機構にとって唯一の誠実なスコープである。経路を見つけて閉じる同じ機構は、それを見つけて搾取也能。
よくある質問
AI レッドチームとは何か、伝統的なレッドチームとどう違うのか? AI レッドチームは、AI システムのセキュリティ、誤用、アライメントの欠陥——ハルシネーション、ジェイルブレイク、ツール誤用、権限昇格、データ漏洩——を発見することを狙う敵対的テストである。伝統的なサイバーセキュリティのレッドチームは、ネットワークとアプリケーションの不正アクセスをテストする。OWASP 報告書は、両者が同じでないことを明示する:AI レッドチームはモデルの振る舞いとその周りのシステムをテストし、境界だけではない。
なぜジェイルブレイクのデモだけでセキュリティを認証するのに十分でないのか? ジェイルブレイクのデモは、特定のプロンプトがチャットボットの拒絶機構を迂回するかを測る。それはツール呼び出しパス、検索パス、マルチエージェント引き渡しパスを測らない——それぞれが独立した機構であり、独立した故障モードを持つ。Theorem 3 は直接に言う:ある性質は、その機構が実装され測定しているときに限って保証される。間違った機構を測るデモは、正しい機構について何も保証しない。
レッドチームベンダーはどのような指標を報告すべきか? OWASP 報告書は pass@k(k 回の試行のうち少なくとも一回が成功する確率)と Average Turns to Jailbreak、加えて再現性、観測可能性、エージェントの追跡可能性を挙げる。それぞれが単一で分離可能な測定機構である。これらの機構なしに発見された脆弱性の計数だけを報告するベンダーは、保証ではなく数字を報告している。
Everythink のトポロジーは AI レッドチームとどう関係するか? network → community → room トポロジーは、何かが応答する前にリクエストをルーティングする。各引き渡しの権限——room のスコープ、community の信頼境界、network の主権——はルーティング決定であり、ルーティング決定はエージェント的システムにおける現実の攻撃面である。プロンプトをテストしルーティング境界をテストしないレッドチームは、金庫ではなくロビーをテストする。「The space is the router」は、ルーティング層こそがセキュリティが勝たれ或いは失われる場所だという陳述である。
レッドチームフレームワークは攻撃的に使えるか? 測定機構は意図に対して中立である。OWASP フレームワークは、欠陥が見つかり修正されることを望む防御的運用者のために設計されている。Everythink は民事・防御のスコープ境界を明示的に守る:トポロジーは防御的運用者が経路を見て閉じられるように構築されており、攻撃的運用者がそれらを開くのではない。
Sources
- 2026 — OWASP GenAI Security Project, "Vendor Evaluation Criteria for AI Red Teaming Providers & Tooling," Version 1.0, public release January 13, 2026; summarized by aigl.blog on March 20, 2026: https://www.aigl.blog/vendor-evaluation-criteria-for-ai-red-teaming-providers-tooling/
あなたの network を作ろう——そして、何かが応答する前に、ルーティング境界がどこに置かれるかを決めよう。

ルーティングが検索に先行する、埋め込み次元ではない
KDnuggets の RAG 失敗調査は、埋め込みの過剰エンジニアリングがコストを悪化させることを示す。欠けているメカニズムは検索前の明示的ルーティングである——Theorem 3 を検索に適用し、Everythink のトポロジーを上流の類比として。
→ →
結果に対する検証こそメカニズムであり、ラベルではない
MIT の Devavrat Shah は実際の結果と照らし合わせて予測を検証する表格データモデルを構築した。メカニズムは測定されたループ——Theorem 3——であり、ワールドモデルのラベルではない。
→ →
勾配計画は測定された経路を通じてルーティングする
GRASP は、密に訓練された行動勾配へ最適化シグナルをルーティングし、敵対的な state 勾配を隔離することで機能する。同じルーティング規律が Theorem 3 と the space is the router を支える。
→ →自らの主張を証明するエンジンの上に、あなたの世界を築く。
2016 年から稼働し続けるエンジンの上に、あなた自身のネットワークを作る——あるいは 21 本の論文を書いたチームに話しかける。
