製品
ソリューション
会社情報
エンタープライズ
サインインネットワークを作成
AI safety · cybersecurity · risk governance · Bayesian networks · Theorem 3

リスク閾値に必要なのは測定メカニズムであって、切断線ではない

Berkeley の白書は、AI サイバーリスク閾値が能力の切断線であるゆえに失敗すると論じる。解は危害を継続的に測定するベイジアンネットワークであり、それはまさに Theorem 3 が要求するものだ。

リスク閾値に必要なのは測定メカニズムであって、切断線ではない

UC Berkeley の Center for Long-Term Cybersecurity が出した白書は、フロンティア AI 研究室の安全フレームワーク(OpenAI、Anthropic、DeepMind、Meta)から引き継いだ AI サイバーリスク閾値が、能力ベースで曖昧で、現実の危害から切り離されているゆえに失敗すると論じる。著者らはベイジアンネットワークを提案し、「このモデルは線を越えるか?」を「現実の条件下で危害を起こす確率はどれくらいか?」に書き換える。静的な切断線から継続的に測定されるメカニズムへの、この移行こそが、防御可能な閾値に必要なものだ。

閾値は越える線ではなく、維持する測定である

フロンティア AI 安全フレームワークは、少数の「閾値要素」—多段階攻撃の自動化、ゼロデイ発見、低スキル攻撃者の有効化—に収束し、それぞれに能力ベンチマークを付ける。Berkeley 白書の中心的批判は、これらの切断線が本質的に確率論的なシステムの中で決定論的であることだ。ベンチマークでゼロデイを「発見できる」モデルが、その事実によって危害を起こすわけではない。同じ能力は、アクセスと防御者の姿勢と攻撃者の経済学によって無害にも致命的にもなる。能力線として表現された閾値は、そうした媒介変数のすべてを無視する。

これは私たちが 21 papers の中で Theorem 3 として名付けるのと同じ故障モードだ。ある性質は、そのメカニズムが実装され測定している時に限って保証される。 [ORIGINAL DATA] Theorem 3 (a property is guaranteed exactly when its mechanism is implemented and measuring) がここで荷重を担うのは、「容認できないサイバーリスク」がモデルではなく社会技術システムの性質だからだ。能力の切断線を宣言しても性質は実装されない。それは性質を主張するだけだ。その性質—危害が容認された水準を下回ること—は、それが越えられたことを教えてくれる測定を継続的に生成する何かがある時にのみ存在する。誰も測定していない線は閾値ではない。それは希望だ。

白書は問いを「このモデルは閾値を越えるか?」から「現実の条件下で危害を起こす確率はどれくらいか?」に書き直す。それは正しい再枠組みであり、構造的な帰結を持つ。閾値は越えられたマイルストーンではなく、維持される状態になる。デプロイメントを計装し、証拠を確率モデルに流し込み、事後分布を容認水準の下に保つ—さもなければデプロイメントを制限する。切断線は稼働中メカニズムの出力であり、その代用品ではない。

能力はリスクではない。文脈がそうだ

白書は批判を率直に述べる。能力 ≠ リスク。同じ能力は、文脈とアクセスと防御によって無害にも致命的にもなり得る。成熟したメールフィルターを持つ企業認証境界の背後にあるフィッシング生成能力は、電話番号と恨みを持つ誰にでも公開された同じ能力とは異なるリスクだ。フロンティアフレームワークは能力に索引を付け、文脈を暗黙のままにすることでこれを回避する。

二つの欠陥が問題を悪化させる。第一に、言葉が曖昧だ。「意味のある増加」が、ベースラインも単位も方法もなしにフレームワークに現れる。「何に対して意味のあるのか、どう測るのか、誰が、いつ更新するのか」。値付けできない閾値用語はコンプライアンスの人工物であり、制御ではない。第二に、フレームワークは極端で確率の低いシナリオ—硬化された対象のエンドツーエンド自律的搾取—に集中し、攻撃・防御の均衡を実際に再構成する漸次的な変位を見落とす。攻撃者の経済学におけるゆっくりとしたドリフトであり、映画的なシナリオではない。それが均衡が傾く所だ。

[UNIQUE INSIGHT] 能力閾値が漸次的ドリフトを見落とす理由は、それらがシステムについての縦断的測定ではなく、モデルについてのある瞬間の宣言だからだ。能力ベンチマークは一枚の写真であり、リスクは一つの動画だ。Berkeley の提案—リスクを変数に分解し、確率論的依存でつなぎ、ベンチマークとレッドチームと現実世界の証拠を流し込み、時間とともに更新する—は、事実上、撮り始めるよう求めている。そうして閾値は単一のベンチマークスコアではなく、事後分布のトレンドの中に生きる。

これは、規制が同じ枠組みに向かっているゆえに重要だ。白書は EU AI Act と NIST Risk Management Framework との整合に言及し、両者とも一回限りの宣言ではなく、継続的で証拠に基づくリスク処理を求めている。能力の切断線しか持たない研究所は、それらのフレームワークが実際に尋ねる問いに答えられない。「あなたの測定されたリスクは何か、それを容認水準の下に保つメカニズムは何か。」

ベイジアンネットワークが測定メカニズムである

白書の建設的な提案はベイジアンネットワーク(BN)だ。AI 能力、攻撃者の振る舞い、防御の検出、経済的影響といった変数間の関係を表す確率グラフであり、多様な証拠を統合し、条件が変わるにつれて継続的に更新される。静的閾値とは異なり、BN はシステムがリスク境界を越えるのにどれくらい近いかを追跡できる。なぜなら境界は一つの軸上の単一の数値ではなく、同時分布の中の一領域だからだ。

これは白書の中で、私たちのメカニズムに対する考え方に最も直接につながる部分だ。BN は口語的な意味での予測ではない。それは測定器器だ。観測したものを与えれば、危害変数上の事後分布はこれであり、新しいレッドチーム結果や新しいインシデント報告を流し込むとこう動く、と言う。そうして閾値はその事後分布に対する一つのポリシーとなる—「P(意味のある危害)が 0.X を超えたらデプロイメントを制限する」—そして、事後分布が証拠とグラフから再現可能であるゆえに、そのポリシーは執行可能だ。

三つの性質が BN をこの仕事に適した形にし、それぞれが私たちがどんな測定メカニズムにも探す性質に対応する。

  • 分解。 高レベルのリスク(「AI がスケーラブルなフィッシングを可能にする」)は、測定可能な変数—AI の言語習熟度、餌の信頼性、防御の検出率、対象の感受性—に分解される。「フィッシングリスク」を直接測ることはできない。その構成要素は測れる。分解こそがリスクを証拠に対して読み可能にするものだ。
  • 依存。 変数は独立して足し合わされるのではなく、条件付き確率でつなげられる。攻撃の成功は、それぞれ単独ではなく、能力と防御の共同的な関数である。能力だけの閾値が失敗する理由はここにある。同時分布が周辺分布から読み取れると想定するからだ。
  • 更新。 事後分布は証拠の関数であり、証拠は蓄積する。BN は構造上、縦断的な器器だ。昨日の事後分布は今日の事前分布である。それが「動的監視」が運用上意味するものであり、スローガンとしてではない。

白書自身が名指す正直な限界は、これらのモデルが初期段階であることだ。大規模な現実世界で検証された BN はなく、確率を値付けする標準化データセットもなく、誰が閾値を設定しどう執行するかの明確なガバナンス統合もない。私は白書自身の「What's Missing」節を引用する。正直な読みはそれを覆わないからだ。結果に対して一度も較正されたことのない測定メカニズムは、測定についての仮説であり、まだ測定ではない。メカニズムの形は正しい。証拠基盤はまだ築かれていない。

フィッシング事例が「意味のある増加」を数値に変える方法

白書のフィッシング事例(31–32 ページ)は、抽象が具体になる所だ。ベイジアンネットワークがソーシャルエンジニアリングリスクをノード—「AI の言語習熟度」「餌の信頼性」「防御の検出率」「対象の感受性」—に分解し、それらが共同で、従業員が悪意あるメールを開くかどうかのような結果を決定する。曖昧な概念が量化可能な信号になるのは、各ノードがあなたが証拠を生成できる何かだからだ。ベンチマークからの言語習熟度スコア、メールフィルター試験からの検出率、フィッシング模擬キャンペーンからの感受性推定。

事例は二つのことを同時にしており、分ける価値がある。第一に、「フィッシング有効性の意味のある増加」のようなリスク用語が、単位を持つ変数に分解できることを示す。第二に、増加自体が単一スコアではなく同時分布の変化であることを示す。言語習熟度の 10% の改善は、開かれたメールの 10% 増に線形には翻訳されない。それは検出率と感受性ノードを通じて翻訳され、防御された企業の中と無防御の小企業の中では翻訳が異なる。

これが能力ベンチマークと、精確に述べられたリスク閾値の違いだ。ベンチマークはモデルがあるタスクで良くなったと言う。BN は、あなたが実際にデプロイする条件下で、その改善が危害事後分布をどれだけ動かしたかを言う。前者は必要であり、後者が閾値が要求するものだ。白書の貢献は、後者が構築可能であることを示すことにあり、単に望ましいであるではないことにあり、そして正直に、大規模にそれを値付けする作業がほとんど始まっていないことを示す。

これが Everythink で何に対応するか

私たちはこの白書を特定のレンズを通して読む。そして、読者が信心で受け取るのではなく、私たちの論証を検証できるよう、明示しておく価値がある。

[PERSONAL EXPERIENCE] HAI Engine は 2016 年から本番で稼働しており、マルチエージェント予測システムを九年運用しての教訓は、更新できない予測は公開すべきでないというものだ。私たちの Sisters はシナリオ草案を産出し、Oracle はそれらを確率の和が一でエントロピーが nats で追跡される較正済みアンサンブルに融合する。そのアンサンブルは測定器器であり、口語的な意味での予測ではない。入力から再現可能であり、証拠が蓄積するにつれて更新され、間違える時は追跡可能な仕方で間違える。Berkeley の BN 提案は同じ形を別の領域に適用したものだ。シナリオ確率ではなく危害変数、信号フィードではなくレッドチーム証拠。しかし、それを産出したメカニズムが検視可能である場合にのみその数値が信頼できるという、同じ主張において。

私たちが共有する構造原則は、私たちが「the space is the router」と呼ぶものだ。network→community→room トポロジーは、何かが応答する前に要求をルーティングする。ルーティングは測定可能な結果—どの文脈がどの信号を見たか—を産出するメカニズムであり、それが下流の予測を監査可能にする。ルーティングトポロジーのない閾値はモデルに括り付けられた数値であり、ルーティングトポロジーの中の閾値はシステムを通るパスに括り付けられた数値であり、そここそが危害が実際に棲む唯一の場所だ。危害は文脈的であり、文脈はトポロジーである。

私たちの正直さタグは、白書が断言より証拠を主張するのと同じ理由で存在する。本番メカニズムがある所では Production ✅ と言う。HAI Engine、Social、Campaigns、Whitelabel Network、World Monitor、Sisters、Oracle。メカニズムが部分的な所では Partial ⚠️。Matchmaking、Marketplace、Calendar。それがロードマップである所では Roadmap 🔵。Wallet & Token、Super App、Community Credit。そしてそれらについては結果を約束しない。それらは pre-revenue であり、トークン構成要素については Howey 審査の対象だからだ。要点はグリフではない。読者が各々の主張を成熟度状態に対応させ、私たちに問いただせることだ。それが白書がフロンティア研究所に求めるのと同じ規律だ。閾値を断言するのをやめ、それらを正当化する測定を産出し始めること。

私たちは適用範囲の境界について明示的だ。白書もそうだからだ。Everythink は市民的および防御的な文脈でのみ運用される。攻撃能力について正直なリスク閾値メカニズムは、攻撃的ツールを構築する許可ではない。それは防衛線がどこにあるかを知り、それを計装する理由だ。Berkeley の枠組みが私たちに有用なのは、まさにそれが防御の姿勢を修辞ではなく測定可能にするからだ。

白書が正直に名指すガバナンスの欠落

白書の最も有用な節は、おそらくその独自の「What's Missing」リストだ。なぜなら、それが提案がもう一つの能力断言になるのを防ぐ部分だからだ。枠組みには、大規模な現実世界で検証されたベイジアンモデル、確率を値付けする標準化データセット、明確なガバナンス統合の指針、そしてモデル能力を現実のサイバー影響に結びつける実証ベンチマークが欠けている。より複雑な領域—自律的搾取、サプライチェーン攻撃—は深く運用化されていない。

私たちは、白書がほのめかすが詳述しない欠落を一つ加えたい。閾値メカニズムは、それに流し込まれる証拠の独立性と同じ程度にしか信頼できない。自身のレッドチーム結果で、自身のベースラインに対して、外部の検査なしに、自身の BN を値付けする研究所は、研究所が報告を必要とするものを報告する器器を建造した。標準化データセットへの要求は、一部には、すべてが測定される当事者に由来しない証拠への要求だ。それが枠組みが開いたままにするガバナンスの問いであり、開いたままにしておく正しい問いだ。答えは制度的であり、技術的ではない。

実用的な帰結は、統治に値する閾値メカニズムは、第三者が再現できるものだ。公開されたグラフ、名指された証拠、宣言された事前分布、再計算可能な事後分布。それらの条件を満たす BN は、規制者が実際に使える形で監査可能であり、満たさないものは測定の衣を着た独占的な主張だ。

主要な要点

  • 能力の切断線はリスク閾値ではない。それは、危害が棲む文脈を無視する、モデルについてのある瞬間の断言だ。
  • Berkeley 白書は問いを「このモデルは線を越えるか?」から「現実の条件下で危害を起こす確率はどれくらいか?」に書き直す。静的なマイルストーンから維持される測定への移行だ。
  • ベイジアンネットワークが提案された測定メカニズムだ。リスクを変数に分解し、条件付き確率でつなぎ、ベンチマークとレッドチームと現実世界の証拠を流し込み、継続的に更新する。
  • フィッシング事例は、「意味のある増加」のような曖昧な用語が単位を持つノードに分解できることを示す。しかし大規模にこれらのモデルを値付けする作業はほとんど始まっておらず、白書はそう言う。
  • Theorem 3 が原則を一般化する。ある性質(容認可能なリスク)は、そのメカニズム(継続的に更新され検視可能な事後分布)が実装され測定している時に限って保証される。
  • 閾値メカニズムは、第三者がそれを再現できる場合にのみ統治可能だ。公開されたグラフ、名指された証拠、宣言された事前分布、再計算可能な事後分布。

よくある質問

なぜ能力ベンチマークはリスク閾値ではないのか? ベンチマークはモデルがテストで何ができるかを測る。リスクは、その能力が現実世界で防御者と攻撃者と対象に出会った時に起こることだ。ベンチマークはリスク推定への入力であり、推定そのものではない。白書の要点は、周辺分布を同時分布であるかのように扱うことがフロンティアフレームワーク閾値の核心的エラーだということだ。

ベイジアンネットワークはチェックリストにない何を加えるのか? チェックリストは統制が存在することを記録し、BN はその統制が危害事後分布をどれだけ動かしたかを記録する。前者は二値で静的であり、後者は連続で更新可能だ。BN はまた依存を明示する。攻撃の成功は能力と防御の共同的な関数だ。これは、散文形の BN にならなければチェックリストは表現できない。

Berkeley の枠組みは今日すでに統治に使えるのか? いいえ、と白書は直接そう言う。大規模に検証されたモデル、標準化データセット、明確なガバナンス統合が欠けている。それは方法論であり、リスクを運用化する反復可能な方法であり、完成した器器ではない。それを完成したものとして扱うことは、それが批判するエラーを繰り返すことだ。性質を測定する代わりに断言すること。

これは Theorem 3 とどうつながるのか? Theorem 3 は、ある性質はそのメカニズムが実装され測定している時に限って保証されると言う。「容認可能なサイバーリスク」はモデルではなくデプロイメントの性質だ。保証は、BN(または同等の器器)が稼働し、流し込まれ、検視可能である時にのみ存在する。切断線を宣言してもメカニズムは何も実装せず、ゆえに何も保証しない。

Everythink はこれを何に使うのか? 私たちは同じ構造原則を—検視可能なメカニズムが産出する、再現可能で更新可能な事後分布を—HAI Engine と Oracle の中で、サイバーリスク閾値ではなく予測のために使う。ルーティングトポロジー(network→community→room)こそが私たちの予測を文脈的かつ監査可能にするものだ。私たちは攻撃的ツールを構築しない。測定可能な防衛線の価値は、それがどこにあるかを知ることだ。

もしこの枠組みが有用なら、次に続く作業は運用的だ。リスクを一つ選び、それを分解し、変数をつなぎ、証拠を名指し、更新を始める。ネットワークを作るか、論文を読むか。

Sources

関連

自らの主張を証明するエンジンの上に、あなたの世界を築く。

2016 年から稼働し続けるエンジンの上に、あなた自身のネットワークを作る——あるいは 21 本の論文を書いたチームに話しかける。