
OWASP GenAI Security Project 在 2026 年发布的一份报告指出,大多数 AI 红队测试测量的对象是错的——一个奏效的越狱提示——然后把它叫做安全。真正的风险面在于机制:工具误用、多智能体系统中的权限提升、RAG 中的数据泄露。该报告的评估框架,用我们的话说,就是 Theorem 3 应用于安全:一个属性恰在其机制被实现并正在测量时才得到保证。
越狱演示是表面,不是保证
OWASP 报告开篇的诊断我们一眼就认出来了:组织认为自己“安全”是因为跑了几轮基于提示的测试,却忽视了智能体架构、工具集成与工作流自动化引入的系统性风险。报告称之为“security theater”——一场测量聊天表面的演示,对底下的系统默不作声地什么也没保证。
[UNIQUE INSIGHT] 这正是 Theorem 3 以一般形式命名的那类错误:一个属性恰在其机制被实现并正在测量时才得到保证。一个对聊天机器人奏效的越狱,测量的是聊天机器人的拒绝机制。它没有测量工具调用路径、检索增强路径、多智能体交接路径,也没有测量 Model Context Protocol 集成路径。每一条都是独立的机制,有独立的失效模式。认证一条,只认证一条。
报告的贡献在于它不再允许供应商把这几者混为一谈。它把简单的 GenAI 系统——聊天机器人、副驾驶、RAG 应用——与高级系统区分开来:调用工具的智能体、MCP 架构、多智能体工作流。每一类都有不同的风险画像。幻觉主导前者;工具误用与权限提升主导后者。一个只测前者的红队,不是为后者准备的红队。它是一场演示。
为什么机制而非演示才是安全的单位
OWASP 框架围绕十个维度组织评估:技术能力、方法与覆盖、对抗创造力、威胁建模现实性、评估严谨性与指标、工具与基础设施、数据治理、透明度与可解释性、定制与集成,以及法律与合规姿态。仔细读,每个维度都是一个必须被实现并测量的机制——不是供应商可以宣称的形容词。
以指标维度为例。报告引入了 pass@k(k 次独立尝试中至少一次成功的概率)与 Average Turns to Jailbreak。这些不是虚荣数字。它们是测量机制:pass@k 告诉你一个失效是罕见还是尚未被观察到;Average Turns to Jailbreak 告诉你系统在持续压力下是优雅降级还是在第三轮崩溃。一个报告“我们发现了 12 个漏洞”却没有这些机制的供应商,报告的是一个计数,不是保证。
[ORIGINAL DATA] Theorem 3,出自奠定 Everythink forecasting 引擎的 the 21 papers,用一行陈述了该原则:一个属性恰在其机制被实现并正在测量时才得到保证。OWASP 报告是安全社区从另一个方向抵达同一行——在足够多的越狱演示认证了随后在生产中失效的系统之后,唯一诚实的回应是追问演示测量了哪个机制,以及那个机制是否就是部署中支撑该属性的那个。
路由边界才是真正攻击面所在
报告区分了简单与高级系统,但没有点出我们会点出的东西:当拓扑开始路由时,攻击面会移动。一个聊天机器人只有一个面——提示。一个调用工具、从语料库检索、再交接给第二个智能体的智能体,在每次交接处都有一个面。调用工具的权限、检索的范围、交接时转移的信任——每一个都是路由决策,而每个路由决策都是对手可能试图重定向流量的地方。
这就是为什么“the space is the router”对我们不只是产品口号。Everythink 的拓扑——network → community → room——在任何东西响应之前就路由一个请求。一个 room 是一个范围;一个 community 是信任边界;一个 network 是主权边界。允许智能体在一个 room 内行动的权限是一个路由决策,而它正是对手想要收买的那个决策。一个测试提示而不测试路由边界的红队,测的是大堂而不是金库。
[PERSONAL EXPERIENCE] HAI Engine 自 2016 年起在生产中运行,而对我们重要的对抗性评估总是在路由边界上——一个请求能否到达它不该到达的 room,一个范围能否被提升,一次交接能否泄露一个权限。OWASP 报告对多智能体污染与 MCP 误用的强调,是同样的强调,面向更广的受众表达出来。机制是边界;演示是提示。
报告做对了什么,又把什么留给了运营者
报告在采购视角上很强。它提供了买方可以立即使用的 green flags 与 red flags、一张顾问对工具的比较矩阵,以及一份跨技术、运营与治理维度的评分清单。那些 green flags——完整攻击链、智能体可追溯性、可重放性、新颖攻击设计而非复用公开越狱库——每一个都是测量机制。那些 red flags——以越狱演示为标题、没有 pass@k、没有 Average Turns、没有映射到 NIST AI RMF 或 ISO 42001 或 EU AI Act——每一个都是缺失的机制。
它在三件事上较弱,而运营者仍需补上。其一,它聚焦于供应商评估,对如何构建内部红队能力或混合模式着墨较少。其二,它引用监管框架,却未把标准深度映射到具体的合规义务——EU AI Act 下的符合性评估留给读者。其三,它假设了相对较高的技术成熟度;处于 AI 之旅早期的组织需要报告未提供的模板。
我们把这些缺口读作报告对自己的范围保持诚实。它是一个采购框架,不是运营手册。运营者的工作——报告命名了但未完成——是拿走这些测量机制并持续运行它们,而不是在采购时跑一次。
报告对指标要求的单机制纪律
报告的指标章节,在我们读来,是它最安静也最重要的贡献。它要求 pass@k、Average Turns to Jailbreak、可重放性、可观测性与智能体可追溯性。每一个都是一个产生可测量信号的单一机制。其背后的纪律与我们为 Oracle 持守的相同:概率恰在一个地方归一化——ensemble 模块——而每个消费者都可以依赖 sum(probability) ≈ 1.0。一个机制,一个保证。
一份把十个指标打包成“risk score”的红队报告,和一份把十个模型打包成一个数字却不说明归一化发生在何处的 forecast 有同样的问题。保证只与产生它的那单一机制一样好。OWASP 报告对命名、可分离指标的坚持——pass@k 就是 pass@k,不是某个分数的组成部分——是对让机制可辨识的坚持,这样当属性失效时,你知道是哪个机制停止了测量。
这是 Theorem 3 的运营后果。如果保证是“安全”,而机制是“工具调用路径上的 pass@k”,那么当 pass@k 下降时,你知道工具调用路径就是保证变弱之处。一个打包的分数无法告诉你这个。它只能告诉你一个数字动了。报告,或许无意之中,是一个主张解包的论据。
民用与防御范围是唯一诚实的范围
报告关于防御性红队——发现失效以便修复。它不关于进攻能力。这与我们明确持守的边界吻合:仅限民用与防御。同一个找到权限提升路径以便你关闭它的机制,在另一些人手里可以找到它以便有人利用它。报告没有在此停留,但采购框架假设买方希望失效被找到并被修复,而不是被找到并被武装化。
我们陈述这一点,因为 Honest Architect 的声音要求如此。红队能力是一种测量机制;测量机制对其运营者的意图是中立的。OWASP 框架对意图防御的运营者最有用,我们不会以别的方式出售它。Everythink 的拓扑——路由决策即攻击面——的构建是为了让防御性运营者能够看到并关闭路径。它不是为了帮助进攻性运营者打开路径而构建的。
这与我们交付的东西如何相连
Sisters → Oracle 管线是一个校准过的 forecast,不是一个猜测。每个 Sister 起草一个 plausible future;Oracle 把它们合并成一个归一化的 ensemble。纪律是:一个归一化机制,一个可测量的保证。OWASP 报告对红队提出了同样的要求:一个 pass@k 机制,一个可测量的安全信号。形状相同,因为底层原则相同——Theorem 3,安全社区与 forecasting 社区都不拥有它,但两者都在不断重新发现它。
承载这一纪律的 Production ✅ 能力:HAI Engine(自 2016 年起运行的路由与匹配引擎)、Sisters 与 Oracle(校准过的 ensemble)、World Monitor(实时 geo-signal 网关,其确定性 id 意味着再摄入是更新而非重复——一个数据完整性的测量机制)、Social 与 Campaigns(权限范围在内容被服务之前路由),以及 Whitelabel Network(对 network、品牌与数据的主权即运营者控制的路由边界)。
Partial ⚠️ 能力:Matchmaking、Marketplace 与 Calendar——测量机制存在但覆盖不完整,在完整之前我们不会称之为 Production。Roadmap 🔵:Wallet & Token、Super App 与 Community Credit——pre-revenue,须接受 Howey 审查,且不作为结果被承诺。我们不升级状态。OWASP 报告的 red flags 实际上就是升级状态的失效模式:一个把越狱演示称作“安全”的供应商,正在把一个表面测试升级为系统保证。
关键要点
- 越狱演示测量的是聊天机器人的拒绝机制。它不测量工具调用、检索或多智能体机制。认证一条只认证一条。这是穿着安全外衣的 Theorem 3。
- OWASP GenAI Security Project 报告(2026)区分简单与高级 AI 系统,给出十个评估维度——每一个都是必须被实现并测量的机制,不是被宣称的。
- 重要的指标——pass@k、Average Turns to Jailbreak、可重放性、智能体可追溯性——是单一、可分离的机制。一个打包的“risk score”隐藏了保证失效时是哪个机制停止了测量。
- 真正的攻击面是路由边界,不是提示。Everythink 的 network → community → room 拓扑在任何东西响应之前路由;每次交接处的权限是对手试图重定向流量的地方。
- 民用与防御范围是测量机制唯一诚实的范围。同一个找到路径以关闭它的机制,也能找到它以利用它。
常见问题
什么是 AI 红队,它与传统红队有何不同? AI 红队是旨在发现 AI 系统中安全、误用与对齐失效的对抗性测试——幻觉、越狱、工具误用、权限提升、数据泄露。传统网络安全红队测试网络与应用的未授权访问。OWASP 报告明确指出两者并非同一回事:AI 红队测试模型的行为及其周围的系统,而不仅仅是边界。
为什么越狱演示不足以认证安全? 越狱演示测量的是一个特定提示是否绕过聊天机器人的拒绝机制。它不测量工具调用路径、检索路径或多智能体交接路径——每一个都是独立机制,有独立失效模式。Theorem 3 直接说:一个属性恰在其机制被实现并正在测量时才得到保证。测量错误机制的演示对正确的机制什么也不保证。
红队供应商应该报告哪些指标? OWASP 报告点名 pass@k(k 次尝试中至少一次成功的概率)与 Average Turns to Jailbreak,外加可重放性、可观测性与智能体可追溯性。每一个都是单一、可分离的测量机制。一个只报告发现漏洞计数而没有这些机制的供应商,报告的是一个数字,不是保证。
Everythink 的拓扑与 AI 红队有何关联? network → community → room 拓扑在任何东西响应之前路由一个请求。每次交接处的权限——room 范围、community 信任边界、network 主权——是一个路由决策,而路由决策是智能体系统中真正的攻击面。一个测试提示而不测试路由边界的红队,测的是大堂而不是金库。“The space is the router”是路由层即安全得失之所的陈述。
红队框架能被用于进攻吗? 测量机制对意图是中立的。OWASP 框架为希望失效被找到并被修复的防御性运营者而设计。Everythink 明确持守民用与防御范围边界:拓扑的构建是为了让防御性运营者能够看到并关闭路径,而非为了让进攻性运营者打开它们。
Sources
- 2026 — OWASP GenAI Security Project, "Vendor Evaluation Criteria for AI Red Teaming Providers & Tooling," Version 1.0, public release January 13, 2026; summarized by aigl.blog on March 20, 2026: https://www.aigl.blog/vendor-evaluation-criteria-for-ai-red-teaming-providers-tooling/
创建你的 network——并在任何东西响应之前,决定路由边界落在哪里。

路由先于检索,而非嵌入维度
KDnuggets 的 RAG 失败调查显示过度工程嵌入会加剧成本。缺失的机制是检索前的显式路由——Theorem 3 应用于搜索,以 Everythink 的拓扑为上游类比。
→ →
对结果的检验才是机制,而非世界模型标签
MIT 的 Devavrat Shah 构建了以真实结果检验预测的表格数据模型。机制是有测量的回路——Theorem 3——而非世界模型标签。
→ →
梯度规划沿被测量的路径路由
GRASP 的关键在于把优化信号路由到密集训练的 action 梯度上,隔离对抗性的 state 梯度。同样的路由纪律支撑着 Theorem 3 和 the space is the router。
→ →