Produkte
Lösungen
Unternehmen
Enterprise
AnmeldenNetzwerk erstellen
AI · Security · Red Teaming · Forecasting · Mechanism

Red Teaming muss den Mechanismus messen, nicht die Demo

Ein OWASP-Bericht nennt Jailbreak-Demos Security Theater. Die echte Risikofläche ist der Mechanismus — Werkzeugmissbrauch, Multi-Agenten-Eskalation, RAG-Leck. Das ist Theorem 3 im Sicherheitskostüm.

Ein Bericht des OWASP GenAI Security Project aus dem Jahr 2026 argumentiert, dass die meisten Red-Teaming-Einsätze für KI das Falsche messen — einen Jailbreak-Prompt, der trifft — und es Sicherheit nennen. Die tatsächliche Risikofläche ist der Mechanismus: Werkzeugmissbrauch, Privilegieneskalation in Multi-Agenten-Systemen, Datenleck in RAG. Das Evaluationsrahmenwerk des Berichts ist, in unserer Sprache, Theorem 3 angewandt auf Sicherheit: eine Eigenschaft ist genau dann garantiert, wenn ihr Mechanismus implementiert und messend ist.

Die Jailbreak-Demo ist die Oberfläche, nicht die Garantie

Der OWASP-Bericht öffnet mit einer Diagnose, die wir sofort erkennen: Organisationen glauben, sie seien „sicher", weil sie prompt-basierte Tests durchgeführt haben, während sie die systemischen Risiken ignorieren, die agentive Architekturen, Werkzeugintegrationen und Workflow-Automatisierung einführen. Der Bericht nennt dies „Security Theater" — eine Demo, die die Chat-Oberfläche misst und schweigend nichts über das darunterliegende System bescheinigt.

[UNIQUE INSIGHT] Dies ist derselbe Fehler, den Theorem 3 in allgemeiner Form benennt: eine Eigenschaft ist genau dann garantiert, wenn ihr Mechanismus implementiert und messend ist. Ein Jailbreak, der gegen einen Chatbot gelingt, misst den Ablehnungsmechanismus des Chatbots. Er misst nicht den Werkzeugaufruf-Pfad, den Retrieval-Augmented-Pfad, den Multi-Agenten-Übergabe-Pfad oder den Model-Context-Protocol-Integrationspfad. Jeder davon ist ein separater Mechanismus mit einer separaten Fehlerart. Einen bescheinigen bescheinigt einen.

Der Beitrag des Berichts ist, dass er aufhört, Anbieter diese Dinge vermischen zu lassen. Er trennt einfache GenAI-Systeme — Chatbots, Copiloten, RAG-Apps — von fortgeschrittenen Systemen: Werkzeug-aufrufende Agenten, MCP-Architekturen, Multi-Agenten-Workflows. Jedes hat ein eigenes Risikoprofil. Halluzinationen dominieren das erste; Werkzeugmissbrauch und Privilegieneskalation dominieren das zweite. Ein Red Team, das nur das erste testet, ist kein Red Team für das zweite. Es ist eine Demo.

Warum der Mechanismus, nicht die Demo, die Einheit der Sicherheit ist

Das OWASP-Rahmenwerk organisiert die Evaluation um zehn Dimensionen: technische Kompetenz, Methodik und Abdeckung, adversariale Kreativität, Realismus des Bedrohungsmodells, Evaluationsstrenge und Metriken, Tooling und Infrastruktur, Daten-Governance, Transparenz und Erklärbarkeit, Anpassung und Integration sowie Rechts- und Compliance-Postur. Sorgfältig gelesen ist jede Dimension ein Mechanismus, der implementiert und gemessen werden muss — kein Adjektiv, das ein Anbieter behaupten kann.

Betrachten Sie die Metrik-Dimension. Der Bericht führt pass@k ein (die Wahrscheinlichkeit, dass mindestens eines von k unabhängigen Versuchen gelingt) und Average Turns to Jailbreak. Dies sind keine Eitelkeitszahlen. Sie sind Messmechanismen: pass@k sagt Ihnen, ob ein Fehler selten oder nur noch nicht beobachtet ist; Average Turns to Jailbreak sagt Ihnen, ob das System unter anhaltendem Druck anmutig degradiert oder im dritten Zug kollabiert. Ein Anbieter, der „wir fanden 12 Schwachstellen" meldet, ohne diese Mechanismen, meldet eine Zählung, keine Garantie.

[ORIGINAL DATA] Theorem 3, aus the 21 papers, die Everythinks Forecasting-Engine begründen, stellt das Prinzip in einer Zeile auf: eine Eigenschaft ist genau dann garantiert, wenn ihr Mechanismus implementiert und messend ist. Der OWASP-Bericht ist die Sicherheits-Community, die von der anderen Seite bei derselben Zeile ankommt — nachdem genug Jailbreak-Demos Systeme bescheinigt hatten, die dann in Produktion scheiterten, ist die einzige ehrliche Antwort zu fragen, welchen Mechanismus die Demo maß, und ob dieser Mechanismus derjenige ist, der die Eigenschaft im Einsatz hält.

Die Routing-Grenze ist, wo die echte Angriffsfläche liegt

Der Bericht unterscheidet einfache von fortgeschrittenen Systemen, benennt aber nicht, was wir benennen würden: die Angriffsfläche bewegt sich, wenn die Topologie routet. Ein Chatbot hat eine Fläche — den Prompt. Ein Agent, der Werkzeuge aufruft, aus einem Corpus abruft und an einen zweiten Agenten übergibt, hat eine Fläche an jedem Übergang. Die Berechtigung, ein Werkzeug aufzurufen, der Scope des Abrufs, das Vertrauen, das beim Übergang transferiert wird — jedes ist eine Routing-Entscheidung, und jede Routing-Entscheidung ist ein Ort, an dem ein Gegner den Fluss umzuleiten versuchen kann.

Darum ist „the space is the router" für uns nicht nur ein Produkt-Slogan. Die Everythink-Topologie — network → community → room — routet eine Anfrage, bevor etwas antwortet. Ein room ist ein Scope; eine community ist eine Vertrauensgrenze; eine network ist eine Souveränitätsgrenze. Die Berechtigung, die einen Agenten innerhalb eines room handeln lässt, ist eine Routing-Entscheidung, und es ist die Entscheidung, die ein Gegner unterlaufen will. Ein Red Team, das den Prompt testet und nicht die Routing-Grenze, testet die Eingangshalle und nicht den Tresor.

[PERSONAL EXPERIENCE] Der HAI Engine läuft seit 2016 in Produktion, und die adversarialen Evaluationen, die für uns zählen, waren immer an der Routing-Grenze — kann eine Anfrage einen room erreichen, den sie nicht erreichen sollte, kann ein Scope eskaliert werden, kann ein Übergang eine Berechtigung lecken? Die Betonung des OWASP-Berichts auf Multi-Agenten-Kontamination und MCP-Missbrauch ist dieselbe Betonung, ausgedrückt für ein breiteres Publikum. Der Mechanismus ist die Grenze; die Demo ist der Prompt.

Was der Bericht richtig macht, und was er dem Betreiber überlässt

Der Bericht ist stark in der Procurement-Linse. Er bietet Green Flags und Red Flags, die ein Käufer sofort verwenden kann, eine Berater-gegen-Tools-Vergleichsmatrix und eine Scoring-Checkliste über technische, operative und Governance-Dimensionen. Die Green Flags — vollständige Angriffsketten, Agenten-Rückverfolgbarkeit, Replayability, neuartiges Angriffsdesign statt Wiederverwendung öffentlicher Jailbreak-Bibliotheken — sind jeweils ein Messmechanismus. Die Red Flags — Jailbreak-Demos als Schlagzeile, kein pass@k, kein Average Turns, kein Mapping zu NIST AI RMF oder ISO 42001 oder dem EU AI Act — sind jeweils ein fehlender Mechanismus.

Er ist schwächer in drei Dingen, die der Betreiber noch beisteuern muss. Erstens konzentriert er sich auf Anbieter-Evaluation, mit weniger Anleitung zum Aufbau interner Red-Teaming-Fähigkeit oder eines Hybridmodells. Zweitens referenziert er regulatorische Rahmen, ohne die Kriterien tief auf spezifische Compliance-Pflichten abzubilden — die Konformitätsbewertungen unter dem EU AI Act bleiben dem Leser überlassen. Drittens nimmt er ein relativ hohes Maß an technischer Reife an; eine Organisation früh in ihrer KI-Reise wird Vorlagen brauchen, die der Bericht nicht liefert.

Wir lesen diese Lücken als den Bericht, der über seinen Scope ehrlich ist. Er ist ein Procurement-Rahmen, kein Betriebshandbuch. Die Aufgabe des Betreibers — die der Bericht nennt, aber nicht vollendet — ist es, die Messmechanismen zu nehmen und sie kontinuierlich auszuführen, nicht einmal bei der Beschaffung.

Die Einzelmechanismus-Disziplin, die der Bericht von Metriken verlangt

Der Metrik-Abschnitt des Berichts ist, in unserer Lektüre, sein leisester und wichtigster Beitrag. Er verlangt pass@k, Average Turns to Jailbreak, Replayability, Observability und Agenten-Rückverfolgbarkeit. Jedes ist ein einzelner Mechanismus, der ein messbares Signal erzeugt. Die Disziplin dahinter ist dieselbe, die wir für den Oracle wahren: Wahrscheinlichkeiten werden an genau einer Stelle normalisiert, dem Ensemble-Modul, und jeder Verbraucher darf sich auf sum(probability) ≈ 1.0 verlassen. Ein Mechanismus, eine Garantie.

Ein Red-Team-Bericht, der zehn Metriken in einem „Risk Score" bündelt, hat dasselbe Problem wie eine Vorhersage, die zehn Modelle in eine Zahl bündelt, ohne zu sagen, wo die Normalisierung stattfindet. Die Garantie ist nur so gut wie der einzelne Mechanismus, der sie erzeugt. Die Beharrung des OWASP-Berichts auf benannten, trennbaren Metriken — pass@k ist pass@k, nicht eine Komponente einer Punktzahl — ist die Beharrung darauf, dass der Mechanismus identifizierbar ist, sodass, wenn die Eigenschaft versagt, Sie wissen, welcher Mechanismus aufhörte zu messen.

Das ist die operative Konsequenz von Theorem 3. Wenn die Garantie „Sicherheit" ist und der Mechanismus „pass@k auf dem Werkzeugaufruf-Pfad", dann, wenn pass@k fällt, wissen Sie, dass der Werkzeugaufruf-Pfad der Ort ist, an dem die Garantie schwächer wurde. Eine gebündelte Punktzahl kann Ihnen das nicht sagen. Sie kann nur sagen, dass sich eine Zahl bewegte. Der Bericht, vielleicht ohne Absicht, ist ein Plädoyer für Entbündelung.

Der zivile und defensive Scope ist der einzige ehrliche Scope

Der Bericht handelt von defensivem Red Teaming — Fehler finden, damit sie behoben werden können. Er handelt nicht von offensiver Fähigkeit. Das entspricht einer Grenze, die wir ausdrücklich wahren: nur zivile und defensive Nutzung. Derselbe Mechanismus, der einen Privilegieneskalations-Pfad findet, damit Sie ihn schließen, könnte ihn in anderen Händen finden, damit ihn jemand ausnutzt. Der Bericht verweilt nicht dabei, aber das Procurement-Rahmen nimmt an, dass der Käufer will, dass der Fehler gefunden und behoben wird, nicht gefunden und bewaffnet.

Wir stellen dies fest, weil die Stimme des Honest Architect es verlangt. Eine Red-Teaming-Fähigkeit ist ein Messmechanismus; ein Messmechanismus ist neutral gegenüber der Absicht seines Betreibers. Das OWASP-Rahmen ist am nützlichsten für einen Betreiber, dessen Absicht defensiv ist, und wir würden es nicht anders verkaufen. Die Everythink-Topologie — wo Routing-Entscheidungen die Angriffsfläche sind — ist so gebaut, dass der defensive Betreiber die Pfade sehen und schließen kann. Sie ist nicht gebaut, um einem offensiven Betreiber zu helfen, sie zu öffnen.

Wie sich das mit dem verbindet, was wir ausliefern

Die Sisters → Oracle-Pipeline ist eine kalibrierte Vorhersage, keine Schätzung. Jede Sister entwirft eine plausible Zukunft; der Oracle verschmilzt sie zu einem normalisierten Ensemble. Die Disziplin lautet: ein Normalisierungsmechanismus, eine messbare Garantie. Der OWASP-Bericht verlangt dasselbe vom Red Teaming: ein pass@k-Mechanismus, ein messbares Sicherheitssignal. Die Form ist dieselbe, weil das zugrundeliegende Prinzip dasselbe ist — Theorem 3, das weder der Sicherheits-Community noch der Forecasting-Community gehört, das aber beide immer wieder neu entdecken.

Production ✅ Fähigkeiten, die diese Disziplin tragen: der HAI Engine (die Routing- und Matching-Engine, die seit 2016 läuft), die Sisters und der Oracle (das kalibrierte Ensemble), World Monitor (das Live-Geo-Signal-Gateway, dessen deterministische IDs bedeuten, dass Re-Ingestion aktualisiert, nie dupliziert — ein Messmechanismus für Datenintegrität), Social und Campaigns (wo Berechtigungs-Scopes routen, bevor Content ausgeliefert wird) und die Whitelabel Network (wo Souveränität über die network, Marke und Daten die Routing-Grenze ist, die der Betreiber kontrolliert).

Partial ⚠️ Fähigkeiten: Matchmaking, Marketplace und Calendar — die Messmechanismen existieren, aber die Abdeckung ist unvollständig, und wir werden sie nicht Production nennen, bis sie es ist. Roadmap 🔵: Wallet & Token, Super App und Community Credit — Pre-Revenue, unter Howey-Review, und nicht als Ergebnisse versprochen. Wir stufen keinen Status hoch. Die Red Flags des OWASP-Berichts sind, in effect, die Fehlerart der Statusaufstufung: ein Anbieter, der eine Jailbreak-Demo „Sicherheit" nennt, stuft einen Oberflächentest zu einer Systemgarantie hoch.

Kernpunkte

  • Eine Jailbreak-Demo misst den Ablehnungsmechanismus eines Chatbots. Sie misst nicht die Werkzeugaufruf-, Retrieval- oder Multi-Agenten-Mechanismen. Einen bescheinigen bescheinigt einen. Das ist Theorem 3 im Sicherheitskostüm.
  • Der Bericht des OWASP GenAI Security Project (2026) trennt einfache von fortgeschrittenen KI-Systemen und gibt zehn Evaluationsdimensionen — jede ein Mechanismus, der implementiert und gemessen werden muss, nicht behauptet.
  • Die Metriken, die zählen — pass@k, Average Turns to Jailbreak, Replayability, Agenten-Rückverfolgbarkeit — sind einzelne, trennbare Mechanismen. Ein gebündelter „Risk Score" verbirgt, welcher Mechanismus aufhörte zu messen, wenn die Garantie versagt.
  • Die echte Angriffsfläche ist die Routing-Grenze, nicht der Prompt. Everythinks network → community → room Topologie routet, bevor etwas antwortet; die Berechtigung an jedem Übergang ist, wo ein Gegner den Fluss umzuleiten versucht.
  • Der zivile und defensive Scope ist der einzige ehrliche Scope für einen Messmechanismus. Derselbe Mechanismus, der einen Pfad findet, um ihn zu schließen, könnte ihn finden, um ihn auszunutzen.

Häufig gestellte Fragen

Was ist KI-Red Teaming und wie unterscheidet es sich vom traditionellen Red Teaming? KI-Red Teaming ist adversariales Testen, das darauf abzielt, Sicherheits-, Missbrauchs- und Alignment-Fehler in KI-Systemen aufzudecken — Halluzinationen, Jailbreaks, Werkzeugmissbrauch, Privilegieneskalation, Datenleck. Traditionelles Cybersecurity-Red-Teaming testet Netzwerke und Anwendungen auf unbefugten Zugriff. Der OWASP-Bericht ist explizit, dass die beiden nicht dasselbe sind: ein KI-Red-Team testet das Verhalten des Modells und das System darum, nicht nur den Perimeter.

Warum reicht eine Jailbreak-Demo nicht aus, um Sicherheit zu bescheinigen? Eine Jailbreak-Demo misst, ob ein bestimmter Prompt den Ablehnungsmechanismus eines Chatbots umgeht. Sie misst nicht den Werkzeugaufruf-Pfad, den Retrieval-Pfad oder den Multi-Agenten-Übergabe-Pfad — jeder ein separater Mechanismus mit einer separaten Fehlerart. Theorem 3 sagt es direkt: eine Eigenschaft ist genau dann garantiert, wenn ihr Mechanismus implementiert und messend ist. Eine Demo, die den falschen Mechanismus misst, garantiert nichts über den richtigen.

Welche Metriken sollte ein Red-Teaming-Anbieter melden? Der OWASP-Bericht nennt pass@k (die Wahrscheinlichkeit, dass mindestens einer von k Versuchen gelingt) und Average Turns to Jailbreak, dazu Replayability, Observability und Agenten-Rückverfolgbarkeit. Jedes ist ein einzelner, trennbarer Messmechanismus. Ein Anbieter, der nur eine Zählung gefundener Schwachstellen meldet, ohne diese Mechanismen, meldet eine Zahl, keine Garantie.

Wie hängt Everythinks Topologie mit KI-Red-Teaming zusammen? Die network → community → room Topologie routet eine Anfrage, bevor etwas antwortet. Die Berechtigung an jedem Übergang — room-Scope, community-Vertrauensgrenze, network-Souveränität — ist eine Routing-Entscheidung, und Routing-Entscheidungen sind die echte Angriffsfläche in agentiven Systemen. Ein Red Team, das den Prompt und nicht die Routing-Grenze testet, testet die Eingangshalle, nicht den Tresor. „The space is the router" ist die Aussage, dass die Routing-Schicht der Ort ist, wo Sicherheit gewonnen oder verloren wird.

Kann ein Red-Teaming-Rahmenwerk offensiv genutzt werden? Ein Messmechanismus ist neutral gegenüber der Absicht. Das OWASP-Rahmen ist für den defensiven Betreiber konzipiert, der will, dass Fehler gefunden und behoben werden. Everythink wahrt eine zivile und defensive Scope-Grenze ausdrücklich: die Topologie ist so gebaut, dass der defensive Betreiber Pfade sehen und schließen kann, nicht damit ein offensiver Betreiber sie öffnet.

Sources

Erstellen Sie Ihre network — und entscheiden Sie, wo die Routing-Grenze liegt, bevor etwas antwortet.

Baue deine Welt auf einer Engine, die beweist, was sie behauptet.

Erstelle dein eigenes Netzwerk auf der Engine, die seit 2016 läuft — oder sprich mit dem Team hinter den 21 Papieren.