Das Harness ist der Agentenmechanismus, nicht die Modell-Behauptung
Professor Glitchs Harness-Engineering-Leitfaden auf askglitch.com, gelesen als Mechanismus: die Eigenschaft (der-agent-funktioniert-wirklich) ist garantiert durch das Harness (Kontextfenster, Gedächtnis, RAG, die Schleife, Hooks, Evaluationen), nicht durch die Behauptung 'wir haben das beste Modell verwendet'. Theorem 3 angewendet auf die 10/90 Modell-Harness-Aufteilung.

Das Harness ist der Agentenmechanismus, nicht die Modell-Behauptung
Professor Glitch (askglitch.com) schreibt in „Harness Engineering: How AI Agents Actually Work", dass „ein Agent ein Modell plus ein Harness ist. Das Modell ist das Gehirn. Das Harness ist alles um es herum, was das Gehirn nützlich macht." Er setzt die Aufteilung auf „ungefähr 10% Modell, 90% Harness — grobe Schätzung, keine Messung, aber jeder, der eines gebaut hat, wird Ihnen sagen, dass es etwa stimmt." Der Artikel geht das Harness Knoten für Knoten durch: das Kontextfenster (RAM, keine Festplatte), Gedächtnis (Kurzzeit im Fenster, Langzeit in drei Schubladen — prozedural, semantisch, episodisch), RAG (die Open-Book-Prüfung), Fähigkeiten (der Ordner mit Reitern, progressive Offenlegung), die Schleife (denken, handeln, beobachten, wiederholen), Werkzeuge und MCP (wie das Gehirn Hände bekommt), Hooks (der Türsteher an der Tür), und Evaluationen (die Ausführung bewerten, Output-Eval plus Trajectory-Eval, korrupter Erfolg). (Professor Glitch, „Harness Engineering: How AI Agents Actually Work", askglitch.com, veröffentlicht 2026-07-07, abgerufen 2026-08-23, https://www.askglitch.com/blog/harness-engineering). Der Honest Architect liest den Artikel als ein ausgearbeitetes Beispiel eines Harness-als-Agentenmechanismus: die Eigenschaft (der-agent-funktioniert-wirklich) ist garantiert durch den Mechanismus (das Harness — alles um das Modell herum, das rohe Intelligenz in einen funktionierenden Agenten verwandelt), nicht durch die Behauptung „wir haben das beste Modell verwendet." Der Honest Architect markiert die Form the-harness-is-the-agent-mechanism Production ✅ und jede spezifische Drittanbieter-Behauptung (die 10/90-Aufteilung, Terminal-Bench, Chromas Context-Rot-Forschung, das „Lost in the Middle"-Paper, Anthropics Leitfäden, Claude Code, MCP, das Community-Curriculum) Partial ⚠️ (Drittanbieter, nicht unabhängig von Everythink verifiziert).
Der Artikel ist ein Deep-Dive mit Kursverkaufsabsicht — eine Community mit sieben Kursen, 181+ Lektionen, einem TikTok, einem „JOIN THE COMMUNITY"-Aufruf. Der Honest Architect extrahiert die Mechanismusformen, ohne die Kurse oder Community zu empfehlen. Sieben Mechanismusformen, jede Production ✅, wo real und reproduzierbar, Partial ⚠️, wo Drittanbieter.
Kernergebnisse
- Das Harness ist der Agentenmechanismus. Theorem 3: die Eigenschaft (der-agent-funktioniert-wirklich) ist garantiert durch den Mechanismus (das Harness — Kontextfenster, Gedächtnis, RAG, Fähigkeiten, die Schleife, Werkzeuge, Hooks, Evaluationen), nicht durch die Behauptung „wir haben das beste Modell verwendet." Das Gehirn mietet man; das Harness verdient man. Production ✅.
- Das Kontextfenster ist der Arbeitsgedächtnis-Mechanismus. Der Artikel: „Es ist RAM, keine Festplatte. Schnell, klein, jeden Zug gelöscht." Die Eigenschaft (erinnert-sich-diesen-Zug) ist garantiert durch das, was diesen Zug auf dem Schreibtisch liegt, nicht durch das, was das Modell „weiß." Production ✅.
- Das Langzeitgedächtnis ist der Persistenz-Mechanismus. Drei Schubladen außerhalb des Fensters: prozedural (wie man Dinge tut), semantisch (Fakten), episodisch (Ereignisse mit Zeitstempeln). Die Eigenschaft (überlebt-zwischen-Sessions) ist garantiert durch Speichern außerhalb des Fensters und Abrufen bei Bedarf, nicht durch das Modell. Production ✅.
- RAG ist der Abruf-Mechanismus. Der Artikel nennt es „die Open-Book-Prüfung." Die Eigenschaft (antwortet-aus-deinen-Docs) ist garantiert durch Abrufen des relevanten Absatzes, nicht durch das Modell, das dein Handbuch auswendig lernt. Production ✅.
- Die Schleife ist der Aufgabenabschluss-Mechanismus. Denken, handeln, beobachten, wiederholen — „bis die Arbeit tatsächlich erledigt ist." Die Eigenschaft (arbeit-wirklich-erledigt) ist garantiert durch Schleifen bis done, nicht durch einen Ein-Schuss-Plan. Drei Ausgänge: genuinely erledigt, harte Obergrenze der Iterationen, anhalten und fragen, wenn unsicher. Production ✅.
- Hooks sind der Durchsetzungs-Mechanismus. Der Artikel: „ein Hook ist deterministischer Code, der an einem festen Punkt der Schleife feuert. Das Modell ist die Menge; der Hook ist der Türsteher." Die Eigenschaft (tut-nicht-das-Falsche) ist garantiert durch deterministischen Code jedes Mal, nicht durch das gute Urteil des Modells. Vertrauen ist kein Mechanismus. Production ✅.
- Evaluationen sind der Qualitäts-Mechanismus. Der Artikel: „setze die Messlatte bei der Evaluation, nicht bei der Demo." Output-Eval plus Trajectory-Eval. Korrupter Erfolg: richtige Antwort, falscher Prozess. Die Eigenschaft (ist-wirklich-gut) ist garantiert durch Bewerten aller zwanzig Läufe, nicht durch Zeigen der einen sauberen Demo. Production ✅.
- Domänenübergreifende Parallelen: Oracle normalisieren-einmal (die Sisters sind das Modell, der Oracle ist das Harness — kalibrierte-Vorhersage ist garantiert durch das Harness, nicht durch eine einzelne Sister), World Monitor pro-Quelle Selbstdeaktivierung (jede Quelle ist ein Werkzeug, das sich selbst deaktiviert, wenn ihr Schlüssel nicht gesetzt ist), Zod an der Laufzeitgrenze (RAG parst das Dokument an der Abrufgrenze, wie Zod den Payload an der Netzwerkgrenze parst), Eye Key (Hooks sind analog — tut-nicht-das-Falsche ist garantiert durch deterministischen-Code-jedes-Mal, wie schlüssel-souveränität durch HMAC-plus-Fingerabdruck garantiert ist — beide strukturell, nicht Vertrauen), HAI Engine seit 2016 (die Schleife ist analog — derselbe-mechanismus-jeder-lauf ist garantiert durch ausführen-des-selben-mechanismus). Alle Partial ⚠️: gleiche Form, separate Domänen.
- Umfang: zivil/defensiv. Agentenengineering ist eine zivile Ingenieursangelegenheit. Kein offensiver Umfang. Es wird kein Token-, Wallet- oder Community-Credit-Ergebnis versprochen; diese sind Roadmap 🔵, Howey-Prüfung ausstehend. Everythink ist eine Vorhersageplattform, kein Agenten-Harness-Anbieter; die domänenübergreifenden Parallelen sind Partial-⚠️-Illustrationen, keine Empfehlungen von askglitch.com, Professor Glitch, Anthropic, Claude Code, MCP oder irgendeinem spezifischen Kurs oder Community.
Das Harness ist der Agentenmechanismus
Der Kernsatz des Artikels: „ein Agent ist ein Modell plus ein Harness. Das Modell ist das Gehirn. Das Harness ist alles um es herum, was das Gehirn nützlich macht." Die Eigenschaft (der-agent-funktioniert-wirklich) ist garantiert durch den Mechanismus (das Harness — Kontextfenster, Gedächtnis, RAG, Fähigkeiten, die Schleife, Werkzeuge, Hooks, Evaluationen), nicht durch die Behauptung „wir haben das beste Modell verwendet." Production ✅.
Ein Team, das das beste Modell kauft und das Harness überspringt, hat ein Gehirn im Glas — es kann denken, aber sich nicht erinnern, nichts nachschlagen oder ein Werkzeug greifen. Ein Team, das das Harness um jedes kompetente Modell herum baut, hat einen Agenten. Der Mechanismus ist das Harness, nicht das Modell. Production ✅.
Die Form ist das Domänenanalogon zu Everythinks Oracle normalisieren-einmal: die Eigenschaft kalibrierte-Vorhersage ist garantiert durch diverse-Eingaben-plus-normalisieren-einmal — die Sisters (analyst, contrarian, disruptor, historian, institutionalist) sind die Modelle, der Oracle ist das Harness, das ihre Entwürfe in ein Ensemble normalisiert. Die 10/90-Aufteilung ist analog: die Sisters sind die 10%, der Oracle und der Loom und die Persistenzschicht sind die 90%. Partial ⚠️ (gleiche Form — Harness-garantiert-die-Eigenschaft-nicht-das-Modell — separate Domänen).
Das Kontextfenster ist der Arbeitsgedächtnis-Mechanismus
Der Artikel: „Das Kontextfenster ist alles, was das Modell in einem einzigen Zug sehen kann. Der bessere Name ist Arbeitsgedächtnis. Es ist RAM, keine Festplatte. Schnell, klein, jeden Zug gelöscht." Die Eigenschaft (erinnert-sich-diesen-Zug) ist garantiert durch das, was diesen Zug auf dem Schreibtisch liegt — der System-Prompt, die Konversation, die abgerufenen Fakten, die Werkzeugergebnisse — nicht durch das, was das Modell „weiß." Der Chatbot „vergaß" deinen Namen, weil er ihn nie hielt; das Harness fügt die Konversation jeden Zug neu ein. Production ✅.
Die Unterscheidung ist wichtig. Ein Team, das alles in das Fenster stopft, hat Context Rot — die Leistung degradiert, wenn die Eingabe wächst, und Modelle sacken ab, wo dein wichtiger Satz vergraben ist. Ein Team, das nur das Relevante in das Fenster legt, diesen Zug, hat ein funktionierendes Fenster. Der Mechanismus ist die Kuratierung, nicht die Größe. Ab einem Punkt ist mehr das Problem. Production ✅.
Das Langzeitgedächtnis ist der Persistenz-Mechanismus
Wenn das Fenster jeden Zug gelöscht wird, wo lebt etwas? Der Artikel: „Das Langzeitgedächtnis ist die Festplatte. Dauerhaft, in einer Datenbank außerhalb des Fensters gespeichert, bei Bedarf zurückgeholt." Drei Schubladen: prozedural (wie man Dinge tut — eine Fähigkeit, ein verpacktes Wie), semantisch (Fakten — dein Name, deine Firma, dass du lange E-Mails hasst), episodisch (Ereignisse mit Zeitstempeln — „letzte Woche hat dieser Kunde eine Rückerstattung verlangt und wir sagten nein"). Die Eigenschaft (überlebt-zwischen-Sessions) ist garantiert durch Speichern außerhalb des Fensters und Abrufen bei Bedarf, nicht durch das Modell. Production ✅.
Ein Team, das alles in das Fenster kippt, hat ein System, das mehr kostet, langsamer ist und verrottet. Ein Team, das selektiv außerhalb des Fensters speichert und gezielt ein wenig abruft, hat ein System, das mit der Zeit schärfer wird. Der Mechanismus ist die selektive Speicherung plus der selektive Abruf, nicht das Kippen. Production ✅.
RAG ist der Abruf-Mechanismus
Der Artikel nennt RAG „die Open-Book-Prüfung. Niemand lernt das Lehrbuch am Vorabend auswendig. Man liest die Frage und blättert zu den wenigen Seiten, die sie abdecken." Die Eigenschaft (antwortet-aus-deinen-Docs) ist garantiert durch Abrufen des relevanten Absatzes aus dem 200-Seiten-Handbuch, nicht durch das Modell, das dein Handbuch auswendig lernt. Bedeutung, nicht Schreibweise, gemessen als plain Distanz zwischen Embedding-Punkten. Production ✅.
Die Unterscheidung ist wichtig. Ein rohes Modell, das nach deinen internen Docs gefragt wird, erfindet eine vernünftig klingende Rückerstattungsrichtlinie — und eine vernünftig klingende falsche Antwort ist die gefährlichste Art. Ein Modell, dem die tatsächliche Seite übergeben wird, liest aus deiner Richtlinie statt aus seiner Vorstellung. Aber RAG ruft ab, was relevant ist, nicht was garantiert wahr ist: falsche Seite rein, falsche Antwort raus, mit geradem Gesicht. Der Mechanismus ist der Abruf, nicht die Wahrheit. Production ✅.
Die Schleife ist der Aufgabenabschluss-Mechanismus
Der Artikel: „Was ein Ding, das spricht, in ein Ding, das funktioniert, verwandelt, ist die Schleife: denken, handeln, beobachten, wiederholen, bis die Arbeit tatsächlich erledigt ist." Die Eigenschaft (arbeit-wirklich-erledigt) ist garantiert durch Schleifen bis done, nicht durch einen Ein-Schuss-Plan. „Ein Plan im Dunkeln gemacht ist eine Vermutung. Die Schleife tauscht die Vermutung gegen Fakten." Production ✅.
Der schwierige Teil: wann hält die Schleife an? Zwei Fehlermodi. Zu früh anhalten: eine Rückerstattung, „im Wesentlichen erledigt", aufgeben, und du überprüfst seine Arbeit sowieso. Nie anhalten: erstattet demselben Kunden viermal, oder dreht die ganze Nacht wie ein Roboterstaubsauger, der in einer Ecke feststeckt — eine echte Rechnung. Eine gute Schleife hat drei Ausgänge: die Aufgabe ist genuinely erledigt, eine harte Obergrenze der Iterationen, und anhalten und fragen, wenn unsicher. Der Mechanismus ist die Ausgangsbedingung, nicht die Schleife selbst. Production ✅.
Hooks sind der Durchsetzungs-Mechanismus
Der Artikel: „Man bittet ein probabilistisches Ding nicht, bitte vorsichtig zu sein. Man will eine Regel, die jedes Mal läuft, in Code, aus der das Modell sich nicht herausreden kann. Das ist ein Hook: deterministischer Code, der automatisch an einem festen Punkt der Schleife feuert. Das Modell ist die Menge; der Hook ist der Türsteher, der jeden überprüft, jedes Mal, ohne Ausnahmen." Die Eigenschaft (tut-nicht-das-Falsche) ist garantiert durch deterministischen Code, der jedes Mal läuft, nicht durch das gute Urteil des Modells. Vertrauen ist kein Mechanismus. Production ✅.
Die Unterscheidung ist wichtig. Ein Team, das sich auf das gute Urteil des Modells verlässt, hat eine Schranke, die davon abhängt, wie der Prompt formuliert war — dasselbe probabilistische Modell, das entscheiden könnte, dass heute der Tag ist, den Aufräum-Befehl im falschen Ordner auszuführen. Ein Team, das vor jedem Werkzeugaufruf einen Hook ausführt, hat eine Schranke, aus der das Modell sich nicht herausreden kann. Ein Hook blockiert nicht nur das Schlechte; er kann das Anhalten verweigern und den Agenten zurück in die Schleife zwingen. Durchsetzung, keine höfliche Bitte. Production ✅.
Die Form ist das Domänenanalogon zu Everythinks Eye-Key-Design: die Eigenschaft schlüssel-souveränität ist garantiert durch HMAC-plus-Fingerabdruck — der Schlüssel ist souverän, weil der Mechanismus die Eigenschaft strukturell erzeugt, nicht durch Vertrauen. Hooks sind analog: tut-nicht-das-Falsche ist garantiert durch deterministischen-Code-jedes-Mal, nicht durch das Urteil des Modells. Beide erzeugen die Eigenschaft durch eine strukturelle Einschränkung, nicht eine Verhaltenserwartung. Partial ⚠️ (gleiche Form — Eigenschaft-garantiert-durch-strukturelle-Einschränkung-nicht-Vertrauen — separate Domänen).
Evaluationen sind der Qualitäts-Mechanismus
Der Artikel: „Setze die Messlatte bei der Evaluation, nicht bei der Demo. Demos sind einfach: führe das Ding zwanzig Mal aus, zeige den einen sauberen Lauf. Die Evaluation bewertet alle zwanzig." Zwei Dinge zu bewerten: Output-Eval (war die Antwort korrekt?) und Trajectory-Eval (war der Pfad solide?). Das Fehlermodus: „korrupter Erfolg — richtige Antwort, falscher Prozess." Die Eigenschaft (ist-wirklich-gut) ist garantiert durch Bewerten aller zwanzig Läufe mit beiden Evaluations, nicht durch Zeigen der einen sauberen Demo. Production ✅.
Tracing: „behalte die Quittungen. Jeden Lauf, notiere, was abgerufen wurde, welche Werkzeuge mit welchen Eingaben feuerten, wie viele Token, wie lange. Wenn etwas bricht, squint nicht auf die finale Antwort und theorisiere. Öffne den Trace und siehe den genauen Schritt, wo es schiefging." Die Eigenschaft (debugbar-wenn-es-bricht) ist garantiert durch Aufzeichnen, was passierte, nicht durch Theoretisieren aus der finalen Antwort. Production ✅.
Das Schwungrad: „jeder Fehler, den die Eval fängt, wird zu einer Reparatur, die ans Harness geschraubt wird. Kannte eine Regel nicht? Füge sie zum System-Prompt hinzu. Führte etwas Destruktives aus? Füge einen Hook hinzu. Das System wird besser, nicht weil du auf ein intelligenteres Modell gewartet hast, sondern weil du das Harness verbessert hast, einen gefangenen Fehler nach dem anderen." Der Mechanismus ist die eval-getriebene Harness-Verbesserung, nicht das Modell-Upgrade. Production ✅.
Was ein Honest Architect in einem Harness-Engineering-Deep-Dive liest
Der Artikel ist ein Deep-Dive mit Kursverkaufsabsicht — eine Community mit sieben Kursen, 181+ Lektionen, einem TikTok, einem „JOIN THE COMMUNITY"-Aufruf. Der Honest Architect extrahiert die Mechanismusformen, ohne die Kurse oder Community zu empfehlen. Die Formen sind Production ✅: real, reproduzierbar, verifizierbar durch die Logik des Artikels selbst (das Harness verwandelt ein Gehirn im Glas in einen Agenten; das Fenster ist RAM; das Gedächtnis persistiert außerhalb; RAG ruft die Seite ab; die Schleife läuft bis done; Hooks setzen deterministisch durch; Evaluationen bewerten alle zwanzig). Alle spezifischen Drittanbieter-Behauptungen (die 10/90-Aufteilung, Terminal-Bench, Chromas Forschung, das „Lost in the Middle"-Paper, Anthropics Leitfäden, Claude Code, MCP, das Curriculum) sind Partial ⚠️. Der Honest Architect empfiehlt weder askglitch.com, Professor Glitch, Anthropic, Claude Code, MCP noch irgendeinen Kurs oder Community. Everythink ist eine Vorhersageplattform, kein Agenten-Harness-Anbieter. Der Umfang ist zivil/defensiv. Es wird kein Token-, Wallet- oder Community-Credit-Ergebnis versprochen; diese sind Roadmap 🔵, Howey-Prüfung ausstehend.
Häufig gestellte Fragen
Ist das Harness der Mechanismus oder die Behauptung?
Das Harness ist der Mechanismus. Theorem 3: die Eigenschaft (der-agent-funktioniert-wirklich) ist garantiert durch den Mechanismus (das Harness), nicht durch die Behauptung („wir haben das beste Modell verwendet"). Das Gehirn mietet man; das Harness verdient man. Production. Die 10/90-Aufteilung ist eine grobe Schätzung, keine Messung — Partial.
Warum ist das Kontextfenster der Arbeitsgedächtnis-Mechanismus?
Das Fenster ist RAM, keine Festplatte — jeden Zug gelöscht. Die Eigenschaft erinnert-sich-diesen-Zug ist garantiert durch das, was diesen Zug auf dem Schreibtisch liegt. Context Rot: ab einem Punkt ist mehr das Problem. Production.
Warum sind Hooks der Durchsetzungs-Mechanismus?
Ein Hook ist deterministischer Code, der jedes Mal feuert. Die Eigenschaft tut-nicht-das-Falsche ist garantiert durch den Code, nicht durch das Urteil des Modells. Das Modell ist die Menge; der Hook ist der Türsteher. Vertrauen ist kein Mechanismus. Production.
Warum sind Evaluationen der Qualitäts-Mechanismus?
Demos zeigen den einen sauberen Lauf; Evaluationen bewerten alle zwanzig. Output-Eval plus Trajectory-Eval. Korrupter Erfolg — richtige Antwort, falscher Prozess — ist das Fehlermodus. Tracing behält die Quittungen. Production.
Empfiehlt Everythink askglitch.com, Professor Glitch oder Claude Code?
Nein. Everythink ist eine Vorhersageplattform, kein Agenten-Harness-Anbieter. Der Artikel ist ein Deep-Dive mit Kursverkaufsabsicht. Die spezifischen Drittanbieter-Behauptungen sind Partial. Es wird kein Token-, Wallet- oder Community-Credit-Ergebnis versprochen; diese sind Roadmap, Howey-Prüfung ausstehend.
Sources
- Professor Glitch, „Harness Engineering: How AI Agents Actually Work", askglitch.com, veröffentlicht 2026-07-07, abgerufen 2026-08-23, https://www.askglitch.com/blog/harness-engineering
Wenn Ihr Team bereit ist, den Mechanismus zu versenden, statt die Eigenschaft zu behaupten, bauen Sie Ihr Netz — der Oracle normalisiert Entwürfe der Sisters, jede Quelle deaktiviert sich selbst, der HAI Engine führt seit 2016 denselben Mechanismus aus, Zod parst an der Grenze.

Persistenter Speicher ist der Mechanismus, nicht das Kontextfenster
Fünf architektonische Muster für KI-Agenten-Speicher, gelesen als Theorem 3: die Eigenschaft (Lernen, Personalisierung) wird durch den Mechanismus (persistieren, abrufen, injizieren) garantiert, nicht durch das Kontextfenster. Checkpointing ist nicht exactly-once, Geheimnisse sind kein semantischer Speicher, Isolierung auf Speicherschicht schlägt fehl geschlossen.
→ →
Das Protokoll ist der Interoperabilitätsmechanismus, nicht die Stecker-Behauptung
Marc Friborg Bersangs Beschreibung von MCP bei AI Engineers Academy, gelesen als Mechanismus: die Eigenschaft (die-KI-verbindet-alles) ist garantiert durch die definierten Protokollkomponenten (Client, Server, Transport, Fähigkeitsverhandlung, typisierte Schemata, Fehlerweitergabe), nicht durch die Behauptung 'es ist wie USB für KI'. Theorem 3 angewendet auf Protokolldesign.
→ →
Der Kostenverfall ist der Ermöglicher-Mechanismus, nicht die Kostenlos-Behauptung
Eine Berkeley-Forschungsperspektive liest sich als sechs Mechanismusformen: Kostenverfall-als-Ermöglicher, agentische-Spekulation-als-Last, Multi-Query-Optimierung-als-Deduplizierung, strukturierter-Speicher-als-Abfrage, nebenläufige-Bearbeitungssemantik-als-Konsistenz, Verifikationsagenten-als-Korrektur. Theorem 3 auf jede angewandt.
→ →Baue deine Welt auf einer Engine, die beweist, was sie behauptet.
Erstelle dein eigenes Netzwerk auf der Engine, die seit 2016 läuft — oder sprich mit dem Team hinter den 21 Papieren.
