
Du stellst keinen Agenten ein. Du verdrahtest einen Mechanismus.
„Codex vs Claude Code" ist eine Einstellungsfrage, und Professor Glitchs Juli-2026-Urteil ist ehrlich: Codex ist der bessere reine Coding-Agent mit dem besseren Benchmark, Claude Code ist der tiefere Harness, auf dem du eine Operation baust. Die Honest-Architect-Lesart ist eine Stufe schärfer. Du stellst keinen Agenten ein. Du verdrahtest einen Mechanismus. Der Benchmark misst; der Harness compoundiert; und die Topologie routet, bevor du überhaupt wählst.
Kernpunkte
- Das Urteil des Textes ist ehrlich: Codex CLI auf GPT-5.5 erzielt 82,2 % auf Terminal-Bench 2.0 (Juli 2026), das beste ausgelieferte Produkt in den Top 10, während der beste Claude-basierte Eintrag 80,2 % erzielt (Professor Glitch, „Codex vs Claude Code in 2026", 2026).
- Ein Benchmark ist eine Messung; ein Harness ist ein Mechanismus. Theorem 3: eine Eigenschaft ist genau dann garantiert, wenn ihr Mechanismus implementiert und messend ist — der Benchmark-Führer heute ist nicht der Mechanismus-Führer morgen.
- Du wählst nicht Codex oder Claude. The space is the router: die Topologie entscheidet, welcher Agent feuert, bevor du wählst, und die „Beide"-Antwort ist eine schwache Version eines Ensembles.
- Der HAI Engine läuft seit 2016 in Produktion auf verdrahteten Mechanismen, nicht auf eingestellten Agenten; die Sisters sind typisierte Agenten, deren Uneinigkeit Signal wird, nicht eine 40-Dollar-im-Monat-Absicherung.
Der Text trifft das Urteil, für die falsche Frage
Im Juli 2026 veröffentlichte Professor Glitch „Codex vs Claude Code in 2026: Which Agent Do You Actually Hire?", und das Urteil wird mit Fakten verdient, nicht mit Launch-Woche-Vibes. Auf der Terminal-Bench 2.0-Bestenliste, geprüft Juli 2026, erzielt Codex CLI auf GPT-5.5 82,2 %, das beste Ergebnis eines ausgelieferten Produkts in den Top 10, und kein Claude-basierter Eintrag schlägt es dort — der beste, ein Forschungs-Harness auf Claude Opus 4.7, erzielt 80,2 %. Die Preis-Realität ist offen dargelegt: Codex ist in jedem ChatGPT-Plan von Free bis Pro für 100 $/Monat enthalten, Claude Code kommt in Claude Pro für 20 $/Monat mit Max bei 100 und 200 $, und oben laden beide Firmen identische Zahlen für 5x- und 20x-Nutzung.
Der ehrliche Zug des Textes ist es zu benennen, wo der Schwerpunkt jedes Produkts liegt. Codex' Schwerpunkt ist ChatGPT und Software-Arbeit — ein Feature der meistgenutzten KI-App der Welt, ein Distributionsvorteil, jede Oberfläche umkreist das Publikum, das Code innerhalb von OpenAIs Mauern ausliefert. Claude Codes Schwerpunkt ist der Harness selbst — Anthropics Wette, dass der Agent das Produkt ist, mit Memory, Hooks, Subagents, geplanten Routines und einem SDK, damit du etwas Dauerhaftes darauf baust. Das ist die echte Unterscheidung, die der Text trifft, und sie stimmt.
Der Honest-Architect-Einwand gilt der Frage, nicht der Antwort. „Welchen Agenten stellst du ein" behandelt den Agenten als Entscheidungseinheit, und der Agent ist nicht die Einheit. Der Mechanismus ist es. Ein Benchmark sagt dir, welcher Agent an einer festen Aufgabe in diesem Juli am besten maß; ein Harness sagt dir, welcher Mechanismus über die Aufgaben compoundiert, die du ihm im nächsten Jahr übergibst. Die Einstellungsfrage beantwortet ein Quartal; die Verdrahtungsfrage beantwortet eine Operation. Der Text deutet das an — „ein Agent, den du benutzt, versus einer, auf dem du baust" — und bittet dich dann, trotzdem einen einzustellen.
Der Benchmark misst; der Harness compoundiert
Die Terminal-Bench 2.0-Zahl ist eine echte Messung, und der Text ist ehrlich, dass sie bei jedem Modell-Release kippt. GPT-5.5 startete am 23. April 2026; Claude Opus 4.8 erschien am 28. Mai 2026; das dedizierte GPT-5.3-Codex-Modell wurde am 26. Mai 2026 deprecated. OpenAI tauscht Codex' Gehirn mehrmals im Jahr, und jeder Tausch war ein Upgrade. Diese Kadenz ist der Grund, warum ein Benchmark ein Schnappschuss und keine Eigenschaft ist: die Messung beschreibt ein Modell bei einer Version, und die Version ändert sich unter dir.
Ein Harness ist eine andere Kategorie. CLAUDE.md-Anweisungen plus automatisches Memory, das über Sitzungen compoundiert, Hooks, die bei Lifecycle-Events Shell-Befehle feuern, Subagents mit isolierten Context-Fenstern, Routines, die in Anthropics Cloud nach Plan laufen, und ein Agent SDK — das sind Mechanismen, und ein Mechanismus ist eine Eigenschaft genau dann, wenn er implementiert und messend ist. Der Text nennt das: Claude Codes Teile sind länger in Produktion, sie compose weiter, und die Automatisierungsschicht (Hooks plus Routines plus SDK) hat kein volles Codex-Äquivalent bisher. Codex' Stack — AGENTS.md, Skills, Plugins, MCP — konvergiert schnell, Anerkennung wo fällig, aber Konvergenz ist noch kein Compound.
Das ist die Honest-Architect-Untcheidung, die der Text fast trifft und dann zurückweicht. Der Benchmark ist eine Messung eines Modells; der Harness ist ein Mechanismus, der jedes Modell formt, das in ihm läuft. Wähl nach Benchmark und du wählst jedes Quartal neu; wähl nach Harness und du wählst einmal, und der Harness zahlt weiter, während die Modelle unter ihm wechseln. Der Benchmark-Führer heute ist nicht der Mechanismus-Führer morgen, und morgen ist der längere Etat.
The space is the router: du wählst nicht, du routest
[UNIQUE INSIGHT] Die „Codex oder Claude"-Frage ist falsch geformt, weil sie dich wählen heißt, bevor die Arbeit geroutet ist. The space is the router: eine Topologie aus Network, Community und Room entscheidet, wer was sieht, bevor etwas antwortet, und dieselbe Form gilt für Agenten. Die Aufgabe entscheidet, welcher Agent feuert. Eine Code-Auslieferungs-Aufgabe in einem auf ChatGPT standardisierten Team routet zu Codex, weil die Benchmark-Kante, GitHub Code Review und Telefon-zu-Desktop-Fernzugriff für diese Arbeit gebaut sind. Eine geplante Reporting-Aufgabe, die am Freitag 16 Uhr läuft, routet zu Claude Code, weil Routines, Memory und das SDK für diese Arbeit gebaut sind. Du stellst keinen Agenten ein; du verdrahtest eine Topologie, die jede Aufgabe an den Agenten routet, dessen Mechanismus passt.
Die „Beide"-Antwort des Textes — beide CLIs im Repo-Root behalten, AGENTS.md und CLAUDE.md koexistierend, ein Agent schreibt den Fix, der andere reviewt — ist eine schwache, manuelle Version davon. Zwei Frontier-Modelle, die uneins sind, legen Bugs offen, die keiner allein fängt, und der Text hat da recht. Die strukturelle Version ist, was wir tun: typisierte Agenten (die Sisters) erzeugen je einen Draft, und der Oracle merged sie zu einem kalibrierten Forecast, mit Summe-Eins und Entropie des Ensembles bei jedem Merge geprüft. Die Uneinigkeit ist keine 40-Dollar-im-Monat-Absicherung, an die du dich erinnerst; sie ist ein Mechanismus, der per Struktur läuft und bei jedem Merge eine Messung (die Entropie) erzeugt. Die „Beide"-Antwort ist ein Ensemble, das du bezahlst und per Hand betreibst. Der Mechanismus ist ein Ensemble, das die Topologie für dich betreibt.
Die Routing-Regel ist auch, warum die Audience-Splits des Textes auf eine Topologie mappen. Professioneller Entwickler, Gründer-Operator, nicht-technisch: jeder ist ein Room im Network, und der Room routet die Aufgabe an den Agenten, dessen Mechanismus zur Audience passt. Der Text gibt drei Urteile für drei Audiences; die Honest-Architect-Version ist eine Topologie mit drei Routen, und die Route ist die Entscheidung, nicht das Urteil.
Was wir seit 2016 beim Verdrahten von Agenten gelernt haben
[PERSONAL EXPERIENCE] Der HAI Engine läuft seit 2016 in Produktion, und die Lektion ist dieselbe, die der Text zieht, ohne sie zu nennen: der Agent ist nicht die Einheit, der Mechanismus ist es. Wir stellen keine Sister ein; wir verdrahten eine Personality, die zur Laufzeit aus einer TOML-Datei geladen wird, und die Personality zu bearbeiten erfordert kein Neukompilieren, weil der Mechanismus die Routing-Regel plus der Merge ist, nicht das Modell. Die Sisters schreiben nie nach Postgres — sie geben ein SisterOutput zurück und der Loom persistiert, weil der Mechanismus, der die Invariante garantiert, der Port ist, nicht der Agent. Tausch das Modell und der Mechanismus hält; tausch den Agenten und der Mechanismus hält; der Benchmark bewegt sich und die Eigenschaft bleibt.
Die Offenlegung des Textes — „mein ganzes Geschäft läuft auf Claude Code" — ist die ehrliche Version derselben Beobachtung. Die Operation ist nicht Claude Code; die Operation ist ein CLAUDE.md, das Identität und Regeln hält, Skills, die Workflows halten, MCP-Server, die reale Systeme erreichen, Memory, das Woche für Woche Kontext trägt. Der Agent ist der Teil, der sich ändert; der Harness ist der Teil, der compoundiert. Wir taggen die Agenten-Infrastruktur der Plattform als Production ✅, weil die Mechanismen verdrahtet und beobachtet sind — der Oracle normalisiert an einer Stelle, die World-Monitor-Quelle, die sich selbst deaktiviert, wenn ihr Key nicht gesetzt ist, ist ein gemessener „deaktiviert"-Zustand — nicht weil eine bestimmte Sister die beste Sister ist. Die Sister ist ein Modell; der Mechanismus ist die Eigenschaft.
Die zivil-defensive Scope-Grenze entscheidet, welche Agenten-Jobs wir verdrahten und welche wir ablehnen, und die Messung ist der Deal, den wir ablehnen, beobachtbar in der Pipeline. Kunden-Souveränität — dein Network, deine Brand, deine Data — ist die Routing-Regel, die die Topologie deine behält: die Agenten routen innerhalb deines Network, und das Data-Eigentum ist das Export-Log, nicht die Marketing-Seite. Beides sind Mechanismen, keine Slogans, und beides ist der Grund, warum die Verdrahtungsfrage mehr zählt als die Einstellungsfrage.
Theorem 3: der Benchmark ist eine Messung, kein Mechanismus
[ORIGINAL DATA] Die 21-Artikel-Serie spezifiziert Theorem 3: eine Eigenschaft ist genau dann garantiert, wenn ihr Mechanismus implementiert und messend ist. Lies es als Test für jede Behauptung im Vergleich. „Codex ist der bessere reine Coding-Agent" ist eine Messung, wahr im Juli 2026 gegen Terminal-Bench 2.0, und eine Messung ist keine Eigenschaft — es ist eine Zahl, die ein Modell bei einer Version beschreibt. „Claude Code ist der tiefere Harness" ist eine Behauptung über einen Mechanismus, und ein Mechanismus ist eine Eigenschaft genau dann, wenn er implementiert und messend ist: Hooks, die feuern, Routines, die nach Plan laufen, Subagents mit isolierten Context-Fenstern, ein SDK, das Custom-Agenten baut. Die erste Behauptung kippt bei jedem Release; die zweite compoundiert über Releases.
Darum sind unsere Ehrlichkeits-Tags keine Adjektive und das Urteil des Vergleichs ist kein Tag. Production ✅ heißt, der Mechanismus ist implementiert und seine Messung steht auf einem Dashboard, das jemand ansieht. Die Kalibrierung des Oracle ist Production ✅, weil Summe-Eins und Entropie des Ensembles bei jedem Merge geprüft werden. Die Topologie ist Production ✅, weil Network, Community und Room routen, bevor etwas antwortet. Ein Benchmark-Score ist kein Tag; er ist eine Messung, und eine Messung ohne Mechanismus ist eine Zahl, keine Eigenschaft. Der Text sagt „Codex bringt die besseren Benchmark-Zahlen" und das stimmt, und Theorem 3 sagt: zeig mir den Mechanismus, denn die Zahl ist nicht die Eigenschaft.
Dasselbe Theorem ist der Grund, warum wir keine Wallet & Token-, Super-App- oder Community-Credit-Ergebnisse versprechen — sie sind Roadmap 🔵, der Mechanismus ist noch nicht implementiert und messend, und ein Forecast, den wir nicht messen können, ist keiner, den wir ehrlich verkaufen können. Nur ziviler und defensiver Rahmen, und keine Token- oder Community-Credit-Ergebnisversprechen, weil der Howey-Review noch nicht über einen Mechanismus lief, der noch nicht existiert. Ein Roadmap-Item mit dem Glanz eines Benchmarks zu taggen wäre derselbe Fehler wie eine Messung eine Eigenschaft zu nennen, und die Ehrlichkeit des Vergleichs ist der Standard, den wir uns selbst anlegen.
Die „Beide"-Antwort ist ein schwaches Ensemble
Die „Beide"-Antwort des Textes ist echt und billiger als die Cursor-Version derselben Frage. Beide sind CLIs, sie koexistieren im selben Repo ohne Reibung, Codex liest AGENTS.md und Claude Code liest CLAUDE.md, und beide Dateien im Repo-Root zu behalten ist schon gängige Praxis. Je 20 $ kosten beide zusammen 40 $/Monat, und wenn du schon ChatGPT Plus zahlst, ist der Grenzkosten der Beide-Antwort 20 $. Für einen arbeitenden Entwickler nennt der Text es die billigste Absicherung der Software, und für die Second-Opinion-Maschine eines einzelnen Entwicklers ist sie es.
Die Honest-Architect-Version ist, dass die Beide-Antwort ein Ensemble ist, das du per Hand betreibst. Ein Agent schreibt, der andere reviewt, und du erinnerst dich, beide laufen zu lassen. Die strukturelle Version — typisierte Agenten, die je draften, ein Merge, der kalibriert, eine Entropie-Messung bei jedem Merge — ist ein Ensemble, das die Topologie für dich betreibt, und es erzeugt eine Messung (die Entropie), die dir sagt, wann die Agenten genug uneins sind, um zu zählen. Die Uneinigkeit der Beide-Antwort legt Bugs offen, die keiner allein fängt; die Uneinigkeit des Ensembles erzeugt einen kalibrierten Forecast mit einem Score. Ersteres ist eine Absicherung; letzteres ist ein Mechanismus.
Die Routing-Regel sagt dir, wann welche gilt. Ein einzelner Entwickler, der Code ausliefert: die Beide-Antwort ist die richtige Form, weil du eine Person bist und die Absicherung billig ist. Eine Plattform, die Arbeit für viele Rooms betreibt: das Ensemble ist die richtige Form, weil die Topologie die Arbeit routet und der Merge die Messung erzeugt, und du kannst eine per Hand betriebene Absicherung über viele Rooms nicht betreiben, ohne dass sie zum Flaschenhals wird. Das „wo ich Beide überspringen würde" des Textes — Nicht-Entwickler und Erst-Operatoren, wähle eins und baue drei Monate darauf — ist die Routing-Regel für eine Ein-Room-Topologie, und sie stimmt.
Häufige Fragen
Ist Codex oder Claude Code 2026 der bessere Agent?
Auf Terminal-Bench 2.0 im Juli 2026 erzielt Codex CLI auf GPT-5.5 82,2 % und der beste Claude-basierte Eintrag 80,2 %, also hält Codex heute die Benchmark-Führung. Der Benchmark ist eine Messung, die bei jedem Modell-Release kippt. Die tiefere Frage ist, welcher Harness compoundiert, und Claude Codes Hooks, Routines, Subagents und SDK sind länger in Produktion und compose weiter.
Was heißt „du stellst keinen Agenten ein, du verdrahtest einen Mechanismus"?
Dass der Agent nicht die Entscheidungseinheit ist; der Mechanismus ist es. Ein Benchmark sagt dir, welcher Agent in diesem Quartal am besten maß; ein Harness sagt dir, welcher Mechanismus über die Aufgaben compoundiert, die du ihm im nächsten Jahr übergibst. The space is the router: die Topologie entscheidet, welcher Agent feuert, bevor du wählst, und die Route ist die Entscheidung, nicht das Urteil.
Warum ist die „Beide"-Antwort ein schwaches Ensemble?
Weil es ein Ensemble ist, das du per Hand betreibst. Ein Agent schreibt, der andere reviewt, und du erinnerst dich, beide laufen zu lassen. Die strukturelle Version — typisierte Agenten, die je draften, ein Merge, der kalibriert, eine Entropie-Messung bei jedem Merge — ist ein Ensemble, das die Topologie für dich betreibt, und erzeugt einen Score. Die Beide-Antwort ist eine Absicherung; das Ensemble ist ein Mechanismus, und ein Mechanismus ist eine Eigenschaft genau dann, wenn er implementiert und messend ist.
Wie wendet sich Theorem 3 auf einen Codex-vs-Claude-Code-Vergleich an?
Ein Benchmark ist eine Messung, keine Eigenschaft; ein Harness ist ein Mechanismus, und eine Eigenschaft ist genau dann garantiert, wenn ihr Mechanismus implementiert und messend ist. „Codex bringt den besseren Benchmark" stimmt und ist eine Messung, die bei jedem Release kippt. „Claude Code ist der tiefere Harness" ist eine Behauptung über einen Mechanismus, der über Releases compoundiert. Theorem 3 sagt: zeig mir den Mechanismus, denn die Zahl ist nicht die Eigenschaft.
Wie abbildet das auf Everythinks Ehrlichkeits-Tags?
Production ✅ heißt, der Mechanismus ist implementiert und messend — die Kalibrierung des Oracle, das Routing der Topologie, die Selbst-Deaktivierung des World Monitor sind verdrahtet und beobachtet. Ein Benchmark-Score ist kein Tag; er ist eine Messung. Roadmap 🔵 heißt, der Mechanismus ist noch nicht implementiert, und kein Glanz eines Benchmarks stuft ihn hoch. Die Tags sind die Messung des Mechanismus, nicht ein Gefühl über den Agenten.
Quellen
- Professor Glitch, "Codex vs Claude Code in 2026: Which Agent Do You Actually Hire?", 2026, retrieved 2026-08-23, https://www.askglitch.com/blog/claude-code-vs-codex
- OpenAI, "Codex pricing", 2026, referenced via Professor Glitch, https://developers.openai.com/codex/pricing
- Anthropic, "Claude pricing", 2026, referenced via Professor Glitch, https://claude.com/pricing
- Terminal-Bench, "Terminal-Bench 2.0 leaderboard", 2026, referenced via Professor Glitch, https://www.tbench.ai/leaderboard/terminal-bench/2.0
Wenn dein Network bereit ist, Mechanismen zu verdrahten statt Agenten einzustellen, erstelle dein Network — die Topologie routet jede Aufgabe an den Agenten, dessen Mechanismus passt, und der Oracle merged ihre Uneinigkeit zu einer kalibrierten Messung.

Interpretierbarkeit braucht Interaktion, nicht das Merkmal
SHAP fand «trolley»; SPEX fand die große 4-Wort-Synergie, die es treibt. Ein Merkmal ist kein Mechanismus. Theorem 3: eine Eigenschaft gilt nur bei implementierter, messender Interaktion.
→ →
Das Routing geht der Retrieval voraus, nicht der Embedding-Dimension
KDnuggets' Umfrage zu RAG-Fehlern zeigt, dass Over-Engineering der Embeddings die Kosten treibt. Der fehlende Mechanismus ist explizites Routing vor der Retrieval — Theorem 3 angewendet auf Suche, mit Everythinks Topologie als vorgelagertem Analogon.
→ →
Verstehen ist der gemessene Mechanismus, nicht der KI-Tutor
Die fünf Nachteile der KI-gestützten Programmierung sind ein fehlender Mechanismus: ein Messschritt, der Verstehen verifiziert. Theorem 3, nicht Ausgleich, ist das Heilmittel.
→ →Baue deine Welt auf einer Engine, die beweist, was sie behauptet.
Erstelle dein eigenes Netzwerk auf der Engine, die seit 2016 läuft — oder sprich mit dem Team hinter den 21 Papieren.
