
Vous n'embauchez pas un agent. Vous câblez un mécanisme.
« Codex vs Claude Code » est une question de recrutement, et le verdict de Professor Glitch en juillet 2026 est honnête : Codex est le meilleur agent de codage pur avec le meilleur benchmark, Claude Code est le harness plus profond sur lequel vous bâtissez une opération. La lecture du Honest Architect est d'un cran plus tranchante. Vous n'embauchez pas un agent. Vous câblez un mécanisme. Le benchmark mesure ; le harness compose ; et la topologie route avant que vous ne choisissiez.
Points clés
- Le verdict du texte est honnête : Codex CLI sur GPT-5.5 marque 82,2 % sur Terminal-Bench 2.0 (juillet 2026), le meilleur produit livré du top 10, tandis que la meilleure entrée Claude-powered marque 80,2 % (Professor Glitch, « Codex vs Claude Code in 2026 », 2026).
- Un benchmark est une mesure ; un harness est un mécanisme. Théorème 3 : une propriété est garantie exactement quand son mécanisme est implémenté et mesurant — le leader du benchmark aujourd'hui n'est pas le leader du mécanisme demain.
- Vous ne choisissez pas Codex ou Claude. The space is the router : la topologie décide quel agent se déclenche avant que vous ne choisissiez, et la réponse « les deux » est une version faible d'un ensemble.
- Le HAI Engine tourne en production depuis 2016 sur des mécanismes câblés, non des agents embauchés ; les Sisters sont des agents typés dont Désaccord devient signal, non une couverture de 40 $/mois.
Le texte a le bon verdict, pour la mauvaise question
En juillet 2026, Professor Glitch a publié « Codex vs Claude Code in 2026: Which Agent Do You Actually Hire? », et le verdict se gagne avec des faits, pas des vibrations de semaine de lancement. Sur le classement Terminal-Bench 2.0, vérifié juillet 2026, Codex CLI sur GPT-5.5 marque 82,2 %, le meilleur résultat d'un produit livré dans le top 10, et aucune entrée Claude-powered ne le bat là — la meilleure, un harness de recherche sur Claude Opus 4.7, marque 80,2 %. La réalité du prix est posée clairement : Codex est inclus dans chaque plan ChatGPT de Free à Pro à 100 $/mois, Claude Code vient dans Claude Pro à 20 $/mois avec Max à 100 et 200 $, et en haut les deux sociétés facturent des chiffres identiques pour 5x et 20x d'usage.
Le mouvement honnête du texte est de nommer où se situe le centre de gravité de chaque produit. Le centre de Codex est ChatGPT et le travail logiciel — une fonctionnalité de l'application IA la plus utilisée du monde, un avantage de distribution, chaque surface orbite autour de l'audience qui livre du code dans les murs d'OpenAI. Le centre de Claude Code est le harness lui-même — le pari d'Anthropic que l'agent est le produit, avec memory, hooks, subagents, Routines planifiées et un SDK pour que vous construisiez quelque chose de durable au-dessus. C'est la vraie distinction que le texte trace, et elle est correcte.
L'objection du Honest Architect porte sur la question, pas la réponse. « Quel agent embauchez-vous » traite l'agent comme l'unité de décision, et l'agent n'est pas l'unité. Le mécanisme l'est. Un benchmark vous dit quel agent a mesuré le mieux sur une tâche fixe en juillet ; un harness vous dit quel mécanisme compose à travers les tâches que vous lui confierez l'année prochaine. La question de recrutement répond à un trimestre ; la question de câblage répond à une opération. Le texte l'effleure — « un agent que vous utilisez versus un agent sur lequel vous bâtissez » — et vous demande quand même d'en embaucher un.
Le benchmark mesure ; le harness compose
Le chiffre de Terminal-Bench 2.0 est une mesure réelle, et le texte est honnête qu'il bascule à chaque version de modèle. GPT-5.5 lancé le 23 avril 2026 ; Claude Opus 4.8 publié le 28 mai 2026 ; le modèle dédié GPT-5.3-Codex a été déprécié le 26 mai 2026. OpenAI échange le cerveau de Codex plusieurs fois par an, et chaque échange a été une amélioration. Cette cadence est la raison pour laquelle un benchmark est un instantané et non une propriété : la mesure décrit un modèle à une version, et la version change sous vous.
Un harness est une catégorie différente. Les instructions CLAUDE.md plus la memory automatique qui compose entre sessions, les hooks qui déclenchent des commandes shell lors d'événements de cycle de vie, les subagents avec des fenêtres de contexte isolées, les Routines qui tournent sur le cloud d'Anthropic selon un calendrier, et un Agent SDK — ce sont des mécanismes, et un mécanisme est une propriété exactement quand il est implémenté et mesurant. Le texte le nomme : les parties de Claude Code sont en production plus longtemps, elles composent plus loin, et la couche d'automatisation (hooks plus Routines plus SDK) n'a pas d'équivalent Codex complet encore. La pile de Codex — AGENTS.md, skills, plugins, MCP — converge vite, crédit où dû, mais la convergence n'est pas encore composition.
C'est la distinction du Honest Architect que le texte presque fait puis recule. Le benchmark est une mesure d'un modèle ; le harness est un mécanisme qui forme chaque modèle qui tourne en lui. Choisissez par benchmark et vous re-choisissez chaque trimestre ; choisissez par harness et vous choisissez une fois, et le harness continue de payer tandis que les modèles s'échangent en dessous. Le leader du benchmark aujourd'hui n'est pas le leader du mécanisme demain, et demain est le budget plus long.
The space is the router : vous ne choisissez pas, vous routez
[UNIQUE INSIGHT] La question « Codex ou Claude » est mal formée parce qu'elle vous demande de choisir avant que le travail ne soit routé. The space is the router : une topologie de network, community et room décide qui voit quoi avant que quoi que ce soit réponde, et la même forme s'applique aux agents. La tâche décide quel agent se déclenche. Un travail de livraison de code dans une équipe standardisée sur ChatGPT route vers Codex, parce que l'avantage du benchmark, la revue de code GitHub et le remote téléphone-vers-bureau sont construits pour ce travail. Un travail de reporting planifié à 16 h vendredi route vers Claude Code, parce que Routines, memory et le SDK sont construits pour ce travail. Vous n'embauchez pas un agent ; vous câblez une topologie qui route chaque tâche à l'agent dont le mécanisme colle.
La réponse « les deux » du texte — garder les deux CLIs à la racine du dépôt, AGENTS.md et CLAUDE.md coexistant, un agent écrit le correctif et l'autre le revue — est une version faible et manuelle de cela. Deux modèles de frontière en désaccord exposent des bugs qu'aucun n'attrape seul, et le texte a raison là. La version structurelle est ce que nous faisons : des agents typés (les Sisters) produisent chacun un draft, et l'Oracle les merge en un forecast calibré, avec la somme-à-un et l'entropie de l'ensemble vérifiées à chaque merge. Le désaccord n'est pas une couverture de 40 $/mois dont vous vous souvenez de lancer ; c'est un mécanisme qui tourne par structure et produit une mesure (l'entropie) à chaque merge. La réponse « les deux » est un ensemble que vous payez et opérez à la main. Le mécanisme est un ensemble que la topologie opère pour vous.
La règle de routage est aussi pourquoi les splits d'audience du texte mappent à une topologie. Développeur professionnel, fondateur-opérateur, non technique : chacun est une room dans le network, et la room route la tâche à l'agent dont le mécanisme colle à l'audience. Le texte donne trois verdicts pour trois audiences ; la version du Honest Architect est une topologie avec trois routes, et la route est la décision, non le verdict.
Ce que nous avons appris à câbler des agents depuis 2016
[PERSONAL EXPERIENCE] Le HAI Engine tourne en production depuis 2016, et la leçon est la même que le texte trace sans la nommer : l'agent n'est pas l'unité, le mécanisme l'est. Nous n'embauchons pas une Sister ; nous câblons une Personality chargée au runtime depuis un fichier TOML, et éditer la personality ne requiert pas de recompiler, parce que le mécanisme est la règle de routage plus le merge, non le modèle. Les Sisters n'écrivent jamais dans Postgres — elles retournent un SisterOutput et le Loom persiste, parce que le mécanisme qui garantit l'invariant est le port, pas l'agent. Échangez le modèle et le mécanisme tient ; échangez l'agent et le mécanisme tient ; le benchmark bouge et la propriété reste.
La divulgation du texte — « toute mon activité tourne sur Claude Code » — est la version honnête de la même observation. L'opération n'est pas Claude Code ; l'opération est un CLAUDE.md qui porte identité et règles, des skills qui portent des workflows, des serveurs MCP qui atteignent des systèmes réels, de la memory qui porte du contexte de semaine en semaine. L'agent est la partie qui change ; le harness est la partie qui compose. Nous taguons l'infrastructure d'agents de la plateforme comme Production ✅ parce que les mécanismes sont câblés et observés — l'Oracle normalise à un endroit, la source World Monitor qui s'auto-désactive quand sa key n'est pas définie est un état « désactivée » mesuré — non parce qu'une Sister particulière est la meilleure Sister. La Sister est un modèle ; le mécanisme est la propriété.
La limite de scope civil-et-défensif décide quels travaux d'agent nous câblons et lesquels nous déclinons, et la mesure est l'affaire que nous déclinons, observable dans le pipeline. La souveraineté du client — votre network, votre brand, votre data — est la règle de routage qui garde la topologie vôtre : les agents routent à l'intérieur de votre network, et la propriété des données est le journal d'export, pas la page marketing. Les deux sont des mécanismes, pas des slogans, et les deux sont la raison pour laquelle la question de câblage compte plus que la question de recrutement.
Théorème 3 : le benchmark est une mesure, pas un mécanisme
[ORIGINAL DATA] La série de 21 articles spécifie le Théorème 3 : une propriété est garantie exactement quand son mécanisme est implémenté et mesurant. Lisez-le comme le test pour chaque affirmation dans la comparaison. « Codex est le meilleur agent de codage pur » est une mesure, vraie en juillet 2026 contre Terminal-Bench 2.0, et une mesure n'est pas une propriété — c'est un nombre qui décrit un modèle à une version. « Claude Code est le harness plus profond » est une affirmation sur un mécanisme, et un mécanisme est une propriété exactement quand il est implémenté et mesurant : des hooks qui se déclenchent, des Routines qui tournent selon un calendrier, des subagents avec des fenêtres de contexte isolées, un SDK qui construit des agents personnalisés. La première affirmation bascule à chaque version ; la seconde compose à travers les versions.
C'est pourquoi nos tags d'honnêteté ne sont pas des adjectifs et pourquoi le verdict de la comparaison n'est pas un tag. Production ✅ signifie que le mécanisme est implémenté et sa mesure est sur un tableau de bord que quelqu'un regarde. La calibration de l'Oracle est Production ✅ parce que la somme-à-un et l'entropie de l'ensemble sont vérifiées à chaque merge. La topologie est Production ✅ parce que le network, la community et la room routent avant que quoi que ce soit réponde. Un score de benchmark n'est pas un tag ; c'est une mesure, et une mesure sans mécanisme est un nombre, pas une propriété. Le texte dit « Codex publie les meilleurs chiffres de benchmark » et c'est vrai, et le Théorème 3 dit : montrez-moi le mécanisme, parce que le nombre n'est pas la propriété.
Le même théorème est la raison pour laquelle nous ne promettrons pas de résultats Wallet & Token, Super App, ou Community Credit — ce sont Roadmap 🔵, le mécanisme n'est pas encore implémenté et mesurant, et un forecast que nous ne pouvons pas mesurer n'est pas un forecast que nous pouvons honnêtement vendre. Scope civil et défensif seulement, et aucune promesse de résultat token ou community-credit, parce que la revue Howey n'a pas couru sur un mécanisme qui n'existe pas encore. Tagger un item Roadmap avec l'éclat d'un benchmark serait la même erreur que d'appeler une mesure une propriété, et l'honnêteté de la comparaison est le standard que nous nous appliquons.
La réponse « les deux » est un ensemble faible
La réponse « les deux » du texte est réelle et moins chère que la version Cursor de la même question. Tous deux sont des CLIs, ils coexistent dans le même dépôt sans friction, Codex lit AGENTS.md et Claude Code lit CLAUDE.md, et garder les deux fichiers à la racine du dépôt est déjà une pratique courante. À 20 $ chacun, les deux coûtent 40 $/mois, et si vous payez déjà ChatGPT Plus le coût marginal de la réponse-les-deux est 20 $. Pour un développeur qui travaille, le texte l'appelle la couverture la moins chère du logiciel, et pour la machine à second avis d'un seul développeur, elle l'est.
La version du Honest Architect est que la réponse-les-deux est un ensemble que vous opérez à la main. Un agent écrit, l'autre revue, et vous vous souvenez de lancer les deux. La version structurelle — des agents typés qui draftent chacun, un merge qui calibre, une mesure d'entropie à chaque merge — est un ensemble que la topologie opère pour vous, et elle produit une mesure (l'entropie) qui vous dit quand les agents sont assez en désaccord pour compter. Le désaccord de la réponse-les-deux expose des bugs qu'aucun n'attrape seul ; le désaccord de l'ensemble produit un forecast calibré avec un score. Le premier est une couverture ; le second est un mécanisme.
La règle de routage vous dit quand chacun s'applique. Un seul développeur livrant du code : la réponse-les-deux est la bonne forme, parce que vous êtes une personne et la couverture est bon marché. Une plateforme qui fait tourner du travail pour de nombreuses rooms : l'ensemble est la bonne forme, parce que la topologie route le travail et le merge produit la mesure, et vous ne pouvez pas opérer une couverture à la main entre de nombreuses rooms sans qu'elle devienne le goulot. Le « où je sauterais les deux » du texte — non-développeurs et opérateurs pour la première fois, choisissez-en un et construisez dessus trois mois — est la règle de routage pour une topologie à une room, et elle est correcte.
Foire aux questions
Codex ou Claude Code est-il le meilleur agent en 2026 ?
Sur Terminal-Bench 2.0 en juillet 2026, Codex CLI sur GPT-5.5 marque 82,2 % et la meilleure entrée Claude-powered marque 80,2 %, donc Codex détient la tête du benchmark aujourd'hui. Le benchmark est une mesure qui bascule à chaque version de modèle. La question plus profonde est quel harness compose, et les hooks, Routines, subagents et SDK de Claude Code sont en production plus longtemps et composent plus loin.
Que signifie « vous n'embauchez pas un agent, vous câblez un mécanisme » ?
Que l'agent n'est pas l'unité de décision ; le mécanisme l'est. Un benchmark vous dit quel agent a mesuré le mieux ce trimestre ; un harness vous dit quel mécanisme compose à travers les tâches que vous lui confierez l'année prochaine. The space is the router : la topologie décide quel agent se déclenche avant que vous ne choisissiez, et la route est la décision, non le verdict.
Pourquoi la réponse « les deux » est-elle un ensemble faible ?
Parce que c'est un ensemble que vous opérez à la main. Un agent écrit, l'autre revue, et vous vous souvenez de lancer les deux. La version structurelle — des agents typés qui draftent chacun, un merge qui calibre, une mesure d'entropie à chaque merge — est un ensemble que la topologie opère pour vous, et produit un score. La réponse-les-deux est une couverture ; l'ensemble est un mécanisme, et un mécanisme est une propriété exactement quand il est implémenté et mesurant.
Comment le Théorème 3 s'applique-t-il à une comparaison Codex vs Claude Code ?
Un benchmark est une mesure, pas une propriété ; un harness est un mécanisme, et une propriété est garantie exactement quand son mécanisme est implémenté et mesurant. « Codex publie le meilleur benchmark » est vrai et est une mesure qui bascule à chaque version. « Claude Code est le harness plus profond » est une affirmation sur un mécanisme qui compose à travers les versions. Le Théorème 3 dit : montrez-moi le mécanisme, parce que le nombre n'est pas la propriété.
Comment cela se mappe-t-il aux tags d'honnêteté d'Everythink ?
Production ✅ signifie que le mécanisme est implémenté et mesurant — la calibration de l'Oracle, le routage de la topologie, l'auto-désactivation du World Monitor sont câblés et observés. Un score de benchmark n'est pas un tag ; c'est une mesure. Roadmap 🔵 signifie que le mécanisme n'est pas encore implémenté, et aucun éclat de benchmark ne le regrade à la hausse. Les tags sont la mesure du mécanisme, pas une ambiance sur l'agent.
Sources
- Professor Glitch, "Codex vs Claude Code in 2026: Which Agent Do You Actually Hire?", 2026, retrieved 2026-08-23, https://www.askglitch.com/blog/claude-code-vs-codex
- OpenAI, "Codex pricing", 2026, referenced via Professor Glitch, https://developers.openai.com/codex/pricing
- Anthropic, "Claude pricing", 2026, referenced via Professor Glitch, https://claude.com/pricing
- Terminal-Bench, "Terminal-Bench 2.0 leaderboard", 2026, referenced via Professor Glitch, https://www.tbench.ai/leaderboard/terminal-bench/2.0
Si votre network est prête à câbler des mécanismes plutôt qu'à embaucher des agents, créez votre network — la topologie route chaque tâche à l'agent dont le mécanisme colle, et l'Oracle merge leur désaccord en une mesure calibrée.

L'interprétabilité a besoin de l'interaction, pas la feature
SHAP a trouvé «trolley» ; SPEX a trouvé la synergie de 4 mots qui le pilote. Une feature n'est pas un mécanisme. Theorem 3 : une propriété tient si son interaction est implémentée et mesure.
→ →
Le routage précède la récupération, pas la dimension d'embedding
L'enquête de KDnuggets sur les défaillances RAG montre que la sur-ingénierie des embeddings aggrave le coût. Le mécanisme absent est le routage explicite avant la récupération — Theorem 3 appliqué à la recherche, avec la topologie d'Everythink comme analogue en amont.
→ →
La compréhension est le mécanisme mesuré, pas le tuteur IA
Les cinq inconvénients de la programmation assistée par IA sont un mécanisme manquant : une étape de mesure qui vérifie la compréhension. Theorem 3, non l'équilibre, est le remède.
→ →Construisez votre monde sur un moteur qui prouve ce qu'il affirme.
Créez votre propre réseau sur le moteur qui tourne depuis 2016 — ou parlez à l'équipe derrière les 21 articles.
