产品
解决方案
公司
企业
登录创建你的网络
AI · Agents · Forecasting

你不是在雇佣一个 agent,你是在接通一个机制

Codex 对比 Claude Code 是一个雇佣问题。诚实的答案:你不是雇佣一个 agent,而是接通一个机制。基准测量,harness 复合,拓扑路由。

你不是在雇佣一个 agent,你是在接通一个机制

“Codex 对比 Claude Code”是一个雇佣问题,Professor Glitch 2026 年 7 月的裁决是诚实的:Codex 是更好的纯编码 agent,基准更好;Claude Code 是更深的 harness,你在此基础上构建一个运营。Honest Architect 的解读再锋利一层。你不是在雇佣一个 agent。你是在接通一个机制。基准测量;harness 复合;而拓扑在你挑选之前就路由。

关键要点

  • 原文的裁决是诚实的:Codex CLI 在 GPT-5.5 上于 Terminal-Bench 2.0 得分 82.2%(2026 年 7 月),是前十名中最佳的出货产品,而最佳的 Claude 驱动条目得分 80.2%(Professor Glitch,《Codex vs Claude Code in 2026》,2026)。
  • 基准是测量;harness 是机制。Theorem 3:一个属性只有在它的机制被实现并在测量时才成立——今天的基准领跑者不等于明天的机制领跑者。
  • 你不是在 Codex 或 Claude 之间二选一。The space is the router:拓扑在你选择之前就决定哪个 agent 触发,而“两个都要”的答案是 ensemble 的弱化版本。
  • HAI Engine 自 2016 年在生产中运行的是接通的机制,而非雇佣的 agent;Sisters 是类型化 agent,它们的分歧成为信号,而不是每月 40 美元的对冲。

原文把裁决弄对了,问题问错了

2026 年 7 月,Professor Glitch 发表了《Codex vs Claude Code in 2026: Which Agent Do You Actually Hire?》,裁决是用事实挣来的,而非发布周的情绪。在 Terminal-Bench 2.0 排行榜上(2026 年 7 月核对),Codex CLI 跑 GPT-5.5 得分 82.2%,是前十名中出货产品的最佳成绩,没有 Claude 驱动条目在那里超过它——最佳的是一个跑在 Claude Opus 4.7 上的研究 harness,得分 80.2%。定价现实摆得很清楚:Codex 从 Free 到每月 100 美元的 Pro 包含在每个 ChatGPT 套餐里,Claude Code 在每月 20 美元的 Claude Pro 里,Max 在 100 和 200 美元,而顶配两家公司对 5x 和 20x 用量收完全相同的数字。

原文诚实的动作是点出每个产品的重心在哪里。Codex 的重心是 ChatGPT 和软件工作——全球最常用 AI 应用的一个 feature,一个分发优势,每个表面都绕着在 OpenAI 墙内出货代码的受众转。Claude Code 的重心是 harness 本身——Anthropic 押的是 agent 即产品,配合 memory、hooks、subagents、定时 Routines 和一个 SDK,让你在上面构建耐用的东西。这是原文画出的真正区别,且是对的。

Honest Architect 的异议是针对问题,而非答案。“你雇佣哪个 agent”把 agent 当作决策单位,但 agent 不是单位。机制才是。一个基准告诉你哪个 agent 在今年七月的一项固定任务上测得最好;一个 harness 告诉你哪个机制在你明年要交给它的任务之间复合。雇佣问题回答一个季度;接通问题回答一个运营。原文对此有所示意——“一个你使用的 agent 对比一个你在此基础上构建的 agent”——然后又要你雇佣一个。

基准测量;harness 复合

Terminal-Bench 2.0 的数字是真实的测量,原文也诚实地说它在每次模型发布时翻盘。GPT-5.5 于 2026 年 4 月 23 日发布;Claude Opus 4.8 于 2026 年 5 月 28 日发布;专用 GPT-5.3-Codex 模型于 2026 年 5 月 26 日弃用。OpenAI 一年给 Codex 换几次大脑,每次都是升级。这种节奏正是一个基准是快照而非属性的原因:测量描述的是某个版本的某个模型,而版本在你底下变动。

harness 是不同类别。CLAUDE.md 指令加上跨会话复合的自动 memory,在生命周期事件触发 shell 命令的 hooks,带独立 context window 的 subagents,按计划在 Anthropic 云上运行的 Routines,以及一个 Agent SDK——这些是机制,而一个机制只有在被实现并在测量时才是属性。原文点出这点:Claude Code 的部件在生产中跑得更久,复合得更远,而自动化层(hooks 加 Routines 加 SDK)在 Codex 里还没有完整对应。Codex 的栈——AGENTS.md、skills、plugins、MCP——正在快速收敛,功劳归功于它,但收敛还不等于复合。

这正是原文几乎要做出却又退回的 Honest Architect 区别。基准是对一个模型的测量;harness 是塑造其中每个模型的机制。按基准选,你每个季度重选;按 harness 选,你选一次,harness 在底下模型替换时持续回报。今天的基准领跑者不是明天的机制领跑者,而明天是更长的预算。

The space is the router:你不是挑选,你是路由

[UNIQUE INSIGHT] “Codex 还是 Claude”这个问题是畸形的是因为它要你在工作被路由之前就选择。The space is the router:一个 network、community、room 拓扑在任何东西响应之前就决定谁能看到什么,而同样的形状适用于 agent。任务决定哪个 agent 触发。一个在 ChatGPT 标准化团队内的代码出货任务路由到 Codex,因为基准优势、GitHub 代码审查和手机到桌面的远程是为那类工作建的。一个每周五下午 4 点运行的定时报告任务路由到 Claude Code,因为 Routines、memory 和 SDK 是为那类工作建的。你不是雇佣一个 agent;你接通一个拓扑,把每个任务路由到机制契合的 agent。

原文的“两个都要”——两个 CLI 都留在 repo 根目录,AGENTS.md 和 CLAUDE.md 共存,一个 agent 写修复、另一个审查——是这东西的一个弱化、手动的版本。两个前沿模型分歧能暴露任一方单独都抓不到的 bug,原文这点是对的。结构化版本是我们所做的:类型化 agent(Sisters)各自产出一份草稿,Oracle 把它们合并成一个校准过的 forecast,并在每次 merge 时检查 ensemble 的 sum-to-one 和熵。分歧不是你记得去跑的每月 40 美元对冲;它是一个按结构运行、并在每次 merge 时产出测量(熵)的机制。“两个都要”是你付费并手动操作的 ensemble。机制是拓扑替你操作的 ensemble。

路由规则也是为什么原文的受众切分映射到一个拓扑。职业开发者、创始人运营者、非技术:每一个是 network 里的一个 room,而 room 把任务路由到机制契合该受众的 agent。原文给三种受众三个裁决;Honest Architect 的版本是带三条路由的一个拓扑,而路由才是决策,不是裁决。

我们自 2016 年接通 agent 所学到的

[PERSONAL EXPERIENCE] HAI Engine 自 2016 年在生产运行,教训和原文未点名地画出的相同:agent 不是单位,机制才是。我们不雇佣一个 Sister;我们接通一个在运行时从 TOML 文件加载的 Personality,编辑 personality 不需要重新编译,因为机制是路由规则加合并,不是模型。Sisters 从不写入 Postgres——它们返回 SisterOutput,由 Loom 持久化,因为保证不变量的机制是 port,不是 agent。换模型,机制不变;换 agent,机制不变;基准移动,属性留下。

原文的披露——“我整个业务跑在 Claude Code 上”——是同一观察的诚实版本。运营不是 Claude Code;运营是一个承载身份与规则的 CLAUDE.md,承载工作流的 skills,触达真实系统的 MCP servers,周复周承载上下文的 memory。agent 是会变的那部分;harness 是会复合的那部分。我们把平台的 agent 基础设施标为 Production ✅,是因为机制已接通并被观测——Oracle 在一处归一化,World Monitor 在 key 未设时自禁用的源是一个被测量的“已禁用”状态——不是因为某个 Sister 是最好的 Sister。Sister 是模型;机制是属性。

民用与防御范畴的边界决定我们接通哪些 agent 工作并拒绝哪些,测量是我们拒绝的那笔交易,在管线里可观测。客户主权——你的 network、你的 brand、你的 data——是保持拓扑归属你的路由规则:agent 在你的 network 内路由,而数据所有权是导出日志,不是营销页面。两者都是机制,不是口号,且两者都是接通问题比雇佣问题更要紧的原因。

Theorem 3:基准是测量,不是机制

[ORIGINAL DATA] 21 篇论文系列规定了 Theorem 3:一个属性当且仅当其机制被实现并在测量时才成立。把它读作对比较里每条主张的测试。“Codex 是更好的纯编码 agent”是一项测量,在 2026 年 7 月对 Terminal-Bench 2.0 成立,而测量不是属性——它是描述某个版本某个模型的一个数字。“Claude Code 是更深的 harness”是关于一个机制的主张,而一个机制只有在被实现并在测量时才是属性:会触发的 hooks、按计划运行的 Routines、带独立 context window 的 subagents、构建定制 agent 的 SDK。前者每个发布都翻盘;后者跨发布复合。

正因如此,我们的诚实标签不是形容词,也比较的裁决不是标签。Production ✅ 意味着机制已实现、其测量在某个有人看的仪表盘上。Oracle 的校准是 Production ✅,因为 ensemble 的 sum-to-one 和熵在每次 merge 时被校验。拓扑是 Production ✅,因为 network、community、room 在任何东西响应之前就路由。一个基准分数不是标签;它是测量,而没有机制的测量是一个数字,不是属性。原文说“Codex 发布了更好的基准数字”,这是真的,而 Theorem 3 说:给我看机制,因为数字不是属性。

同一定理也是我们不会承诺 Wallet & Token、Super App 或 Community Credit 结果的原因——那些是 Roadmap 🔵,机制尚未实现并在测量,而我们无法测量的 forecast 不是我们能诚实出售的 forecast。仅限民用与防御范畴,且不承诺任何 token 或 community-credit 结果,因为 Howey 审查尚未在一个尚不存在的机制上运行。用一个基准的光辉给 Roadmap 条目贴标签,和把测量称为属性是同一个错误,而比较的诚实是我们用以自律的标准。

“两个都要”是弱化 ensemble

原文的“两个都要”是真实的,也比同一问题的 Cursor 版本便宜。两个都是 CLI,它们在同一 repo 里无摩擦共存,Codex 读 AGENTS.md、Claude Code 读 CLAUDE.md,把两个文件都留在 repo 根目录已是常见做法。各 20 美元,两个共 40 美元/月,如果你已付 ChatGPT Plus,两个都要的边际成本是 20 美元。对一个工作中的开发者,原文称之为软件里最便宜的对冲,而对单个开发者的第二意见机器,它确实是。

Honest Architect 的版本是:“两个都要”是你手动操作的 ensemble。一个 agent 写、另一个审查,而你要记得两个都跑。结构化版本——类型化 agent 各自草拟、一个合并校准、每次 merge 一项熵测量——是拓扑替你操作的 ensemble,并产出一项测量(熵),告诉你 agent 何时分歧大到要紧。“两个都要”的分歧暴露任一方单独都抓不到的 bug;ensemble 的分歧产出带分数的校准 forecast。前者是对冲;后者是机制。

路由规则告诉你各自何时适用。一个出货代码的单一开发者:“两个都要”是对的形状,因为你是一个人,对冲便宜。一个为许多 room 跑工作的平台:ensemble 是对的形状,因为拓扑路由工作、合并产出测量,而你无法在许多 room 间手动操作对冲而不让它成为瓶颈。原文的“哪里我会跳过两个”——非开发者和首次运营者,选一个并在其上构建三个月——是一个单 room 拓扑的路由规则,且是对的。

常见问题

2026 年 Codex 还是 Claude Code 是更好的 agent?

在 2026 年 7 月的 Terminal-Bench 2.0 上,Codex CLI 在 GPT-5.5 上得分 82.2%,最佳 Claude 驱动条目得分 80.2%,所以 Codex 今天持有基准领先。基准是一项每次模型发布都翻盘的测量。更深的问题是哪个 harness 复合,而 Claude Code 的 hooks、Routines、subagents 和 SDK 在生产中跑得更久、复合得更远。

“你不是雇佣一个 agent,你接通一个机制”是什么意思?

意思是 agent 不是决策单位;机制才是。一个基准告诉你哪个 agent 这个季度测得最好;一个 harness 告诉你哪个机制在你明年要交给它的任务之间复合。The space is the router:拓扑在你挑选之前就决定哪个 agent 触发,而路由才是决策,不是裁决。

为什么“两个都要”是弱化 ensemble?

因为它是你手动操作的 ensemble。一个 agent 写、另一个审查,而你要记得两个都跑。结构化版本——类型化 agent 各自草拟、一个合并校准、每次 merge 一项熵测量——是拓扑替你操作的 ensemble,并产出一个分数。“两个都要”是对冲;ensemble 是机制,而机制只有在被实现并在测量时才是属性。

Theorem 3 如何应用于 Codex 对比 Claude Code?

基准是测量,不是属性;harness 是机制,而属性当且仅当其机制被实现并在测量时才成立。“Codex 发布更好的基准”是真的,且是一项每次发布都翻盘的测量。“Claude Code 是更深的 harness”是关于一个跨发布复合的机制的主张。Theorem 3 说:给我看机制,因为数字不是属性。

这如何映射到 Everythink 的诚实标签?

Production ✅ 意味着机制已实现并在测量——Oracle 的校准、拓扑的路由、World Monitor 的自禁用都已接通并被观测。一个基准分数不是标签;它是测量。Roadmap 🔵 意味着机制尚未实现,任何基准的光辉都不能升级它。标签是对机制的测量,不是对 agent 的感觉。

来源

如果你的 network 已准备好接通机制而非雇佣 agent,创建你的 network——拓扑把每个任务路由到机制契合的 agent,而 Oracle 把它们的分歧合并成一项校准测量。

在一个能证明其声明的引擎上构建你的世界。

在自 2016 年起持续运行的引擎上创建你自己的网络——或与 21 篇论文背后的团队交流。