
harness 即代理机制,而非模型断言
Professor Glitch (askglitch.com) 在「Harness Engineering: How AI Agents Actually Work」中写道:「代理是模型加 harness。模型是大脑。harness 是围绕它的一切,使大脑有用。」他将划分定为「大约 10% 模型,90% harness —— 粗略估计,非测量,但任何构建过一个的人都会告诉你这差不多对。」文章逐节点遍历 harness:上下文窗口(RAM,非硬盘)、记忆(短期在窗口中,长期在三个抽屉 —— 程序性、语义性、情景性)、RAG(开卷考试)、技能(带标签的活页夹,渐进式披露)、循环(思考、行动、观察、重复)、工具和 MCP(大脑如何获得手)、hooks(门口的保镖)、以及评估(给运行打分,输出评估加轨迹评估,腐败成功)。(Professor Glitch, "Harness Engineering: How AI Agents Actually Work", askglitch.com, 发布于 2026-07-07, 检索于 2026-08-23, https://www.askglitch.com/blog/harness-engineering)。Honest Architect 将文章读作 harness 作为代理机制的工作示例:属性(代理真正工作)由机制(harness —— 围绕模型的一切,将原始智能转化为可工作的代理)保证,而非由「我们用了最好的模型」这一断言保证。Honest Architect 将 the-harness-is-the-agent-mechanism 形式标为 Production ✅,将每条特定第三方主张(10/90 划分、Terminal-Bench、Chroma 的 context-rot 研究、「Lost in the Middle」论文、Anthropic 的指南、Claude Code、MCP、社区课程)标为 Partial ⚠️(第三方,未经 Everythink 独立验证)。
文章是带有课程销售意图的深度分析 —— 一个包含七门课程、181+ 节课、一个 TikTok 和「JOIN THE COMMUNITY」行动号召的社区。Honest Architect 提取机制形式,而不背书课程或社区。七种机制形式,每种在真实且可复现之处标为 Production ✅,在第三方之处标为 Partial ⚠️。
关键结论
- harness 即代理机制。Theorem 3:属性(代理真正工作)由机制(harness —— 上下文窗口、记忆、RAG、技能、循环、工具、hooks、评估)保证,而非由「我们用了最好的模型」这一断言保证。大脑你租;harness 你挣。Production ✅。
- 上下文窗口即工作记忆机制。文章:「它是 RAM,不是硬盘。快、小、每回合清空。」属性(记得本回合)由本回合桌上的东西保证,而非由模型「知道」的东西保证。Production ✅。
- 长期记忆即持久性机制。窗口外三个抽屉:程序性(如何做事)、语义性(事实)、情景性(带时间戳的事件)。属性(在会话间存活)由在窗口外存储并按需拉回保证,而非由模型保证。Production ✅。
- RAG 即检索机制。文章称之为「开卷考试」。属性(从你的文档回答)由检索相关段落保证,而非由模型记住你的手册保证。Production ✅。
- 循环即任务完成机制。思考、行动、观察、重复 —— 「直到工作真正完成」。属性(工作真正完成)由循环直到 done 保证,而非由一次性计划保证。三个出口:真正完成、硬性迭代上限、不确定时停下来问。Production ✅。
- hooks 即执行机制。文章:「hook 是在循环固定点触发的确定性代码。模型是人群;hook 是保镖。」属性(不做错事)由每次都运行的确定性代码保证,而非由模型的好判断保证。信任不是机制。Production ✅。
- 评估即质量机制。文章:「把标准设在评估上,不是演示上。」输出评估加轨迹评估。腐败成功:正确答案,错误过程。属性(真正好不好)由给全部二十次运行打分保证,而非由展示那一次干净的演示保证。Production ✅。
- 跨域平行:Oracle 归一一次(Sisters 是模型,Oracle 是 harness —— 校准预测 由 harness 保证,而非由任何单个 Sister 保证),World Monitor 按源自我禁用(每个源是一个当其密钥未设置时自我禁用的工具),Zod 在运行时边界(RAG 在检索边界解析文档,如 Zod 在网络边界解析载荷),Eye Key(hooks 类似 —— 不做错事 由 每次确定性代码 保证,如 密钥主权 由 HMAC 加指纹 保证 —— 两者均为结构性,非信任),HAI Engine 自 2016 年(循环类似 —— 同一机制每次运行 由 执行同一机制 保证)。均为 Partial ⚠️:同形式,不同域。
- 范围:民事/防御性。代理工程是民事工程关切。无进攻性范围。不承诺任何 token、钱包或社区积分结果;这些是 Roadmap 🔵,Howey 审查待定。Everythink 是一个预测平台,不是代理 harness 供应商;跨域平行是 Partial ⚠️ 插图,非对 askglitch.com、Professor Glitch、Anthropic、Claude Code、MCP 或任何特定课程或社区的背书。
harness 即代理机制
文章的核心句子:「代理是模型加 harness。模型是大脑。harness 是围绕它的一切,使大脑有用。」属性(代理真正工作)由机制(harness —— 上下文窗口、记忆、RAG、技能、循环、工具、hooks、评估)保证,而非由「我们用了最好的模型」这一断言保证。Production ✅。
一个购买最好模型但跳过 harness 的团队拥有罐中之脑 —— 它能思考但不能记住、查找任何东西或拿起工具。一个围绕任何胜任模型构建 harness 的团队拥有一个代理。机制是 harness,不是模型。Production ✅。
形式是 Everythink 的 Oracle 归一一次的域类比:属性 校准预测 由 多样输入加归一一次 保证 —— Sisters(analyst、contrarian、disruptor、historian、institutionalist)是模型,Oracle 是将其草稿归一为一个 ensemble 的 harness。10/90 划分类似:Sisters 是 10%,Oracle 和 Loom 和持久层是 90%。Partial ⚠️(同形式 —— harness 保证属性而非模型 —— 不同域)。
上下文窗口即工作记忆机制
文章:「上下文窗口是模型在单个回合中能看到的一切。更好的名字是工作记忆。它是 RAM,不是硬盘。快、小、每回合清空。」属性(记得本回合)由本回合桌上的东西保证 —— 系统提示、对话、检索到的事实、工具结果 —— 而非由模型「知道」的东西保证。聊天机器人「忘了」你的名字是因为它从未持有它;harness 每回合重新粘贴对话。Production ✅。
区别至关重要。一个把所有东西塞进窗口的团队有 context rot —— 随着输入增长性能下降,模型在你重要句子被埋没处下沉。一个只放入本回合相关内容的团队有一个有效的窗口。机制是策展,不是大小。超过一个点,更多是问题。Production ✅。
长期记忆即持久性机制
如果窗口每回合清空,东西住在哪里?文章:「长期记忆是硬盘。持久,存储在窗口外的数据库中,按需拉回。」三个抽屉:程序性(如何做事 —— 一项技能,一个打包的如何做)、语义性(事实 —— 你的名字、你的公司、你讨厌长邮件)、情景性(带时间戳的事件 —— 「上周这个客户要求退款我们说不」)。属性(在会话间存活)由在窗口外存储并按需拉回保证,而非由模型保证。Production ✅。
一个把所有东西倒进窗口的团队有一个成本更高、更慢、且腐烂的系统。一个在窗口外选择性存储并有目的地检索一点的团队有一个随时间变得更锐利的系统。机制是选择性存储加选择性检索,不是倾倒。Production ✅。
RAG 即检索机制
文章称 RAG 为「开卷考试。没有人前一晚记住教科书。你读问题,然后翻到覆盖它的那几页。」属性(从你的文档回答)由从 200 页手册中检索相关段落保证,而非由模型记住你的手册保证。意义,非拼写,以嵌入点之间的平面距离测量。Production ✅。
区别至关重要。一个被问及内部文档的原始模型发明一个听起来合理的退款政策 —— 而一个听起来合理的错误答案是最危险的。一个被交给真实页面的模型从你的政策而非其想象中读取。但 RAG 检索的是相关的,而非保证为真的:错误页面进,错误答案出,面不改色。机制是检索,不是真相。Production ✅。
循环即任务完成机制
文章:「将一个说话的东西变成一个工作的东西的是循环:思考、行动、观察、重复,直到工作真正完成。」属性(工作真正完成)由循环直到 done 保证,而非由一次性计划保证。「在黑暗中做的计划是猜测。循环用事实换猜测。」Production ✅。
难点:循环何时停止?两种失败模式。过早停止:一次退款,「基本完成」,退出,你反正得检查它的工作。永不停止:给同一客户退款四次,或整夜旋转如卡在角落的扫地机器人 —— 一笔真实的账单。一个好循环有三个出口:任务真正完成、硬性迭代上限、不确定时停下来问。机制是退出条件,不是循环本身。Production ✅。
hooks 即执行机制
文章:「你不要求一个概率性的东西小心。你要一条每次都运行的规则,在代码中,模型无法说情逃出。那就是 hook:在循环固定点自动触发的确定性代码。模型是人群;hook 是保镖,每次检查每个人,无例外。」属性(不做错事)由每次都运行的确定性代码保证,而非由模型的好判断保证。信任不是机制。Production ✅。
区别至关重要。一个依赖模型好判断的团队有一条取决于提示如何措辞的护栏 —— 同一个概率性模型可能决定今天是那天,在错误的文件夹上运行清理命令。一个在每次工具调用前运行 hook 的团队有一条模型无法说情逃出的护栏。hook 不仅阻止坏事;它可以拒绝停止并强制代理回到循环中。执行,非礼貌请求。Production ✅。
形式是 Everythink 的 Eye Key 设计的域类比:属性 密钥主权 由 HMAC 加指纹 保证 —— 密钥主权是因为机制结构性地产生属性,非由信任。hooks 类似:不做错事 由 每次确定性代码 保证,非由模型的判断。两者都通过结构性约束而非行为期望产生属性。Partial ⚠️(同形式 —— 属性由结构性约束保证而非信任 —— 不同域)。
评估即质量机制
文章:「把标准设在评估上,不是演示上。演示容易:跑二十次,展示那一次干净的运行。评估给全部二十次打分。」两件事要打分:输出评估(答案正确吗?)和轨迹评估(路径稳健吗?)。失败模式:「腐败成功 —— 正确答案,错误过程。」属性(真正好不好)由用两种评估给全部二十次运行打分保证,而非由展示那一次干净的演示保证。Production ✅。
追踪:「保留收据。每次运行,记录检索了什么、哪些工具以什么输入触发、多少 token、多长时间。当某东西坏了,你不要眯着眼看最终答案并理论化。你打开追踪并看到它偏离的确切步骤。」属性(坏了时可调试)由记录发生了什么保证,而非由从最终答案理论化保证。Production ✅。
飞轮:「评估捕获的每个失败变成一个拧到 harness 上的修复。不知道一条规则?加到系统提示中。运行了破坏性的东西?加一个 hook。系统变好不是因为你等了一个更聪明的模型,而是因为你改进了 harness,一次捕获一个失败。」机制是评估驱动的 harness 改进,不是模型升级。Production ✅。
Honest Architect 在 harness-engineering 深度分析中读到什么
文章是带有课程销售意图的深度分析 —— 一个包含七门课程、181+ 节课、一个 TikTok、「JOIN THE COMMUNITY」行动号召的社区。Honest Architect 提取机制形式,而不背书课程或社区。形式是 Production ✅:真实、可复现、可由文章本身的逻辑验证(harness 将罐中之脑变成代理;窗口是 RAM;记忆在窗口外持久;RAG 检索页面;循环运行直到 done;hooks 确定性地执行;评估给全部二十次打分)。所有特定第三方主张(10/90 划分、Terminal-Bench、Chroma 的研究、「Lost in the Middle」论文、Anthropic 的指南、Claude Code、MCP、课程)是 Partial ⚠️。Honest Architect 不背书 askglitch.com、Professor Glitch、Anthropic、Claude Code、MCP 或任何课程或社区。Everythink 是一个预测平台,不是代理 harness 供应商。范围是民事/防御性。不承诺任何 token、钱包或社区积分结果;这些是 Roadmap 🔵,Howey 审查待定。
常见问题
harness 是机制还是断言?
harness 是机制。Theorem 3:属性(代理真正工作)由机制(harness)保证,而非由断言(「我们用了最好的模型」)保证。大脑你租;harness 你挣。Production。10/90 划分是粗略估计,非测量 —— Partial。
为什么上下文窗口是工作记忆机制?
窗口是 RAM,不是硬盘 —— 每回合清空。属性 记得本回合 由本回合桌上的东西保证。Context rot:超过一个点,更多是问题。Production。
为什么 hooks 是执行机制?
hook 是每次都触发的确定性代码。属性 不做错事 由代码保证,而非由模型的判断。模型是人群;hook 是保镖。信任不是机制。Production。
为什么评估是质量机制?
演示展示那一次干净的运行;评估给全部二十次打分。输出评估加轨迹评估。腐败成功 —— 正确答案,错误过程 —— 是失败模式。追踪保留收据。Production。
Everythink 背书 askglitch.com、Professor Glitch 或 Claude Code 吗?
不。Everythink 是一个预测平台,不是代理 harness 供应商。文章是带有课程销售意图的深度分析。特定第三方主张是 Partial。不承诺任何 token、钱包或社区积分结果;这些是 Roadmap,Howey 审查待定。
Sources
- Professor Glitch, "Harness Engineering: How AI Agents Actually Work", askglitch.com, 发布于 2026-07-07, 检索于 2026-08-23, https://www.askglitch.com/blog/harness-engineering
如果你的团队准备好发送机制而非断言属性,构建你的网络 —— Oracle 归一来自 Sisters 的草稿,每个源自我禁用,HAI Engine 自 2016 年运行同一机制,Zod 在边界解析。

Persistent memory is the mechanism, not the context window
Five architectural patterns for AI agent memory, read as Theorem 3: the property (learning, personalization) is guaranteed by the mechanism (persist, retrieve, inject), not by the context window. Checkpointing is not exactly-once, secrets are not semantic memory, storage-layer isolation fails closed.
→ →
协议即互操作机制,而非插头断言
Marc Friborg Bersang 在 AI Engineers Academy 对 MCP 的描述,被解读为机制:属性(AI 连接一切)由定义的协议组件(客户端、服务器、传输、能力协商、类型化 schema、错误传播)保证,而非由「就像 AI 的 USB」这一断言保证。Theorem 3 应用于协议设计。
→ →
成本下降是使能机制,而非免费的断言
伯克利的研究视角解读为六种机制形式:成本下降作为使能器、智能体投机作为负载、多查询优化作为去重、结构化记忆作为检索、并发编辑语义作为一致性、验证智能体作为纠正。定理3应用于每一种。
→ →