製品
ソリューション
会社情報
エンタープライズ
サインインネットワークを作成
harness-engineering · ai-agents · context-engineering · agent-architecture · mcp

ハーネスはエージェントメカニズムであり、モデルの主張ではない

askglitch.com での Professor Glitch のハーネスエンジニアリングガイドは、メカニズムとして読める:プロパティ(エージェントが実際に機能する)はハーネス(コンテキストウィンドウ、メモリ、RAG、ループ、フック、評価)によって保証され、「最高のモデルを使った」という主張によってではない。Theorem 3 を 10/90 モデル-ハーネス分割に適用。

ハーネスはエージェントメカニズムであり、モデルの主張ではない

Professor Glitch (askglitch.com) は「Harness Engineering: How AI Agents Actually Work」で次のように書いている。「エージェントはモデルプラスハーネスである。モデルは脳である。ハーネスは脳を有用にするその周りのすべてである。」彼は分割を「約 10% モデル、90% ハーネス —— 大まかな見積もり、測定ではないが、これを構築した人は誰でもだいたい正しいと言うだろう」と置く。記事はハーネスをノードごとに歩く:コンテキストウィンドウ(RAM、ディスクではない)、メモリ(ウィンドウ内の短期、三つの引き出しの長期 —— 手続き的、意味的、エピソード的)、RAG(オープンブック試験)、スキル(タブ付きバインダー、漸進的開示)、ループ(考える、行う、観察する、繰り返す)、ツールと MCP(脳が手を得る方法)、フック(ドアのバウンサー)、評価(実行を採点する、出力評価プラス軌跡評価、腐敗した成功)。(Professor Glitch, "Harness Engineering: How AI Agents Actually Work", askglitch.com, 公開 2026-07-07, 取得 2026-08-23, https://www.askglitch.com/blog/harness-engineering)。Honest Architect は記事をハーネスすなわちエージェントメカニズムの実例として読む:プロパティ(エージェントが実際に機能する)はメカニズム(ハーネス —— モデルの周りのすべてで、生の知性を作業するエージェントに変えるもの)によって保証され、「最高のモデルを使った」という主張によってではない。Honest Architect は the-harness-is-the-agent-mechanism 形を Production ✅ とし、特定のサードパーティの主張(10/90 分割、Terminal-Bench、Chroma の context-rot 研究、「Lost in the Middle」論文、Anthropic のガイド、Claude Code、MCP、コミュニティカリキュラム)を Partial ⚠️ とする(サードパーティ、Everythink により独立に検証されていない)。

記事はコース販売意図を持つディープダイブ —— 七つのコース、181+ レッスン、TikTok、「JOIN THE COMMUNITY」コールトゥアクションを持つコミュニティ。Honest Architect はメカニズム形式を抽出するが、コースやコミュニティを推薦しない。七つのメカニズム形式、それぞれ現実かつ再現可能なものを Production ✅、サードパーティのものを Partial ⚠️。

主要な結論

  • ハーネスはエージェントメカニズムである。Theorem 3:プロパティ(エージェントが実際に機能する)はメカニズム(ハーネス —— コンテキストウィンドウ、メモリ、RAG、スキル、ループ、ツール、フック、評価)によって保証され、「最高のモデルを使った」という主張によってではない。脳は借りるもの;ハーネスは稼ぐもの。Production ✅。
  • コンテキストウィンドウは作業メモリメカニズムである。記事:「それは RAM であり、ディスクではない。速い、小さい、毎ターン消去される。」プロパティ(このターン覚える)はこのターンで机の上にあるものによって保証され、モデルが「知っている」ものによってではない。Production ✅。
  • 長期記憶は永続性メカニズムである。ウィンドウの外の三つの引き出し:手続き的(物事のやり方)、意味的(事実)、エピソード的(タイムスタンプ付きイベント)。プロパティ(セッション間で生き残る)はウィンドウの外に保存しオンデマンドで引き戻すことによって保証され、モデルによってではない。Production ✅。
  • RAG は検索メカニズムである。記事は「オープンブック試験」と呼ぶ。プロパティ(あなたのドキュメントから答える)は関連する段落を検索することによって保証され、モデルがマニュアルを暗記することによってではない。Production ✅。
  • ループはタスク完了メカニズムである。考える、行う、観察する、繰り返す —— 「仕事が実際に完了するまで。」プロパティ(仕事が本当に完了した)は完了までループすることによって保証され、一回の計画によってではない。三つの出口:本当に完了、ハードイテレーション上限、不確かなときは聞くために止まる。Production ✅。
  • フックは執行メカニズムである。記事:「フックはループの固定ポイントで発火する決定的コードである。モデルは群衆;フックはバウンサー。」プロパティ(間違ったことをしない)は毎回決定的コードによって保証され、モデルの良識によってではない。信頼はメカニズムではない。Production ✅。
  • 評価は品質メカニズムである。記事:「評価にバーを設定せよ、デモではない。」出力評価プラス軌跡評価。腐敗した成功:正しい答え、間違ったプロセス。プロパティ(本当に良いか)は全二十回の実行を採点することによって保証され、唯一のきれいなデモを見せることによってではない。Production ✅。
  • クロスドメイン並行:Oracle の一度だけ正規化(Sisters はモデル、Oracle はハーネス —— 調整済み予測 はハーネスによって保証され、単一の Sister によってではない)、World Monitor のソースごとの自己無効化(各ソースはキーが未設定のとき自己無効化するツール)、Zod の実行時境界(RAG は検索境界でドキュメントをパースする、Zod がネットワーク境界でペイロードをパースするように)、Eye Key(フックは類似 —— 間違ったことをしない は 毎回決定的コード によって保証され、鍵の主権 が HMAC プラスフィンガープリント によって保証されるように —— 両者とも構造的、信頼ではない)、HAI Engine 2016 年から(ループは類似 —— 同じメカニズム毎回実行 は 同じメカニズムを実行する によって保証される)。すべて Partial ⚠️:同じ形式、別のドメイン。
  • スコープ:民事/防御的。エージェントエンジニアリングは民事工学の関心事である。攻撃的スコープはない。トークン、ウォレット、コミュニティクレジットの結果は一切約束されない;それらは Roadmap 🔵、Howey 審査待ち。Everythink は予測プラットフォームであり、エージェントハーネスプロバイダではない;クロスドメイン並行は Partial ⚠️ の挿絵であり、askglitch.com、Professor Glitch、Anthropic、Claude Code、MCP、特定のコースやコミュニティへの推薦ではない。

ハーネスはエージェントメカニズムである

記事の核心文:「エージェントはモデルプラスハーネスである。モデルは脳である。ハーネスは脳を有用にするその周りのすべてである。」プロパティ(エージェントが実際に機能する)はメカニズム(ハーネス —— コンテキストウィンドウ、メモリ、RAG、スキル、ループ、ツール、フック、評価)によって保証され、「最高のモデルを使った」という主張によってではない。Production ✅。

最高のモデルを買い、ハーネスを飛ばすチームは瓶の中の脳を持つ —— 考えることはできるが、思い出す、調べる、ツールを取ることができない。任意の有能なモデルの周りにハーネスを構築するチームはエージェントを持つ。メカニズムはハーネスであり、モデルではない。Production ✅。

形式は Everythink の Oracle の一度だけ正規化のドメイン類推である:プロパティ 調整済み予測 は 多様な入力プラス一度だけ正規化 によって保証される —— Sisters(analyst、contrarian、disruptor、historian、institutionalist)はモデル、Oracle はドラフトを一つのアンサンブルに正規化するハーネス。10/90 分割は類似:Sisters は 10%、Oracle と Loom と永続化レイヤーは 90%。Partial ⚠️(同じ形式 —— ハーネスがプロパティを保証しモデルではない —— 別のドメイン)。

コンテキストウィンドウは作業メモリメカニズムである

記事:「コンテキストウィンドウはモデルが一つのターンで見えるすべてである。より良い名前は作業メモリである。それは RAM であり、ディスクではない。速い、小さい、毎ターン消去される。」プロパティ(このターン覚える)はこのターンで机の上にあるもの —— システムプロンプト、会話、検索された事実、ツール結果 —— によって保証され、モデルが「知っている」ものによってではない。チャットボットが名前を「忘れた」のは決して持っていなかったから;ハーネスは毎ターン会話を再貼り付けする。Production ✅。

区別は重要である。すべてをウィンドウに詰め込むチームは context rot を持つ —— 入力が成長するにつれ性能が低下し、重要な一文が埋もれた場所でモデルが沈む。このターンで重要なものだけを入れるチームは機能するウィンドウを持つ。メカニズムはキュレーションであり、サイズではない。ある点を過ぎると、多くが問題である。Production ✅。

長期記憶は永続性メカニズムである

ウィンドウが毎ターン消去されるなら、どこに何が住むのか?記事:「長期記憶はディスクである。耐久性があり、ウィンドウの外のデータベースに保存され、オンデマンドで引き戻される。」三つの引き出し:手続き的(物事のやり方 —— スキル、パッケージされたやり方)、意味的(事実 —— あなたの名前、会社、長いメールが嫌い)、エピソード的(タイムスタンプ付きイベント —— 「先週この顧客が返金を求め、私たちは断った」)。プロパティ(セッション間で生き残る)はウィンドウの外に保存しオンデマンドで引き戻すことによって保証され、モデルによってではない。Production ✅。

すべてをウィンドウに注ぐチームはコストがより高く、より遅く、腐敗するシステムを持つ。ウィンドウの外に選択的に保存し、意図的に少しを検索するチームは時間とともに鋭くなるシステムを持つ。メカニズムは選択的保存プラス選択的検索であり、注ぐことではない。Production ✅。

RAG は検索メカニズムである

記事は RAG を「オープンブック試験。誰も前夜に教科書を暗記しない。質問を読み、それをカバーする数ページにめくる。」プロパティ(あなたのドキュメントから答える)は 200 ページのマニュアルから関連する段落を検索することによって保証され、モデルがマニュアルを暗記することによってではない。意味、スペルではなく、埋め込みポイント間の平面距離として測られる。Production ✅。

区別は重要である。内部ドキュメントについて聞かれる生のモデルはもっともらしく聞こえる返金ポリシーを発明する —— そしてもっともらしく聞こえる間違った答えが最も危険な種類である。実際のページを手渡されたモデルは想像ではなくポリシーから読む。しかし RAG は関連するものを検索し、保証された真実ではない:間違ったページが入れば、間違った答えが出る、平然と。メカニズムは検索であり、真理ではない。Production ✅。

ループはタスク完了メカニズムである

記事:「話すものを機能するものに変えるのはループである:考える、行う、観察する、繰り返す、仕事が実際に完了するまで。」プロパティ(仕事が本当に完了した)は完了までループすることによって保証され、一回の計画によってではない。「暗闇で作られた計画は推測である。ループは推測を事実と交換する。」Production ✅。

難しい部分:ループはいつ止まるのか?二つの失敗モード。早すぎる止まり:一回の返金、「基本的に完了」、やめ、そしてあなたは結局その仕事をチェックする。決して止まらない:同じ顧客に四回返金する、または隅に挟まったロボット掃除機のように一晩中スピンする —— 実際の請求書。良いループには三つの出口がある:タスクが本当に完了した、ハードイテレーション上限、不確かなときは聞くために止まる。メカニズムは出口条件であり、ループそのものではない。Production ✅。

フックは執行メカニズムである

記事:「確率的なものにどうか注意深くあってくれとは頼まない。毎回実行するルールが欲しい、コードで、モデルが言い抜けできないもの。それがフックである:ループの固定ポイントで自動的に発火する決定的コード。モデルは群衆;フックはバウンサー、毎回すべての人をチェック、例外なし。」プロパティ(間違ったことをしない)は毎回実行する決定的コードによって保証され、モデルの良識によってではない。信頼はメカニズムではない。Production ✅。

区別は重要である。モデルの良識に頼るチームは、プロンプトがどう書かれたかに依存するガードレールを持つ —— 今日が間違ったフォルダでクリーンアップコマンドを実行する日だと決めるかもしれないのと同じ確率的モデル。各ツール呼び出しの前にフックを実行するチームは、モデルが言い抜けできないガードレールを持つ。フックは悪いことをブロックするだけでなく;停止を拒否しエージェントをループに強制戻しできる。執行であり、丁寧な依頼ではない。Production ✅。

形式は Everythink の Eye Key 設計のドメイン類推である:プロパティ 鍵の主権 は HMAC プラスフィンガープリント によって保証される —— 鍵が主権的であるのはメカニズムが構造的にプロパティを生み出すからであり、信頼によってではない。フックは類似:間違ったことをしない は 毎回決定的コード によって保証され、モデルの判断によってではない。両者とも行動期待ではなく構造的制約によってプロパティを生み出す。Partial ⚠️(同じ形式 —— プロパティが信頼ではなく構造的制約によって保証される —— 別のドメイン)。

評価は品質メカニズムである

記事:「評価にバーを設定せよ、デモではない。デモは簡単:二十回実行し、きれいな一回を見せる。評価は全二十回を採点する。」採点する二つのこと:出力評価(答えは正しかったか?)と軌跡評価(経路は堅牢だったか?)。失敗モード:「腐敗した成功 —— 正しい答え、間違ったプロセス。」プロパティ(本当に良いか)は両方の評価で全二十回の実行を採点することによって保証され、唯一のきれいなデモを見せることによってではない。Production ✅。

トレーシング:「領収書を保管せよ。各実行で、何が検索されたか、どのツールがどんな入力で発火したか、何トークン、どれくらいの時間を記録する。何かが壊れたとき、最終答えを眯めて理論化しない。トレースを開き、脱線した正確なステップを見る。」プロパティ(壊れたときデバッグ可能)は何が起きたかを記録することによって保証され、最終答えから理論化することによってではない。Production ✅。

フライホイール:「評価が捕らえる各失敗はハーネスにボルト留めされた修正になる。ルールを知らなかった?システムプロンプトに追加せよ。破壊的なものを実行した?フックを追加せよ。システムはより賢いモデルを待ったからではなく、ハーネスを改善したから良くなる、一度に一つの捕らえた失敗。」メカニズムは評価駆動のハーネス改善であり、モデルアップグレードではない。Production ✅。

Honest Architect がハーネスエンジニアリングディープダイブから読み取るもの

記事はコース販売意図を持つディープダイブ —— 七つのコース、181+ レッスン、TikTok、「JOIN THE COMMUNITY」コールトゥアクションを持つコミュニティ。Honest Architect はメカニズム形式を抽出するが、コースやコミュニティを推薦しない。形式は Production ✅ である:現実、再現可能、記事自体の論理によって検証可能(ハーネスは瓶の中の脳をエージェントに変える;ウィンドウは RAM;メモリは外に永続する;RAG はページを検索する;ループは完了まで実行する;フックは決定的に執行する;評価は全二十回を採点する)。特定のサードパーティの主張(10/90 分割、Terminal-Bench、Chroma の研究、「Lost in the Middle」論文、Anthropic のガイド、Claude Code、MCP、カリキュラム)はすべて Partial ⚠️ である。Honest Architect は askglitch.com、Professor Glitch、Anthropic、Claude Code、MCP、いかなるコースやコミュニティも推薦しない。Everythink は予測プラットフォームであり、エージェントハーネスプロバイダではない。スコープは民事/防御的である。トークン、ウォレット、コミュニティクレジットの結果は一切約束されない;それらは Roadmap 🔵、Howey 審査待ち。

よくある質問

ハーネスはメカニズムか、主張か?

ハーネスはメカニズムである。Theorem 3:プロパティ(エージェントが実際に機能する)はメカニズム(ハーネス)によって保証され、主張(「最高のモデルを使った」)によってではない。脳は借りるもの;ハーネスは稼ぐもの。Production。10/90 分割は大まかな見積もりであり、測定ではない —— Partial。

なぜコンテキストウィンドウが作業メモリメカニズムなのか?

ウィンドウは RAM であり、ディスクではない —— 毎ターン消去される。プロパティ このターン覚える はこのターンで机の上にあるものによって保証される。Context rot:ある点を過ぎると、多くが問題。Production。

なぜフックが執行メカニズムなのか?

フックは毎回発火する決定的コードである。プロパティ 間違ったことをしない はコードによって保証され、モデルの判断によってではない。モデルは群衆;フックはバウンサー。信頼はメカニズムではない。Production。

なぜ評価が品質メカニズムなのか?

デモはきれいな一回を見せる;評価は全二十回を採点する。出力評価プラス軌跡評価。腐敗した成功 —— 正しい答え、間違ったプロセス —— が失敗モード。トレーシングは領収書を保管する。Production。

Everythink は askglitch.com、Professor Glitch、Claude Code を推薦するか?

いいえ。Everythink は予測プラットフォームであり、エージェントハーネスプロバイダではない。記事はコース販売意図を持つディープダイブ。特定のサードパーティの主張は Partial。トークン、ウォレット、コミュニティクレジットの結果は一切約束されない;それらは Roadmap、Howey 審査待ち。

Sources

もしあなたのチームがプロパティを主張する代わりにメカニズムを出荷する準備ができているなら、ネットワークを構築せよ —— Oracle は Sisters のドラフトを正規化し、各ソースは自己無効化し、HAI Engine は 2016 年から同じメカニズムを実行し、Zod は境界でパースする。

関連
mcp · model-context-protocol · interoperability · protocol-design · ai-tooling

プロトコルは相互運用メカニズムであり、プラグの主張ではない

Marc Friborg Bersang による AI Engineers Academy での MCP の解説は、メカニズムとして読める:プロパティ(AI がすべてに接続する)は、定義されたプロトコル構成要素(クライアント、サーバー、トランスポート、能力ネゴシエーション、型付きスキーマ、エラー伝播)によって保証され、「AI の USB のような」という主張によってではない。Theorem 3 をプロトコル設計に適用。

data-systems · ai-agents · inference-cost · agentic-systems · berkeley

コスト低下はイネーブラー機構であり、無料の断言ではない

バークレーの研究視点は6つの機構フォームとして読める:コスト低下をイネーブラーとして、エージェント投機を負荷として、マルチクエリ最適化を重複排除として、構造化メモリを取得として、並行編集セマンティクスを一貫性として、検証エージェントを訂正として。定理3をそれぞれに適用。

自らの主張を証明するエンジンの上に、あなたの世界を築く。

2016 年から稼働し続けるエンジンの上に、あなた自身のネットワークを作る——あるいは 21 本の論文を書いたチームに話しかける。