製品
ソリューション
会社情報
エンタープライズ
サインインネットワークを作成
ai · architecture · mechanism · theorem-3 · customization · mixture-of-experts · inkling · honest-architect

カスタマイズとはメカニズムの分離であり、オープンウェイトではない

Inkling がカスタマイズされるために設計されているのは、Apache 2.0 ライセンスのためではなく、各アーキテクチャ上の決定が測定可能な属性を独自のメカニズムの背後に隔離するからだ。バイアスベースの負荷均衡は Theorem 3 の最も純粋な実例であり、主目的と競合しないメカニズムによって保証される属性である。

カスタマイズとはメカニズムの分離であり、オープンウェイトではない

Thinking Machines は 2026 年 7 月 15 日に Inkling を公開し、公開の言葉遣いでは「カスタマイズされるために設計された」モデルと呼んでいる。ウェイトは Hugging Face に Apache 2.0 ライセンスで置かれ、安易な読み方は、カスタマイズとはライセンスが与えるものだというものだ。その読み方は間違っている。オープンウェイトは公開の選択である。カスタマイズの保証は構造的である。モデルの各アーキテクチャ上の決定が、測定可能な一つの属性をそれ自身のメカニズムの背後に隔離し、各メカニズムが独立に測定可能で調整可能である。一つを再訓練しても他を引きずらない。これが、メカニズムを真剣に受け止めた時の「カスタマイズされるために設計された」の意味であり、それぞれのポートが異なる質問に答えるシステムと同じ形をしている。

これは Inkling に関する Honest Architect の読みであり、公開発表、モデルカード、vLLM プロジェクトが公開した統合ノートに基づく(ByteByteGo、「The New American AI Model Designed to be Customized」、2026 年 8 月 18 日、2026-08-23 取得)。ここでの主張は Everythink が LLM を出荷するということではない。出荷しない。主張は、設計パターンが認識可能だということである。ある属性は、そのメカニズムが実装され測定している時に正確に保証され、システムは、各属性が他と競合しない独自のメカニズムを持つ時に正確にカスタマイズ可能である。

メカニズム 1 — 疎結合はストレージと計算を分離する

最初の決定は、残りすべてを手頃にする決定である。Inkling は 9750 億パラメータを格納し、トークンごとに約 410 億を実行し、一度にアクティブなのはモデルの約 4 パーセントである。メカニズムは Mixture of Experts である。各レイヤーは 256 のエキスパートを保持し、ルータはトークンごとに 6 つを選び、さらにすべてのトークンで実行される 2 つの共有エキスパートが加わる。属性は「これほど大きなモデルが実行可能である」こと。メカニズムは「単一の feed-forward ネットワークを 256 の小さなもので置き換え、6 つだけ実行する」こと。測定は比率である。9750 億が格納され、410 億がアクティブ。✅

トレードオフは正直に述べられている。フル精度のチェックポイントは少なくとも 2 TB の合計 GPU メモリを必要とする(NVIDIA B300 が 8 枚、または H200 が 16 枚)。量子化チェックポイントは約 600 GB で、B300 が 4 枚に収まる。疎結合はストレージと計算を分離するが、ストレージの床を排除はしない。ハードウェア要件は、各トークンが安価であっても高いままである。ある属性を保証するメカニズムは、それが構築された対象以外の属性も保証するわけではない。

メカニズム 2 — バイアスは目的と競合せずにエキスパートを均衡させる

これはアーキテクチャ全体の中で最も純粋な主張の実例である。属性は「訓練中にエキスパートの使用が均等に保たれる」こと。素朴なメカニズムは、訓練目的に加えられる均衡ペナルティで、使用が不均等になると大きくなる。問題は、予測勾配と均衡勾配が異なる方向を指し、その一方が勝つことだ。ペナルティを高く設定すればテキスト品質は劣化する。低く設定すればエキスパートは結局崩壊する。

Thinking Machines は Wang らによって導入され DeepSeek も採用した auxiliary-loss-free 法を使う。各エキスパートにはバイアス値があり、そのエキスパートの選択スコアに加えられる小さな数字である。過負荷のエキスパートのバイアスは下に漂い、その選択スコアはより静かな隣接のものより下がり、隣接が枠を取る。バイアスは選択にのみ影響する。それは選ばれたエキスパートの出力の重み付けには決して触れず、backpropagation の完全に外側で実行される単純なカウント規則によって更新される。主訓練目的は競合する勾配を受け取らない。「均等な使用」という属性は、「次のトークンを正確に予測する」という属性と戦わないメカニズムによって保証される。✅

これは Theorem 3 の最も清潔な形である。属性はそのメカニズムが実装され測定している時に正確に保証される。メカニズムはバイアス。測定はカウント規則。メカニズムは主目的と競合しない、そう設計されたからだ。事後のペナルティではなく、構造による主権。

メカニズム 3 — 5:1 のアテンション分割が 100 万トークンを手頃にする

アテンションコストは系列長の二乗で増大する。100 万トークンはレイヤーごとに約 1 兆回の比較を生み、66 レイヤーでは合理的なハードウェアの範囲を超える。属性は「100 万トークンのコンテキストウィンドウ」。メカニズムは sliding-window レイヤーと full-attention レイヤーの 5:1 の比率であり、55 の sliding-window レイヤーと 11 の full-attention レイヤーである。sliding-window レイヤーは各トークンを最近のトークンの固定ウィンドウに制限するので、そのコストは二次ではなく線形に増大する。長距離情報は 11 の完全レイヤーを通じて伝わり、およそ 6 レイヤーに 1 回更新される。✅

測定は比率とレイヤー数であり、55 対 11。トークン 200 の事実がトークン 900,000 で重要になる場合、それは full-attention レイヤーを通じて前方に伝わり、その間の局所表現の中で運ばれる。トレードオフは正直である。長コンテキストモデルは大きな文書の全体的な内容をうまく扱えることが多いが、中間に埋もれた特定の詳細を見逃すことがある。メカニズムはウィンドウを手頃にする。埋もれた詳細すべての想起を保証はしない。

メカニズム 4 — 相対位置符号化が外挿を排除する

最近のほぼすべてのオープンモデルは Rotary Position Embedding を使う。各トークンの query と key は、その位置に比例する角度で回転される。その角度はモデルが訓練した位置でのみ遭遇される。位置 900,000 について尋ねると、角度はモデルが経験した範囲外に落ちる。RoPE を訓練データを超える範囲に伸ばすための技術の一族全体が存在する。

Inkling は Shaw らのスタイルの相対スキームを使う。各トークンがどこに座るかを符号化する代わりに、2 つのトークン間の各距離について一つの値を学習し、その値を比較スコアに加える。距離 4 のトークンは、どこで生じても距離 4 のトークンである。あるカットオフを超える距離はすべて同じ学習された値を共有するので、90 万トークン離れたペアはモデルが訓練中に何度も見た値を使う。何も外挿する必要がない。✅

測定は距離であり、位置ではない。属性は「モデルが訓練したことのない長さを扱う」ことで、メカニズムは「絶対位置ではなく距離を符号化することで、未訓練の長さが訓練された距離に収束する」こと。トレードオフは、周囲のツールが RoPE を中心に構築されたため、すべての serving フレームワークがそのために新しいコードを書かなければならなかったことだ。ある属性を保証するメカニズムは、古いメカニズムの周囲に育ったエコシステムを犠牲にする可能性がある。

メカニズム 5 — エンコーダなしマルチモダリティをゼロから訓練

ほとんどのマルチモーダルモデルは 3 つの訓練されたコンポーネントを付加する。視覚エンコーダ、音声エンコーダ、投影レイヤーであり、それぞれが別個に事前訓練される。Inkling は個別に事前訓練されたエンコーダなしで画像と音声を受け入れる。音声は mel spectrogram として到着し、周波数帯と時間スライスにわたる loudness 値のグリッドである。dMel 法は各 loudness 値を固定されたレベルの集合の一つに丸める。それが変換のすべてである。数字を丸めるのに訓練は不要だ。画像は 40×40 ピクセルのパッチに切られ、それぞれが計算量に 1 パーセント未満しか加えない 4 段階の hMLP ステムを通る。両者はその後、軽量な変換レイヤーを通り、テキストトークンと一緒に単一の系列に合流し、同じ 66 レイヤーで処理される。✅

属性は「画像と音声が個別に事前訓練されたエンコーダなしでモデルに入る」こと。メカニズムは「音声を丸め、画像をパッチにし、局所的に混合し、すべてを一緒にゼロから訓練する」こと。測定は 1 パーセント未満の計算オーバーヘッド。トレードオフはラベルの混乱である。公開は encoder-free と呼ぶが、モデルカードは hierarchical patch encoder と記述する。両方とも正確である。Encoder-free とは、個別に事前訓練された大きなネットワークがないことであり、処理がまったくないことではない。

メカニズム 6 — Effort が訓練された設定としてベンチマークを曲線にする

推論モデルは最終的な答えの前に working-out を生成し、その working-out はトークンを消費する。Effort は 0 から 1 の間の数字であり、redaction を通じて要求されるのではなく、reinforcement learning 中にモデルに訓練された。RL 中、Thinking Machines は試行間で effort メッセージを変えながらトークンごとに請求されるコストを調整した。high effort の試行は長い working-out をほとんど罰せずに生成でき、low effort の試行はトークンごとに重く罰せられたので短い答えが良く採点された。メッセージと有利な長さの間の接続が学習された。✅

測定は生成されたトークンに対するスコアの曲線である。Terminal Bench 2.1 で、Inkling は NVIDIA の Nemotron 3 Ultra と同じスコアに達しながら、約 3 分の 1 のトークンを生成する。属性は「推論の深さが呼び出しごとに調整可能」であり、メカニズムは「RL 試行間でトークンごとのコストを変えることで effort メッセージへの応答を訓練する」こと。トレードオフは、より高い effort がより多くの推論を促すが、個々のサンプルでより長く、またはより良い応答を保証しないこと。ベンチマークの数字は今や曲線上の一点であり、モデルの固定された属性ではない。

別のスタックからどう見えるか

Everythink は LLM を出荷しない。以下の並行は構造的であり、製品の主張ではなく、Partial とタグ付けされる。類比がポイントであり、Everythink が同じ仕事をすると主張しているのではない。

競合せずに均衡させるバイアスは、Oracle の単一の正規化サイトと同じ形である。確率は everythink-oracle 内の正確に一つの場所で正規化され、消費者は合計がほぼ 1 であることに依存できる。属性は merge と競合しないメカニズムによって保証される。⚠️

ほとんどのレイヤーが少ししか見ず、少数が長距離を運ぶ 5:1 のアテンション分割は、「the space is the router」と同じ形である。Network、community、room は何かが応答する前にルーティングし、ほとんどの要求は局所的に解決し、少数は長い経路を旅する。メカニズムはトポロジーであり、測定は要求がどこで解決するかである。⚠️

再遭遇した距離がモデルが何度も見た値を使う相対位置符号化は、World Monitor の決定論的 uuidv5 id と同じ形である。再摂取は更新であって複製ではなく、id がソースと native id から決定論的に派生するからだ。属性は「再摂取で重複なし」であり、メカニズムは決定論的起源である。⚠️

各モダリティが自身の安価なメカニズムを通じて入り同じ系列に合流するエンコーダなしマルチモダリティは、trait に基づく六角形ポートと同じ形である。各ポートは異なる質問に答え、AppState リポジトリは Arc であり、テストは mock に差し替えられる。属性は「具体的な adapter ではなく trait に依存する」ことであり、メカニズムは trait 境界である。⚠️

ベンチマークが曲線上の一点になる訓練された設定としての Effort は、Sisters の型付き人格と同じ形である。analyst、contrarian、disruptor、historian、institutionalist は型付きであり、prompt version は再現性のために毎回の実行に刻印される。属性は「再現可能な型付き推論」であり、メカニズムは人格と版スタンプである。⚠️

主目的を明け渡すことなく均衡させるバイアスは、Eye Key の主権と同じ形である。Eye Key 平文は決してディスクに触れない。HMAC と指紋だけが Postgres に行く。属性は「key への主権」であり、メカニズムは構造であり、事後的に適用される罰ではない。⚠️

スコープの限界と Roadmap

この投稿は AI モデルアーキテクチャに関するものであり、商業および産業のスコープである。上の Everythink の並行は Partial である。Everythink は LLM を出荷しない。構造的類比が主張であり、製品の主張ではない。Eye Key は開発者向け API 主権メカニズムであり、Production であり、投資手段ではない。HAI Engine は 2016 年から生産である。The 21 papers は Production である。World Monitor は Production である。Oracle は Production である。Sisters は Production である。ここでは token、wallet、community-credit の成果は何も約束されない。それらは Roadmap 🔵 のままであり、Howey 審査の対象であり、決して密かに昇格されない。Theorem 3 は、属性がメカニズムの実装と測定の時に保証されるという主張の命名規則であり、法的用語ではない。

ほとんどの報道が見落とした 2 つのこと

第一に、バイアスは完全に backpropagation の外側で更新される。ほとんどの報道は auxiliary-loss-free 法を「auxiliary loss なし」と記述するが、荷重を担う詳細は、バイアス更新が勾配ではなくカウント規則だということだ。メカニズムは「loss を取り除く」ことではない。それは「勾配を取り除き、カウンターで置き換える」ことだ。これが、あなたが調整する罰と、あなたが実装するメカニズムの違いである。

第二に、effort 設定はテキストとして到着する。対話が始まる前に、effort レベルを述べる system message がすべての前に挿入される。モデルはそのメッセージに応答するよう訓練された。カスタマイズのノブは、コードの中で設定するパラメータではない。それはモデルが従うことを学んだ一文である。それは境界解析メカニズムであり、effort 設定が system message を送れる任意のクライアントに、ネットワーク境界で入力を検証するものを含めて、移植可能であることを意味する。

FAQ

オープンウェイトはカスタマイズ可能と同じですか? いいえ。オープンウェイトはダウンロードして再訓練できることを意味する。カスタマイズ可能は、アーキテクチャが独立した測定可能なメカニズムを露出し、一つを再訓練しても他を引きずらないことを意味する。Inkling は両方を持つ。オープンウェイトとモノリシックなアーキテクチャを持つモデルは再訓練可能であり、構造的な意味でカスタマイズ可能ではない。

なぜ疎結合よりバイアスが重要なのか? 疎結合はストレージと計算を分離し、それはコストの物語だ。バイアスは均衡を主目的から分離し、それは設計パターンの物語だ。バイアスは主張を証明するメカニズムである。属性は競合しないメカニズムによって保証される。疎結合は主張を手頃にするメカニズムである。

相対位置符号化のトレードオフは何ですか? モデルは訓練したことのない長さを扱うが、すべての serving フレームワークがそのために新しいコードを書かなければならなかった。ツールのエコシステムは RoPE を中心に構築された。ある属性を保証するメカニズムは、古いメカニズムの周囲に育ったエコシステムを犠牲にする可能性がある。

Effort はより良い答えを保証しますか? いいえ。より高い effort はより多くの推論を促すが、個々のサンプルでより長く、またはより良い応答を保証しない。Effort と最大トークン制限は別々の設定である。high effort 設定は、切り捨てられないために大きなトークン制限を必要とするかもしれない。ベンチマークは曲線であり、単一サンプルはその上の一点である。

Everythink は Inkling を使えますか? この投稿の Everythink の並行は構造的である。Everythink は LLM を出荷しない。Everythink が使う LLM プロバイダーは OpenAI-compatible である。類比は設計パターンに対するものであり、製品統合に対するものではない。

Sources

  • ByteByteGo、「The New American AI Model Designed to be Customized」、2026 年 8 月 18 日 — https://blog.bytebytego.com/p/the-new-american-ai-model-designed — 2026-08-23 取得
  • Thinking Machines Lab、「Inkling: Our Open-Weights Model」(ByteByteGo 経由で引用)
  • Thinking Machines Lab、「Inkling Model Card」(ByteByteGo 経由で引用)
  • vLLM Recipes、「thinkingmachines/Inkling」統合ノート(ByteByteGo 経由で引用)
  • Wang et al.、「Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts」(ByteByteGo 経由で引用)
  • Shaw et al.、「Self-Attention with Relative Position Representations」(ByteByteGo 経由で引用)

Theorem 3、Oracle、the-space-is-the-router パターンに関する Honest Architect を読んでください。Everythink は生産状態である。ここの並行は構造的であり、そのようにタグ付けされている。

自らの主張を証明するエンジンの上に、あなたの世界を築く。

2016 年から稼働し続けるエンジンの上に、あなた自身のネットワークを作る——あるいは 21 本の論文を書いたチームに話しかける。