
推論で975Bの教師を上回り、事実の再現で教師に負ける276Bのモデルは、「より良いモデル」ではありません。それは別のメカニズムです。Thinking Machines Labは2026年8月2日にInkling-Smallを公開しました:276Bの総パラメータ、12Bのアクティブ、Apache 2.0のオープンウェイト、ネイティブのテキスト・画像・音声入力、1Mトークンのコンテキスト。このモデルはHumanity's Last Examで31.6パーセントを獲得し(教師は29.7)、SimpleQA Verifiedで20.6パーセントを獲得しました(教師は43.9)。誠実な読み方は「小さいほど良い」ではありません。誠実な読み方は:トレーニングがどのメカニズムを強化したのか、そしてそのメカニズムは実装され測定しているか、です。
安易な見出しは「オープンウェイトのMoEが4分の1のサイズでフロンティアに並ぶ」です。その見出しは防御可能ですが、決定的な事実を隠しています。決定的な事実は、Inkling-Smallが現実世界の予測問題のコーパスに対してproper scoring rulesで強化学習によってトレーニングされ、そのForecastBench Brier指数が61.3で教師の60.1を上回っていることです。その数字がこのリリースをEverythinkの仕事に結びつけます。キャリブレーションメカニズムが論点です。
リリースの概要、一段落で
Inkling-Smallは42層のdecoder-onlyトランスフォーマーで、スパースなMixture-of-Expertsフィードフォワードバックボーンを備えています。各トークンは256のエキスパートのうち6つと2つの共有エキスパートにルーティングされ、トークンごとに258のエキスパートのうち8つが発火します。このモデルはエンコーダーフリーでネイティブにマルチモーダルです:画像は4層のhMLPを通じて40x40ピクセルのパッチとして入力され、音声はdMelスペクトログラムとして入力され、両者は軽量な埋め込み層を通りテキストトークンストリームに合流します。コンテキストウィンドウは1Mトークンです。思考努力は調整可能です。ウェイトはHugging FaceでApache 2.0の下で公開されます。BF16チェックポイントは600 GBの集約VRAM(4x B300または8x H200)を必要とします;NVFP4チェックポイントはその下限を180 GBに下げ、単一のB300でW4A4を実行します。Marktechpostの報道とThinking Machines Labのモデルカードによれば、サポートされるランタイムはSGLang、vLLM、TokenSpeed、Unsloth、Hugging Faceです。
メカニズム1:アクティブパラメータ数がコストメカニズムであり、総数ではない ✅
「モデルの提供が手頃な価格である」というプロパティは、スパースルーティングのメカニズムによって保証され、総パラメータ数によって保証されるのではありません。276Bの密なモデルはトークンごとに276Bの計算を必要とするでしょう。Inkling-Smallは12Bを必要とします。総パラメータ数はメモリコスト(276Bすべてを保存する)です。アクティブパラメータ数は計算コスト(トークンごとに12Bを乗算する)です。MoEは両者を切り離します。これが決定的なアーキテクチャ上の事実であり、276Bのモデルがフロンティアラボのクラスタではなく単一のレンタルB300で動く理由です。
Theorem 3はこれを明確に読み取ります:「手頃な推論」というプロパティは「トークンごとに258のエキスパートのうち8つを活性化するスパースルーティング」というメカニズムによって保証され、測定はアクティブパラメータ数(12B)とVRAMの下限(NVFP4で180 GB)です。メカニズムのないプロパティは主張です(「小さい」)。測定しているメカニズムのあるプロパティは保証です(「12Bアクティブ、180 GB VRAM」)。Production ✅ — チェックポイントは公開され、ハードウェア要件は明記されています。
[UNIQUE INSIGHT] 総数対アクティブの区別は、Everythinkがネットワークとルームの間に引く区別と同じです。ネットワークは総体(存在するすべての組織、コミュニティ、ルーム)です。アクティブなコンテキストはあなたがいるルームです。The space is the router:ネットワークからコミュニティへ、コミュニティからルームへと、何かが応答する前にリクエストを12Bに関連するスライスにルーティングします。MoEルーティングとEverythinkルーティングは異なるスケールでの同じパターンです — 大きな保存空間上のスパースな活性化。
メカニズム2:proper scoring rulesに対するキャリブレーションはTheorem 3の縮図 ✅
これがEverythinkにとって決定的なメカニズムです。モデルカードは、キャリブレーションが現実世界の予測問題の大規模なコーパスに対してproper scoring rulesでRLによってトレーニングされたと述べています。検索なしのForecastBenchは61.3プラスマイナス0.46のBrier指数を与え、Inklingの60.1プラスマイナス0.54を上回ります。Brierスコアはproper scoring ruleです:それは真の信念を報告することによってのみ期待値で最小化されます。それに対してトレーニングすることは、モデルに自信のある確率ではなくキャリブレーションされた確率を報告することを教えます。
Theorem 3は、プロパティはそのメカニズムが実装され測定している時に正確に保証されると言います。プロパティは「モデルの確率予測がキャリブレーションされている」です。メカニズムはproper scoring ruleに対するRLです。測定は保留された予測コーパス上のBrierスコアです。3つすべてが明記されています。それは保証であり、主張ではありません。Production ✅。
これはEverythinkのOracleがすることです。Sistersが候補となる未来を生成し;Oracleがそれらを毎回のマージでエントロピーを伴うキャリブレーションされたアンサンブルにマージします。確率は正確に一箇所で正規化されます。OracleはSistersの自信を額面通りに受け取りません;それらをスコアリングします。Inkling-Smallのトレーニングも同じことをします:モデルの生のlogitsを額面通りに受け取りません;過信と自信不足の両方を罰するルールに対してそれらをスコアリングします。メカニズムはスコアリングルールです。保証はキャリブレーションです。[PERSONAL EXPERIENCE] 私たち自身の仕事で、proper scoring ruleのない予測アンサンブルが最も声の大きいSisterに向かってドリフトすることを見てきました。スコアリングルールがアンサンブルを誠実に保つものです。Inkling-Smallのトレーニングパイプラインはこの規律をモデルレベルで実装しています。
メカニズム3:SimpleQAでの回帰は誠実さであり、失敗ではない
このモデルはHLE(31.6 vs 29.7)、SWE-bench Verified(80.2 vs 77.6)、Terminal-Bench 2.1(64.7)、Toolathlon Verified(54.4 vs 45.5)、ARC-AGI-2(40.1 vs 36.5)で教師を上回ります。SimpleQA Verified(20.6 vs 43.9)、AA Omniscience(-9.0 vs 2.1)、Tau 3 Banking(15.5 vs 23.7)で負けます。誠実な読み方は「モデルがより良い」ではありません。誠実な読み方は:トレーニングは推論とエージェント的コーディングを強化し、事実の再現はその結果として回帰しました。メカニズム(2週間のエージェント的コーディングRL、教師からのオンポリシー蒸留)があるプロパティを別のプロパティと交換しました。
Theorem 3はこれを正確に評価します。「強い推論」というプロパティは「bashのみのハーネスでのエージェント的コーディングRL」というメカニズムによって保証され、SWE-bench Verifiedによって測定されます。「広範な事実の再現」というプロパティは別のメカニズム(事前トレーニングデータの幅)によって保証され、SimpleQAによって測定されます。2番目のメカニズムはポストトレーニング段階で強化されず、回帰が証拠です。すべてにおいてより良いモデルは、メカニズムのトレードオフのないモデルでしょう。そのようなモデルは存在しません。Inkling-Smallはそのベンチマーク表でトレードオフを明示しています。それが誠実なスコアカードです。
[ORIGINAL DATA] SimpleQA(20.6)とSWE-bench Verified(80.2)の間のギャップは59.6パーセンテージポイントです。その広がりが可視化されたトレードオフです。SimpleQAスコアなしでSWE-benchスコアで販売されるモデルは、そのメカニズムを隠しているモデルです。Thinking Machines Labは両方を公開します。それがEverythinkが自らに課す基準です:Sistersの予見は毎回のマージでエントロピーとともに公開され、見出しの確率だけではありません。
メカニズム4:Apache 2.0の下のオープンウェイトが主権メカニズム ✅
「あなたがモデルを所有する」というプロパティは、寛容なライセンスの下のオープンウェイトのメカニズムによって保証され、ベンダーのAPI規約によって保証されるのではありません。Apache 2.0はウェイトを実行、変更、ファインチューン、プライベートに提供できることを意味します。単一のB300で180 GBで動くNVFP4チェックポイントは、規制されたセクター — 金融サービス、医療、保険、電気通信、公共部門 — が独自のハードウェアで、独自のファイアウォールの後ろで、データが施設から出ることなく276Bモデルを動かせることを意味します。それはモデル層での顧客主権です。
Theorem 3:「プライベート推論」というプロパティは「オープンウェイト プラス デプロイ可能なハードウェアに収まる量子化チェックポイント」というメカニズムによって保証され、180 GBのVRAM下限によって測定されます。Production ✅ — チェックポイントはHugging Faceにあり、ハードウェア要件は公開されています。
Everythinkの主張は顧客主権です:あなたのネットワーク、あなたのブランド、あなたのデータ。オープンウェイトはその主張のモデル層バージョンです。ベンダーホストのAPIは賃貸配置です;あなたのハードウェア上のオープンウェイトは所有権です。EverythinkのWhitelabel Networkモジュールはプラットフォーム層バージョンです:あなたがあなたのブランドの下でネットワークを運営し、私たちのではありません。Production ✅。
メカニズム5:ネイティブマルチモダリティが包含メカニズム ✅
「モデルが世界を到着したまま読む」というプロパティは、ネイティブマルチモーダル入力のメカニズムによって保証され、別個のビジョンとオーディオエンコーダーを後付けすることによってではありません。Inkling-Smallはエンコーダーフリーです:画像は4層のhMLPを通じてパッチとして入力され、音声はdMelスペクトログラムとして入力され、両者は軽量な埋め込み層を通じてテキストトークンストリームに合流します。MMMU Proは74.0、CharXiv RQは77.4(Pythonでのクロップ・ズーム・インスペクトで81.3)、Audio MCは54.9、MMAUは77.0、VoiceBenchは90.1です。モデルはテキスト、画像、音声を一度に読みます。テキストのみのモデルは入力が画像や音声メモとして到着する人を除外します;ネイティブにマルチモーダルなモデルはそれらを包含します。Everythinkのデザインによる包含の原則 — 多言語、マルチモーダル、低接続性 — は同じパターンです。World Monitorゲートウェイはフライト、船舶、地震、火災、天気をネイティブgeo-signalsとして取り込み、テキスト記述としてではありません。Production ✅。
メカニズム6:安全メカニズムは階層的であり、モノリシックではない ✅
「モデルが有害なリクエストを拒否する」というプロパティは、安全トレーニング plus ダウンストリームモデレーションのメカニズムによって保証され、安全トレーニングのみによってではありません。StrongREJECTは98.4パーセント、FORTRESS adversarialは71.6パーセント、FORTRESS benignは96.9パーセントです。Thinking Machines Labはコンシューマ向けデプロイメントにLlama Guardを追加することを推奨しています。それは階層的安全の主張です:ベースモデルは安全のためにトレーニングされ、デプロイメントが2番目のフィルターを追加します。Theorem 3はこれを2つのメカニズムとして評価します — ベースはStrongREJECTとFORTRESSで測定され、デプロイメントはダウンストリーム層で測定されます。Production ✅ベースモデル用;ダウンストリーム層はデプロイヤーの責任です。Everythinkのスコープの倫理 — 民事・防御的利用のみ — は同じ階層的パターンです。
Everythinkの類似、そしてPartialなところ
Oracle、Everythinkの予測マージは、Sistersの候補未来を取り、毎回のマージでエントロピーを伴うキャリブレーションされたアンサンブルを返します。Inkling-Smallのキャリブレーショントレーニングはモデルの生のlogitsを取り、proper scoring ruleに対するキャリブレーションされた確率を返します。類似はリアルでProduction ✅です:両者がスコアリングし、両者がキャリブレーションし、両者が測定します。Oracleは複数エージェントをマージし;モデルは1つのエージェントをキャリブレーションします。Partial ⚠️ — メカニズムは同じ(proper scoring rule)、スコープは異なる(アンサンブル vs 単一モデル)。
Sistersは型付きのペルソナです:analyst、contrarian、disruptor、historian、institutionalist。Inkling-SmallのMoEバックボーンには256のエキスパートがあり、それぞれ専門化されています。類似はリアルです:タイピングは多様な出力を生み出すメカニズムです。Sistersは推論スタイルをタイプ化し;エキスパートはトークンレベルの計算をタイプ化します。Partial ⚠️ — 両者はスパースに型付けされたシステムですが、異なるレベルで。HAI Engineは2016年から本番環境にあります。Everythinkの予測理論を基礎づける21篇の論文は、モデルカードのベンチマーク表の類似です:両者ともメカニズムと測定を公開し、見出しのみではありません。Production ✅。
Everythinkのスコープはここでは商業的・民事的です:予測、キャリブレーションされた確率、プラットフォームインフラ。Everythinkはtoken、wallet、community-creditの結果を約束しません。Wallet & Token、Super App、Community CreditはRoadmap 🔵のまま、pre-revenue、Howey審査対象。投資助言なし。捏造メトリックなし。ベンチマークの数字はThinking Machines Labのもので、モデルカードで公開されMarktechpostによって2026年8月2日に要約されました。
メカニズム、言い換え
Theorem 3:プロパティはそのメカニズムが実装され測定している時に正確に保証されます。このリリースのプロパティは「手頃なオープンウェイトモデルからのキャリブレーションされた確率予測」です。メカニズムはproper scoring rulesに対するRL plus スパースMoEルーティングです。測定はBrierスコア(61.3)とアクティブパラメータ数(12B)です。SimpleQAでの回帰(20.6)は推論のゲインを生み出したメカニズムの誠実なコストです。すべてにおいてより良いモデルはメカニズムのトレードオフを持たないでしょう。そのようなモデルは存在しません。Inkling-Smallはそのトレードオフを公開します。それが基準です。
主要ポイント
- Inkling-SmallはApache 2.0の下の276B総/12BアクティブのMoEモデルで、2026年8月2日にリリース。アクティブパラメータ数(12B)がコストメカニズム;総数(276B)はメモリコスト。
- キャリブレーションはproper scoring rulesに対するRLでトレーニングされました。ForecastBench Brierスコア61.3は975B教師の60.1を上回ります。それはTheorem 3の縮図です:プロパティ(キャリブレーション)はメカニズム(proper scoring rule)によって保証され測定されます(Brierスコア)。
- モデルは推論で教師を上回り(HLE 31.6 vs 29.7、SWE-bench Verified 80.2 vs 77.6)、事実の再現で回帰します(SimpleQA 20.6 vs 43.9)。トレードオフはメカニズムであり、失敗ではありません。
- NVFP4チェックポイントは単一のB300で180 GB VRAMで動きます。Apache 2.0の下のオープンウェイトは主権メカニズムです:あなたがモデルを所有し、プライベートに動かします。
- ネイティブマルチモーダル入力(テキスト、画像、音声)は包含メカニズムです。モデルは世界を到着したまま読み、テキストのみではありません。
よくある質問
なぜアクティブパラメータ数が総数より重要なのか? 総パラメータ数(276B)はあなたが保存するメモリです。アクティブパラメータ数(12B)はトークンごとに費やす計算です。MoEルーティングは両者を切り離します:276Bモデルの容量を12Bモデルの計算コストで得ます。モデルを提供するコストは総数ではなくアクティブ数によって決まります。
SimpleQAでの回帰は何を教えてくれるか? トレーニングが推論とエージェント的コーディングを強化し、事実の再現ではないことを教えてくれます。SimpleQAは広範な事実の知識を測り;SWE-bench Verifiedはコーディングのエージェンシーを測ります。モデルは2番目で改善し1番目で回帰しました。すべてにおいてより良いモデルはメカニズムのトレードオフを持たないでしょう。そのようなモデルは存在しません。回帰はゲインの誠実なコストです。
キャリブレーショントレーニングはEverythinkのOracleにどうつながるか? 両者ともproper scoring rulesを使います。Inkling-Smallは現実世界の予測問題に対してproper scoring rulesでRLでトレーニングされました。OracleはSistersの候補未来を毎回のマージでエントロピーを伴うキャリブレーションされたアンサンブルにマージします。メカニズムは同じです:予測をスコアリングし、自信ではなく。Brierスコアが両方の場合の物差しです。
単一GPU上の276Bモデルは本当にデプロイ可能か? はい、NVFP4チェックポイントで。BF16チェックポイントは600 GBの集約VRAM(4x B300または8x H200)を必要とします。NVFP4チェックポイントはその下限を180 GBに下げ、単一のB300でW4A4を実行します。それが276Bモデルをフロンティアラボの領域からスタートアップと規制されたセクターの領域に移すメカニズムです。
このリリースの誠実なスコアカードは何か? モデルはそのメカニズム(スパースMoE、proper scoring rulesに対するRL、エージェント的コーディングRL)、その測定(Brierスコア、SWE-bench、SimpleQA、HLE)、そのトレードオフ(推論上昇、事実の再現下降)を明示します。Theorem 3はそれを保証として評価し、主張としてはありません。ベンチマーク表はゲインと回帰の両方を公開します。それがEverythinkが自らに課す基準です。
もしこのフレームワークが有用なら、Everythinkが同じキャリブレーション規律を自らのプラットフォームにどう適用しているかのより詳しい解説 — 2016年から本番のHAI Engine、毎回のマージでエントロピーを伴うOracleアンサンブル、21篇の論文 — はEverythinkのサイトにあります。
Sources
Marktechpost, « Thinking Machines Lab Releases Inkling-Small: A 276B Total, 12B Active Open Weights Multimodal MoE Model », 2026年8月2日公開。2026-08-23取得。 https://www.marktechpost.com/2026/08/02/thinking-machines-lab-releases-inkling-small-276b-open-weights-multimodal-moe-model/

結果に対する検証こそメカニズムであり、ラベルではない
MIT の Devavrat Shah は実際の結果と照らし合わせて予測を検証する表格データモデルを構築した。メカニズムは測定されたループ——Theorem 3——であり、ワールドモデルのラベルではない。
→ →
パラメータは測定されているときだけノブである
MLパラメータのノブの比喩は10億のノブで壊れる。保証は測定機構にあり、パラメータ数にはない。Theorem 3 を適用。
→ →
学習とは測定されるメカニズムであり、資格証明ではない
ダ・ヴィンチは学習は心を消耗させないと言った。私たちはそれを測定についての主張として読む。更新するループは消耗せず、固定のカタログは消耗する。Theorem 3 がそれを形式化する。
→ →自らの主張を証明するエンジンの上に、あなたの世界を築く。
2016 年から稼働し続けるエンジンの上に、あなた自身のネットワークを作る——あるいは 21 本の論文を書いたチームに話しかける。
