Produkte
Lösungen
Unternehmen
Enterprise
AnmeldenNetzwerk erstellen
AI · Forecasting · Calibration · Open Weights · MoE

Kalibrierung ist der Mechanismus, nicht die Parameterzahl

Inkling-Small schlägt seinen 975B-Lehrer beim Reasoning und regrediert beim Faktenabruf. Die ehrliche Lesart ist der Mechanismus, nicht die Parameterzahl.

Ein Modell mit 276B Parametern, das seinen 975B-Lehrer im Reasoning schlägt und gegen ihn beim Faktenabruf verliert, ist kein «besseres Modell». Es ist ein anderer Mechanismus. Thinking Machines Lab veröffentlichte Inkling-Small am 2. August 2026: 276B Parameter gesamt, 12B aktiv, offene Gewichte unter Apache 2.0, native Text-Bild-Audio-Eingabe, 1M-Token-Kontext. Das Modell erreicht 31,6 Prozent im Humanity's Last Exam gegenüber 29,7 des Lehrers und 20,6 Prozent im SimpleQA Verified gegenüber 43,9 des Lehrers. Die ehrliche Lesart ist nicht «kleiner ist besser». Die ehrliche Lesart lautet: welchen Mechanismus hat das Training verstärkt, und ist dieser Mechanismus implementiert und messend?

Die einfache Schlagzeile lautet «offene MoE-Gewichte erreichen die Frontier bei einem Viertel der Größe». Diese Schlagzeile ist vertretbar, aber sie verdeckt die entscheidende Tatsache. Die entscheidende Tatsache ist, dass Inkling-Small mit verstärkendem Lernen gegen proper scoring rules auf einem Korpus realer Vorhersagefragen trainiert wurde und sein ForecastBench-Brier-Index bei 61,3 liegt gegenüber 60,1 des Lehrers. Das ist die Zahl, die diesen Release mit der Arbeit von Everythink verbindet. Der Kalibrierungsmechanismus ist die These.

Der Release, in einem Absatz

Inkling-Small ist ein 42-schichtiger Decoder-only-Transformer mit einem sparsen Mixture-of-Experts-Feed-Forward-Rückgrat. Jedes Token wird zu 6 von 256 Experten plus 2 gemeinsamen Experten geroutet, sodass 8 von 258 Experten pro Token aktiviert werden. Das Modell ist encoderfrei und nativ multimodal: Bilder kommen als 40x40-Pixel-Patches durch eine vier-schichtige hMLP, Audio kommt als dMel-Spektrogramme, beide durchlaufen eine leichte Embedding-Schicht und treten dem Text-Token-Strom bei. Das Kontextfenster beträgt 1M Tokens. Der Thinking-Aufwand ist einstellbar. Die Gewichte werden unter Apache 2.0 auf Hugging Face veröffentlicht. Der BF16-Checkpoint benötigt 600 GB aggregierten VRAM (4x B300 oder 8x H200); der NVFP4-Checkpoint senkt diese Untergrenze auf 180 GB und läuft W4A4 auf einer einzigen B300. Laut der Marktechpost-Berichterstattung und der Modellkarte von Thinking Machines Lab sind SGLang, vLLM, TokenSpeed, Unsloth und Hugging Face die unterstützten Runtimes.

Mechanismus 1: die aktive Parameterzahl ist der Kostenmechanismus, nicht die Gesamtzahl ✅

Die Eigenschaft «das Modell ist günstig zu betreiben» wird durch den Mechanismus des sparsen Routings garantiert, nicht durch die Gesamtzahl der Parameter. Ein dichtes 276B-Modell würde 276B Rechenleistung pro Token benötigen. Inkling-Small benötigt 12B. Die Gesamtzahl der Parameter ist die Speicherkosten (Sie speichern alle 276B). Die aktive Parameterzahl ist die Rechenkosten (Sie multiplizieren 12B pro Token). MoE entkoppelt beides. Das ist der entscheidende architektonische Fakt, und er ist der Grund, warum ein 276B-Modell auf einer einzigen gemieteten B300 läuft statt auf einem Frontier-Labor-Cluster.

Theorem 3 liest das sauber: die Eigenschaft «günstige Inferenz» wird durch den Mechanismus «sparses Routing, das 8 von 258 Experten pro Token aktiviert» garantiert, und die Messung ist die aktive Parameterzahl (12B) und die VRAM-Untergrenze (180 GB bei NVFP4). Eine Eigenschaft ohne Mechanismus ist eine Behauptung («es ist klein»). Eine Eigenschaft mit einem Mechanismus, der messend ist, ist eine Garantie («12B aktiv, 180 GB VRAM»). Production ✅ — der Checkpoint ist öffentlich und die Hardware-Anforderungen sind benannt.

[UNIQUE INSIGHT] Die Unterscheidung Gesamt-vs-Aktiv ist dieselbe Unterscheidung, die Everythink zwischen dem Netzwerk und dem Raum trifft. Das Netzwerk ist das Gesamte (jede Organisation, Community und jeder Raum, der existiert). Der aktive Kontext ist der Raum, in dem Sie sich befinden. The space is the router: von Netzwerk zu Community zu Raum wird eine Anfrage an das 12B-relevante Segment geroutet, bevor etwas antwortet. MoE-Routing und Everythink-Routing sind dasselbe Muster auf unterschiedlichen Skalen — sparsame Aktivierung über einem großen gespeicherten Raum.

Mechanismus 2: Kalibrierung gegen proper scoring rules ist Theorem 3 im Miniaturformat ✅

Dies ist der entscheidende Mechanismus für Everythink. Die Modellkarte besagt, dass die Kalibrierung mit RL gegen proper scoring rules auf einem großen Korpus realer Vorhersagefragen trainiert wurde. ForecastBench ohne Suche ergibt einen Brier-Index von 61,3 plus oder minus 0,46, vor Inklings 60,1 plus oder minus 0,54. Der Brier-Score ist eine proper scoring rule: Er wird im Erwartungswert nur minimiert, wenn Sie Ihre wahren Überzeugungen angeben. Dagegen zu trainieren lehrt das Modell, kalibrierte Wahrscheinlichkeiten anzugeben, nicht zuversichtliche.

Theorem 3 besagt, dass eine Eigenschaft genau dann garantiert ist, wenn ihr Mechanismus implementiert und messend ist. Die Eigenschaft ist «die Wahrscheinlichkeitsvorhersagen des Modells sind kalibriert». Der Mechanismus ist RL gegen eine proper scoring rule. Die Messung ist der Brier-Score auf einem zurückgehaltenen Vorhersagekorpus. Alle drei sind benannt. Das ist eine Garantie, keine Behauptung. Production ✅.

Das ist es, was der Oracle von Everythink tut. Die Sisters erzeugen mögliche Zukünfte; der Oracle fusioniert sie zu einem kalibrierten Ensemble mit Entropie bei jedem Merge. Wahrscheinlichkeiten werden an genau einer Stelle normalisiert. Der Oracle nimmt die Zuversicht der Sisters nicht beim Nennwert; er bewertet sie. Das Training von Inkling-Small tut dasselbe: Es nimmt die rohen Logits des Modells nicht beim Nennwert; es bewertet sie gegen eine Regel, die sowohl Über- als auch Unterzuversicht bestraft. Der Mechanismus ist die Scoring-Regel. Die Garantie ist die Kalibrierung. [PERSONAL EXPERIENCE] In unserer eigenen Arbeit haben wir gesehen, dass ein Vorhersage-Ensemble ohne eine proper scoring rule zur lautesten Sister abdriftet. Die Scoring-Regel ist es, die das Ensemble ehrlich hält. Die Trainings-Pipeline von Inkling-Small implementiert diese Disziplin auf Modellebene.

Mechanismus 3: die Regression bei SimpleQA ist die Ehrlichkeit, nicht der Fehlschlag

Das Modell schlägt seinen Lehrer bei HLE (31,6 vs 29,7), SWE-bench Verified (80,2 vs 77,6), Terminal-Bench 2.1 (64,7), Toolathlon Verified (54,4 vs 45,5) und ARC-AGI-2 (40,1 vs 36,5). Es verliert bei SimpleQA Verified (20,6 vs 43,9), AA Omniscience (-9,0 vs 2,1) und Tau 3 Banking (15,5 vs 23,7). Die ehrliche Lesart ist nicht «das Modell ist besser». Die ehrliche Lesart lautet: das Training hat Reasoning und agentorisches Programmieren verstärkt, und der Faktenabruf ist als Konsequenz regrediert. Der Mechanismus (zwei Wochen agentorisches Programmier-RL, On-Policy-Destillation vom Lehrer) tauschte eine Eigenschaft gegen eine andere.

Theorem 3 bewertet das präzise. Die Eigenschaft «starkes Reasoning» wird durch den Mechanismus «agentorisches Programmier-RL mit einem bash-only-Harness» garantiert und durch SWE-bench Verified gemessen. Die Eigenschaft «breiter Faktenabruf» wird durch einen anderen Mechanismus (Breite der Pre-Training-Daten) garantiert und durch SimpleQA gemessen. Der zweite Mechanismus wurde in der Post-Training-Phase nicht verstärkt, und die Regression ist der Beweis. Ein Modell, das in allem besser wäre, wäre ein Modell ohne Mechanismus-Kompromisse. Dieses Modell existiert nicht. Inkling-Small benennt seine Kompromisse in seiner Benchmark-Tabelle. Das ist die ehrliche Bewertung.

[ORIGINAL DATA] Die Lücke zwischen SimpleQA (20,6) und SWE-bench Verified (80,2) beträgt 59,6 Prozentpunkte. Diese Spreizung ist der sichtbar gemachte Kompromiss. Ein Modell, das mit seiner SWE-bench-Score ohne seine SimpleQA-Score vermarktet wird, ist ein Modell, das seinen Mechanismus verbirgt. Thinking Machines Lab veröffentlicht beide. Das ist der Standard, den Everythink sich selbst auferlegt: die Voraussicht der Sisters wird mit Entropie bei jedem Merge veröffentlicht, nicht nur die Schlagzeilen-Wahrscheinlichkeit.

Mechanismus 4: offene Gewichte unter Apache 2.0 sind der Souveränitätsmechanismus ✅

Die Eigenschaft «Sie besitzen das Modell» wird durch den Mechanismus offener Gewichte unter einer freizügigen Lizenz garantiert, nicht durch die API-Bedingungen eines Anbieters. Apache 2.0 bedeutet, dass Sie die Gewichte ausführen, verändern, feinabstimmen und privat betreiben können. Der NVFP4-Checkpoint, der auf einer einzigen B300 bei 180 GB läuft, bedeutet, dass ein regulierter Sektor — Finanzdienstleistungen, Gesundheitswesen, Versicherungen, Telekommunikation, öffentlicher Sektor — ein 276B-Modell auf eigener Hardware hinter eigenem Firewall betreiben kann, ohne dass Daten das Haus verlassen. Das ist Kundensouveränität auf der Modell-Ebene.

Theorem 3: die Eigenschaft «private Inferenz» wird durch den Mechanismus «offene Gewichte plus ein quantisierter Checkpoint, der auf einsetzbarer Hardware Platz hat» garantiert und durch die 180-GB-VRAM-Untergrenze gemessen. Production ✅ — der Checkpoint ist auf Hugging Face und die Hardware-Anforderungen sind veröffentlicht.

Everythinks Anspruch ist Kundensouveränität: Ihr Netzwerk, Ihre Marke, Ihre Daten. Offene Gewichte sind die Modell-Ebenen-Version dieses Anspruchs. Eine Anbieter-hosted API ist ein Pachtverhältnis; offene Gewichte auf Ihrer Hardware sind Eigentum. Das Whitelabel Network-Modul von Everythink ist die Plattform-Ebenen-Version: Sie betreiben das Netzwerk unter Ihrer Marke, nicht unter unserer. Production ✅.

Mechanismus 5: native Multimodalität ist der Inklusionsmechanismus ✅

Die Eigenschaft «das Modell liest die Welt, wie sie ankommt» wird durch den Mechanismus nativer multimodaler Eingabe garantiert, nicht durch nachträgliches Anfügen separater Vision- und Audio-Encoder. Inkling-Small ist encoderfrei: Bilder kommen als Patches durch eine vier-schichtige hMLP, Audio kommt als dMel-Spektrogramme, beide treten dem Text-Token-Strom durch eine leichte Embedding-Schicht bei. MMMU Pro ist 74,0, CharXiv RQ ist 77,4 (81,3 mit Python-Zoom-Schnitt-Inspektion), Audio MC ist 54,9, MMAU ist 77,0, VoiceBench ist 90,1. Das Modell liest Text, Bilder und Audio in einem Durchgang. Ein reines Textmodell schließt jeden aus, dessen Eingabe als Bild oder Sprachnotiz ankommt; ein nativ multimodales Modell schließt sie ein. Everythinks Prinzip der Inklusion by Design — mehrsprachig, multimodal, niedrige Konnektivität — ist dasselbe Muster. Das World Monitor-Gateway nimmt Flüge, Schiffe, Erdbeben, Brände und Wetter als native Geo-Signale auf, nicht als Textbeschreibungen. Production ✅.

Mechanismus 6: der Sicherheitsmechanismus ist geschichtet, nicht monolithisch ✅

Die Eigenschaft «das Modell lehnt schädliche Anfragen ab» wird durch den Mechanismus Sicherheitstraining plus Downstream-Moderation garantiert, nicht durch Sicherheitstraining allein. StrongREJECT ist 98,4 Prozent, FORTRESS adversarial ist 71,6 Prozent, FORTRESS benign ist 96,9 Prozent. Thinking Machines Lab empfiehlt, Llama Guard bei konsumerorientierten Bereitstellungen hinzuzufügen. Das ist eine geschichtete Sicherheitsbehauptung: das Basismodell ist auf Sicherheit trainiert, und die Bereitstellung fügt einen zweiten Filter hinzu. Theorem 3 bewertet das als zwei Mechanismen — die Basis gemessen durch StrongREJECT und FORTRESS, die Bereitstellung gemessen durch die Downstream-Schicht. Production ✅ für das Basismodell; die Downstream-Schicht liegt in der Verantwortung des Bereitstellers. Everythinks Ethik des Geltungsbereichs — nur zivile und defensive Nutzung — ist dasselbe geschichtete Muster.

Die Everythink-Parallele, und wo sie Partial ist

Der Oracle, Everythinks Vorhersage-Fusion, nimmt die möglichen Zukünfte der Sisters und gibt ein kalibriertes Ensemble mit Entropie bei jedem Merge zurück. Das Kalibrierungstraining von Inkling-Small nimmt die rohen Logits des Modells und gibt eine kalibrierte Wahrscheinlichkeit gegen eine proper scoring rule zurück. Die Parallele ist real und Production ✅: beide bewerten, beide kalibrieren, beide messen. Der Oracle fusioniert mehrere Agenten; das Modell kalibriert einen Agenten. Partial ⚠️ — der Mechanismus ist derselbe (proper scoring rule), der Geltungsbereich ist verschieden (Ensemble vs Einzelmodell).

Die Sisters sind typisierte Persönlichkeiten: Analyst, Contrarian, Disruptor, Historiker, Institutionalist. Das MoE-Rückgrat von Inkling-Small hat 256 Experten, jeden spezialisiert. Die Parallele ist real: Typisierung ist der Mechanismus, der diverse Ausgaben erzeugt. Die Sisters typisieren den Reasoning-Stil; die Experten typisieren das Token-Level-Compute. Partial ⚠️ — beide sind sparsam typisierte Systeme, aber auf unterschiedlichen Ebenen. Der HAI Engine ist seit 2016 in Produktion. Die 21 papers, die Everythinks Vorhersagetheorie begründen, sind das Analogon zur Benchmark-Tabelle der Modellkarte: beide veröffentlichen den Mechanismus und die Messung, nicht nur die Schlagzeile. Production ✅.

Everythinks Geltungsbereich hier ist kommerziell und zivil: Vorhersage, kalibrierte Wahrscheinlichkeit, Plattform-Infrastruktur. Everythink verspricht keine Token-, Wallet- oder Community-Credit-Ergebnisse. Wallet & Token, Super App und Community Credit bleiben Roadmap 🔵, pre-revenue, Howey-Prüfung vorbehalten. Keine Anlageberatung. Keine erfundenen Metriken. Die Benchmark-Zahlen stammen von Thinking Machines Lab, veröffentlicht in der Modellkarte und zusammengefasst von Marktechpost am 2. August 2026.

Der Mechanismus, neu formuliert

Theorem 3: eine Eigenschaft ist genau dann garantiert, wenn ihr Mechanismus implementiert und messend ist. Die Eigenschaft dieses Releases ist «kalibrierte Wahrscheinlichkeitsvorhersagen aus einem erschwinglichen offene-Gewichte-Modell». Der Mechanismus ist RL gegen proper scoring rules plus sparses MoE-Routing. Die Messung ist der Brier-Score (61,3) und die aktive Parameterzahl (12B). Die Regression bei SimpleQA (20,6) sind die ehrlichen Kosten des Mechanismus, der den Reasoning-Gewinn erbracht hat. Ein Modell, das in allem besser wäre, hätte keine Mechanismus-Kompromisse. Dieses Modell existiert nicht. Inkling-Small veröffentlicht seine Kompromisse. Das ist der Standard.

Kernpunkte

  • Inkling-Small ist ein 276B-Gesamt-/12B-aktives MoE-Modell unter Apache 2.0, veröffentlicht am 2. August 2026. Die aktive Parameterzahl (12B) ist der Kostenmechanismus; die Gesamtzahl (276B) ist die Speicherkosten.
  • Die Kalibrierung wurde mit RL gegen proper scoring rules trainiert. Der ForecastBench-Brier-Score von 61,3 schlägt den 60,1 des 975B-Lehrers. Das ist Theorem 3 im Miniaturformat: die Eigenschaft (Kalibrierung) wird durch den Mechanismus (proper scoring rule) garantiert und gemessen (Brier-Score).
  • Das Modell schlägt seinen Lehrer beim Reasoning (HLE 31,6 vs 29,7, SWE-bench Verified 80,2 vs 77,6) und regrediert beim Faktenabruf (SimpleQA 20,6 vs 43,9). Der Kompromiss ist der Mechanismus, kein Fehlschlag.
  • Der NVFP4-Checkpoint läuft auf einer einzigen B300 bei 180 GB VRAM. Offene Gewichte unter Apache 2.0 sind der Souveränitätsmechanismus: Sie besitzen das Modell, Sie betreiben es privat.
  • Native multimodale Eingabe (Text, Bild, Audio) ist der Inklusionsmechanismus. Das Modell liest die Welt, wie sie ankommt, nicht nur als Text.

Häufige Fragen

Warum ist die aktive Parameterzahl wichtiger als die Gesamtzahl? Die Gesamtzahl der Parameter (276B) ist der Speicher, den Sie vorhalten. Die aktive Parameterzahl (12B) ist die Rechenleistung, die Sie pro Token aufwenden. MoE-Routing entkoppelt beides: Sie erhalten die Kapazität eines 276B-Modells zu den Rechenkosten eines 12B-Modells. Die Betriebskosten bestimmt die aktive Zahl, nicht die Gesamtzahl.

Was sagt uns die Regression bei SimpleQA? Sie sagt uns, dass das Training Reasoning und agentorisches Programmieren verstärkt hat, nicht den Faktenabruf. SimpleQA misst breites Faktenwissen; SWE-bench Verified misst Programmier-Agentur. Das Modell hat sich beim zweiten verbessert und beim ersten verschlechtert. Ein Modell, das in allem besser wäre, hätte keine Mechanismus-Kompromisse. Dieses Modell existiert nicht. Die Regression sind die ehrlichen Kosten des Gewinns.

Wie verbindet sich das Kalibrierungstraining mit dem Oracle von Everythink? Beide verwenden proper scoring rules. Inkling-Small wurde mit RL gegen proper scoring rules auf realen Vorhersagefragen trainiert. Der Oracle fusioniert die möglichen Zukünfte der Sisters zu einem kalibrierten Ensemble mit Entropie bei jedem Merge. Der Mechanismus ist derselbe: bewerte die Vorhersage, nicht die Zuversicht. Der Brier-Score ist in beiden Fällen der Maßstab.

Ist ein 276B-Modell auf einer einzigen GPU tatsächlich einsetzbar? Ja, beim NVFP4-Checkpoint. Der BF16-Checkpoint benötigt 600 GB aggregierten VRAM (4x B300 oder 8x H200). Der NVFP4-Checkpoint senkt diese Untergrenze auf 180 GB und läuft W4A4 auf einer einzigen B300. Das ist der Mechanismus, der ein 276B-Modell aus dem Frontier-Labor-Gebiet in das Gebiet von Startups und regulierten Sektoren bringt.

Wie lautet die ehrliche Bewertung dieses Releases? Das Modell benennt seinen Mechanismus (sparses MoE, RL gegen proper scoring rules, agentorisches Programmier-RL), seine Messung (Brier-Score, SWE-bench, SimpleQA, HLE) und seine Kompromisse (Reasoning rauf, Faktenabruf runter). Theorem 3 bewertet das als Garantie, nicht als Behauptung. Die Benchmark-Tabelle veröffentlicht sowohl Gewinne als auch Regressionen. Das ist der Standard, den Everythink sich selbst auferlegt.

Wenn diese Perspektive nützlich ist, findet sich die ausführlichere Darstellung, wie Everythink dieselbe Kalibrierungsdisziplin auf die eigene Plattform anwendet — der HAI Engine in Produktion seit 2016, das Oracle-Ensemble mit Entropie bei jedem Merge, die 21 papers — auf der Everythink-Website.

Sources

Marktechpost, «Thinking Machines Lab Releases Inkling-Small: A 276B Total, 12B Active Open Weights Multimodal MoE Model», veröffentlicht am 2. August 2026. Abgerufen am 2026-08-23. https://www.marktechpost.com/2026/08/02/thinking-machines-lab-releases-inkling-small-276b-open-weights-multimodal-moe-model/

Baue deine Welt auf einer Engine, die beweist, was sie behauptet.

Erstelle dein eigenes Netzwerk auf der Engine, die seit 2016 läuft — oder sprich mit dem Team hinter den 21 Papieren.