
Un modèle de 276B qui bat son professeur de 975B en raisonnement et perd contre lui en rappel factuel n'est pas un « meilleur modèle ». C'est un mécanisme différent. Thinking Machines Lab a publié Inkling-Small le 2 août 2026 : 276B de paramètres totaux, 12B actifs, poids ouverts sous Apache 2.0, entrée native texte-image-audio, contexte de 1M de tokens. Le modèle obtient 31,6 pour cent au Humanity's Last Exam contre 29,7 pour le professeur, et 20,6 pour cent au SimpleQA Verified contre 43,9 pour le professeur. La lecture honnête n'est pas « plus petit c'est mieux ». La lecture honnête est : quel mécanisme l'entraînement a-t-il renforcé, et ce mécanisme est-il implémenté et mesurant ?
Le titre facile est « un MoE à poids ouverts égale la frontière au quart de la taille ». Ce titre est défendable mais il masque le fait déterminant. Le fait déterminant est qu'Inkling-Small a été entraîné par apprentissage par renforcement contre des proper scoring rules sur un corpus de questions réelles de prévision, et son indice Brier sur ForecastBench est 61,3 contre 60,1 pour le professeur. C'est le nombre qui relie cette sortie au travail d'Everythink. Le mécanisme de calibration est la thèse.
La sortie, en un paragraphe
Inkling-Small est un transformeur decoder-only de 42 couches avec une colonne vertébrale feed-forward Mixture-of-Experts creuse. Chaque token est routé vers 6 des 256 experts plus 2 experts partagés, donc 8 des 258 experts s'activent par token. Le modèle est sans encodeur et nativement multimodal : les images entrent comme patchs de 40x40 pixels via une hMLP à quatre couches, l'audio entre comme spectrogrammes dMel, les deux traversent une couche d'embedding légère et rejoignent le flux de tokens de texte. La fenêtre de contexte est de 1M de tokens. L'effort de réflexion est ajustable. Les poids sont publiés sous Apache 2.0 sur Hugging Face. Le checkpoint BF16 nécessite 600 Go de VRAM agrégée (4x B300 ou 8x H200) ; le checkpoint NVFP4 ramène ce plancher à 180 Go et tourne en W4A4 sur une seule B300. Selon la couverture de Marktechpost et la fiche du modèle de Thinking Machines Lab, les runtimes pris en charge sont SGLang, vLLM, TokenSpeed, Unsloth et Hugging Face.
Mécanisme 1 : le nombre de paramètres actifs est le mécanisme de coût, pas le total ✅
La propriété « le modèle est abordable à servir » est garantie par le mécanisme du routage creux, non par le nombre total de paramètres. Un modèle dense de 276B nécessiterait 276B de calcul par token. Inkling-Small en nécessite 12B. Le nombre total de paramètres est le coût mémoire (vous stockez les 276B). Le nombre de paramètres actifs est le coût de calcul (vous multipliez 12B par token). MoE découple les deux. C'est le fait architectural déterminant, et c'est la raison pour laquelle un modèle de 276B tourne sur une seule B300 louée au lieu d'un cluster de laboratoire de frontière.
Theorem 3 le lit clairement : la propriété « inférence abordable » est garantie par le mécanisme « routage creux activant 8 des 258 experts par token », et la mesure est le nombre de paramètres actifs (12B) et le plancher de VRAM (180 Go en NVFP4). Une propriété sans mécanisme est une affirmation (« c'est petit »). Une propriété avec un mécanisme qui mesure est une garantie (« 12B actifs, 180 Go VRAM »). Production ✅ — le checkpoint est public et les exigences matérielles sont nommées.
[UNIQUE INSIGHT] La distinction total-vs-actif est la même distinction qu'Everythink trace entre le réseau et la salle. Le réseau est le total (chaque organisation, communauté et salle qui existe). Le contexte actif est la salle où vous êtes. The space is the router : du réseau à la communauté à la salle achemine une requête vers la tranche de 12B pertinente avant que quoi que ce soit réponde. Le routage MoE et le routage Everythink sont le même patron à des échelles différentes — activation creuse sur un grand espace stocké.
Mécanisme 2 : la calibration entraînée contre des proper scoring rules est Theorem 3 en miniature ✅
C'est le mécanisme déterminant pour Everythink. La fiche du modèle indique que la calibration a été entraînée avec RL contre des proper scoring rules sur un large corpus de questions réelles de prévision. ForecastBench sans recherche donne un indice Brier de 61,3 plus ou moins 0,46, devant les 60,1 plus ou moins 0,54 d'Inkling. L'indice Brier est une proper scoring rule : il est minimisé en espérance uniquement en rapportant vos vraies croyances. S'entraîner contre lui apprend au modèle à rapporter des probabilités calibrées, pas confiantes.
Theorem 3 dit qu'une propriété est garantie exactement quand son mécanisme est implémenté et mesurant. La propriété est « les prévisions probabilistes du modèle sont calibrées ». Le mécanisme est RL contre une proper scoring rule. La mesure est l'indice Brier sur un corpus de prévision retenu. Les trois sont nommés. C'est une garantie, pas une affirmation. Production ✅.
C'est ce que fait l'Oracle d'Everythink. Les Sisters génèrent des futurs candidats ; l'Oracle les fusionne en un ensemble calibré avec entropie à chaque fusion. Les probabilités sont normalisées à un seul endroit. L'Oracle ne prend pas la confiance des Sisters au pied de la lettre ; il les évalue. L'entraînement d'Inkling-Small fait la même chose : il ne prend pas les logits bruts du modèle au pied de la lettre ; il les évalue contre une règle qui punit à la fois la surconfiance et la sous-confiance. Le mécanisme est la règle de score. La garantie est la calibration. [PERSONAL EXPERIENCE] Dans notre propre travail, nous avons vu qu'un ensemble de prévision sans proper scoring rule dérive vers la Sister la plus bruyante. La règle de score est ce qui garde l'ensemble honnête. Le pipeline d'entraînement d'Inkling-Small implémente cette discipline au niveau du modèle.
Mécanisme 3 : la régression sur SimpleQA est l'honnêteté, pas l'échec
Le modèle bat son professeur sur HLE (31,6 vs 29,7), SWE-bench Verified (80,2 vs 77,6), Terminal-Bench 2.1 (64,7), Toolathlon Verified (54,4 vs 45,5) et ARC-AGI-2 (40,1 vs 36,5). Il perd sur SimpleQA Verified (20,6 vs 43,9), AA Omniscience (-9,0 vs 2,1) et Tau 3 Banking (15,5 vs 23,7). La lecture honnête n'est pas « le modèle est meilleur ». La lecture honnête est : l'entraînement a renforcé le raisonnement et le codage agentique, et le rappel factuel a régressé en conséquence. Le mécanisme (deux semaines de RL de codage agentique, distillation on-policy depuis le professeur) a échangé une propriété contre une autre.
Theorem 3 évalue cela avec précision. La propriété « raisonnement fort » est garantie par le mécanisme « RL de codage agentique avec un harness bash uniquement » et mesurée par SWE-bench Verified. La propriété « rappel factuel large » est garantie par un mécanisme différent (l'étendue des données de pré-entraînement) et mesurée par SimpleQA. Le second mécanisme n'a pas été renforcé dans la phase de post-entraînement, et la régression en est la preuve. Un modèle qui serait meilleur en tout serait un modèle sans compromis de mécanisme. Ce modèle n'existe pas. Inkling-Small nomme ses compromis dans sa table de benchmarks. C'est la feuille de score honnête.
[ORIGINAL DATA] L'écart entre SimpleQA (20,6) et SWE-bench Verified (80,2) est de 59,6 points de pourcentage. Cet écart est le compromis rendu visible. Un modèle commercialisé sur son score SWE-bench sans son score SimpleQA est un modèle qui cache son mécanisme. Thinking Machines Lab publie les deux. C'est le standard qu'Everythink s'impose : la prévision des Sisters est publiée avec entropie à chaque fusion, pas seulement la probabilité du titre.
Mécanisme 4 : les poids ouverts sous Apache 2.0 sont le mécanisme de souveraineté ✅
La propriété « vous possédez le modèle » est garantie par le mécanisme des poids ouverts sous une licence permissive, non par les termes d'API d'un fournisseur. Apache 2.0 signifie que vous pouvez exécuter les poids, les modifier, les affiner et les servir en privé. Le checkpoint NVFP4 tournant sur une seule B300 à 180 Go signifie qu'un secteur régulé — services financiers, santé, assurances, télécom, secteur public — peut faire tourner un modèle de 276B sur son propre matériel, derrière son propre pare-feu, sans que les données ne quittent les locaux. C'est la souveraineté du client à la couche du modèle.
Theorem 3 : la propriété « inférence privée » est garantie par le mécanisme « poids ouverts plus un checkpoint quantifié qui tient sur du matériel déployable » et mesurée par le plancher de 180 Go de VRAM. Production ✅ — le checkpoint est sur Hugging Face et les exigences matérielles sont publiées.
L'affirmation d'Everythink est la souveraineté du client : votre réseau, votre marque, vos données. Les poids ouverts sont la version couche-du-modèle de cette affirmation. Une API hébergée par un fournisseur est un arrangement locatif ; les poids ouverts sur votre matériel sont une propriété. Le module Whitelabel Network d'Everythink est la version couche-plateforme : vous opérez le réseau sous votre marque, pas la nôtre. Production ✅.
Mécanisme 5 : la multimodalité native est le mécanisme d'inclusion ✅
La propriété « le modèle lit le monde comme il arrive » est garantie par le mécanisme d'entrée multimodale native, non en ajoutant des encodeurs de vision et d'audio séparés. Inkling-Small est sans encodeur : les images entrent comme patchs via une hMLP à quatre couches, l'audio entre comme spectrogrammes dMel, les deux rejoignent le flux de tokens de texte via une couche d'embedding légère. MMMU Pro est 74,0, CharXiv RQ est 77,4 (81,3 avec recadrage-zoom-inspection en Python), Audio MC est 54,9, MMAU est 77,0, VoiceBench est 90,1. Le modèle lit texte, images et audio en une seule passe. Un modèle texte uniquement exclut quiconque dont l'entrée arrive comme image ou note vocale ; un modèle nativement multimodal les inclut. Le principe d'Everythink d'inclusion by design — multilingue, multimodal, faible connectivité — est le même patron. La passerelle de World Monitor ingère vols, navires, séismes, incendies et météo comme des geo-signaux natifs, non comme des descriptions textuelles. Production ✅.
Mécanisme 6 : le mécanisme de sécurité est en couches, pas monolithique ✅
La propriété « le modèle refuse les requêtes nuisibles » est garantie par le mécanisme de l'entraînement de sécurité plus la modération en aval, non par l'entraînement de sécurité seul. StrongREJECT est 98,4 pour cent, FORTRESS adversarial est 71,6 pour cent, FORTRESS benign est 96,9 pour cent. Thinking Machines Lab recommande d'ajouter Llama Guard sur les déploiements grand public. C'est une affirmation de sécurité en couches : le modèle de base est entraîné pour la sécurité, et le déploiement ajoute un second filtre. Theorem 3 évalue cela comme deux mécanismes — la base mesurée par StrongREJECT et FORTRESS, le déploiement mesuré par la couche en aval. Production ✅ pour le modèle de base ; la couche en aval est la responsabilité du déployeur. L'éthique de portée d'Everythink — usage civil et défensif uniquement — est le même patron en couches.
Le parallèle d'Everythink, et où il est Partial
L'Oracle, la fusion de prévisions d'Everythink, prend les futurs candidats des Sisters et retourne un ensemble calibré avec entropie à chaque fusion. L'entraînement de calibration d'Inkling-Small prend les logits bruts du modèle et retourne une probabilité calibrée contre une proper scoring rule. Le parallèle est réel et Production ✅ : les deux évaluent, les deux calibrent, les deux mesurent. L'Oracle fusionne plusieurs agents ; le modèle calibre un agent. Partial ⚠️ — le mécanisme est le même (proper scoring rule), la portée est différente (ensemble vs modèle unique).
Les Sisters sont des personnalités typées : analyste, contrarian, disruptor, historien, institutionnaliste. La colonne MoE d'Inkling-Small a 256 experts, chacun spécialisé. Le parallèle est réel : le typage est le mécanisme qui produit des sorties diverses. Les Sisters typent le style de raisonnement ; les experts typent le calcul au niveau du token. Partial ⚠️ — les deux sont des systèmes creux typés, mais à des niveaux différents. Le HAI Engine est en production depuis 2016. Les 21 papers qui fondent la théorie de prévision d'Everythink sont l'analogue de la table de benchmarks de la fiche du modèle : les deux publient le mécanisme et la mesure, pas seulement le titre. Production ✅.
La portée d'Everythink ici est commerciale et civile : prévision, probabilité calibrée, infrastructure de plateforme. Everythink ne promet pas de résultats de token, wallet ni community-credit. Wallet & Token, Super App et Community Credit restent Roadmap 🔵, pre-revenue, soumis à la révision Howey. Aucun conseil en investissement. Aucune métrique fabriquée. Les chiffres de benchmark sont ceux de Thinking Machines Lab, publiés dans la fiche du modèle et résumés par Marktechpost le 2 août 2026.
Le mécanisme, reformulé
Theorem 3 : une propriété est garantie exactement quand son mécanisme est implémenté et mesurant. La propriété de cette sortie est « prévisions probabilistes calibrées d'un modèle à poids ouverts abordable ». Le mécanisme est RL contre des proper scoring rules plus routage MoE creux. La mesure est l'indice Brier (61,3) et le nombre de paramètres actifs (12B). La régression sur SimpleQA (20,6) est le coût honnête du mécanisme qui a produit le gain en raisonnement. Un modèle qui serait meilleur en tout n'aurait aucun compromis de mécanisme. Ce modèle n'existe pas. Inkling-Small publie ses compromis. C'est le standard.
Points clés
- Inkling-Small est un modèle MoE de 276B totaux / 12B actifs sous Apache 2.0, publié le 2 août 2026. Le nombre de paramètres actifs (12B) est le mécanisme de coût ; le total (276B) est le coût mémoire.
- La calibration a été entraînée avec RL contre des proper scoring rules. L'indice Brier sur ForecastBench de 61,3 bat le 60,1 du professeur de 975B. C'est Theorem 3 en miniature : la propriété (calibration) est garantie par le mécanisme (proper scoring rule) et mesurée (indice Brier).
- Le modèle bat son professeur en raisonnement (HLE 31,6 vs 29,7, SWE-bench Verified 80,2 vs 77,6) et régresse en rappel factuel (SimpleQA 20,6 vs 43,9). Le compromis est le mécanisme, pas un échec.
- Le checkpoint NVFP4 tourne sur une seule B300 à 180 Go de VRAM. Les poids ouverts sous Apache 2.0 sont le mécanisme de souveraineté : vous possédez le modèle, vous le servez en privé.
- L'entrée multimodale native (texte, image, audio) est le mécanisme d'inclusion. Le modèle lit le monde comme il arrive, pas en texte uniquement.
Questions fréquentes
Pourquoi le nombre de paramètres actifs est-il plus important que le total ? Le nombre total de paramètres (276B) est la mémoire que vous stockez. Le nombre de paramètres actifs (12B) est le calcul que vous dépensez par token. Le routage MoE découple les deux : vous obtenez la capacité d'un modèle de 276B au coût de calcul d'un modèle de 12B. Le coût de service du modèle est déterminé par le nombre actif, non le total.
Que nous dit la régression sur SimpleQA ? Elle nous dit que l'entraînement a renforcé le raisonnement et le codage agentique, pas le rappel factuel. SimpleQA mesure la connaissance factuelle large ; SWE-bench Verified mesure l'agentivité de codage. Le modèle s'est amélioré sur le second et a régressé sur le premier. Un modèle qui serait meilleur en tout n'aurait aucun compromis de mécanisme. Ce modèle n'existe pas. La régression est le coût honnête du gain.
Comment l'entraînement de calibration se connecte-t-il à l'Oracle d'Everythink ? Les deux utilisent des proper scoring rules. Inkling-Small a été entraîné avec RL contre des proper scoring rules sur des questions réelles de prévision. L'Oracle fusionne les futurs candidats des Sisters en un ensemble calibré avec entropie à chaque fusion. Le mécanisme est le même : évaluez la prévision, pas la confiance. L'indice Brier est le mètre étalon dans les deux cas.
Un modèle de 276B sur un seul GPU est-il réellement déployable ? Oui, au checkpoint NVFP4. Le checkpoint BF16 nécessite 600 Go de VRAM agrégée (4x B300 ou 8x H200). Le checkpoint NVFP4 ramène ce plancher à 180 Go et tourne en W4A4 sur une seule B300. C'est le mécanisme qui sort un modèle de 276B du territoire de laboratoire de frontière pour le mettre dans le territoire des startups et des secteurs régulés.
Quelle est la feuille de score honnête de cette sortie ? Le modèle nomme son mécanisme (MoE creux, RL contre des proper scoring rules, RL de codage agentique), sa mesure (indice Brier, SWE-bench, SimpleQA, HLE) et ses compromis (raisonnement en hausse, rappel factuel en baisse). Theorem 3 évalue cela comme une garantie, pas une affirmation. La table de benchmarks publie à la fois les gains et les régressions. C'est le standard qu'Everythink s'impose.
Si cette perspective vous est utile, l'analyse plus approfondie de la façon dont Everythink applique la même discipline de calibration à sa propre plateforme — le HAI Engine en production depuis 2016, l'ensemble de l'Oracle avec entropie à chaque fusion, les 21 papers — se trouve sur le site d'Everythink.
Sources
Marktechpost, « Thinking Machines Lab Releases Inkling-Small: A 276B Total, 12B Active Open Weights Multimodal MoE Model », publié le 2 août 2026. Consulté le 2026-08-23. https://www.marktechpost.com/2026/08/02/thinking-machines-lab-releases-inkling-small-276b-open-weights-multimodal-moe-model/

Le test sur le résultat est le mécanisme, pas l'étiquette
Devavrat Shah du MIT a construit un modèle de données tabulaires qui confronte les prévisions aux résultats réels. Le mécanisme est la boucle mesurée — Theorem 3 —, pas l'étiquette world model.
→ →
Un paramètre est un bouton seulement quand quelque chose le mesure
La métaphore des boutons pour les paramètres ML se brise à un milliard. La garantie vit dans le mécanisme de mesure, pas le nombre. Theorem 3 appliqué.
→ →
Apprendre est le mécanisme mesuré, pas le diplôme
Da Vinci disait qu'apprendre n'épuise pas l'esprit. Nous le lisons comme une affirmation sur la mesure : une boucle qui se renouvelle ne s'épuise jamais, un catalogue fixe si. Theorem 3 le formalise.
→ →Construisez votre monde sur un moteur qui prouve ce qu'il affirme.
Créez votre propre réseau sur le moteur qui tourne depuis 2016 — ou parlez à l'équipe derrière les 21 articles.
