La personnalisation est la séparation des mécanismes, pas les poids ouverts
Inkling est conçu pour être personnalisé non pas à cause de sa licence Apache 2.0 mais parce que chaque décision architecturale isole une propriété mesurable derrière son propre mécanisme. L'équilibrage de charge fondé sur le biais est l'instance la plus pure de Theorem 3 : une propriété garantie par un mécanisme qui ne concurrence pas l'objectif principal.

La personnalisation est la séparation des mécanismes, pas les poids ouverts
Thinking Machines a publié Inkling le 15 juillet 2026, et le langage de lancement le qualifie de modèle « conçu pour être personnalisé ». Les poids sont sur Hugging Face sous licence Apache 2.0, et la lecture facile est que la personnalisation est ce que la licence vous donne. Cette lecture est fausse. Les poids ouverts sont un choix de publication. La garantie de personnalisation est structurelle : chaque décision architecturale du modèle isole une propriété mesurable derrière son propre mécanisme, et chaque mécanisme est indépendamment mesurable et réglable. Réentraînez-en un sans entraîner les autres. C'est ce que « conçu pour être personnalisé » signifie quand on prend le mécanisme au sérieux, et c'est la même forme qu'un système où chaque port répond à une question différente.
Ceci est la lecture du Honest Architect sur Inkling, basée sur l'annonce de lancement, la carte du modèle et les notes d'intégration publiées par le projet vLLM (ByteByteGo, « The New American AI Model Designed to be Customized », 18 août 2026 ; récupéré 2026-08-23). La thèse ici n'est pas qu'Everythink livre un LLM. Il n'en livre pas. La thèse est que le motif de conception est reconnaissable : une propriété est garantie exactement quand son mécanisme est implémenté et mesure, et un système est personnalisable exactement quand chaque propriété a son propre mécanisme qui ne concurrence pas les autres.
Mécanisme 1 — La parcimonie sépare le stockage du calcul
La première décision est celle qui rend le reste abordable. Inkling stocke 975 milliards de paramètres et en exécute environ 41 milliards par token, à peu près 4 pour cent du modèle actif à la fois. Le mécanisme est Mixture of Experts : chaque couche contient 256 experts, le routeur en choisit six par token, plus deux experts partagés qui s'exécutent à chaque token. La propriété est « un modèle de cette taille est abordable à exécuter ». Le mécanisme est « remplacez le réseau feed-forward unique par 256 petits et n'en exécutez que six ». La mesure est le rapport : 975 milliards stockés, 41 milliards actifs. ✅
Le compromis est honnête et déclaré. Le checkpoint en précision complète nécessite au moins 2 To de mémoire GPU combinée (huit cartes NVIDIA B300 ou seize H200). Le checkpoint quantifié nécessite environ 600 Go et tient sur quatre cartes B300. La parcimonie sépare le stockage du calcul, mais elle n'élimine pas le plancher de stockage. L'exigence matérielle reste élevée même si chaque token est bon marché. Un mécanisme qui garantit une propriété ne garantit pas aussi des propriétés pour lesquelles il n'a pas été conçu.
Mécanisme 2 — Le biais équilibre les experts sans concurrencer l'objectif
Ceci est l'instance la plus pure de la thèse dans toute l'architecture. La propriété est « l'utilisation des experts reste équilibrée pendant l'entraînement ». Le mécanisme naïf est une pénalité d'équilibre ajoutée à l'objectif d'entraînement, qui croît quand l'utilisation est inégale. Le problème est que le gradient de prédiction et le gradient d'équilibre pointent dans des directions différentes, et l'un des deux gagne. Mettez la pénalité élevée et la qualité du texte se dégrade. Mettez-la basse et les experts s'effondrent quand même.
Thinking Machines utilise la méthode auxiliary-loss-free introduite par Wang et collègues et adoptée par DeepSeek. Chaque expert a une valeur de biais, un petit nombre ajouté au score de sélection de cet expert. Le biais d'un expert surchargé dérive vers le bas, son score de sélection tombe en dessous de celui d'un voisin plus silencieux, et le voisin prend la place. Le biais n'affecte que la sélection. Il ne touche jamais la pondération des sorties des experts sélectionnés, et il est mis à jour par une règle de comptage simple qui s'exécute entièrement en dehors de la backpropagation. L'objectif principal d'entraînement ne reçoit aucun gradient concurrent. La propriété « utilisation équilibrée » est garantie par un mécanisme qui ne lutte pas contre la propriété « bien prédire le token suivant ». ✅
Ceci est Theorem 3 sous sa forme la plus pure. La propriété est garantie exactement quand son mécanisme est implémenté et mesure. Le mécanisme est le biais. La mesure est la règle de comptage. Le mécanisme ne concurrence pas l'objectif principal parce qu'il a été conçu pour ne pas le faire. Souveraineté par construction, non par pénalité.
Mécanisme 3 — La division 5:1 de l'attention rend un million de tokens abordable
Le coût de l'attention croît avec le carré de la longueur de la séquence. Un million de tokens produit environ mille milliards de comparaisons par couche, et 66 couches de cela dépasse toute combinaison matérielle raisonnable. La propriété est « une fenêtre de contexte d'un million de tokens ». Le mécanisme est un rapport 5:1 de couches à fenêtre glissante par rapport aux couches à attention complète : 55 couches à fenêtre glissante et 11 couches à attention complète. Une couche à fenêtre glissante restreint chaque token à une fenêtre fixe de tokens récents, donc son coût croît linéairement, pas quadratiquement. L'information à longue portée voyage à travers les onze couches complètes, rafraîchie environ une fois toutes les six couches. ✅
La mesure est le rapport et le nombre de couches : 55 contre 11. Un fait au token 200 qui importe au token 900,000 voyage en avant à travers les couches à attention complète et est transporté dans les représentations locales entre elles. Le compromis est honnête : les modèles à contexte long gèrent souvent bien le contenu général d'un grand document mais peuvent encore manquer un détail spécifique enfoui au milieu. Le mécanisme rend la fenêtre abordable ; il ne garantit pas le rappel de chaque détail enfoui.
Mécanisme 4 — Le codage de position relative élimine l'extrapolation
Presque tous les modèles ouverts récents utilisent Rotary Position Embedding, où la requête et la clé de chaque token sont tournées d'un angle proportionnel à sa position. L'angle n'est rencontré qu'à des positions sur lesquelles le modèle s'est entraîné. Demandez la position 900,000 et l'angle tombe en dehors de tout ce que le modèle a expérimenté. Toute une famille de techniques existe spécifiquement pour étirer RoPE dans des plages au-delà de ses données d'entraînement.
Inkling utilise un schéma relatif dans le style de Shaw et collègues. Plutôt que de coder où chaque token se trouve, il apprend une valeur pour chaque distance entre deux tokens et ajoute cette valeur au score de comparaison. Des tokens distants de 4 sont des tokens distants de 4 où qu'ils apparaissent. Les distances au-delà d'un seuil partagent toutes une même valeur apprise, donc une paire à 900,000 tokens d'intervalle utilise une valeur que le modèle a vue d'innombrables fois pendant l'entraînement. Rien n'a besoin d'être extrapolé. ✅
La mesure est la distance, non la position. La propriété est « gère des longueurs sur lesquelles le modèle ne s'est jamais entraîné », et le mécanisme est « coder la distance, pas la position absolue, de sorte que les longueurs non entraînées se réduisent à une distance entraînée ». Le compromis est que chaque framework de serving a dû écrire du nouveau code pour cela, parce que l'outillage environnant a été construit autour de RoPE. Un mécanisme qui garantit une propriété peut vous coûter l'écosystème qui a grandi autour de l'ancien mécanisme.
Mécanisme 5 — Multimodalité sans encodeur, entraînée depuis zéro
La plupart des modèles multimodaux attachent trois composants entraînés : un encodeur de vision, un encodeur audio et des couches de projection, chacun pré-entraîné séparément. Inkling accepte des images et de l'audio sans un encodeur pré-entraîné séparément. Le son arrive sous forme de mel spectrogram, une grille de valeurs de loudness à travers des bandes de fréquence et des tranches de temps. La méthode dMel arrondit chaque valeur de loudness à l'un d'un ensemble fixe de niveaux. C'est toute la conversion. Arrondir des nombres ne nécessite aucun entraînement. Les images sont découpées en patchs de 40 par 40 pixels, chacun passant par une tige hMLP à quatre étapes qui ajoute moins d'un pour cent au calcul. Les deux passent ensuite par une couche de conversion légère et rejoignent les tokens de texte dans une seule séquence, traités par les mêmes 66 couches. ✅
La propriété est « les images et l'audio entrent dans le modèle sans un encodeur pré-entraîné séparément ». Le mécanisme est « arrondir l'audio, patcher l'image, mélanger localement et tout entraîner depuis zéro ensemble ». La mesure est le surcoût de calcul de moins d'un pour cent. Le compromis est la confusion d'étiquette : le lancement l'appelle encoder-free tandis que la carte du modèle décrit un hierarchical patch encoder. Les deux sont exacts. Encoder-free signifie aucun grand réseau pré-entraîné séparément, pas aucun traitement du tout.
Mécanisme 6 — Effort comme réglage entraîné fait du benchmark une courbe
Les modèles de raisonnement produisent du working-out avant la réponse finale, et ce working-out coûte des tokens. Effort est un nombre entre 0 et 1, et il a été entraîné dans le modèle pendant le reinforcement learning plutôt que demandé par la formulation. Pendant RL, Thinking Machines a varié le message d'effort entre les tentatives tout en ajustant le coût facturé par token : les tentatives à high effort pouvaient produire du working-out étendu sans beaucoup de pénalité, les tentatives à low effort étaient lourdement pénalisées par token donc les réponses courtes marquaient mieux. La connexion entre le message et la longueur profitable a été apprise. ✅
La mesure est la courbe du score par rapport aux tokens générés. Sur Terminal Bench 2.1, Inkling atteint le même score que le Nemotron 3 Ultra de NVIDIA tout en produisant environ un tiers des tokens. La propriété est « la profondeur de raisonnement est réglable par appel », et le mécanisme est « entraîner la réponse à un message d'effort en variant le coût par token entre les tentatives de RL ». Le compromis est qu'un effort plus élevé encourage plus de raisonnement sans garantir une réponse plus longue ou meilleure sur un échantillon unique. Un nombre de benchmark est maintenant un point sur une courbe, pas une propriété fixe du modèle.
À quoi cela ressemble depuis une autre pile
Everythink ne livre pas de LLM. Les parallèles ci-dessous sont structurels, pas des affirmations produit, et sont marqués Partial parce que l'analogie est le point, pas une affirmation qu'Everythink fait le même travail.
Le biais qui équilibre sans concurrencer a la même forme que l'unique site de normalisation de l'Oracle. Les probabilités sont normalisées en exactement un endroit dans everythink-oracle, et les consommateurs peuvent se fier à ce que la somme soit approximativement un. La propriété est garantie par un mécanisme qui ne concurrence pas la fusion. ⚠️
La division 5:1 de l'attention, où la plupart des couches voient peu et quelques-unes portent la longue portée, a la même forme que « the space is the router ». Network, community et room routent avant que quoi que ce soit réponde, et la plupart des requêtes se résolvent localement tandis que quelques-unes parcourent le long chemin. Le mécanisme est la topologie, et la mesure est l'endroit où la requête se résout. ⚠️
Le codage de position relative, où une distance recontrée réutilise une valeur que le modèle a vue d'innombrables fois, a la même forme que les identifiants uuidv5 déterministes de World Monitor. La ré-ingestion met à jour, ne duplique jamais, parce que l'id est déterministe depuis la source et l'identifiant natif. La propriété est « pas de doublons à la ré-ingestion », et le mécanisme est l'origine déterministe. ⚠️
La multimodalité sans encodeur, où chaque modalité entre par son propre mécanisme bon marché et rejoint la même séquence, a la même forme que les ports hexagonaux basés sur des traits. Chaque port répond à une question différente, et les dépôts AppState sont des Arc
Effort comme réglage entraîné, où un benchmark devient un point sur une courbe, a la même forme que les personnalités typées des Sisters. L'analyst, le contrarian, le disruptor, l'historian et l'institutionalist sont typés, et la prompt version est estampillée à chaque exécution pour la reproductibilité. La propriété est « raisonnement typé reproductible », et le mécanisme est la personnalité plus le tampon de version. ⚠️
Le biais qui équilibre sans céder l'objectif principal a la même forme que la souveraineté de l'Eye Key. Le texte en clair de l'Eye Key ne touche jamais le disque. Seuls le HMAC et l'empreinte vont à Postgres. La propriété est « souveraineté sur la clé », et le mécanisme est la construction, pas une pénalité appliquée après coup. ⚠️
Limites de portée et Roadmap
Ce billet porte sur l'architecture de modèles d'IA, ce qui est un périmètre commercial et industriel. Les parallèles Everythink ci-dessus sont Partial parce qu'Everythink ne livre pas de LLM ; l'analogie structurelle est l'affirmation, pas une affirmation produit. L'Eye Key est un mécanisme de souveraineté d'API pour développeurs, Production, et n'est pas un véhicule d'investissement. HAI Engine est en production depuis 2016. The 21 papers sont Production. World Monitor est Production. L'Oracle est Production. Les Sisters sont Production. Aucun résultat de token, wallet ou community-credit n'est promis ici ; ceux-ci restent Roadmap 🔵, soumis à l'examen Howey, et ne sont jamais promus silencieusement. Theorem 3 est la convention de nommage pour l'affirmation « propriété garantie quand mécanisme implémenté et mesurant » ; ce n'est pas un terme juridique.
Deux choses que la plupart des couvertures ont omises
Premièrement, le biais est mis à jour entièrement en dehors de la backpropagation. La plupart des couvertures décrivent la méthode auxiliary-loss-free comme « sans auxiliary loss », mais le détail porteur est que la mise à jour du biais est une règle de comptage, pas un gradient. Le mécanisme n'est pas « retirer le loss ». C'est « retirer le gradient et le remplacer par un compteur ». C'est la différence entre une pénalité que vous réglez et un mécanisme que vous implémentez.
Deuxièmement, le réglage d'effort arrive sous forme de texte. Avant que la conversation commence, un system message indiquant le niveau d'effort est inséré avant tout le reste. Le modèle a été entraîné à répondre à ce message. Le bouton de personnalisation n'est pas un paramètre que vous réglez dans le code. C'est une phrase que le modèle a apprise à obéir. C'est un mécanisme d'analyse de frontière, et cela signifie que le réglage d'effort est portable vers tout client capable d'envoyer un system message, y compris un qui valide ses entrées à la frontière réseau.
FAQ
Poids ouverts est-il synonyme de personnalisable ? Non. Poids ouverts signifie que vous pouvez télécharger et ré-entraîner. Personnalisable signifie que l'architecture expose des mécanismes indépendants et mesurables de sorte que ré-entraîner un mécanisme n'entraîne pas les autres. Inkling a les deux. Un modèle à poids ouverts et à architecture monolithique est ré-entraînable, pas personnalisable au sens structurel.
Pourquoi le biais importe-t-il plus que la parcimonie ? La parcimonie sépare le stockage du calcul, c'est le récit des coûts. Le biais sépare l'équilibrage de l'objectif principal, c'est le récit du motif de conception. Le biais est le mécanisme qui prouve la thèse : une propriété est garantie par un mécanisme qui ne concurrence pas. La parcimonie est le mécanisme qui rend la thèse abordable.
Quel est le compromis du codage de position relative ? Le modèle gère des longueurs sur lesquelles il ne s'est jamais entraîné, mais chaque framework de serving a dû écrire du nouveau code pour cela. L'écosystème d'outillage a été construit autour de RoPE. Un mécanisme qui garantit une propriété peut vous coûter l'écosystème qui a grandi autour de l'ancien mécanisme.
Effort garantit-il une meilleure réponse ? Non. Un effort plus élevé encourage plus de raisonnement sans garantir une réponse plus longue ou meilleure sur un échantillon unique. Effort et la limite maximale de tokens sont des réglages séparés. Un réglage high effort peut nécessiter une limite de tokens plus grande pour éviter d'être coupé. Le benchmark est une courbe, et un échantillon unique est un point dessus.
Everythink peut-il utiliser Inkling ? Les parallèles Everythink dans ce billet sont structurels. Everythink ne livre pas de LLM. Les fournisseurs de LLM qu'Everythink utilise sont OpenAI-compatible. L'analogie porte sur le motif de conception, pas sur une intégration produit.
Sources
- ByteByteGo, « The New American AI Model Designed to be Customized », 18 août 2026 — https://blog.bytebytego.com/p/the-new-american-ai-model-designed — récupéré 2026-08-23
- Thinking Machines Lab, « Inkling: Our Open-Weights Model » (référencé via ByteByteGo)
- Thinking Machines Lab, « Inkling Model Card » (référencé via ByteByteGo)
- vLLM Recipes, « thinkingmachines/Inkling » notes d'intégration (référencé via ByteByteGo)
- Wang et al., « Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts » (référencé via ByteByteGo)
- Shaw et al., « Self-Attention with Relative Position Representations » (référencé via ByteByteGo)
Lisez le Honest Architect sur Theorem 3, l'Oracle et le motif the-space-is-the-router. Everythink est en production ; les parallèles ici sont structurels et marqués comme tels.

La prédiction à partir de signaux est le mécanisme, non l'assertion de vibes
Le guide de GRIN sur l'IA dans le marketing d'influence se lit comme six formes de mécanisme : prédiction à partir de signaux, automatisation, détection d'anomalies, prévision, jugement humain irréductible, automatisation ciblée. Theorem 3 appliqué à chacune.
→ →
La mémoire persistante est le mécanisme, pas la fenêtre de contexte
Cinq motifs architecturaux pour la mémoire des agents IA, lus comme Theorem 3 : la propriété (apprentissage, personnalisation) est garantie par le mécanisme (persister, récupérer, injecter), non par la fenêtre de contexte. Le checkpointing n'est pas exactly-once, les secrets ne sont pas mémoire sémantique, l'isolement sur la couche de stockage échoue fermé.
→ →
Recherche neurosymbolique : le mécanisme, pas le volume
Le modèle de recherche neurosymbolique Ontology 1 d'Onton lu comme Théorème 3 : la pertinence sur les requêtes à forte intention est garantie par le mécanisme (graphe de connaissance inspectable décomposant les prédicats vagues en propriétés vérifiables), non par le volume du catalogue. La méthodologie du benchmark est honnête (code+données libérés, 3 juges, bootstrap CI, alpha de Krippendorff 0,465 nommé). Le titre 2.7x n'est pas le chiffre agrégé. Cas d'échec nommés.
→ →Construisez votre monde sur un moteur qui prouve ce qu'il affirme.
Créez votre propre réseau sur le moteur qui tourne depuis 2016 — ou parlez à l'équipe derrière les 21 articles.
