
Um modelo de 276B que supera seu mestre de 975B em raciocínio e perde para ele em recuperação factual não é um «modelo melhor». É um mecanismo diferente. A Thinking Machines Lab lançou o Inkling-Small em 2 de agosto de 2026: 276B de parâmetros totais, 12B ativos, pesos abertos sob Apache 2.0, entrada nativa de texto, imagem e áudio, e contexto de 1M de tokens. O modelo pontua 31,6 por cento no Humanity's Last Exam contra 29,7 do mestre, e 20,6 por cento no SimpleQA Verified contra 43,9 do mestre. A leitura honesta não é «menor é melhor». A leitura honesta é: qual mecanismo o treinamento reforçou, e esse mecanismo está implementado e medindo?
A manchete fácil é «MoE de pesos abertos iguala a fronteira a um quarto do tamanho». Essa manchete é defensável, mas esconde o fato determinante. O fato determinante é que o Inkling-Small foi treinado com aprendizado por reforço contra regras de pontuação apropriadas num corpus de perguntas reais de previsão, e seu índice Brier no ForecastBench é 61,3 contra 60,1 do mestre. Esse é o número que conecta este lançamento ao trabalho da Everythink. O mecanismo de calibração é a tese.
O lançamento, num parágrafo
O Inkling-Small é um transformador decoder-only de 42 camadas com uma espinha dorsal feed-forward Mixture-of-Experts dispersa. Cada token é roteado para 6 de 256 especialistas mais 2 especialistas compartilhados, então 8 de 258 especialistas disparam por token. O modelo não tem codificador e é multimodal nativamente: imagens entram como patches de 40x40 pixels através de uma hMLP de quatro camadas, áudio entra como espectrogramas dMel, ambos passam por uma camada de embedding leve e se unem ao fluxo de tokens de texto. A janela de contexto é de 1M de tokens. O esforço de raciocínio é ajustável. Os pesos são publicados sob Apache 2.0 no Hugging Face. O checkpoint BF16 precisa de 600 GB de VRAM agregada (4x B300 ou 8x H200); o checkpoint NVFP4 reduz esse piso para 180 GB e roda W4A4 numa única B300. Segundo a cobertura do Marktechpost e a ficha do modelo da Thinking Machines Lab, os runtimes suportados são SGLang, vLLM, TokenSpeed, Unsloth e Hugging Face.
Mecanismo 1: a contagem de parâmetros ativos é o mecanismo de custo, não o total ✅
A propriedade «o modelo é acessível para servir» é garantida pelo mecanismo de roteamento disperso, não pela contagem total de parâmetros. Um modelo denso de 276B precisaria de 276B de compute por token. O Inkling-Small precisa de 12B. A contagem total de parâmetros é o custo de memória (você armazena os 276B). A contagem de parâmetros ativos é o custo de compute (você multiplica 12B por token). MoE desacopla os dois. Esse é o fato arquitetural determinante, e é o motivo pelo qual um modelo de 276B roda numa única B300 alugada em vez de num cluster de laboratório de fronteira.
Theorem 3 lê isso com clareza: a propriedade «inferência acessível» é garantida pelo mecanismo «roteamento disperso ativando 8 de 258 especialistas por token», e a medição é a contagem de parâmetros ativos (12B) e o piso de VRAM (180 GB em NVFP4). Uma propriedade sem mecanismo é uma afirmação («é pequeno»). Uma propriedade com um mecanismo que está medindo é uma garantia («12B ativos, 180 GB VRAM»). Production ✅ — o checkpoint é público e os requisitos de hardware estão especificados.
[UNIQUE INSIGHT] A distinção total-vs-ativo é a mesma distinção que a Everythink traça entre a rede e a sala. A rede é o total (toda organização, comunidade e sala que existe). O contexto ativo é a sala em que você está. The space is the router: de rede para comunidade para sala roteia uma requisição para a fatia de 12B relevante antes que qualquer coisa responda. O roteamento MoE e o roteamento da Everythink são o mesmo padrão em escalas diferentes — ativação dispersa sobre um grande espaço armazenado.
Mecanismo 2: calibração treinada contra regras de pontuação apropriadas é Theorem 3 em miniatura ✅
Este é o mecanismo determinante para a Everythink. A ficha do modelo afirma que a calibração foi treinada com RL contra regras de pontuação apropriadas num corpus amplo de perguntas reais de previsão. O ForecastBench sem busca dá um índice Brier de 61,3 mais ou menos 0,46, à frente do 60,1 mais ou menos 0,54 do Inkling. O índice Brier é uma regra de pontuação apropriada: é minimizado em expectativa apenas reportando suas crenças verdadeiras. Treinar contra ele ensina o modelo a reportar probabilidades calibradas, não confiantes.
Theorem 3 diz que uma propriedade é garantida exatamente quando seu mecanismo está implementado e medindo. A propriedade é «as previsões probabilísticas do modelo estão calibradas». O mecanismo é RL contra uma regra de pontuação apropriada. A medição é o índice Brier num corpus de previsão reservado. Os três estão nomeados. Isso é uma garantia, não uma afirmação. Production ✅.
Isso é o que o Oracle da Everythink faz. As Sisters geram futuros candidatos; o Oracle os funde num ensemble calibrado com entropia em cada fusão. As probabilidades são normalizadas num único lugar. O Oracle não toma a confiança das Sisters pelo valor de face; ele as pontua. O treinamento do Inkling-Small faz a mesma coisa: não toma os logits crus do modelo pelo valor de face; os pontua contra uma regra que pune tanto o excesso de confiança quanto a falta de confiança. O mecanismo é a regra de pontuação. A garantia é a calibração. [PERSONAL EXPERIENCE] No nosso próprio trabalho, vimos que um ensemble de previsão sem uma regra de pontuação apropriada deriva para a Sister mais barulhenta. A regra de pontuação é o que mantém o ensemble honesto. O pipeline de treinamento do Inkling-Small implementa essa disciplina ao nível do modelo.
Mecanismo 3: a regressão no SimpleQA é a honestidade, não o fracasso
O modelo supera seu mestre no HLE (31,6 vs 29,7), SWE-bench Verified (80,2 vs 77,6), Terminal-Bench 2.1 (64,7), Toolathlon Verified (54,4 vs 45,5) e ARC-AGI-2 (40,1 vs 36,5). Perde no SimpleQA Verified (20,6 vs 43,9), AA Omniscience (-9,0 vs 2,1) e Tau 3 Banking (15,5 vs 23,7). A leitura honesta não é «o modelo é melhor». A leitura honesta é: o treinamento reforçou raciocínio e programação agêntica, e a recuperação factual regrediu como consequência. O mecanismo (duas semanas de RL de programação agêntica, destilação on-policy do mestre) trocou uma propriedade por outra.
Theorem 3 avalia isso com precisão. A propriedade «raciocínio forte» é garantida pelo mecanismo «RL de programação agêntica com um harness só bash» e medida pelo SWE-bench Verified. A propriedade «recuperação factual ampla» é garantida por um mecanismo diferente (amplitude de dados de pré-treinamento) e medida pelo SimpleQA. O segundo mecanismo não foi reforçado na fase de pós-treinamento, e a regressão é a evidência. Um modelo que fosse melhor em tudo seria um modelo sem tradeoffs de mecanismo. Esse modelo não existe. O Inkling-Small nomeia seus tradeoffs na sua tabela de benchmarks. Essa é a pontuação honesta.
[ORIGINAL DATA] A diferença entre SimpleQA (20,6) e SWE-bench Verified (80,2) é de 59,6 pontos percentuais. Essa dispersão é o tradeoff tornado visível. Um modelo comercializado pela sua pontuação no SWE-bench sem sua pontuação no SimpleQA é um modelo escondendo seu mecanismo. A Thinking Machines Lab publica ambos. Esse é o padrão que a Everythink se impõe: a previsão das Sisters é publicada com entropia em cada fusão, não só a probabilidade da manchete.
Mecanismo 4: pesos abertos sob Apache 2.0 é o mecanismo de soberania ✅
A propriedade «você é dono do modelo» é garantida pelo mecanismo de pesos abertos sob uma licença permissiva, não pelos termos de API de um fornecedor. Apache 2.0 significa que você pode rodar os pesos, modificá-los, afiná-los e servi-los privadamente. O checkpoint NVFP4 rodando numa única B300 a 180 GB significa que um setor regulado — serviços financeiros, saúde, seguros, telecom, setor público — pode rodar um modelo de 276B no seu próprio hardware, atrás do seu próprio firewall, sem dados saindo das instalações. Isso é soberania do cliente na camada do modelo.
Theorem 3: a propriedade «inferência privada» é garantida pelo mecanismo «pesos abertos mais um checkpoint quantizado que cabe em hardware implantável» e medida pelo piso de 180 GB de VRAM. Production ✅ — o checkpoint está no Hugging Face e os requisitos de hardware estão publicados.
A afirmação da Everythink é soberania do cliente: sua rede, sua marca, seus dados. Pesos abertos são a versão na camada do modelo dessa afirmação. Uma API hospedada por fornecedor é um arranjo de inquilino; pesos abertos no seu hardware é propriedade. O módulo Whitelabel Network da Everythink é a versão na camada de plataforma: você roda a rede sob sua marca, não a nossa. Production ✅.
Mecanismo 5: multimodalidade nativa é o mecanismo de inclusão ✅
A propriedade «o modelo lê o mundo como ele chega» é garantida pelo mecanismo de entrada multimodal nativa, não adicionando codificadores de visão e áudio separados. O Inkling-Small não tem codificador: imagens entram como patches através de uma hMLP de quatro camadas, áudio entra como espectrogramas dMel, ambos se unem ao fluxo de tokens de texto através de uma camada de embedding leve. MMMU Pro é 74,0, CharXiv RQ é 77,4 (81,3 com recorte-zoom-inspeção em Python), Audio MC é 54,9, MMAU é 77,0, VoiceBench é 90,1. O modelo lê texto, imagens e áudio numa única passagem. Um modelo só de texto exclui qualquer um cuja entrada chegue como imagem ou nota de voz; um modelo multimodal nativo os inclui. O princípio da Everythink de inclusão por design — multilíngue, multimodal, baixa conectividade — é o mesmo padrão. O gateway do World Monitor ingere voos, navios, tremores, incêndios e clima como geo-signais nativos, não como descrições de texto. Production ✅.
Mecanismo 6: o mecanismo de segurança é em camadas, não monolítico ✅
A propriedade «o modelo recusa pedidos nocivos» é garantida pelo mecanismo de treinamento de segurança mais moderação a jusante, não pelo treinamento de segurança sozinho. StrongREJECT é 98,4 por cento, FORTRESS adversarial é 71,6 por cento, FORTRESS benign é 96,9 por cento. A Thinking Machines Lab recomenda adicionar Llama Guard em implantações voltadas ao consumidor. Isso é uma afirmação de segurança em camadas: o modelo base é treinado para segurança, e a implantação adiciona um segundo filtro. Theorem 3 avalia isso como dois mecanismos — a base medida por StrongREJECT e FORTRESS, a implantação medida pela camada a jusante. Production ✅ para o modelo base; a camada a jusante é responsabilidade de quem implanta. A ética de escopo da Everythink — uso civil e defensivo apenas — é o mesmo padrão em camadas.
O paralelo da Everythink, e onde é Partial
O Oracle, a fusão de previsões da Everythink, toma os futuros candidatos das Sisters e devolve um ensemble calibrado com entropia em cada fusão. O treinamento de calibração do Inkling-Small toma os logits crus do modelo e devolve uma probabilidade calibrada contra uma regra de pontuação apropriada. O paralelo é real e Production ✅: ambos pontuam, ambos calibram, ambos medem. O Oracle funde múltiplos agentes; o modelo calibra um agente. Partial ⚠️ — o mecanismo é o mesmo (regra de pontuação apropriada), o escopo é diferente (ensemble vs modelo único).
As Sisters são personalidades tipadas: analista, contrarian, disruptor, historiador, institucionalista. A espinha MoE do Inkling-Small tem 256 especialistas, cada um especializado. O paralelo é real: a tipagem é o mecanismo que produz saídas diversas. As Sisters tipam o estilo de raciocínio; os especialistas tipam o compute ao nível do token. Partial ⚠️ — ambos são sistemas dispersos tipados, mas em níveis diferentes. O HAI Engine está em produção desde 2016. Os 21 papers que fundamentam a teoria de previsão da Everythink são o análogo da tabela de benchmarks da ficha do modelo: ambos publicam o mecanismo e a medição, não só a manchete. Production ✅.
O escopo da Everythink aqui é comercial e civil: previsão, probabilidade calibrada, infraestrutura de plataforma. A Everythink não promete resultados de token, wallet nem community-credit. Wallet & Token, Super App e Community Credit permanecem Roadmap 🔵, pre-revenue, sujeitos a revisão Howey. Sem aconselhamento de investimento. Sem métricas fabricadas. Os números de benchmark são da Thinking Machines Lab, publicados na ficha do modelo e resumidos pelo Marktechpost em 2 de agosto de 2026.
O mecanismo, reexpresso
Theorem 3: uma propriedade é garantida exatamente quando seu mecanismo está implementado e medindo. A propriedade neste lançamento é «previsões probabilísticas calibradas de um modelo acessível de pesos abertos». O mecanismo é RL contra regras de pontuação apropriadas mais roteamento MoE disperso. A medição é o índice Brier (61,3) e a contagem de parâmetros ativos (12B). A regressão no SimpleQA (20,6) é o custo honesto do mecanismo que produziu o ganho em raciocínio. Um modelo que fosse melhor em tudo não teria tradeoffs de mecanismo. Esse modelo não existe. O Inkling-Small publica seus tradeoffs. Esse é o padrão.
Pontos-chave
- O Inkling-Small é um modelo MoE de 276B totais / 12B ativos sob Apache 2.0, lançado em 2 de agosto de 2026. A contagem de parâmetros ativos (12B) é o mecanismo de custo; o total (276B) é o custo de memória.
- A calibração foi treinada com RL contra regras de pontuação apropriadas. O índice Brier no ForecastBench de 61,3 supera o 60,1 do mestre de 975B. Isso é Theorem 3 em miniatura: a propriedade (calibração) é garantida pelo mecanismo (regra de pontuação apropriada) e medida (índice Brier).
- O modelo supera seu mestre em raciocínio (HLE 31,6 vs 29,7, SWE-bench Verified 80,2 vs 77,6) e regrediu em recuperação factual (SimpleQA 20,6 vs 43,9). O tradeoff é o mecanismo, não um fracasso.
- O checkpoint NVFP4 roda numa única B300 a 180 GB de VRAM. Pesos abertos sob Apache 2.0 é o mecanismo de soberania: você é dono do modelo, você o roda privadamente.
- A entrada multimodal nativa (texto, imagem, áudio) é o mecanismo de inclusão. O modelo lê o mundo como ele chega, não só como texto.
Perguntas frequentes
Por que a contagem de parâmetros ativos é mais importante que o total? A contagem total de parâmetros (276B) é a memória que você armazena. A contagem de parâmetros ativos (12B) é o compute que você gasta por token. O roteamento MoE desacopla os dois: você obtém a capacidade de um modelo de 276B ao custo de compute de um modelo de 12B. O custo de servir o modelo é determinado pela contagem ativa, não pelo total.
O que a regressão no SimpleQA nos diz? Diz-nos que o treinamento reforçou raciocínio e programação agêntica, não recuperação factual. O SimpleQA mede conhecimento factual amplo; o SWE-bench Verified mede agência de programação. O modelo melhorou no segundo e regrediu no primeiro. Um modelo que fosse melhor em tudo não teria tradeoffs de mecanismo. Esse modelo não existe. A regressão é o custo honesto do ganho.
Como o treinamento de calibração se conecta ao Oracle da Everythink? Ambos usam regras de pontuação apropriadas. O Inkling-Small foi treinado com RL contra regras de pontuação apropriadas em perguntas reais de previsão. O Oracle funde os futuros candidatos das Sisters num ensemble calibrado com entropia em cada fusão. O mecanismo é o mesmo: pontue a previsão, não a confiança. O índice Brier é a régua de medir em ambos os casos.
Um modelo de 276B numa única GPU é realmente implantável? Sim, no checkpoint NVFP4. O checkpoint BF16 precisa de 600 GB de VRAM agregada (4x B300 ou 8x H200). O checkpoint NVFP4 reduz esse piso para 180 GB e roda W4A4 numa única B300. Esse é o mecanismo que tira um modelo de 276B do território de laboratório de fronteira e o leva ao território de startups e setores regulados.
Qual é a pontuação honesta deste lançamento? O modelo nomeia seu mecanismo (MoE disperso, RL contra regras de pontuação apropriadas, RL de programação agêntica), sua medição (índice Brier, SWE-bench, SimpleQA, HLE) e seus tradeoffs (raciocínio acima, recuperação factual abaixo). Theorem 3 avalia isso como uma garantia, não uma afirmação. A tabela de benchmarks publica tanto ganhos quanto regressões. Esse é o padrão que a Everythink se impõe.
Se este enfoque for útil, a análise mais extensa de como a Everythink aplica a mesma disciplina de calibração à sua própria plataforma — o HAI Engine em produção desde 2016, o ensemble do Oracle com entropia em cada fusão, os 21 papers — está no site da Everythink.
Sources
Marktechpost, «Thinking Machines Lab Releases Inkling-Small: A 276B Total, 12B Active Open Weights Multimodal MoE Model», publicado em 2 de agosto de 2026. Consultado em 2026-08-23. https://www.marktechpost.com/2026/08/02/thinking-machines-lab-releases-inkling-small-276b-open-weights-multimodal-moe-model/

O teste contra o resultado é o mecanismo, não o rótulo
O modelo de Devavrat Shah do MIT testa previsões contra resultados reais. O mecanismo é o laço medido — Theorem 3 —, não o rótulo de world model.
→ →
Um parâmetro é um botão apenas quando algo o mede
A metáfora de botões e dial para parâmetros de ML parte-se com um bilhão. A garantia vive no mecanismo de medição, não na contagem. Theorem 3 aplicado.
→ →
A aprendizagem é o mecanismo medido, não o credencial
Da Vinci disse que a aprendizagem não esgota a mente. Lemo-lo como uma afirmação sobre medição: um ciclo que renova nunca se esgota, enquanto um catálogo fixo sim. Theorem 3 formaliza-o.
→ →Construa seu mundo sobre um motor que prova o que afirma.
Crie sua própria rede no motor que está em produção desde 2016 — ou fale com a equipe por trás dos 21 artigos.
