
一个在推理上击败其975B教师、却在事实回忆上输给教师的276B模型,不是「更好的模型」。它是不同的机制。Thinking Machines Lab于2026年8月2日发布了Inkling-Small:276B总参数,12B活跃参数,Apache 2.0开放权重,原生文本-图像-音频输入,1M token上下文。该模型在Humanity's Last Exam上得分31.6%,而教师为29.7%;在SimpleQA Verified上得分20.6%,而教师为43.9%。诚实的解读不是「更小就是更好」。诚实的解读是:训练强化了哪个机制,而该机制是否已实现并在测量?
容易的标题是「开放权重MoE以四分之一规模匹敌前沿」。该标题站得住脚,但它掩盖了关键事实。关键事实是Inkling-Small通过强化学习针对proper scoring rules在真实世界预测问题语料上训练,其ForecastBench Brier指数为61.3,而教师为60.1。这个数字将此次发布与Everythink的工作联系起来。校准机制是论点。
发布概述,一段话
Inkling-Small是一个42层decoder-only transformer,带有稀疏Mixture-of-Experts前馈骨干。每个token路由到256个专家中的6个加2个共享专家,因此每个token激活258个专家中的8个。该模型无编码器且原生多模态:图像通过四层hMLP以40x40像素块输入,音频以dMel频谱图输入,两者通过轻量嵌入层并加入文本token流。上下文窗口为1M tokens。思考努力可调。权重在Hugging Face上以Apache 2.0发布。BF16检查点需要600 GB聚合VRAM(4x B300或8x H200);NVFP4检查点将该门槛降至180 GB并在单个B300上运行W4A4。根据Marktechpost的报道和Thinking Machines Lab的模型卡,支持的运行时为SGLang、vLLM、TokenSpeed、Unsloth和Hugging Face。
机制1:活跃参数计数是成本机制,而非总数 ✅
属性「模型服务成本低」由稀疏路由机制保证,而非由总参数计数保证。一个276B密集模型每个token需要276B计算。Inkling-Small需要12B。总参数计数是内存成本(你存储全部276B)。活跃参数计数是计算成本(你每个token乘12B)。MoE将两者解耦。这是关键架构事实,也是276B模型在单台租用B300上运行而非前沿实验室集群上的原因。
Theorem 3清晰解读:属性「低廉推理」由机制「每个token激活258个专家中8个的稀疏路由」保证,测量是活跃参数计数(12B)和VRAM门槛(NVFP4下180 GB)。没有机制的属性是断言(「它小」)。有正在测量的机制的属性是保证(「12B活跃,180 GB VRAM」)。Production ✅——检查点公开且硬件要求已明确。
[UNIQUE INSIGHT] 总数与活跃数的区分正是Everythink在网络与房间之间所做的区分。网络是总数(存在的每个组织、社区和房间)。活跃上下文是你所在的房间。The space is the router:从网络到社区到房间将请求路由到12B相关的切片,在任何东西响应之前。MoE路由和Everythink路由是不同尺度上的同一模式——在大型存储空间上的稀疏激活。
机制2:针对proper scoring rules训练的校准是Theorem 3的缩影 ✅
这是Everythink的关键机制。模型卡指出校准通过RL针对proper scoring rules在大量真实世界预测问题上训练。ForecastBench无搜索给出Brier指数61.3正负0.46,领先Inkling的60.1正负0.54。Brier分数是proper scoring rule:它仅在报告真实信念时期望最小化。针对它训练教会模型报告校准过的概率,而非自信的概率。
Theorem 3说一个属性当且仅当其机制已实现并在测量时才被保证。属性是「模型的概率预测是校准过的」。机制是RL针对proper scoring rule。测量是在留出预测语料上的Brier分数。三者都已明确。那是保证,不是断言。Production ✅。
这正是Everythink的Oracle所做的。Sisters生成候选未来;Oracle将它们合并为每次合并都带熵的校准集成。概率在一个地方归一化。Oracle不以面值接受Sisters的置信度;它给它们打分。Inkling-Small的训练做同样的事:它不以面值接受模型的原始logits;它针对一个惩罚过度自信和自信不足的规则给它们打分。机制是评分规则。保证是校准。[PERSONAL EXPERIENCE]在我们自己的工作中,我们看到没有proper scoring rule的预测集向最响亮的Sister漂移。评分规则是保持集成诚实的东西。Inkling-Small的训练管道在模型层面实现了这一纪律。
机制3:SimpleQA上的回归是诚实,不是失败
该模型在HLE(31.6 vs 29.7)、SWE-bench Verified(80.2 vs 77.6)、Terminal-Bench 2.1(64.7)、Toolathlon Verified(54.4 vs 45.5)和ARC-AGI-2(40.1 vs 36.5)上击败教师。它在SimpleQA Verified(20.6 vs 43.9)、AA Omniscience(-9.0 vs 2.1)和Tau 3 Banking(15.5 vs 23.7)上落败。诚实的解读不是「模型更好」。诚实的解读是:训练强化了推理和代理编程,而事实回忆因此回归。机制(两周代理编程RL、从教师on-policy蒸馏)用一个属性交换了另一个。
Theorem 3精确评判这一点。属性「强推理」由机制「带bash-only harness的代理编程RL」保证并由SWE-bench Verified测量。属性「广泛事实回忆」由不同机制(预训练数据广度)保证并由SimpleQA测量。第二个机制在后训练阶段未被强化,而回归是证据。一个在一切方面都更好的模型将是没有机制权衡的模型。那种模型不存在。Inkling-Small在其基准表中明确其权衡。那是诚实的记分卡。
[ORIGINAL DATA] SimpleQA(20.6)和SWE-bench Verified(80.2)之间的差距是59.6个百分点。该跨度是可见化的权衡。一个以SWE-bench分数营销而不提SimpleQA分数的模型是隐藏其机制的模型。Thinking Machines Lab两者都发布。那是Everythink对自己持有的标准:Sisters的预见每次合并都带熵发布,而不仅仅是标题概率。
机制4:Apache 2.0下的开放权重是主权机制 ✅
属性「你拥有模型」由宽松许可下开放权重的机制保证,而非由供应商API条款保证。Apache 2.0意味着你可以运行权重、修改权重、微调权重并私有地服务它们。在单个B300上以180 GB运行的NVFP4检查点意味着受监管行业——金融服务、医疗保健、保险、电信、公共部门——可以在自己的硬件上、自己的防火墙后运行276B模型,数据不离开场所。那是模型层的客户主权。
Theorem 3:属性「私有推理」由机制「开放权重加上适合可部署硬件的量化检查点」保证并由180 GB VRAM门槛测量。Production ✅——检查点在Hugging Face上且硬件要求已发布。
Everythink的主张是客户主权:你的网络、你的品牌、你的数据。开放权重是该主张的模型层版本。供应商托管的API是房东安排;你硬件上的开放权重是所有权。Everythink的Whitelabel Network模块是平台层版本:你以你的品牌运营网络,而非我们的。Production ✅。
机制5:原生多模态是包容机制 ✅
属性「模型按世界到达的方式读取世界」由原生多模态输入机制保证,而非通过附加独立的视觉和音频编码器。Inkling-Small无编码器:图像通过四层hMLP以块输入,音频以dMel频谱图输入,两者通过轻量嵌入层加入文本token流。MMMU Pro为74.0,CharXiv RQ为77.4(用Python裁剪-缩放-检查时81.3),Audio MC为54.9,MMAU为77.0,VoiceBench为90.1。模型在一次通过中读取文本、图像和音频。纯文本模型排除了任何输入以图像或语音备忘到达的人;原生多模态模型包容他们。Everythink的包容设计原则——多语言、多模态、低连接——是同一模式。World Monitor网关将航班、船舶、地震、火灾和天气作为原生geo-signals摄取,而非文本描述。Production ✅。
机制6:安全机制是分层的,不是单体式的 ✅
属性「模型拒绝有害请求」由安全训练加下游审核的机制保证,而非仅由安全训练保证。StrongREJECT为98.4%,FORTRESS adversarial为71.6%,FORTRESS benign为96.9%。Thinking Machines Lab建议在面向消费者的部署中添加Llama Guard。那是分层安全声明:基础模型为安全训练,部署添加第二个过滤器。Theorem 3将此评判为两个机制——基础由StrongREJECT和FORTRESS测量,部署由下游层测量。Production ✅用于基础模型;下游层是部署者的责任。Everythink的范围伦理——仅限民用和防御用途——是同一分层模式。
Everythink的类比,以及何处是Partial
Oracle,Everythink的预测合并,取Sisters的候选未来并返回每次合并都带熵的校准集成。Inkling-Small的校准训练取模型的原始logits并返回针对proper scoring rule的校准概率。类比是真实的且Production ✅:两者都评分、都校准、都测量。Oracle合并多个代理;模型校准一个代理。Partial ⚠️——机制相同(proper scoring rule),范围不同(集成 vs 单模型)。
Sisters是类型化人格:analyst、contrarian、disruptor、historian、institutionalist。Inkling-Small的MoE骨干有256个专家,每个专门化。类比是真实的:类型化是产生多样输出的机制。Sisters类型化推理风格;专家类型化token级计算。Partial ⚠️——两者都是稀疏类型化系统,但在不同层面。HAI Engine自2016年投入生产。奠定Everythink预测理论的21篇论文是模型卡基准表的类比:两者都发布机制和测量,而不仅仅是标题。Production ✅。
Everythink此处的范围是商业和民用的:预测、校准概率、平台基础设施。Everythink不承诺token、wallet或community-credit结果。Wallet & Token、Super App和Community Credit仍是Roadmap 🔵,pre-revenue,须接受Howey审查。无投资建议。无捏造指标。基准数字来自Thinking Machines Lab,发布在模型卡中并由Marktechpost于2026年8月2日总结。
机制,重述
Theorem 3:一个属性当且仅当其机制已实现并在测量时才被保证。此次发布的属性是「来自低成本开放权重模型的校准概率预测」。机制是RL针对proper scoring rules加稀疏MoE路由。测量是Brier分数(61.3)和活跃参数计数(12B)。SimpleQA上的回归(20.6)是产生推理增益的机制的诚实成本。一个在一切方面都更好的模型将没有机制权衡。那种模型不存在。Inkling-Small发布其权衡。那是标准。
关键要点
- Inkling-Small是Apache 2.0下的276B总/12B活跃MoE模型,2026年8月2日发布。活跃参数计数(12B)是成本机制;总数(276B)是内存成本。
- 校准通过RL针对proper scoring rules训练。ForecastBench Brier分数61.3击败975B教师的60.1。那是Theorem 3的缩影:属性(校准)由机制(proper scoring rule)保证并被测量(Brier分数)。
- 该模型在推理上击败教师(HLE 31.6 vs 29.7,SWE-bench Verified 80.2 vs 77.6)并在事实回忆上回归(SimpleQA 20.6 vs 43.9)。权衡是机制,不是失败。
- NVFP4检查点在单个B300上以180 GB VRAM运行。Apache 2.0下的开放权重是主权机制:你拥有模型,你私有地运行它。
- 原生多模态输入(文本、图像、音频)是包容机制。模型按世界到达的方式读取世界,而非仅文本。
常见问题
为什么活跃参数计数比总数更重要? 总参数计数(276B)是你存储的内存。活跃参数计数(12B)是你每个token花费的计算。MoE路由将两者解耦:你以12B模型的计算成本获得276B模型的容量。服务模型的成本由活跃计数决定,而非总数。
SimpleQA上的回归告诉我们什么? 它告诉我们训练强化了推理和代理编程,而非事实回忆。SimpleQA测量广泛事实知识;SWE-bench Verified测量编程代理性。模型在第二个上改进并在第一个上回归。一个在一切方面都更好的模型将没有机制权衡。那种模型不存在。回归是增益的诚实成本。
校准训练如何连接到Everythink的Oracle? 两者都使用proper scoring rules。Inkling-Small通过RL针对proper scoring rules在真实世界预测问题上训练。Oracle将Sisters的候选未来合并为每次合并都带熵的校准集成。机制相同:给预测评分,而非置信度。Brier分数在两种情况下都是测量标尺。
单个GPU上的276B模型真的可部署吗? 是的,在NVFP4检查点。BF16检查点需要600 GB聚合VRAM(4x B300或8x H200)。NVFP4检查点将该门槛降至180 GB并在单个B300上运行W4A4。那是将276B模型从前沿实验室领域移至初创企业和受监管行业领域的机制。
此次发布诚实的记分卡是什么? 模型明确其机制(稀疏MoE、RL针对proper scoring rules、代理编程RL)、其测量(Brier分数、SWE-bench、SimpleQA、HLE)及其权衡(推理上升、事实回忆下降)。Theorem 3将此评判为保证,而非断言。基准表发布增益和回归两者。那是Everythink对自己持有的标准。
如果这一框架有用,关于Everythink如何将同样的校准纪律应用于自身平台的更详细论述——2016年投入生产的HAI Engine、每次合并都带熵的Oracle集成、21篇论文——在Everythink网站上。
Sources
Marktechpost, « Thinking Machines Lab Releases Inkling-Small: A 276B Total, 12B Active Open Weights Multimodal MoE Model », 发表于2026年8月2日。检索于2026-08-23。 https://www.marktechpost.com/2026/08/02/thinking-machines-lab-releases-inkling-small-276b-open-weights-multimodal-moe-model/



