
定制化是机制分离,不是开放权重
Thinking Machines 于 2026 年 7 月 15 日发布了 Inkling,发布用语把它称为「为定制化而设计」的模型。权重放在 Hugging Face 上,采用 Apache 2.0 许可证,最简单的解读是:定制化是许可证赋予你的东西。这种解读是错的。开放权重是一项发布选择。定制化的保证是结构性的:模型中的每一项架构决策都把一个可度量的属性隔离在它自己的机制背后,而每个机制都独立可度量、可调优。重新训练一个机制,不会拖累其余的。这才是「为定制化而设计」在认真对待机制时的含义,它与一个每个端口回答一个不同问题的系统具有相同的形状。
这是 Honest Architect 对 Inkling 的解读,基于发布公告、模型卡以及 vLLM 项目发布的集成说明(ByteByteGo,《The New American AI Model Designed to be Customized》,2026 年 8 月 18 日;检索于 2026-08-23)。这里的论点不是 Everythink 发布了一个 LLM。它没有。论点是:这个设计模式是可识别的——一个属性恰好在其机制被实现且在度量时才被保证,而一个系统恰好在每个属性都拥有自己的、不与其他属性竞争的机制时才是可定制的。
机制 1 — 稀疏性把存储与计算分离
第一项决策是让其余一切变得可负担的那一项。Inkling 存储 9750 亿参数,每个 token 运行约 410 亿参数,大约 4% 的模型在任何时刻处于激活状态。机制是 Mixture of Experts:每一层容纳 256 个专家,路由器每个 token 选 6 个,外加 2 个在每个 token 上都运行的共享专家。属性是「这么大的模型运行得起」。机制是「用 256 个小网络替换单一 feed-forward 网络,只运行 6 个」。度量是比例:存储 9750 亿,激活 410 亿。✅
权衡是诚实的且被明确陈述。全精度 checkpoint 至少需要 2 TB 的组合 GPU 内存(八张 NVIDIA B300 或十六张 H200)。量化 checkpoint 大约需要 600 GB,可以装在四张 B300 上。稀疏性把存储与计算分离,但它不消除存储下限。硬件要求仍然很高,即便每个 token 很便宜。一个保证某属性的机制,并不连带保证它未被设计去保证的属性。
机制 2 — 偏置在不与目标竞争的情况下平衡专家
这是整套架构中对论点最纯粹的实例。属性是「专家使用在训练过程中保持均衡」。朴素的机制是在训练目标里加一个平衡惩罚,当使用不均时增大。问题在于预测梯度和平衡梯度指向不同方向,而其中一个会赢。把惩罚调高,文本质量退化。调低,专家照样坍缩。
Thinking Machines 使用 Wang 等人提出、DeepSeek 也采用的 auxiliary-loss-free 方法。每个专家有一个偏置值,一个加到该专家选择分数上的小数字。一个过载专家的偏置向下漂移,它的选择分数降到比一个更安静的邻居低,邻居就接过这个位置。偏置只影响选择。它从不触及被选中专家输出的加权,并且它由一条简单的计数规则更新,完全在 backpropagation 之外运行。主训练目标不接收任何竞争梯度。「均衡使用」这一属性由一个不与「把下一个 token 预测好」这一属性对抗的机制来保证。✅
这是 Theorem 3 最干净的形式。属性恰好在其机制被实现且在度量时才被保证。机制是偏置。度量是计数规则。机制不与主目标竞争,因为它被设计成不竞争。构造式主权,而非惩罚式主权。
机制 3 — 5:1 注意力切分让一百万 token 变得可负担
注意力成本随序列长度的平方增长。一百万 token 每层产生约一万亿次比较,66 层这样的计算超出任何合理硬件。属性是「一百万 token 的上下文窗口」。机制是 sliding-window 层与 full-attention 层 5:1 的比例:55 层 sliding-window 和 11 层 full-attention。一层 sliding-window 把每个 token 限制在最近 token 的固定窗口内,所以它的成本线性增长,而不是二次增长。长距离信息通过那十一层全注意力层传播,大约每六层刷新一次。✅
度量是比例和层数:55 比 11。位于 token 200 的事实若在 token 900,000 处有用,它会通过全注意力层向前传播,并在其间的局部表示中被携带。权衡是诚实的:长上下文模型通常能很好地处理大文档的总体内容,但仍然可能错过埋在中间的某个具体细节。机制让窗口变得可负担;它不保证对每个埋藏细节的回忆。
机制 4 — 相对位置编码消除外推
几乎所有近期开放模型都使用 Rotary Position Embedding,其中每个 token 的 query 和 key 按与其位置成正比的角度旋转。该角度只在模型训练过的位置上被遇到过。问它位置 900,000,角度就落在模型经验之外的任何东西上。一整套技术族专门用来把 RoPE 拉伸到训练数据之外的范围。
Inkling 使用 Shaw 等人风格的相对方案。它不编码每个 token 坐在哪里,而是为两个 token 之间的每个距离学习一个值,并把这个值加到比较分数上。相距 4 的 token 无论在哪里都是相距 4 的 token。超出某个截断的距离都共享同一个学习到的值,所以一对相距 900,000 token 的位置使用一个模型在训练中见过无数次的值。没有任何东西需要被外推。✅
度量是距离,不是位置。属性是「处理模型从未训练过的长度」,机制是「编码距离而非绝对位置,所以未训练长度坍缩到一个已训练距离」。权衡是每个 serving 框架都得为它写新代码,因为周边工具链是围绕 RoPE 建立的。一个保证某属性的机制,可能让你付出围绕旧机制生长出来的生态系统的代价。
机制 5 — 无编码器的多模态从零训练
大多数多模态模型附接三个训练好的组件:一个视觉编码器、一个音频编码器和投影层,每一个都单独预训练。Inkling 接受图像和音频而无需单独预训练的编码器。声音以 mel spectrogram 的形式进入,一个跨频带和时间切片的 loudness 值网格。dMel 方法把每个 loudness 值舍入到一组固定级别中的一个。这就是全部转换。舍入数字不需要训练。图像被切成 40×40 像素的 patch,每个经过一个四阶段 hMLP stem,增加不到 1% 的计算量。两者随后经过一个轻量转换层,并与文本 token 合并到单一序列中,由同一套 66 层处理。✅
属性是「图像和音频在无需单独预训练编码器的情况下进入模型」。机制是「舍入音频、patch 图像、局部混合、从零一起训练」。度量是不到 1% 的计算开销。权衡是标签混乱:发布称之为 encoder-free,而模型卡描述了一个 hierarchical patch encoder。两者都准确。Encoder-free 意味着没有大型单独预训练的网络,而不是没有任何处理。
机制 6 — Effort 作为训练好的设置让基准变成一条曲线
推理模型在最终答案之前产生 working-out,而那 working-out 消耗 token。Effort 是一个 0 到 1 之间的数字,它在 reinforcement learning 期间被训练进模型,而不是通过措辞请求。在 RL 期间,Thinking Machines 在各次尝试间改变 effort 消息,同时调整每个 token 的收费:high effort 的尝试可以产生冗长的 working-out 而不太受惩罚,low effort 的尝试每个 token 被重重收费,于是短回答得分更高。消息与有利长度之间的连接被学习到了。✅
度量是分数对生成 token 数的曲线。在 Terminal Bench 2.1 上,Inkling 达到与 NVIDIA 的 Nemotron 3 Ultra 相同的分数,同时产生大约三分之一的 token。属性是「推理深度可按调用调节」,机制是「通过在 RL 尝试间改变每 token 成本来训练对 effort 消息的响应」。权衡是更高的 effort 鼓励更多推理,但不保证在任一样本上产生更长或更好的响应。一个基准数字现在是一条曲线上的一个点,而不是模型的固定属性。
从另一个技术栈看过来是什么样子
Everythink 不发布 LLM。下面的平行是结构性的,不是产品声称,并标记为 Partial,因为类比才是重点,而不是声称 Everythink 做同样的工作。
那个不竞争就平衡的偏置,与 Oracle 的单一归一化位点形状相同。概率在 everythink-oracle 中恰好在一个地方被归一化,消费者可以依赖总和约为 1。属性由一个不与 merge 竞争的机制来保证。⚠️
5:1 注意力切分——大多数层看得少,少数层承载长距离——与「the space is the router」形状相同。Network、community 和 room 在任何东西响应之前先路由,大多数请求在本地解析,而少数走长路径。机制是拓扑,度量是请求在哪里解析。⚠️
相对位置编码——一个被重新遇到的距离使用一个模型见过无数次的值——与 World Monitor 的确定性 uuidv5 id 形状相同。重新摄入是更新,不是重复,因为 id 从来源和 native id 确定性地派生。属性是「重新摄入无重复」,机制是确定性起源。⚠️
无编码器的多模态——每种模态通过自己廉价的机制进入并合并到同一序列——与基于 trait 的六边形端口形状相同。每个端口回答一个不同的问题,AppState 仓库是 Arc
Effort 作为训练好的设置——基准变成曲线上一个点——与 Sisters 的类型化人格形状相同。analyst、contrarian、disruptor、historian 和 institutionalist 是类型化的,prompt version 在每次运行时被盖戳以保证可复现性。属性是「可复现的类型化推理」,机制是人格加上版本戳。⚠️
那个不交出主目标就平衡的偏置,与 Eye Key 主权形状相同。Eye Key 明文从不触及磁盘。只有 HMAC 和指纹进入 Postgres。属性是「对 key 的主权」,机制是构造,不是事后施加的惩罚。⚠️
范围限制与 Roadmap
这篇文章关于 AI 模型架构,属于商业和工业范围。上文的 Everythink 平行是 Partial,因为 Everythink 不发布 LLM;结构性类比才是声称,而不是产品声称。Eye Key 是面向开发者的 API 主权机制,Production,不是投资工具。HAI Engine 自 2016 年起处于生产状态。The 21 papers 是 Production。World Monitor 是 Production。Oracle 是 Production。Sisters 是 Production。此处不承诺任何 token、wallet 或 community-credit 结果;那些仍是 Roadmap 🔵,须接受 Howey 审查,且从不被悄悄提升。Theorem 3 是「属性—当—机制—被实现且在度量—时—被保证」这一声称的命名约定;它不是法律术语。
大多数报道漏掉的两件事
第一,偏置完全在 backpropagation 之外被更新。大多数报道把 auxiliary-loss-free 方法描述为「没有 auxiliary loss」,但承重的细节是:偏置更新是一条计数规则,而不是梯度。机制不是「去掉 loss」。它是「去掉梯度并用一个计数器替换它」。这是你调优的惩罚与你实现的机制之间的差别。
第二,effort 设置以文本形式到达。在对话开始之前,一条说明 effort 水平的 system message 被插入到一切之前。模型被训练来响应那条消息。定制旋钮不是你在代码里设置的参数。它是模型学会服从的一句话。那是一个 boundary-parsing 机制,它意味着 effort 设置可移植到任何能发送 system message 的客户端,包括一个在网络边界验证其输入的客户端。
FAQ
开放权重和可定制是一回事吗? 不是。开放权重意味着你可以下载并重新训练。可定制意味着架构暴露独立的、可度量的机制,从而重新训练一个不会拖累其余的。Inkling 两者都有。一个拥有开放权重和单体架构的模型是可重训练的,而不是结构意义上的可定制。
为什么偏置比稀疏性更重要? 稀疏性把存储与计算分离,这是成本叙事。偏置把平衡与主目标分离,这是设计模式叙事。偏置是证明论点的机制:一个属性由一个不竞争的机制保证。稀疏性是让论点变得可负担的机制。
相对位置编码的权衡是什么? 模型处理它从未训练过的长度,但每个 serving 框架都得为它写新代码。工具链生态系统是围绕 RoPE 建立的。一个保证某属性的机制,可能让你付出围绕旧机制生长出来的生态系统的代价。
Effort 保证更好的答案吗? 不。更高的 effort 鼓励更多推理,但不保证在任一样本上产生更长或更好的响应。Effort 和最大 token 限制是分开的设置。一个 high effort 设置可能需要更大的 token 限制以避免被截断。基准是一条曲线,而一个样本是上面一个点。
Everythink 可以使用 Inkling 吗? 这篇文章里的 Everythink 平行是结构性的。Everythink 不发布 LLM。Everythink 使用的 LLM 提供者是 OpenAI-compatible 的。类比指向设计模式,而不是产品集成。
Sources
- ByteByteGo,《The New American AI Model Designed to be Customized》,2026 年 8 月 18 日 — https://blog.bytebytego.com/p/the-new-american-ai-model-designed — 检索于 2026-08-23
- Thinking Machines Lab,《Inkling: Our Open-Weights Model》(经 ByteByteGo 引用)
- Thinking Machines Lab,《Inkling Model Card》(经 ByteByteGo 引用)
- vLLM Recipes,《thinkingmachines/Inkling》集成说明(经 ByteByteGo 引用)
- Wang et al.,《Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts》(经 ByteByteGo 引用)
- Shaw et al.,《Self-Attention with Relative Position Representations》(经 ByteByteGo 引用)
阅读 Honest Architect 关于 Theorem 3、Oracle 和 the-space-is-the-router 模式的内容。Everythink 处于生产状态;这里的平行是结构性的,并被如此标记。

从信号预测是机制,不是直觉断言
GRIN 关于 AI 在网红营销中的指南读作六种机制形式:从信号预测、自动化、异常检测、预测、人类判断不可约、有范围自动化。Theorem 3 应用于每一种。
→ →
Persistent memory is the mechanism, not the context window
Five architectural patterns for AI agent memory, read as Theorem 3: the property (learning, personalization) is guaranteed by the mechanism (persist, retrieve, inject), not by the context window. Checkpointing is not exactly-once, secrets are not semantic memory, storage-layer isolation fails closed.
→ →
Neurosymbolic search wins on mechanism, not catalog volume
Onton's Ontology 1 neurosymbolic search model read as Theorem 3: relevance on intent-heavy queries is guaranteed by the mechanism (inspectable knowledge graph decomposing vague predicates into checkable properties), not by catalog volume. The benchmark methodology is honest (released code+data, 3 judges, bootstrap CI, Krippendorff alpha 0.465 named). The 2.7x headline is not the aggregate number. Failure cases named.
→ →