Productos
Soluciones
Empresa
Empresas
Iniciar sesiónCrea tu red
ai · architecture · mechanism · theorem-3 · customization · mixture-of-experts · inkling · honest-architect

La personalización es la separación de mecanismos, no los pesos abiertos

Inkling está diseñado para ser personalizado no por su licencia Apache 2.0 sino porque cada decisión arquitectónica aísla una propiedad medible detrás de su propio mecanismo. El balanceo basado en sesgo es la instancia más pura de Theorem 3: una propiedad garantizada por un mecanismo que no compite con el objetivo principal.

La personalización es la separación de mecanismos, no los pesos abiertos

Thinking Machines lanzó Inkling el 15 de julio de 2026, y el lenguaje del lanzamiento lo llama un modelo «diseñado para ser personalizado». Los pesos están en Hugging Face bajo licencia Apache 2.0, y la lectura fácil es que la personalización es lo que te da la licencia. Esa lectura es incorrecta. Los pesos abiertos son una decisión de lanzamiento. La garantía de personalización es estructural: cada decisión arquitectónica del modelo aísla una propiedad medible detrás de su propio mecanismo, y cada mecanismo es independientemente medible y ajustable. Reentrena uno sin arrastrar a los demás. Eso es lo que significa «diseñado para ser personalizado» cuando tomas el mecanismo en serio, y es la misma forma que un sistema donde cada puerto responde a una pregunta diferente.

Esta es la lectura del Honest Architect sobre Inkling, basada en el anuncio de lanzamiento, la tarjeta del modelo y las notas de integración publicadas por el proyecto vLLM (ByteByteGo, «The New American AI Model Designed to be Customized», 18 de agosto de 2026; recuperado 2026-08-23). La tesis aquí no es que Everythink envíe un LLM. No lo envía. La tesis es que el patrón de diseño es reconocible: una propiedad está garantizada exactamente cuando su mecanismo está implementado y midiendo, y un sistema es personalizable exactamente cuando cada propiedad tiene su propio mecanismo que no compite con los demás.

Mecanismo 1 — La dispersión separa el almacenamiento del cómputo

La primera decisión es la que hace que el resto sea asequible. Inkling almacena 975 mil millones de parámetros y ejecuta aproximadamente 41 mil millones por token, roughly el 4 por ciento del modelo activo a la vez. El mecanismo es Mixture of Experts: cada capa contiene 256 expertos, el router elige seis por token, más dos expertos compartidos que se ejecutan en cada token. La propiedad es «un modelo tan grande es asequible de ejecutar». El mecanismo es «reemplaza la red feed-forward única con 256 pequeñas y ejecuta solo seis». La medición es la proporción: 975 mil millones almacenados, 41 mil millones activos. ✅

El trade-off es honesto y declarado. El checkpoint de precisión completa necesita al menos 2 TB de memoria GPU combinada (ocho tarjetas NVIDIA B300 o dieciséis H200). El checkpoint cuantizado necesita alrededor de 600 GB y cabe en cuatro tarjetas B300. La dispersión separa el almacenamiento del cómputo, pero no elimina el piso de almacenamiento. El requisito de hardware sigue siendo alto aunque cada token sea barato. Un mecanismo que garantiza una propiedad no garantiza también propiedades para las que no fue construido.

Mecanismo 2 — El sesgo balancea los expertos sin competir con el objetivo

Esta es la instancia más pura de la tesis en toda la arquitectura. La propiedad es «el uso de expertos se mantiene equilibrado durante el entrenamiento». El mecanismo ingenuo es una penalización de balance añadida al objetivo de entrenamiento, que crece cuando el uso es desigual. El problema es que el gradiente de predicción y el gradiente de balance apuntan en direcciones diferentes, y uno de los dos gana. Pon la penalización alta y la calidad del texto degrada. Ponla baja y los expertos colapsan de todos modos.

Thinking Machines usa el método auxiliary-loss-free introducido por Wang y colegas y adoptado por DeepSeek. Cada experto tiene un valor de sesgo, un número pequeño añadido a la puntuación de selección de ese experto. El sesgo de un experto sobrecargado desciende, su puntuación de selección cae por debajo de la de un vecín más tranquilo, y el vecino toma el puesto. El sesgo afecta solo la selección. Nunca toca la ponderación de las salidas de los expertos seleccionados, y se actualiza por una regla de conteo simple que se ejecuta completamente fuera de backpropagation. El objetivo principal de entrenamiento no recibe ningún gradiente competidor. La propiedad «uso equilibrado» está garantizada por un mecanismo que no lucha contra la propiedad «predecir bien el siguiente token». ✅

Esto es Theorem 3 en su forma más limpia. La propiedad está garantizada exactamente cuando su mecanismo está implementado y midiendo. El mecanismo es el sesgo. La medición es la regla de conteo. El mecanismo no compite con el objetivo principal porque fue diseñado para no hacerlo. Soberanía por construcción, no por penalización.

Mecanismo 3 — La división 5:1 de atención hace accesible un millón de tokens

El costo de atención crece con el cuadrado de la longitud de la secuencia. Un millón de tokens produce aproximadamente un billón de comparaciones por capa, y 66 capas de eso está más allá de cualquier hardware razonable. La propiedad es «una ventana de contexto de un millón de tokens». El mecanismo es una proporción 5:1 de capas de ventana deslizante a capas de atención completa: 55 capas de ventana deslizante y 11 capas de atención completa. Una capa de ventana deslizante restringe cada token a una ventana fija de tokens recientes, así que su costo crece linealmente, no cuadráticamente. La información de largo alcance viaja a través de las once capas completas, refrescada aproximadamente una vez cada seis capas. ✅

La medición es la proporción y el conteo de capas: 55 a 11. Un hecho en el token 200 que importa en el token 900,000 viaja hacia adelante a través de las capas de atención completa y se transporta en las representaciones locales entre ellas. El trade-off es honesto: los modelos de contexto largo a menudo manejan bien el contenido general de un documento grande pero aún pueden perder un detalle específico enterrado en el medio. El mecanismo hace la ventana asequible; no garantiza record de cada detalle enterrado.

Mecanismo 4 — La codificación de posición relativa elimina la extrapolación

Casi todos los modelos abiertos recientes usan Rotary Position Embedding, donde el query y el key de cada token se rotan por un ángulo proporcional a su posición. El ángulo solo se encuentra en posiciones en las que el modelo entrenó. Pregunta por la posición 900,000 y el ángulo cae fuera de cualquier cosa que el modelo haya experimentado. Toda una familia de técnicas existe para estirar RoPE hacia rangos más allá de sus datos de entrenamiento.

Inkling usa un esquema relativo al estilo de Shaw y colegas. En lugar de codificar dónde se sienta cada token, aprende un valor para cada distancia entre dos tokens y añade ese valor a la puntuación de comparación. Tokens a 4 de distancia son tokens a 4 de distancia dondequiera que ocurran. Las distancias más allá de un corte comparten un único valor aprendido, así que un par a 900,000 tokens de distancia usa un valor que el modelo ha visto innumerables veces durante el entrenamiento. Nada tiene que ser extrapolado. ✅

La medición es la distancia, no la posición. La propiedad es «maneja longitudes que el modelo nunca entrenó», y el mecanismo es «codifica la distancia, no la posición absoluta, así que las longitudes no entrenadas colapsan a una distancia entrenada». El trade-off es que cada framework de serving tuvo que escribir código nuevo para esto, porque el tooling circundante se construyó alrededor de RoPE. Un mecanismo que garantiza una propiedad puede costarte el ecosistema que creció alrededor del mecanismo antiguo.

Mecanismo 5 — Multimodalidad sin codificador, entrenada desde cero

La mayoría de los modelos multimodales adjuntan tres componentes entrenados: un codificador de visión, un codificador de audio y capas de proyección, cada uno preentrenado por separado. Inkling acepta imágenes y audio sin un codificador preentrenado por separado. El sonido llega como un mel spectrogram, una cuadrícula de valores de loudness a través de bandas de frecuencia y slices de tiempo. El método dMel redondea cada valor de loudness a uno de un conjunto fijo de niveles. Esa es toda la conversión. Redondear números no requiere entrenamiento. Las imágenes se cortan en parches de 40 por 40 píxeles, cada uno pasando por un hMLP stem de cuatro etapas que añade menos del uno por ciento al cómputo. Ambos pasan luego por una capa de conversión ligera y se unen a los tokens de texto en una única secuencia, procesados por las mismas 66 capas. ✅

La propiedad es «imágenes y audio entran al modelo sin un codificador preentrenado por separado». El mecanismo es «redondea el audio, parchea la imagen, mezcla localmente y entrena todo desde cero junto». La medición es el sobrecosto de cómputo de menos del uno por ciento. El trade-off es la confusión de etiquetas: el lanzamiento lo llama encoder-free mientras que la tarjeta del modelo describe un hierarchical patch encoder. Ambos son precisos. Encoder-free significa ninguna red grande preentrenada por separado, no ningún procesamiento en absoluto.

Mecanismo 6 — El esfuerzo como ajuste entrenado convierte el benchmark en una curva

Los modelos de razonamiento producen working-out antes de la respuesta final, y ese working-out cuesta tokens. Effort es un número entre 0 y 1, y fue entrenado en el modelo durante reinforcement learning en lugar de ser solicitado mediante redacción. Durante RL, Thinking Machines varió el mensaje de esfuerzo entre intentos mientras ajustaba el costo cobrado por token: los intentos de high effort podían producir working-out extenso sin mucha penalización, los de low effort eran penalizados fuertemente por cada token así que las respuestas cortas puntúan mejor. La conexión entre el mensaje y la longitud rentable se aprendió. ✅

La medición es la curva de puntuación contra tokens generados. En Terminal Bench 2.1, Inkling alcanza la misma puntuación que Nemotron 3 Ultra de NVIDIA mientras produce aproximadamente un tercio de los tokens. La propiedad es «la profundidad de razonamiento es ajustable por llamada», y el mecanismo es «entrena la respuesta a un mensaje de esfuerzo variando el costo por token entre intentos de RL». El trade-off es que un esfuerzo mayor fomenta más razonamiento sin garantizar una respuesta más larga o mejor en cualquier muestra individual. Un número de benchmark es ahora un punto en una curva, no una propiedad fija del modelo.

Cómo se ve esto desde un stack diferente

Everythink no envía un LLM. Los paralelos de abajo son estructurales, no claims de producto, y están tagged Partial porque la analogía es el punto, no un claim de que Everythink hace el mismo trabajo.

El sesgo que balancea sin competir es la misma forma que el único sitio de normalización del Oracle. Las probabilidades se normalizan en exactamente un lugar en everythink-oracle, y los consumidores pueden confiar en que la suma sea aproximadamente uno. La propiedad está garantizada por un mecanismo que no compite con el merge. ⚠️

La división de atención 5:1, donde la mayoría de las capas ven poco y unas pocas transportan el largo alcance, es la misma forma que «the space is the router». Network, community y room rutear antes de que algo responda, y la mayoría de las peticiones se resuelven localmente mientras unas pocas viajan el camino largo. El mecanismo es la topología, y la medición es dónde se resuelve la petición. ⚠️

La codificación de posición relativa, donde una distancia reencontrada usa un valor que el modelo ha visto innumerables veces, es la misma forma que los ids uuidv5 deterministas de World Monitor. La reingesta actualiza, nunca duplica, porque el id es determinista desde la fuente y el native id. La propiedad es «sin duplicados en la reingesta», y el mecanismo es el origen determinista. ⚠️

La multimodalidad sin codificador, donde cada modalidad entra por su propio mecanismo barato y se une a la misma secuencia, es la misma forma que los puertos hexagonales basados en traits. Cada puerto responde a una pregunta diferente, y los repositorios de AppState son Arc para que los tests intercambien mocks. La propiedad es «depender del trait, no del adapter concreto», y el mecanismo es el límite del trait. ⚠️

El esfuerzo como ajuste entrenado, donde un benchmark se convierte en un punto en una curva, es la misma forma que las personalidades tipadas de las Sisters. El analyst, contrarian, disruptor, historian e institutionalist están tipados, y la prompt version se estampa en cada ejecución para reproducibilidad. La propiedad es «razonamiento tipado reproducible», y el mecanismo es la personalidad más el sello de versión. ⚠️

El sesgo que balancea sin rendir el objetivo principal es la misma forma que la soberanía del Eye Key. El plaintext del Eye Key nunca toca disco. Solo el HMAC y la huella van a Postgres. La propiedad es «soberanía sobre la key», y el mecanismo es la construcción, no una penalización aplicada después de los hechos. ⚠️

Límites de alcance y Roadmap

Este post trata sobre arquitectura de modelos de IA, lo cual es alcance comercial e industrial. Los paralelos de Everythink de arriba son Partial porque Everythink no envía un LLM; la analogía estructural es el claim, no un claim de producto. El Eye Key es un mecanismo de soberanía del API para desarrolladores, Production, y no es un vehículo de inversión. HAI Engine está en producción desde 2016. The 21 papers son Production. World Monitor es Production. El Oracle es Production. Las Sisters son Production. No se promete aquí ningún resultado de token, wallet o community-credit; esos siguen siendo Roadmap 🔵, sujetos a revisión Howey, y nunca se promocionan silenciosamente. Theorem 3 es la convención de nombres para el claim de propiedad-cuando-mecanismo-implementado-y-midiendo; no es un término legal.

Dos cosas que la mayoría de la cobertura omitió

Primero, el sesgo se actualiza completamente fuera de backpropagation. La mayoría de la cobertura describe el método auxiliary-loss-free como «sin auxiliary loss», pero el detalle load-bearing es que la actualización del sesgo es una regla de conteo, no un gradiente. El mecanismo no es «quita el loss». Es «quita el gradiente y reemplázalo con un contador». Esa es la diferencia entre una penalización que ajustas y un mecanismo que implementas.

Segundo, el ajuste de esfuerzo llega como texto. Antes de que comience la conversación, un system message indicando el nivel de esfuerzo se inserta antes de todo lo demás. El modelo fue entrenado para responder a ese mensaje. El knob de personalización no es un parámetro que pones en código. Es una oración que el modelo aprendió a obedecer. Ese es un mecanismo de boundary-parsing, y significa que el ajuste de esfuerzo es portable a cualquier cliente que pueda enviar un system message, incluyendo uno que valide sus entradas en el network boundary.

FAQ

¿Pesos abiertos es lo mismo que personalizable? No. Pesos abiertos significan que puedes descargar y reentrenar. Personalizable significa que la arquitectura expone mecanismos independientes y medibles así reentrenar uno no arrastra a los demás. Inkling tiene ambos. Un modelo con pesos abiertos y arquitectura monolítica es reentrenable, no personalizable en el sentido estructural.

¿Por qué importa el sesgo más que la dispersión? La dispersión separa el almacenamiento del cómputo, que es la story de costo. El sesgo separa el balance del objetivo principal, que es la story del patrón de diseño. El sesgo es el mecanismo que prueba la tesis: una propiedad está garantizada por un mecanismo que no compite. La dispersión es el mecanismo que hace la tesis asequible.

¿Cuál es el trade-off de la codificación de posición relativa? El modelo maneja longitudes que nunca entrenó, pero cada framework de serving tuvo que escribir código nuevo para esto. El ecosistema de tooling se construyó alrededor de RoPE. Un mecanismo que garantiza una propiedad puede costarte el ecosistema que creció alrededor del mecanismo antiguo.

¿Effort garantiza una mejor respuesta? No. Un esfuerzo mayor fomenta más razonamiento sin garantizar una respuesta más larga o mejor en cualquier muestra individual. Effort y el límite máximo de tokens son ajustes separados. Un ajuste de high effort puede necesitar un límite de tokens más grande para evitar ser cortado. El benchmark es una curva, y una muestra individual es un punto en ella.

¿Puede Everythink usar Inkling? Los paralelos de Everythink en este post son estructurales. Everythink no envía un LLM. Los proveedores de LLM que Everythink usa son OpenAI-compatible. La analogía es al patrón de diseño, no a una integración de producto.

Sources

  • ByteByteGo, «The New American AI Model Designed to be Customized», 18 de agosto de 2026 — https://blog.bytebytego.com/p/the-new-american-ai-model-designed — recuperado 2026-08-23
  • Thinking Machines Lab, «Inkling: Our Open-Weights Model» (referenciado vía ByteByteGo)
  • Thinking Machines Lab, «Inkling Model Card» (referenciado vía ByteByteGo)
  • vLLM Recipes, «thinkingmachines/Inkling» notas de integración (referenciado vía ByteByteGo)
  • Wang et al., «Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts» (referenciado vía ByteByteGo)
  • Shaw et al., «Self-Attention with Relative Position Representations» (referenciado vía ByteByteGo)

Lee al Honest Architect sobre Theorem 3, el Oracle y el patrón the-space-is-the-router. Everythink está en producción; los paralelos aquí son estructurales y tagged como tales.

Relacionado
ai-agents · memory-architecture · theorem-3 · mechanism · honest-architect

La memoria persistente es el mecanismo, no la ventana de contexto

Cinco patrones arquitectónicos para la memoria de agentes de IA, leídos como Theorem 3: la propiedad (aprendizaje, personalización) está garantizada por el mecanismo (persistir, recuperar, inyectar), no por la ventana de contexto. El checkpointing no es exactly-once, los secretos no son memoria semántica, el aislamiento en la capa de almacenamiento falla cerrado.

neurosymbolic · search · theorem-3 · mechanism · honest-architect

Búsqueda neurosymbolic: mecanismo, no volumen de catálogo

El modelo de búsqueda neurosymbolic Ontology 1 de Onton leído como Teorema 3: la relevancia en consultas con mucha intención es garantizada por el mecanismo (grafo de conocimiento inspeccionable que descompone predicados vagos en propiedades verificables), no por el volumen de catálogo. La metodología del benchmark es honesta (código+datos liberados, 3 jueces, bootstrap CI, alfa de Krippendorff 0,465 nombrado). El titular 2.7x no es el número agregado. Casos de fallo nombrados.

Construye tu mundo sobre un motor que demuestra lo que afirma.

Crea tu propia red en el motor que funciona desde 2016 — o habla con el equipo detrás de los 21 artículos.