Productos
Soluciones
Empresa
Empresas
Iniciar sesiónCrea tu red
AI · Forecasting · Calibration · Open Weights · MoE

La calibración es el mecanismo, no el recuento de parámetros

Inkling-Small supera a su maestro de 975B en razonamiento y regresa en recuperación factual. La lectura honesta es el mecanismo, no el recuento de parámetros.

Un modelo de 276B que supera a su maestro de 975B en razonamiento y pierde contra él en recuperación factual no es un «mejor modelo». Es un mecanismo distinto. Thinking Machines Lab publicó Inkling-Small el 2 de agosto de 2026: 276B de parámetros totales, 12B activos, pesos abiertos bajo Apache 2.0, entrada nativa de texto, imagen y audio, y contexto de 1M de tokens. El modelo obtiene 31,6 por ciento en Humanity's Last Exam frente al 29,7 del maestro, y 20,6 por ciento en SimpleQA Verified frente al 43,9 del maestro. La lectura honesta no es «más pequeño es mejor». La lectura honesta es: ¿qué mecanismo reforzó el entrenamiento, y está ese mecanismo implementado y midiendo?

El titular fácil es «un MoE de pesos abiertos iguala a la frontera a la cuarta parte del tamaño». Ese titular es defendible pero oculta el dato determinante. El dato determinante es que Inkling-Small fue entrenado con aprendizaje por refuerzo contra reglas de puntuación apropiadas sobre un corpus de preguntas reales de pronóstico, y su índice Brier en ForecastBench es 61,3 frente al 60,1 del maestro. Ese es el número que conecta este lanzamiento con el trabajo de Everythink. El mecanismo de calibración es la tesis.

El lanzamiento, en un párrafo

Inkling-Small es un transformador decoder-only de 42 capas con una columna vertebral feed-forward Mixture-of-Experts dispersa. Cada token se enruta a 6 de 256 expertos más 2 expertos compartidos, así que 8 de 258 expertos se activan por token. El modelo no tiene codificador y es multimodal de forma nativa: las imágenes entran como parches de 40x40 píxeles a través de una hMLP de cuatro capas, el audio entra como espectrogramas dMel, ambos pasan por una capa de incrustación ligera y se unen al flujo de tokens de texto. La ventana de contexto es de 1M de tokens. El esfuerzo de razonamiento es ajustable. Los pesos se publican bajo Apache 2.0 en Hugging Face. El checkpoint BF16 necesita 600 GB de VRAM agregada (4x B300 u 8x H200); el checkpoint NVFP4 reduce ese piso a 180 GB y ejecuta W4A4 en una sola B300. Según la cobertura de Marktechpost y la ficha del modelo de Thinking Machines Lab, los runtimes soportados son SGLang, vLLM, TokenSpeed, Unsloth y Hugging Face.

Mecanismo 1: el recuento de parámetros activos es el mecanismo de coste, no el total ✅

La propiedad «el modelo es asequible de servir» está garantizada por el mecanismo de enrutamiento disperso, no por el recuento total de parámetros. Un modelo denso de 276B necesitaría 276B de cómputo por token. Inkling-Small necesita 12B. El recuento total de parámetros es el coste de memoria (almacenas los 276B). El recuento de parámetros activos es el coste de cómputo (multiplicas 12B por token). MoE desacopla ambos. Ese es el dato arquitectónico determinante, y es la razón por la que un modelo de 276B corre en una sola B300 alquilada en lugar de en un clúster de laboratorio frontera.

Theorem 3 lo lee con claridad: la propiedad «inferencia asequible» está garantizada por el mecanismo «enrutamiento disperso que activa 8 de 258 expertos por token», y la medición es el recuento de parámetros activos (12B) y el piso de VRAM (180 GB en NVFP4). Una propiedad sin mecanismo es una afirmación («es pequeño»). Una propiedad con un mecanismo que está midiendo es una garantía («12B activos, 180 GB VRAM»). Production ✅ — el checkpoint es público y los requisitos de hardware están especificados.

[UNIQUE INSIGHT] La distinción total-frente-a-activo es la misma distinción que Everythink traza entre la red y la sala. La red es el total (toda organización, comunidad y sala que existe). El contexto activo es la sala en la que estás. The space is the router: de red a comunidad a sala se enruta una petición a la fracción de 12B relevante antes de que algo responda. El enrutamiento MoE y el enrutamiento de Everythink son el mismo patrón a escalas distintas — activación dispersa sobre un espacio almacenado grande.

Mecanismo 2: la calibración entrenada contra reglas de puntuación apropiadas es Theorem 3 en miniatura ✅

Este es el mecanismo determinante para Everythink. La ficha del modelo indica que la calibración fue entrenada con RL contra reglas de puntuación apropiadas sobre un corpus amplio de preguntas reales de pronóstico. ForecastBench sin búsqueda da un índice Brier de 61,3 más o menos 0,46, por delante del 60,1 más o menos 0,54 de Inkling. El índice Brier es una regla de puntuación apropiada: se minimiza en expectativa únicamente reportando tus creencias verdaderas. Entrenar contra ella enseña al modelo a reportar probabilidades calibradas, no confiadas.

Theorem 3 dice que una propiedad está garantizada exactamente cuando su mecanismo está implementado y midiendo. La propiedad es «los pronósticos probabilísticos del modelo están calibrados». El mecanismo es RL contra una regla de puntuación apropiada. La medición es el índice Brier en un corpus de pronóstico reservado. Los tres están nombrados. Eso es una garantía, no una afirmación. Production ✅.

Esto es lo que hace el Oracle de Everythink. Las Sisters generan futuros candidatos; el Oracle los fusiona en un ensamble calibrado con entropía en cada fusión. Las probabilidades se normalizan en un solo lugar. El Oracle no toma la confianza de las Sisters al pie de la letra; las puntúa. El entrenamiento de Inkling-Small hace lo mismo: no toma los logits crudos del modelo al pie de la letra; los puntúa contra una regla que castiga tanto la sobrefianza como la subfianza. El mecanismo es la regla de puntuación. La garantía es la calibración. [PERSONAL EXPERIENCE] En nuestro propio trabajo hemos visto que un ensamble de pronóstico sin una regla de puntuación apropiada deriva hacia la Sister más ruidosa. La regla de puntuación es lo que mantiene al ensamble honesto. El pipeline de entrenamiento de Inkling-Small implementa esa disciplina a nivel de modelo.

Mecanismo 3: la regresión en SimpleQA es la honestidad, no el fracaso

El modelo supera a su maestro en HLE (31,6 frente a 29,7), SWE-bench Verified (80,2 frente a 77,6), Terminal-Bench 2.1 (64,7), Toolathlon Verified (54,4 frente a 45,5) y ARC-AGI-2 (40,1 frente a 36,5). Pierde en SimpleQA Verified (20,6 frente a 43,9), AA Omniscience (-9,0 frente a 2,1) y Tau 3 Banking (15,5 frente a 23,7). La lectura honesta no es «el modelo es mejor». La lectura honesta es: el entrenamiento reforzó el razonamiento y la programación agéntica, y la recuperación factual regresó como consecuencia. El mecanismo (dos semanas de RL de programación agéntica, destilación on-policy desde el maestro) intercambió una propiedad por otra.

Theorem 3 califica esto con precisión. La propiedad «razonamiento fuerte» está garantizada por el mecanismo «RL de programación agéntica con un harness solo bash» y medida por SWE-bench Verified. La propiedad «recuperación factual amplia» está garantizada por un mecanismo distinto (amplitud de datos de pre-entrenamiento) y medida por SimpleQA. El segundo mecanismo no fue reforzado en la fase de post-entrenamiento, y la regresión es la evidencia. Un modelo que fuera mejor en todo sería un modelo sin contrapartidas de mecanismo. Ese modelo no existe. Inkling-Small nombra sus contrapartidas en su tabla de benchmarks. Esa es la tarjeta de puntuación honesta.

[ORIGINAL DATA] La brecha entre SimpleQA (20,6) y SWE-bench Verified (80,2) es de 59,6 puntos porcentuales. Esa dispersión es la contrapartida hecha visible. Un modelo comercializado por su puntuación en SWE-bench sin su puntuación en SimpleQA es un modelo que oculta su mecanismo. Thinking Machines Lab publica ambos. Ese es el estándar que Everythink se exige a sí mismo: la previsión de las Sisters se publica con entropía en cada fusión, no solo la probabilidad titular.

Mecanismo 4: los pesos abiertos bajo Apache 2.0 son el mecanismo de soberanía ✅

La propiedad «tú eres dueño del modelo» está garantizada por el mecanismo de pesos abiertos bajo una licencia permisiva, no por los términos de la API de un proveedor. Apache 2.0 significa que puedes ejecutar los pesos, modificarlos, afinarlos y servirlos de forma privada. El checkpoint NVFP4 corriendo en una sola B300 a 180 GB significa que un sector regulado — servicios financieros, salud, seguros, telecom, sector público — puede correr un modelo de 276B en su propio hardware, detrás de su propio firewall, sin que los datos salgan del recinto. Eso es soberanía del cliente en la capa del modelo.

Theorem 3: la propiedad «inferencia privada» está garantizada por el mecanismo «pesos abiertos más un checkpoint cuantizado que cabe en hardware desplegable» y medida por el piso de 180 GB de VRAM. Production ✅ — el checkpoint está en Hugging Face y los requisitos de hardware están publicados.

La afirmación de Everythink es la soberanía del cliente: tu red, tu marca, tus datos. Los pesos abiertos son la versión en la capa del modelo de esa afirmación. Una API alojada por un proveedor es un arreglo de arrendatario; los pesos abiertos en tu hardware son propiedad. El módulo Whitelabel Network de Everythink es la versión en la capa de plataforma: tú operas la red bajo tu marca, no la nuestra. Production ✅.

Mecanismo 5: la multimodalidad nativa es el mecanismo de inclusión ✅

La propiedad «el modelo lee el mundo tal como llega» está garantizada por el mecanismo de entrada multimodal nativa, no añadiendo codificadores de visión y audio por separado. Inkling-Small no tiene codificador: las imágenes entran como parches a través de una hMLP de cuatro capas, el audio entra como espectrogramas dMel, ambos se unen al flujo de tokens de texto a través de una capa de incrustación ligera. MMMU Pro es 74,0, CharXiv RQ es 77,4 (81,3 con recorte-zoom-inspección en Python), Audio MC es 54,9, MMAU es 77,0, VoiceBench es 90,1. El modelo lee texto, imágenes y audio en una sola pasada. Un modelo solo de texto excluye a cualquiera cuya entrada llegue como imagen o nota de voz; un modelo multimodal nativo los incluye. El principio de Everythink de inclusión por diseño — multilingüe, multimodal, baja conectividad — es el mismo patrón. La pasarela de World Monitor ingiere vuelos, buques, sismos, incendios y clima como geo-signales nativas, no como descripciones de texto. Production ✅.

Mecanismo 6: el mecanismo de seguridad es por capas, no monolítico ✅

La propiedad «el modelo rechaza peticiones dañinas» está garantizada por el mecanismo de entrenamiento de seguridad más moderación aguas abajo, no por el entrenamiento de seguridad solo. StrongREJECT es 98,4 por ciento, FORTRESS adversarial es 71,6 por ciento, FORTRESS benign es 96,9 por ciento. Thinking Machines Lab recomienda añadir Llama Guard en despliegues orientados al consumidor. Eso es una afirmación de seguridad por capas: el modelo base está entrenado para seguridad, y el despliegue añade un segundo filtro. Theorem 3 califica esto como dos mecanismos — la base medida por StrongREJECT y FORTRESS, el despliegue medido por la capa aguas abajo. Production ✅ para el modelo base; la capa aguas abajo es responsabilidad de quien despliega. La ética de alcance de Everythink — uso civil y defensivo únicamente — es el mismo patrón por capas.

El paralelo de Everythink, y dónde es Partial

El Oracle, la fusión de pronósticos de Everythink, toma los futuros candidatos de las Sisters y devuelve un ensamble calibrado con entropía en cada fusión. El entrenamiento de calibración de Inkling-Small toma los logits crudos del modelo y devuelve una probabilidad calibrada contra una regla de puntuación apropiada. El paralelo es real y Production ✅: ambos puntúan, ambos calibran, ambos miden. El Oracle fusiona múltiples agentes; el modelo calibra un agente. Partial ⚠️ — el mecanismo es el mismo (regla de puntuación apropiada), el alcance es distinto (ensamble frente a modelo único).

Las Sisters son personalidades tipadas: analista, contrarian, disruptor, historiador, institucionalista. La columna MoE de Inkling-Small tiene 256 expertos, cada uno especializado. El paralelo es real: la tipificación es el mecanismo que produce salidas diversas. Las Sisters tipifican el estilo de razonamiento; los expertos tipifican el cómputo a nivel de token. Partial ⚠️ — ambos son sistemas dispersos tipados, pero a niveles distintos. El HAI Engine está en producción desde 2016. Los 21 papers que fundamentan la teoría de pronóstico de Everythink son el análogo de la tabla de benchmarks de la ficha del modelo: ambos publican el mecanismo y la medición, no solo el titular. Production ✅.

El alcance de Everythink aquí es comercial y civil: pronóstico, probabilidad calibrada, infraestructura de plataforma. Everythink no promete resultados de token, wallet ni community-credit. Wallet & Token, Super App y Community Credit siguen siendo Roadmap 🔵, pre-revenue, sujetos a revisión Howey. Sin asesoramiento de inversión. Sin métricas fabricadas. Los números de benchmark son de Thinking Machines Lab, publicados en la ficha del modelo y resumidos por Marktechpost el 2 de agosto de 2026.

El mecanismo, reexpresado

Theorem 3: una propiedad está garantizada exactamente cuando su mecanismo está implementado y midiendo. La propiedad en este lanzamiento es «pronósticos probabilísticos calibrados de un modelo asequible de pesos abiertos». El mecanismo es RL contra reglas de puntuación apropiadas más enrutamiento MoE disperso. La medición es el índice Brier (61,3) y el recuento de parámetros activos (12B). La regresión en SimpleQA (20,6) es el coste honesto del mecanismo que produjo la ganancia en razonamiento. Un modelo que fuera mejor en todo no tendría contrapartidas de mecanismo. Ese modelo no existe. Inkling-Small publica sus contrapartidas. Ese es el estándar.

Puntos clave

  • Inkling-Small es un modelo MoE de 276B totales / 12B activos bajo Apache 2.0, publicado el 2 de agosto de 2026. El recuento de parámetros activos (12B) es el mecanismo de coste; el total (276B) es el coste de memoria.
  • La calibración se entrenó con RL contra reglas de puntuación apropiadas. El índice Brier en ForecastBench de 61,3 supera al 60,1 del maestro de 975B. Eso es Theorem 3 en miniatura: la propiedad (calibración) está garantizada por el mecanismo (regla de puntuación apropiada) y medida (índice Brier).
  • El modelo supera a su maestro en razonamiento (HLE 31,6 frente a 29,7, SWE-bench Verified 80,2 frente a 77,6) y regresa en recuperación factual (SimpleQA 20,6 frente a 43,9). La contrapartida es el mecanismo, no un fracaso.
  • El checkpoint NVFP4 corre en una sola B300 a 180 GB de VRAM. Los pesos abiertos bajo Apache 2.0 son el mecanismo de soberanía: tú eres dueño del modelo, tú lo ejecutas de forma privada.
  • La entrada multimodal nativa (texto, imagen, audio) es el mecanismo de inclusión. El modelo lee el mundo tal como llega, no solo como texto.

Preguntas frecuentes

¿Por qué el recuento de parámetros activos es más importante que el total? El recuento total de parámetros (276B) es la memoria que almacenas. El recuento de parámetros activos (12B) es el cómputo que gastas por token. El enrutamiento MoE desacopla ambos: obtienes la capacidad de un modelo de 276B al coste de cómputo de un modelo de 12B. El coste de servir el modelo lo determina el recuento activo, no el total.

¿Qué nos dice la regresión en SimpleQA? Nos dice que el entrenamiento reforzó el razonamiento y la programación agéntica, no la recuperación factual. SimpleQA mide conocimiento factual amplio; SWE-bench Verified mide agencia de programación. El modelo mejoró en lo segundo y regresó en lo primero. Un modelo que fuera mejor en todo no tendría contrapartidas de mecanismo. Ese modelo no existe. La regresión es el coste honesto de la ganancia.

¿Cómo conecta el entrenamiento de calibración con el Oracle de Everythink? Ambos usan reglas de puntuación apropiadas. Inkling-Small fue entrenado con RL contra reglas de puntuación apropiadas sobre preguntas reales de pronóstico. El Oracle fusiona los futuros candidatos de las Sisters en un ensamble calibrado con entropía en cada fusión. El mecanismo es el mismo: puntúa el pronóstico, no la confianza. El índice Brier es la vara de medir en ambos casos.

¿Un modelo de 276B en una sola GPU es realmente desplegable? Sí, en el checkpoint NVFP4. El checkpoint BF16 necesita 600 GB de VRAM agregada (4x B300 u 8x H200). El checkpoint NVFP4 reduce ese piso a 180 GB y ejecuta W4A4 en una sola B300. Ese es el mecanismo que saca un modelo de 276B del territorio de laboratorio frontera y lo lleva al territorio de startups y sectores regulados.

¿Cuál es la tarjeta de puntuación honesta de este lanzamiento? El modelo nombra su mecanismo (MoE disperso, RL contra reglas de puntuación apropiadas, RL de programación agéntica), su medición (índice Brier, SWE-bench, SimpleQA, HLE) y sus contrapartidas (razonamiento arriba, recuperación factual abajo). Theorem 3 califica eso como una garantía, no una afirmación. La tabla de benchmarks publica tanto ganancias como regresiones. Ese es el estándar que Everythink se exige.

Si este enfoque te resulta útil, el análisis más extenso de cómo Everythink aplica la misma disciplina de calibración a su propia plataforma — el HAI Engine en producción desde 2016, el ensamble del Oracle con entropía en cada fusión, los 21 papers — está en el sitio de Everythink.

Sources

Marktechpost, «Thinking Machines Lab Releases Inkling-Small: A 276B Total, 12B Active Open Weights Multimodal MoE Model», publicado el 2 de agosto de 2026. Consultado el 2026-08-23. https://www.marktechpost.com/2026/08/02/thinking-machines-lab-releases-inkling-small-276b-open-weights-multimodal-moe-model/

Construye tu mundo sobre un motor que demuestra lo que afirma.

Crea tu propia red en el motor que funciona desde 2016 — o habla con el equipo detrás de los 21 artículos.