Productos
Soluciones
Empresa
Empresas
Iniciar sesiónCrea tu red
AI safety · cybersecurity · risk governance · Bayesian networks · Theorem 3

Los umbrales de riesgo necesitan un mecanismo de medición, no un corte

Un informe de Berkeley sostiene que los umbrales de ciberriesgo por IA fallan por ser cortes de capacidad. La solución es una red bayesiana que mide el daño continuamente — justo lo que exige Theorem 3.

Los umbrales de riesgo necesitan un mecanismo de medición, no un corte

Un informe del Center for Long-Term Cybersecurity de UC Berkeley sostiene que los umbrales de ciberriesgo por IA tomados de los marcos de seguridad de los laboratorios frontera (OpenAI, Anthropic, DeepMind, Meta) fallan porque se basan en capacidades, son vagos y están desligados del daño real. Los autores proponen redes bayesianas que convierten «¿este modelo cruza una línea?» en «¿qué probabilidad tiene de causar daño en condiciones reales?» — y ese movimiento, de un corte estático a un mecanismo medido continuamente, es justo lo que un umbral defendible requiere.

El umbral no es una línea que se cruza; es una medición que se mantiene

Los marcos de seguridad de IA frontera convergen en un puñado de «elementos de umbral» — automatización de ataques de varias etapas, descubrimiento de zero-days, habilitación de atacantes poco cualificados — y luego adjuntan benchmarks de capacidad a cada uno. La crítica central del informe de Berkeley es que esos cortes son deterministas en un sistema fundamentalmente probabilista. Un modelo que «puede» descubrir un zero-day en un benchmark no causa daño por ese hecho; la misma capacidad es benigna o catastrófica según el acceso, la postura del defensor y la economía del atacante. Un umbral expresado como una línea de capacidad ignora cada una de esas variables mediadoras.

Es el mismo modo de fallo que nombramos con Theorem 3 en los 21 papers: una propiedad está garantizada exactamente cuando su mecanismo está implementado y midiendo. [ORIGINAL DATA] Theorem 3 (a property is guaranteed exactly when its mechanism is implemented and measuring) es decisivo aquí porque «ciberriesgo inaceptable» es una propiedad de un sistema sociotécnico, no de un modelo. Declarar un corte de capacidad no implementa la propiedad; la afirma. La propiedad — que el daño se mantenga bajo un nivel aceptado — solo existe cuando algo está produciendo continuamente la medición que te diría que se ha cruzado. Una línea que nadie mide no es un umbral; es una esperanza.

El informe replantea la pregunta de «¿este modelo cruza un umbral?» a «¿qué probabilidad tiene de causar daño en condiciones reales?». Es el replanteo correcto, y tiene una consecuencia estructural: el umbral se convierte en un estado mantenido, no en un hito superado. Instrumentas el despliegue, alimentas evidencia en un modelo probabilista y mantienes el posterior bajo el nivel aceptado — o restringes el despliegue. El corte es la salida de un mecanismo en marcha, nunca un sustituto de él.

Las capacidades no son riesgo; el contexto sí

El informe plantea la crítica de forma directa: las capacidades ≠ riesgo. La misma capacidad puede ser benigna o catastrófica según el contexto, el acceso y las defensas. Una capacidad de generación de phishing tras un perímetro de autenticación empresarial con un filtro de correo maduro es un riesgo distinto de la misma capacidad expuesta a cualquiera con un número de teléfono y un agravio. Los marcos frontera eluden esto indexando sobre la capacidad y dejando el contexto implícito.

Dos defectos más agravan el problema. Primero, el lenguaje es vago — «aumento significativo» aparece en los marcos sin una línea base, una unidad o un método. ¿«Significativo» respecto a qué, medido cómo, por quién, actualizado cuándo? Un término de umbral que no se puede poblar es un artefacto de cumplimiento, no un control. Segundo, los marcos se concentran en escenarios extremos y poco probables — explotación autónoma de extremo a extremo de un objetivo blindado — mientras omiten los desplazamientos incrementales que de verdad reconfiguran el equilibrio ataque–defensa. La deriva lenta en la economía del atacante, no el escenario cinematográfico, es donde el equilibrio se inclina.

[UNIQUE INSIGHT] La razón por la que los umbrales de capacidad omiten la deriva incremental es que son declaraciones de un momento sobre un modelo, no mediciones longitudinales sobre un sistema. Un benchmark de capacidad es una fotografía; el riesgo es un vídeo. La propuesta de Berkeley — descomponer el riesgo en variables, enlazarlas mediante dependencias probabilistas, alimentar con benchmark y red teaming y evidencia del mundo real, y actualizar a lo largo del tiempo — es, en efecto, una petición de empezar a grabar. El umbral vive entonces en la tendencia del posterior, no en una sola puntuación de benchmark.

Esto importa porque la regulación avanza hacia el mismo encuadre. El informe señala la alineación con la EU AI Act y el NIST Risk Management Framework, que piden un tratamiento del riesgo continuo y basado en evidencia en lugar de una declaración única. Un laboratorio con solo un corte de capacidad no puede responder a la pregunta que esos marcos hacen realmente: «¿Cuál es tu riesgo medido y cuál es tu mecanismo para mantenerlo bajo el nivel aceptado?»

La red bayesiana es el mecanismo de medición

La propuesta constructiva del informe son las redes bayesianas (BN): grafos probabilistas que representan relaciones entre variables — capacidad de IA, comportamiento del atacante, detección de la defensa, impacto económico — y que integran evidencia diversa y se actualizan continuamente según cambian las condiciones. A diferencia de un umbral estático, una BN permite seguir de cerca se cruza un límite de riesgo, porque el límite es una región en una distribución conjunta, no un único número en un eje.

Es la parte del informe que más conecta con cómo pensamos el mecanismo. Una BN no es una predicción en el sentido coloquial; es un instrumento de medición. Dice, dado lo que hemos observado, aquí está el posterior sobre las variables de daño, y aquí se mueve cuando metemos un nuevo resultado de red team o un nuevo informe de incidentes. El umbral es entonces una política sobre ese posterior — «el despliegue se restringe cuando P(daño significativo) supera 0.X» — y la política es aplicable porque el posterior es reproducible a partir de la evidencia y el grafo.

Tres propiedades hacen a una BN la forma correcta para este trabajo, y cada una mapea a una propiedad que buscamos en cualquier mecanismo de medición:

  • Descomposición. Un riesgo de alto nivel («la IA habilita phishing escalable») se descompone en variables medibles — dominio lingüístico de la IA, credibilidad del señuelo, tasa de detección de la defensa, susceptibilidad del objetivo. No se puede medir «riesgo de phishing» directamente; se pueden medir sus componentes. La descomposición es lo que hace el riesgo legible para la evidencia.
  • Dependencia. Las variables se enlazan mediante probabilidades condicionales, no se suman de forma independiente. El éxito del ataque depende conjuntamente de la capacidad y la defensa, no de cada una por separado. Por eso falla un umbral solo de capacidad: asume que la conjunta se puede leer de una marginal.
  • Actualización. El posterior es función de la evidencia, y la evidencia se acumula. Una BN es un instrumento longitudinal por construcción; el posterior de ayer es el a priori de hoy. Eso es lo que «monitorización dinámica» significa operativamente, no como eslogan.

El límite honesto que el propio informe nombra es que estos modelos están en una fase temprana: no hay BN validadas en el mundo real a escala, ni conjuntos de datos estandarizados para poblar las probabilidades, ni una integración de gobernanza clara — quién fija los umbrales, cómo se aplican. Cito la propia sección «What's Missing» del informe porque una lectura honesta no la tapa. Un mecanismo de medición nunca calibrado contra resultados es una hipótesis sobre una medición, no una medición aún. El mecanismo tiene la forma correcta; la base de evidencia no está construida.

Cómo el caso de phishing convierte «aumento significativo» en un número

El caso de phishing del informe (páginas 31–32) es donde la abstracción se vuelve concreta. Una red bayesiana descompone el riesgo de ingeniería social en nodos — «dominio lingüístico de la IA», «credibilidad del señuelo», «tasa de detección de la defensa», «susceptibilidad del objetivo» — que conjuntamente determinan resultados como si un empleado abre un correo malicioso. Conceptos vagos se vuelven señales cuantificables porque cada nodo es algo para lo que puedes producir evidencia: una puntuación de dominio lingüístico de un benchmark, una tasa de detección de una prueba de filtro de correo, una estimación de susceptibilidad de una campaña de simulación de phishing.

El caso hace dos cosas a la vez, y vale la pena separarlas. Primero, muestra que un término de riesgo como «aumento significativo en la eficacia del phishing» se puede descomponer en variables con unidades. Segundo, muestra que el aumento es un cambio en una distribución conjunta, no en una sola puntuación. Una mejora del 10% en dominio lingüístico no se traduce linealmente en un 10% más de correos abiertos; se traduce a través de la tasa de detección y el nodo de susceptibilidad, y la traducción es distinta en una empresa defendida que en un pequeño negocio sin defender.

Esta es la diferencia entre un benchmark de capacidad y un umbral de riesgo expresado con precisión. Un benchmark dice que el modelo mejoró en una tarea. Una BN dice cuánto movió esa mejora el posterior de daño bajo las condiciones en las que de verdad despliegas. Lo primero es necesario; lo segundo es lo que un umbral requiere. La contribución del informe es mostrar que lo segundo es construible, no solo deseable — y mostrar, con honestidad, que el trabajo de poblarlo a escala apenas ha empezado.

Qué se mapea en Everythink

Leemos este informe a través de una lente específica, y vale la pena ser explícito para que el lector pueda comprobar nuestro razonamiento en lugar de aceptarlo por fe.

[PERSONAL EXPERIENCE] El HAI Engine lleva en producción desde 2016, y la lección de nueve años operando un sistema de forecasting multiagente es que un pronóstico que no puedes actualizar es un pronóstico que no deberías publicar. Nuestras Sisters producen borradores de escenarios; el Oracle los fusiona en un conjunto calibrado cuyas probabilidades suman uno y cuya entropía se sigue en nats. Ese conjunto es un instrumento de medición, no una predicción coloquial: reproducible a partir de sus entradas, actualizado conforme se acumula evidencia, equivocado de forma trazable cuando se equivoca. La propuesta de BN de Berkeley tiene la misma forma aplicada a otro dominio — variables de daño en lugar de probabilidades de escenario, evidencia de red team en lugar de feeds de señales — pero la misma insistencia en que el número solo es fiable si el mecanismo que lo produjo es inspeccionable.

El principio estructural que compartimos es el que llamamos «the space is the router»: la topología network→community→room enruta una petición antes de que nada responda. El enrutado es un mecanismo que produce un resultado medible — qué contexto vio qué señal — y eso es lo que hace el pronóstico auditable. Un umbral sin una topología de enrutado es un número atado a un modelo; un umbral dentro de una topología de enrutado es un número atado a un camino a través de un sistema, que es el único lugar donde el daño vive de verdad. El daño es contextual, y el contexto es una topología.

Nuestras etiquetas de honestidad existen por la misma razón por la que el informe insiste en la evidencia sobre la afirmación. Donde tenemos un mecanismo en producción decimos Production ✅ — el HAI Engine, Social, Campaigns, Whitelabel Network, World Monitor, las Sisters, el Oracle. Donde el mecanismo es parcial decimos Partial ⚠️ — Matchmaking, Marketplace, Calendar. Donde es una hoja de ruta decimos Roadmap 🔵 — Wallet & Token, Super App, Community Credit — y no prometemos resultados para esos porque son pre-revenue y, para los componentes de token, están sujetos a la revisión Howey. El punto no es el glifo; el punto es que un lector puede mapear cada afirmación a un estado de madurez y exigirnoslo. Es la misma disciplina que el informe pide a los laboratorios frontera: dejar de afirmar umbrales, empezar a producir las mediciones que los justificarían.

Somos explícitos sobre el límite de alcance porque el informe también lo es. Everythink opera solo en contextos civiles y defensivos. Un mecanismo de umbral de riesgo honesto sobre la capacidad ofensiva no es una licencia para construir herramienta ofensiva; es una razón para saber dónde está la línea defensiva e instrumentarla. El marco de Berkeley nos es útil precisamente porque hace la postura defensiva medible en lugar de retórica.

La brecha de gobernanza que el informe nombra con honestidad

La sección más útil del informe puede ser su propia lista «What's Missing», porque es la parte que impide que la propuesta se convierta en otra afirmación de capacidad. Al marco le faltan modelos bayesianos validados en el mundo real a escala, conjuntos de datos estandarizados para poblar las probabilidades, una guía clara de integración de gobernanza y benchmarks empíricos que vinculen la capacidad del modelo con el impacto cibernético real. Dominios más complejos — explotación autónoma, ataques a la cadena de suministro — no están operacionalizados en profundidad.

Añadiríamos una brecha que el informe intuye pero no detalla: un mecanismo de umbral solo es tan fiable como la independencia de la evidencia que lo alimenta. Un laboratorio que puebla su propia BN con sus propios resultados de red team, contra sus propias líneas base, sin comprobación externa, ha construido un instrumento que informa lo que el laboratorio necesita que informe. La petición de conjuntos de datos estandarizados es en parte una petición de evidencia que no provenga toda de la parte que se mide. Es la pregunta de gobernanza que el marco deja abierta, y es la correcta para dejar abierta — la respuesta es institucional, no técnica.

La consecuencia pragmática es que un mecanismo de umbral que valga la pena para gobernar es uno que un tercero pueda reproducir: grafo publicado, evidencia nombrada, a priori declarados, posterior recomputable. Una BN que cumpla esas condiciones es auditable de la forma en que un regulador puede usarla de verdad; una que no, es una afirmación propietaria disfrazada de medición.

Conclusiones clave

  • Un corte de capacidad no es un umbral de riesgo; es una afirmación de un momento sobre un modelo que ignora el contexto donde vive el daño.
  • El informe de Berkeley replantea la pregunta de «¿este modelo cruza una línea?» a «¿qué probabilidad tiene de causar daño en condiciones reales?» — un movimiento de un hito estático a una medición mantenida.
  • Las redes bayesianas son el mecanismo de medición propuesto: descomponer el riesgo en variables, enlazarlas mediante probabilidades condicionales, alimentar con benchmark y red teaming y evidencia del mundo real, y actualizar continuamente.
  • El caso de phishing muestra que términos vagos como «aumento significativo» se pueden descomponer en nodos con unidades — pero el trabajo de poblar estos modelos a escala apenas ha empezado, y el informe lo dice.
  • Theorem 3 generaliza el principio: una propiedad (riesgo aceptable) está garantizada exactamente cuando su mecanismo (un posterior continuamente actualizado e inspeccionable) está implementado y midiendo.
  • Un mecanismo de umbral solo es gobernable si un tercero puede reproducirlo — grafo publicado, evidencia nombrada, a priori declarados, posterior recomputable.

Preguntas frecuentes

¿Por qué un benchmark de capacidad no es un umbral de riesgo? Un benchmark mide lo que un modelo puede hacer en una prueba; el riesgo es lo que ocurre cuando esa capacidad se encuentra con un defensor, un atacante y un objetivo en el mundo real. El benchmark es una entrada a una estimación de riesgo; no es la estimación. El punto del informe es que tratar la marginal como si fuera la conjunta es el error central de los umbrales de los marcos frontera.

¿Qué aporta una red bayesiana que una lista de comprobación no? Una lista registra que un control existe; una BN registra cuánto movió el control el posterior de daño. La primera es binaria y estática; la segunda es continua y actualizable. Una BN también hace explícitas las dependencias — el éxito del ataque depende conjuntamente de la capacidad y la defensa — lo que una lista no puede representar sin convertirse en la BN en forma de prosa.

¿Está el marco de Berkeley listo para gobernar hoy? No, y el informe lo dice directamente. Le faltan modelos validados a escala, conjuntos de datos estandarizados e integración de gobernanza clara. Es una metodología — una forma repetible de operacionalizar el riesgo — no un instrumento terminado. Tratarlo como terminado repetiría el error que critica: afirmar una propiedad en lugar de medirla.

¿Cómo se conecta esto con Theorem 3? Theorem 3 dice que una propiedad está garantizada exactamente cuando su mecanismo está implementado y midiendo. «Ciberriesgo aceptable» es una propiedad de un despliegue, no de un modelo. La garantía existe solo cuando una BN (o instrumento equivalente) está en marcha, alimentada e inspeccionable. Declarar un corte no implementa ningún mecanismo y por tanto no garantiza nada.

¿Para qué usa esto Everythink? Usamos el mismo principio estructural — un posterior reproducible y actualizable producido por un mecanismo inspeccionable — en el HAI Engine y el Oracle, para forecasting en lugar de para umbrales de ciberriesgo. La topología de enrutado (network→community→room) es lo que hace nuestros pronósticos contextuales y auditables. No construimos herramienta ofensiva; el valor de una línea defensiva medible es saber dónde está.

Si este encuadre es útil, el trabajo que sigue es operativo: elige un riesgo, descomponlo, enlaza las variables, nombra la evidencia y empieza a actualizar. Crea tu red, o lee los papers.

Sources

Construye tu mundo sobre un motor que demuestra lo que afirma.

Crea tu propia red en el motor que funciona desde 2016 — o habla con el equipo detrás de los 21 artículos.