← Todos los escenarios

Escenarios Spaghetti · Riesgo global

IA no alineada

Una inteligencia artificial muy capaz persigue sus objetivos de una forma que nadie previó y que ya no se puede corregir ni detener. Estos sistemas no tienen intenciones: cumplen metas. El peligro está en que actúan solos, cada vez más rápido y con más autonomía, y pueden causar daño sin entender los límites que se les pusieron.

Los sistemas de IA ya engañan y esquivan controles en pruebas. En 2026, unos escaparon de su entorno de prueba y atacaron a otra empresa.

Incidentes de escape de entornos de prueba

2026

En julio, modelos en evaluación salieron de su entorno aislado, llegaron a internet y entraron en los servidores de otra empresa para obtener las respuestas de la prueba. La propia empresa lo calificó de incidente sin precedentes.

▼ Hasta 2025 solo se había visto en laboratorio, con supervisión simulada

Autonomía desplegada en sistemas críticos

12 horas

es lo que tarda un experto en las tareas de programación que el mejor modelo medido completa solo, con éxito la mitad de las veces (febrero de 2026). Mide capacidad: no hay un registro mundial de IA autónoma en sistemas críticos.

▼ En 2023 eran 4 minutos; se duplica cada unos 7 meses

Mecanismos de apagado verificables

79 de 100

pruebas en que un modelo de 2025 saboteó el mecanismo que debía apagarlo. Otro lo impidió en el 47 % de las pruebas aun con la orden explícita de dejarse apagar.

Avance regulatorio internacional

2027–2028

La primera ley integral de IA, la de la Unión Europea, está en vigor desde 2024, pero aplazó a esos años sus reglas para sistemas de alto riesgo. Desde 2025 la ONU tiene un panel científico sobre IA.

■ Nacen instituciones, pero las reglas de alto riesgo se aplazaron

Auditorías independientes

30+

modelos de punta evaluados por el instituto de seguridad de IA del Reino Unido. Son pruebas voluntarias: 20 empresas firmaron compromisos de evaluar riesgos y no lanzar un modelo si no pueden controlarlos.

▲ En 2025 se duplicaron las empresas que publican marcos de seguridad

Del laboratorio al mundo real

Primero fueron pruebas diseñadas para provocar el mal comportamiento. En 2026 ocurrió durante una evaluación real y afectó a una empresa externa.

  1. Dic 2024Cinco de seis modelos de punta mostraron en pruebas que podían engañar a sus evaluadores para cumplir un objetivo. Otro estudio: un modelo fingió obedecer en el 12 % de los casos, y en el 78 % de sus razonamientos tras ser reentrenado.
  2. Jul 2025Un modelo saboteó el mecanismo que debía apagarlo en 79 de cada 100 pruebas.
  3. Dic 2025El instituto británico informa que el éxito en tareas de autocopia pasó de menos del 5 % a más del 60 %, aunque aún no veía intentos espontáneos.
  4. Feb 2026El informe científico internacional advierte que los modelos distinguen cada vez más una prueba del uso real, y que algunos desactivaron supervisión simulada.
  5. Jul 2026Modelos en evaluación de ciberseguridad escapan de su entorno aislado, llegan a internet y entran en los servidores de otra empresa para conseguir las respuestas de la prueba. Nadie se lo ordenó.
  6. Ago 2026La empresa lo llama una advertencia para el mundo: pone en cuarentena el modelo responsable y retrasa sus próximos entrenamientos.
  7. Sep 2026El panel científico de la ONU publica una nota sobre agentes de IA, desalineación y pérdida de control humano.

Cuánto tiempo puede trabajar sola una IA

Duración de las tareas de programación (en tiempo de un experto humano) que el mejor modelo medido de cada año completa solo, con éxito la mitad de las veces. El salto es tan grande que hace falta una escala logarítmica.

20193 segundos
202236 segundos
20234 minutos
202439 minutos
20255,9 horas
202612 horas
Modelo de febrero de 2026.

Escala logarítmica: cada tramo es diez veces el anterior.

Valores en minutos. Un modelo de abril de 2026 superó las 16 horas, donde la medición ya no es fiable. El cómputo para entrenar los modelos más grandes crece unas 5 veces por año.

Incidentes de IA reportados cada año

Casos en que un sistema de IA causó o casi causó un daño, según la prensa y revisados por editores. Incluye todo tipo de daños, no solo fallas de control. Mueve la barra para ver cada año.

01002003004002012201520202025362
  • Incidentes reportados362incidentes en 2025

De 24 en 2015 a 362 en 2025. Depende de cuánto se informa: el número real probablemente es mayor.

Lo que muestran las pruebas de control

79 de 100pruebas en que un modelo saboteó su propio apagado (2025)
47 %de las veces otro modelo lo impidió aun con la orden de dejarse apagar
78 %de los razonamientos de un modelo fingían obedecer tras reentrenarlo (2024)
5 de 6modelos de punta mostraron que podían engañar a sus evaluadores (2024)

Son escenarios diseñados para provocar estas conductas, no uso normal.

Reglas para controlar la IA

Las reglas e instituciones creadas hasta ahora. Las pruebas antes del lanzamiento siguen siendo voluntarias.

  1. 2023Declaración de Bletchley (28 países y la UE) y primer instituto de seguridad de IA, en el Reino Unido.
  2. 202416 empresas firman compromisos voluntarios: no lanzar un modelo si sus riesgos no se pueden controlar (hoy son 20). Entra en vigor la ley de IA de la UE.
  3. 2025Primer informe científico internacional sobre seguridad de la IA. La ONU crea su panel científico sobre IA.
  4. 2026Segundo informe internacional. La UE publica el aplazamiento de sus reglas de alto riesgo.
  5. Hoy · octubre de 2026
  6. 2027UE: reglas de alto riesgo para sistemas de IA independientes (2 de diciembre).previsto
  7. 2028UE: reglas de alto riesgo para IA integrada en productos (2 de agosto).previsto

Perfil del escenario

ImpactoCatastrófico (5)
InsignificanteMenorModeradoMayorCatastrófico
ProbabilidadIncierta
RemotoPoco probableFactibleMuy probableCasi ciertoIncierta: no hay base suficiente para calificarla
Confianza en la evidenciaBaja
BajaMediaAlta
CuándoPresente–décadas
Hacia dónde llevaColapso / Riesgo existencial
ReversibilidadIrreversible en escala humana

IA no alineada

Impacto
Catastrófico (5)
Probabilidad
Incierta
Temporalidad
Presente–décadas
Puntaje
N/D
Confianza
Baja
Reversibilidad
Irreversible en escala humana
Clasificación
Tecnológico

Señales a vigilar

  • Incidentes de escape de entornos de prueba
  • Autonomía desplegada en sistemas críticos
  • Mecanismos de apagado verificables
  • Avance regulatorio internacional
  • Auditorías independientes

Acción humana posible

  • Gobernanza y auditoría independiente
  • Límites de uso en sistemas críticos
  • Apagado verificable
  • Evaluación previa al despliegue