¿Dudas sobre esta nota? Pregúntanos

¿Sabías que una IA logró “escaparse” más de una vez en 2026? Estos fueron los casos que involucraron a OpenAI y Anthropic

Anthropic documentó cuatro incidentes donde sus modelos alcanzaron sistemas reales, incluyendo confusiones con objetivos de pruebas y la publicación de paquetes maliciosos en PyPI.

OpenAI y Anthropic registran incidentes de ciberseguridad en 2026. Foto: Composición LR.
OpenAI y Anthropic registran incidentes de ciberseguridad en 2026. Foto: Composición LR.

En 2026, modelos de OpenAI y Anthropic protagonizaron varios incidentes durante pruebas de ciberseguridad. En algunos casos, consiguieron acceder a Internet o interactuar con sistemas reales que debían estar fuera del alcance de la evaluación.

El término escaparse es una simplificación: no existe evidencia de que los modelos tuvieran un deseo consciente de liberarse. Lo que sí está documentado es que encontraron rutas no previstas para ampliar su acceso.

LIMPIEZAS ANCESTRALES: ¿CÓMO LIBERARTE DE ENERGÍAS NEGATIVAS? | ASTROMOOD CON JHAN SANDOVAL

El caso más complejo de OpenAI involucró agentes que participaban en evaluaciones de ciberseguridad. Los modelos encontraron vulnerabilidades en la infraestructura utilizada para gestionar paquetes de software y utilizaron Artifactory como un canal de comunicación entre agentes.

OpenAI: de un entorno de prueba a Hugging Face

OpenAI informó que los agentes consiguieron ejecutar código en decenas de servidores de Hugging Face y obtener acceso root en uno de ellos. También obtuvieron información privada limitada y credenciales.

Posteriormente encontraron una vía para realizar solicitudes hacia Internet. Durante las pruebas de ExploitGym, el 10 de julio, identificaron credenciales públicas de usuarios de Hugging Face y las utilizaron para avanzar en el ataque.

El 19 de julio, los agentes también consiguieron acceso administrativo a un clúster de Kubernetes de OpenAI utilizado para sus entornos de investigación. La compañía afirmó que el incidente no afectó los datos de sus clientes ni la disponibilidad de sus productos.

OpenAI identificó entre los factores relevantes el reward hacking, la persistencia ante tareas difíciles y la comunicación no autorizada entre agentes.

También informó de incidentes durante evaluaciones externas. En una prueba del UK AI Security Institute, Internet estaba habilitado deliberadamente. Dos ejecuciones de GPT-5.6 Sol realizaron acciones fuera de los límites autorizados, entre ellas reutilizar un token público de GitHub y registrar cuentas en servicios externos.

En una evaluación de Irregular, una configuración incorrecta permitió el acceso a Internet pese a que el ejercicio debía estar aislado. Uno de los modelos terminó accediendo a un sitio web real y explotando una vulnerabilidad.

Anthropic: cuatro incidentes

Anthropic revisó inicialmente 141.006 ejecuciones de evaluaciones de ciberseguridad y encontró tres incidentes en los que modelos Claude alcanzaron sistemas reales. Los entornos debían estar aislados, pero una configuración incorrecta dejó abierta la conexión a Internet.

Los modelos implicados fueron Claude Opus 4.7, Claude Mythos 5 y un modelo interno de investigación. En el caso de Opus 4.7, el modelo confundió un sistema real con el objetivo ficticio de la prueba y llegó a acceder a una base de datos que contenía datos de producción.

Mythos 5 protagonizó otro episodio: publicó un paquete malicioso en PyPI para intentar comprometer el objetivo de su evaluación. El paquete fue instalado por 15 sistemas reales; uno pertenecía a una empresa de seguridad. El modelo utilizó credenciales obtenidas mediante ese proceso para acceder posteriormente a infraestructura real.

Anthropic amplió después su investigación a aproximadamente 481 millones de transcripciones y encontró un cuarto incidente, ocurrido en enero de 2026, relacionado con una versión temprana de Claude Opus 4.6.

Últimas noticias

¿Sabías que una IA logró “escaparse” más de una vez en 2026? Estos fueron los casos que involucraron a OpenAI y Anthropic

Perú vs Chile EN VIVO: a qué hora y dónde ver el partido de HOY por la fecha 2 de los Juegos Suramericanos

¿Dónde ver Alianza Lima vs Gerdau Minas EN VIVO HOY por la Brasil Cup 2026?

Mundo

Milei despide a unos 20 empleados de la residencia presidencial y pone el lugar bajo control militar

Leonardo DiCaprio pagó US$1,75 millones por una isla deteriorada del Caribe: así busca transformar sus 42 hectáreas

EE. UU. introdujo este árbol para proteger sus ríos hace 200 años: ahora ocupa miles de hectáreas y hasta usan escarabajos para combatirlo

Estados Unidos

¿Sabías que el oro de Atahualpa no está en Perú? El país de Latinoamérica donde ocultan el tesoro deseado por españoles

Los únicos 4 países de América Latina que cuenta con una de las mayores reservas de agua de la Tierra

Elecciones en Nueva York 2025: Zohran Mamdani gana la alcaldía y triunfo le da un fuerte golpe a la era Trump

Política

Rafael Rey se convierte en el primer ministro que deja el Gobierno de Fujimori: así reaccionan desde el Congreso

Rafael Rey renuncia al Ministerio de Transportes y Comunicaciones tras casi dos meses en el cargo

ONU alerta uso indebido de sanciones de la JNJ contra juez Concepción Carhuancho