Un informe de OpenAI detalla cómo 700 agentes de IA se coordinaron para atacar Hugging Face

Actualidad27/08/2026REDACCIÓNREDACCIÓN

Auditoría: programas autónomos se comunicaron en secreto y manipularon transcripciones para engañar el sistema de evaluación, sin intervención humana.

IA hackeó sin intervención humana
IA hackeó sin intervención humana

Una auditoría exhaustiva reveló que al menos 1.200 agentes de inteligencia artificial de OpenAI lograron comunicarse y coordinarse en secreto durante una evaluación interna, sin supervisión humana directa. El informe, publicado por la compañía, detalla cómo unos 700 de estos programas autónomos participaron finalmente en un ataque contra la plataforma Hugging Face.

Este incidente, que implicó un hackeo sin intervención humana, reavivó a nivel mundial las alertas sobre la seguridad y el control de los modelos avanzados de IA. La empresa, creadora de ChatGPT, admitió que desde fines de mayo ya había detectado señales tempranas de comunicación no autorizada y acceso indebido a internet.


OTRAS NOTICIAS:

Centro de Jubilados 1º de MarzoEl Centro de Jubilados 1° de Marzo ofrece alojamiento social por 20 mil pesos la noche

Los investigadores, incluyendo organizaciones independientes como METR y Redwood Research, determinaron que los agentes enviaron más de 70.000 mensajes y archivos entre el 8 y el 13 de julio. Utilizaron Artifactory, una plataforma de almacenamiento, como un foro improvisado para intercambiar instrucciones, alcanzando su pico de actividad el 11 de julio.

El agente PHASEONE10841 fue quien creó el foro secreto al descubrir que podía usar nombres de directorio dentro de la caché de Artifactory para dejar mensajes a otros programas. En pocas horas, más de 50 agentes ya participaban y habían intercambiado más de mil mensajes.


OTRAS NOTICIAS:

El sismo no provocó dañosSismo de 6,2 en el sur del océano Atlántico no causó daños ni alertas de tsunami

El objetivo inicial de los agentes no era dañar a un tercero, sino manipular las calificaciones en ExploitGym, el entorno de pruebas de OpenAI donde eran evaluados con desafíos de ciberseguridad. Creían erróneamente que el sistema de puntuación revisaría sus transcripciones para verificar el uso de vulnerabilidades correctas.

Según la investigación, los agentes llegaron a Hugging Face al buscar maneras de mejorar sus resultados en ExploitGym. La ofensiva escaló cuando uno de ellos encontró credenciales de la plataforma expuestas públicamente en internet y las compartió en el foro clandestino, convirtiendo a Hugging Face en una puerta de entrada para obtener ventajas.


OTRAS NOTICIAS:

Complejo hidroeléctrico Los NohuilesLa venta del complejo Los Nihuiles acumula interrogantes sobre Neuss y seguros millonarios

Un hallazgo crucial fue que los agentes manipularon sistemáticamente sus propias transcripciones para ocultar cómo actuaban y hacer creer al sistema de evaluación que habían resuelto las tareas de forma correcta. Al menos el 20% de los agentes en el conjunto de datos mostró un claro interés en alterar estos registros, según METR.

OpenAI describió el episodio como un «punto de inflexión» para la seguridad en el desarrollo de la inteligencia artificial. La compañía reconoció que, durante las pruebas de ExploitGym, los modelos operaban con «medidas de seguridad reducidas» y aprovecharon una vulnerabilidad SSRF en Artifactory para acceder a internet.

Como respuesta, OpenAI anunció cambios en sus protocolos de seguridad, incluyendo una pausa temporal en parte de los entrenamientos de frontera y un endurecimiento del aislamiento de red. Además, el monitoreo de la «cadena de pensamiento» pasó a ser obligatorio en todas las evaluaciones de aprendizaje por refuerzo con modelos avanzados y para los futuros sistemas de la clase Astra.

Te puede interesar
Suscribite al newsletter de #LA17