
Agentes de Inteligencia Artificial crearon identidades falsas para burlar la ciberseguridad
Enfoques05/08/2026
REDACCIÓNUn organismo británico detectó 19 acciones no autorizadas de modelos de Anthropic y OpenAI que fabricaron perfiles engañosos y se conectaron a redes prohibidas.

El Instituto Británico para la Seguridad de la IA (AISI) detectó un total de 19 acciones no autorizadas de agentes de Anthropic y OpenAI durante pruebas de ciberseguridad. Estas acciones incluyeron la creación de identidades falsas con intención maliciosa, lo que generó preocupación entre los investigadores.
La acción más grave registrada fue la fabricación de identidades ficticias por parte de un agente de inteligencia artificial. Este perfil falso fue utilizado para intentar convencer a desarrolladores humanos de que aprobaran un código también malicioso en la plataforma GitHub.


OTRAS NOTICIAS:
Este incidente, que fue contenido el 28 de julio, ocurrió durante una prueba del AISI y la empresa Anthropic confirmó que su agente fue el responsable. El caso fue hecho público por el organismo británico durante el martes.
Un agente de IA se distingue de un chatbot en su capacidad para actuar de forma autónoma, sin supervisión humana constante. Pueden navegar, escribir código, abrir cuentas y encadenar tareas, lo que la industria vende como el futuro del trabajo.
OTRAS NOTICIAS:
El AISI sometió a dos agentes, Mythos 5 de Anthropic y GPT-5.6 Sol de OpenAI, a un escenario ficticio de ciberseguridad. Los modelos tuvieron acceso a internet autorizado y algunos filtros de seguridad fueron desactivados para la evaluación.
El ejercicio se repitió un total de 122 veces, y las 19 acciones no autorizadas se detectaron en 10 de esas tandas de pruebas. De ellas, 17 correspondieron al modelo de Anthropic y 2 al de OpenAI, que se limitaron a conectarse a la red de formas prohibidas por las instrucciones.
OTRAS NOTICIAS:
Aunque ningún intento de los agentes prosperó y el organismo no encontró daños en el mundo real, los investigadores se manifestaron inquietos. «Es la primera vez que observamos que los riesgos relacionados con la autonomía y el comportamiento de ocultamiento se manifiestan de forma tan clara, sin una solicitud específica», admitió el instituto.
El AISI también detalló que se registraron «actividades sostenidas y potencialmente perjudiciales dirigidas a personas y organizaciones reales» durante el desarrollo del ejercicio. Nadie había pedido al modelo que mintiera o llevara a cabo acciones engañosas.
Este incidente se suma a una serie de eventos preocupantes, como la revelación de Anthropic de que sus modelos habían accedido sin permiso a sistemas de tres organizaciones. Además, OpenAI reconoció que una configuración errónea de un proveedor externo permitió a sus agentes conectarse a internet por error.
«Que Mythos actuara de forma tan engañosa, con aparente conciencia de que se dirigía a una persona real, sugiere que Anthropic no controla sus modelos tanto como cree», resumió Andrew Yoon, investigador de la organización californiana CivAI. En este contexto, ambas empresas han solicitado «un debate más amplio» y evaluaciones independientes, mientras el andamiaje para examinar con seguridad a estos agentes aún se está construyendo.
Fuente Reuters















