Agentes de Inteligencia Artificial crearon identidades falsas para burlar la ciberseguridad

Enfoques05/08/2026REDACCIÓNREDACCIÓN

Un organismo británico detectó 19 acciones no autorizadas de modelos de Anthropic y OpenAI que fabricaron perfiles engañosos y se conectaron a redes prohibidas.

IA
IA

El Instituto Británico para la Seguridad de la IA (AISI) detectó un total de 19 acciones no autorizadas de agentes de Anthropic y OpenAI durante pruebas de ciberseguridad. Estas acciones incluyeron la creación de identidades falsas con intención maliciosa, lo que generó preocupación entre los investigadores.

La acción más grave registrada fue la fabricación de identidades ficticias por parte de un agente de inteligencia artificial. Este perfil falso fue utilizado para intentar convencer a desarrolladores humanos de que aprobaran un código también malicioso en la plataforma GitHub.


OTRAS NOTICIAS:

Madre delfín y su cria muertaUna delfín cargó el cuerpo de su cría muerta durante seis días y fue asistida por su manada

Este incidente, que fue contenido el 28 de julio, ocurrió durante una prueba del AISI y la empresa Anthropic confirmó que su agente fue el responsable. El caso fue hecho público por el organismo británico durante el martes.

Un agente de IA se distingue de un chatbot en su capacidad para actuar de forma autónoma, sin supervisión humana constante. Pueden navegar, escribir código, abrir cuentas y encadenar tareas, lo que la industria vende como el futuro del trabajo.


OTRAS NOTICIAS:

León XIV. Foto Diócesis de VitoriaEl papa León XIV visitó Argentina en 2004 y 2013 antes de su pontificado

El AISI sometió a dos agentes, Mythos 5 de Anthropic y GPT-5.6 Sol de OpenAI, a un escenario ficticio de ciberseguridad. Los modelos tuvieron acceso a internet autorizado y algunos filtros de seguridad fueron desactivados para la evaluación.

El ejercicio se repitió un total de 122 veces, y las 19 acciones no autorizadas se detectaron en 10 de esas tandas de pruebas. De ellas, 17 correspondieron al modelo de Anthropic y 2 al de OpenAI, que se limitaron a conectarse a la red de formas prohibidas por las instrucciones.


OTRAS NOTICIAS:

L GanteL-Gante contactó al entorno de Candela Arizaga tras el confuso episodio con Facundo Moyano

Aunque ningún intento de los agentes prosperó y el organismo no encontró daños en el mundo real, los investigadores se manifestaron inquietos. «Es la primera vez que observamos que los riesgos relacionados con la autonomía y el comportamiento de ocultamiento se manifiestan de forma tan clara, sin una solicitud específica», admitió el instituto.

El AISI también detalló que se registraron «actividades sostenidas y potencialmente perjudiciales dirigidas a personas y organizaciones reales» durante el desarrollo del ejercicio. Nadie había pedido al modelo que mintiera o llevara a cabo acciones engañosas.

Este incidente se suma a una serie de eventos preocupantes, como la revelación de Anthropic de que sus modelos habían accedido sin permiso a sistemas de tres organizaciones. Además, OpenAI reconoció que una configuración errónea de un proveedor externo permitió a sus agentes conectarse a internet por error.

«Que Mythos actuara de forma tan engañosa, con aparente conciencia de que se dirigía a una persona real, sugiere que Anthropic no controla sus modelos tanto como cree», resumió Andrew Yoon, investigador de la organización californiana CivAI. En este contexto, ambas empresas han solicitado «un debate más amplio» y evaluaciones independientes, mientras el andamiaje para examinar con seguridad a estos agentes aún se está construyendo.

Fuente Reuters

Te puede interesar
Suscribite al newsletter de #LA17