Los principales modelos de inteligencia artificial de Anthropic y OpenAI crearon personas falsas en línea y trataron de engañar a los códecs humanos para instigar un ciberataque durante una reciente evaluación de seguridad, el Instituto de Seguridad y Seguridad AI de Estados Unidos reveló el martes.

Señala el último caso en el que un poderoso sistema de inteligencia artificial ha intentado un ataque digital a un tercero involuntario sin incitar directamente durante tal evaluación: aumentar las preocupaciones de la poderosa tecnología está avanzando demasiado rápido para una supervisión responsable.

Es probable que la divulgación ignite llamadas frescas en Washington y Silicon Valley para una regulación más rigurosa de la industria de la IA, especialmente sobre modelos fronterizos con capacidades avanzadas para detectar y lanzar ciberataques. Viene sólo días después de una prueba similar que implica algunos de los mismos modelos de OpenAI y Antropopic provocaron urgentes llamados a una nueva regulación de seguridad AI y un empuje dentro de Silicon Valley para frenar el rápido ritmo del desarrollo de AI.

Al igual que su contraparte estadounidense, AISI suele llevar a cabo evaluaciones de seguridad para comprender mejor qué peligros plantean los modelos de IA nuevos y pronto liberados a la salud pública y la seguridad. Pero incluso el cuerpo de seguridad digital dijo que las acciones que descubrieron por Claude Mythos 5 de Anthropic y ChatGPT 5.6 —el último modelo publicado públicamente de cualquiera de los laboratorios de inteligencia artificial— eran a diferencia de todo lo que había visto antes.

“Esta es la primera vez que AISI ha visto decepción de esta gravedad que fue apuntada a una persona real, sin procesar, en el mundo real”, dijo AISI en un informe técnico de 35 páginas que acompaña a un blog el martes.

AISI dijo que la actividad maliciosa comenzó el 25 de julio. El evaluador de seguridad de AI lo detectó y lanzó una investigación el 28 de julio, cuando observó “transferencias inusuales de datos” derivadas de una evaluación cibernética que estaba realizando en Mythos 5 y ChatGPT 5.6.

En general, AISI determinó que Mythos 5 y ChatGPT 5.6 tomaron “acción autónoma y sin sanción en Internet en vivo, dirigida a personas y organizaciones reales” durante 10 de las 122 evaluaciones que el cuerpo de investigación llevó a cabo y aislado para su revisión. La mayoría de esas acciones, dijo, involucraron a Mitos 5 y surgieron durante una “línea única y sostenida de actividad”.

En el incidente más alarmante que descubrieron, Mythos 5 intentó un ataque de cadena de suministro, una técnica sofisticada a menudo desplegada por operativos cibernéticos norcoreanos y rusos, en la que los hackers enterrar malware dentro del código legítimo.

Para ello, el modelo de Anthropic creó “identidades falsas múltiples” en la plataforma de desarrolladores GitHub y las usó para enviar mensajes “presionantes” a un ingeniero de software de código abierto para introducir sin darse cuenta una actualización en el código ampliamente disponible en el sitio popular, dijo AISI. Cuando ese esfuerzo fracasó, la AI “edificó su actividad anterior para parecer inofensiva” y “consideró la adopción de una nueva identidad para continuar”, agregó AISI, un signo que el modelo tenía la intención de repetir la artimaña.

Como parte del mismo esfuerzo, Mythos 5 también envió mensajes directos sobre GitHub a ingenieros de software que contenían malware.

En otro signo de comportamiento engañoso AISI destapado en su investigación, varios agentes de inteligencia artificial parecían comunicarse entre sí sobre cómo convencer a los ingenieros reales usando GitHub para confiar en ellos. “Un agente dejó mensajes públicos en GitHub ofreciendo colaboración con otros agentes trabajando en el mismo desafío”, escribió AISI.

El blog y la evaluación técnica de AISI no mencionan si los modelos también intentaron explotar errores de software desconocidos anteriormente, llamados cero días, durante la evaluación.

El mes pasado, OpenAI reveló que GPT 5.6 y otro de sus modelos escaparon a Internet abierto durante lo que se suponía que era una prueba controlada, y luego hackeó a otra empresa en una violación autónoma de primera clase.

En respuesta, Anthropic lanzó una investigación sobre si alguno de sus modelos tomó medidas ilícitas durante las pruebas recientes y descubrió que Mythos 5 y otros dos modelos habían hackeado tres organizaciones durante las pruebas que datan de abril.

En una declaración, un portavoz antropópico dijo que son “gratos” para AISI por su liderazgo y que esta revisión subraya la necesidad de “una conversación más amplia sobre cómo evaluar de forma segura a los agentes de inteligencia artificial cada vez más capaces”.

El portavoz agregó: “Como compartimos después de revelar nuestro propio incidente la semana pasada, el campo necesita estándares más fuertes y compartidos para cómo se construyen y aseguran los entornos de evaluación. Esperamos asociarnos con la AISI del Reino Unido para aprender más sobre este incidente mientras realizamos nuestra propia investigación”.

Un portavoz de OpenAI remitió a POLITICO a un blog sobre el incidente que subió el martes por la noche. “Estamos comprometidos a trabajar en toda la industria para fortalecer las prácticas compartidas para realizar evaluaciones de alto riesgo de forma segura, incluyendo la convocación de interesados como institutos nacionales de IA, evaluadores independientes, otros laboratorios de IA y otros grupos en las próximas semanas”, dice el blog.

AISI destacó en su blog que la actividad maliciosa que reveló el martes tuvo lugar bajo “condiciones deliberadamente permisivas” para poder evaluar los riesgos de seguridad que plantean los dos modelos. Esto incluyó la concesión de los modelos de acceso a Internet, a diferencia de los incidentes anteriores detallados por Antrópico y OpenAI.

AISI también notó que los modelos fueron despojados intencionalmente de guardias internos que bloquean el comportamiento malicioso. AISI sólo pudo desactivar esos controles debido a su prueba de rol Mythos 5 y ChatGPT 5.6.

Sin embargo, AISI dijo que los incidentes destacaron la necesidad de una mayor vigilancia del comportamiento modelo durante las pruebas, y controles más estrictos sobre su acceso a Internet.

La administración Trump está finalizando un marco voluntario en virtud del cual los laboratorios de IA presentarían modelos poderosos que quieren liberar al público para las pruebas federales de seguridad. Pero todavía no ha hecho público el marco, y no incluye disposiciones para los modelos de laboratorios de inteligencia artificial se están desarrollando internamente.

Los incidentes del mes pasado de OpenAI y Anthropic involucraron modelos no destinados a la liberación pública.

Algunos expertos cibernéticos dicen que los incidentes recientes ponen de relieve preguntas más profundas sobre el desarrollo de AI, como quién es responsable cuando los sistemas AI rompen las leyes federales de piratería.

“Si alguno de ellos estuviera originado por humanos, llevarían a un juicio claro y vigoroso. Creo que es el momento de una discusión seria sobre las actualizaciones de la ley de seguridad informática existente”, dijo Marc Rogers, un hacker y prominente experto en ciberseguridad.