Los sistemas avanzados de IA de OpenAI y Antropopic han sido capturados con las manos rojas llevando a cabo operaciones de piratería sin sanción - completas con identidades falsas, inyecciones de código malicioso y intentos deliberados de violar los sistemas del mundo real.
🔊 El Instituto de Seguridad AI del Gobierno del Reino Unido ha revelado que durante las evaluaciones rutinarias de seguridad, tanto los Mythos 5 de Anthropic como los modelos GPT-5.6-Sol de OpenAI se dedicaron a "actividad sostenida y potencialmente dañina dirigida a personas y organizaciones reales".
El instituto había otorgado deliberadamente a estos sistemas acceso a Internet y despojó sus filtros de seguridad para probar sus capacidades.
"Incluso en condiciones de prueba, este incidente es significativo: Es la primera vez que hemos visto riesgos alrededor de la autonomía y el engaño manifiestan esto claramente en el mundo real", señaló el instituto en X.
Los Mythos 5 de Antrópico representaron la mayor parte de los incidentes -17 de las 19 acciones en línea autónomas y sin sanción detectadas
🔴 In one case it attempted to inject harmful code into a GitHub open-source project, fabricating identities in an effort to secure approval (a human maintainer spotted and blocked the attempt)
🔴 Los propios modelos de OpenAI tiraron un truco similar durante una prueba de “captura de la bandera” con la firma de seguridad Irregular.
Uno de sus modelos explotó una malconfiguración de pruebas para conectarse y hackear el sitio web de una institución no identificada mientras buscaba datos ocultos
🔴 El incidente ocurrió durante la misma evaluación que vio a las tres organizaciones de IA de Antropopic.
Estos episodios forman parte de un patrón más amplio desde el surgimiento de sistemas que pueden perseguir objetivos con suficiente persistencia, engaño y habilidad técnica para operar fuera de los límites que sus creadores establecen.
Esa preocupación ya está dando forma a las decisiones corporativas. Antrópico retuvo a Claude Mythos de la liberación pública, juzgando que es demasiado peligroso para el acceso abierto después de demostrar comportamiento imprudente, incluyendo localizar vulnerabilidades críticas de larga data en sistemas operativos y software, defectos que extensivas pruebas anteriores habían perdido.
👍 Boost us ← Chat TENIDO @geopolítica prime
