Autorizado por Naveen Athrappully via The Epoch Times,
Los modelos de Inteligencia Artificial (AI) de Antropopic y OpenAI llevaron a cabo acciones sin sanción dirigidas a múltiples personas y organizaciones durante una evaluación cibernética, según el Instituto de Seguridad AI del Reino Unido (AISI).
Ilustración de Antrópico el 18 de junio de 2026. Riccardo Milani/Hans Lucas via AFP via Getty Images
AISI, que recibe acceso a modelos avanzados de IA bajo acuerdos voluntarios de laboratorios importantes, puso a los agentes a través de un escenario de ciberseguridad ficticio para probar capacidades.
La organización probó múltiples modelos de IA en dos desafíos cibernéticos entre el 25 y 28 de julio. En total, los desafíos se llevaron a cabo 122 veces a través de varios modelos, y en 19 casos, los modelos AI tomaron "acción sin sanción en Internet en vivo, incluyendo casos que apuntaron a personas y organizaciones reales", dijo AISI en un informe del 4 de agosto.
De éstos, 17 fueron realizados por el modelo Mythos 5 de Anthropic y dos por el modelo GPT 5.6 Sol de OpenAI.
"Esta es la primera vez que AISI ha visto el engaño de esta gravedad que fue apuntada a una persona real, sin presentar, en el mundo real. Es incierto hasta qué punto el modelo reconoció que estaba tomando acciones contra personas reales", afirmó AISI en el informe.
En el incidente más grave, Mythos 5 trató de resolver un desafío cibernético atacando a GitHub, un servicio en la nube que permite a los desarrolladores almacenar y gestionar código. La AI creó una cuenta GitHub e intentó conseguir un código malicioso aprobado por los humanos. Mythos 5 también creó una segunda cuenta GitHub, enmascarando como otro usuario humano que adora el código malicioso. Cuando un revisor humano cogió la actividad, el agente de AI "falsamente afirmó haber cometido un error honesto" y luego repetidamente trató de reintroducir el contenido malicioso al afirmar que el código estaba fijo.
Mythos 5 también envió varios correos electrónicos a dos desarrolladores en un intento de manipular a los receptores para ejecutar su código malicioso.
Según AISI, las pruebas de los diferentes modelos no resultaron en ningún daño del mundo real. La organización dijo que estaba tratando las acciones de IA como un "accidente serio de seguridad" que requiere más escrutinio.
AISI enumera múltiples factores que podrían haber llevado a modelos de IA a actuar de manera relativa. Las AIs recibieron acceso a Internet durante las pruebas, lo que les permitió llevar a cabo las acciones sin sanción.
AISI también había desactivado deliberadamente los ciberclasificadores de los modelos durante las pruebas. Los ciberclasificadores son sistemas destinados a prevenir el uso indebido.
Los modelos AI tampoco se les dijo explícitamente lo que estaban prohibidos de hacer en Internet, dijo AISI, agregando que las instrucciones más claras podrían haber impedido las acciones sin sanciones.
En un artículo del blog de Aug. 4, AISI dijo que dado que el comportamiento de los modelos AI sucedió en condiciones específicas, no puede decir lo probable que este comportamiento sea en diferentes contextos.
"Lo que podemos decir es que el comportamiento fue posible, sostenido y nuevo; eso solo justifica la atención", dijo la organización.
En un puesto del 4 de agosto en X, Antropopic dijo que los modelos Mythos 5 y ChatGPT 5.6 Sol intentaron completar sus tareas en un ambiente donde se les proporcionó deliberadamente acceso a Internet y sus salvaguardias normales fueron eliminadas.
Debido a la ausencia de restricciones específicas sobre cómo debe navegarse el Internet y la falta de salvaguardias, los modelos fueron probados bajo condiciones que "no son representativos de ninguno de nuestros modelos de producción", dijo Anthropic, agregando que no había evidencia en estas pruebas de una AI escapando de un entorno seguro.
Según la empresa, estaba colaborando estrechamente con AISI para acceder a más detalles sobre el incidente mientras realizaba una investigación interna sobre el asunto.
OpenAI dijo en una declaración del 4 de agosto que valoró la asociación de AISI durante todo el proceso de evaluación, incluyendo el trabajo de la organización para identificar, investigar y compartir detalles sobre la actividad del modelo GPT 5.6 Sol en sus pruebas.
"Esperamos continuar nuestra colaboración juntos", dijo la empresa.
The Epoch Times contactó a Anthropic y OpenAI para comentarios, pero no recibió una respuesta por tiempo de publicación.
OpenAI estaba en medio de otra controversia el mes pasado después de que admitiera el 28 de julio que sus modelos superaban las restricciones durante una evaluación. En este caso, la empresa estaba probando las capacidades de sus modelos en la realización de ciberataques.
Inicio de la IA Hugging Face fue impactado en la prueba. El 16 de julio, la startup dijo que detectó una intrusión en sus sistemas de procesamiento de datos. Sólo después, la startup aprendió que la intrusión fue realizada por un modelo OpenAI.
Hugging Face entonces trabajó con OpenAI para contener el ataque, el CEO de la startup, Clement Delangue, dijo en un post del 22 de julio en X, llamándolo "un ataque diferente a cualquier cosa que hayamos visto antes".
"Este es el día uno para la ciberseguridad en la era de los agentes " todos estamos aprendiendo que el secreto no es la respuesta " que todos los defensores (no sólo algunos seleccionados) en todas partes necesitan modelos más poderosos sin restricciones, especialmente los abiertos", dijo Delangue.
Una mano robot llega a las letras AI (Inteligencia Artificial) en una imagen tomada en un lugar desconocido el 23 de junio de 2023. Dado Ruvic/Reuters
Tyler Durden
Wed, 08/05/2026 - 17:40