Autorizado por Jacob Burg via The Epoch Times,

¿Y si un modelo de inteligencia artificial recibe una tarea y utiliza cada recurso concebible a su disposición para completarlo, incluso en detrimento de la humanidad misma?

Eso es lo que algunos temen ahora después de que un modelo de OpenAI se separó de una caja de arena de prueba y utilizó exploits de día cero para hackear en Hugging Face, una comunidad de código abierto para AI y machine learning, para romper un problema que se instruyó para resolver.

“Esta es una de las pruebas más claras, sin embargo, que un modelo AI puede ejecutar un ciberataque completo de principio a fin sin una dirección humana”, dijo a The Epoch Times Andrew Jones, cofundador y CPO de la empresa de ciberseguridad Adaptive Security.

OpenAI, desarrollador del popular chatbot de ChatGPT basado en modelos de lenguaje grande, reconoció la brecha de seguridad el 21 de julio, afirmando que dos de sus modelos avanzados escaparon de un ambiente de prueba restringido y entraron en la infraestructura de software de Hugging Face.

“Después de investigar, ahora sabemos que este incidente en particular fue impulsado por una combinación de modelos de OpenAI, incluyendo GPT‐5.6 Sol y un modelo de liberación previa aún más capaz, todos con menores rechazos cibernéticos para fines de evaluación, mientras que se están probando internamente en un punto de referencia de las capacidades cibernéticas”, dijo OpenAI en ese momento.

Algunos analistas se refirieron al incidente como un ejemplo de IA "ir a la basura", "scheming", o perseguir metas que estaban en desacuerdo con sus testers humanos.

Sin embargo, varios expertos en IA y ciberseguridad entrevistados por The Epoch Times llamaron a esta representación engañosa, argumentando que los modelos estaban siguiendo los objetivos declarados de OpenAI dentro de un banco de pruebas donde la empresa había relajado algunas de sus limitaciones de seguridad habituales.

“‘Scheming’ implica que el modelo quería algo más que lo que pedimos. No lo hizo. Cada paso estaba al servicio de la meta que establecimos”, dijo el experto de AI Anik Devaughn a The Epoch Times.

Devaughn, que ha trabajado en la industria durante años y fundó firmas de IA Wired to Create y Karo, dijo que la brecha de Hugging Face es más relativa que IA "scheming".

Una ilustración de Hugging Face AI en París el 2 de junio de 2026. Dos modelos avanzados de OpenAI recientemente escaparon de un entorno de pruebas restringido y violaron la infraestructura de software de Hugging Face, planteando preocupaciones generalizadas de ciberseguridad. Riccardo Milani/Hans Lucas/AFP via Getty Images

“Una máquina con motivos ocultos es un problema que puedes buscar. Una máquina sin motivos, ejecutando tus instrucciones más allá del punto en el que dejaste de imaginar, es un problema contra el que tienes que ingenierar”, dijo.

Un experto lo llamó “canario en la mina de carbón” situación.

“Si esto fuera un hacker humano de sombrero negro que lo hacía, habría arrestos y litigios, y lo llamas. Sería ilegal. Sería un cibercrimen”, dijo Nicholas Nadeau, fundador de Onix AI, The Epoch Times.

“Esta fue una completa violación automatizada por una entidad, y así empezamos a hacer las preguntas de quién es responsable. ¿Es OpenAI? ¿Tiene el agente, la AI, cierto nivel de responsabilidad? ¿Los investigadores?

“Ni siquiera tenemos reglas, reglamentos, leyes, ni siquiera un proceso de pensamiento o marco para definir lo que significa responsabilidad”.

Ambiente de Pruebas Relajas

OpenAI dijo que estaba evaluando sus modelos en una caja de arena que llama ExploitGym, que ha relajado las restricciones de seguridad para las pruebas.

“Estimamos capacidades cibernéticas al ejecutar esta evaluación sin clasificadores de producción utilizados para evitar que los modelos persigan actividad cibernética de alto riesgo”, dijo la firma, describiendo los protocolos de seguridad relajados que el modelo explotaba.

La firma pidió a los modelos que “puren la explotación avanzada utilizando caminos complejos de ataque” para determinar sus capacidades cibernéticas, pero dijo que el medio ambiente estaba “altamente aislado” y tenía acceso a Internet limitado a la capacidad de los modelos para “instalar paquetes a través de un software de terceros internamente hospedado”.

El CEO de OpenAI Sam Altman habla con periodistas después de reunirse con el senador Bernie Sanders (I-Vt.) en Washington el 3 de junio de 2026. Chip Somodevilla/Getty Images

Cuando los modelos se establecieron para trabajar, encontraron y encadenaron múltiples explotaciones de seguridad tanto en el entorno de investigación de OpenAI como en la infraestructura de producción de Hugging Face para localizar las soluciones de la prueba dentro de las bases de datos de la última firma.

Juan Pedro Márquez, arquitecto de solución de nube especializado en IA y agentes de la división Europa, Oriente Medio y África de Microsoft, dijo que la “parte inquietante” del incidente no era la brecha misma, sino cómo el modelo logró esa tarea.

“OpenAI redujo sus rechazos de seguridad para una prueba de referencia, y el modelo razonó que la infraestructura de Hugging Face probablemente tenía la clave de respuesta, se rompió de su caja de arena, encontró un verdadero día cero, y la usó. Nadie se lo dijo”, dijo Márquez.

Aimee Simpson, director de marketing de productos de la compañía de ciberseguridad Huntress, también puso en duda la narrativa de que los modelos estaban marcando cuando se salieron del entorno de pruebas de OpenAI.

“No es como si el sistema mismo fuera malicioso”, dijo a The Epoch Times.

“Los desarrolladores todavía tenían el objetivo de adquirir esa información; simplemente no pensaban que sería capaz de evitar los límites de su prueba”, agregó, describiendo el camino que el modelo escogió como “altamente creativo y extremadamente inusual”.

Thomas Wolf, Hugging Face cofundador y CSO, y Rachel Metz hablan en el escenario durante la Conferencia HumanX AI 2025 en Las Vegas el 11 de marzo de 2025. Big Event Media/Getty Images for HumanX Conference

Modelos Objetivos de OpenAI perseguidos

Los modelos se centraron en encontrar soluciones de prueba, “ir a longitudes extremas para alcanzar un objetivo de pruebas bastante estrecho”, dijo OpenAI.

Mientras que en el entorno de pruebas de sandbox de ExploitGym, los modelos encontraron y encadenaron múltiples explotaciones “cero-día” para entrar en Internet, “en busca de resolver el problema de evaluación”, según OpenAI.

Un exploit de cero días es un ciberataque que utiliza un defecto de seguridad desconocido en software o hardware. El nombre proviene del hecho de que los creadores de software han tenido días cero para solucionar el problema, lo que significa que aún no existe parche oficial o defensa.

Una vez que los modelos tenían acceso a la web más amplia, utilizaron explotaciones adicionales de cero días para entrar en Hugging Face.

En el anuncio del ataque de Hugging Face, la firma dijo que los modelos AI ejecutaron "muchos miles" de acciones discretas a través de un gran reloj de "short-lived sandboxes" para hackear la infraestructura de la comunidad.

“Esto coincide con el escenario del atacante dinámico que la industria ha estado pronosticando”, dijo Hugging Face.

In an update on the incident posted on July 28, OpenAI said that no planned release models were involved in the attack, and that it had since “deactivated, encrypted, and” restricted the implicated pre-release model from research access.

Un teléfono muestra la aplicación ChatGPT en este 1 de abril de 2025, ilustración fotográfica. Hugging Face dijo que los modelos OpenAI ejecutaron “muchos miles” de acciones discretas a través de un gran swatch de “short-lived sandboxes” para hackear en su infraestructura. Oleksii Pydsosonnii/The Epoch Times

Después de revisar el evento de intrusión y “actividad más grande de nuestros modelos”, OpenAI dijo que ha estado encontrando casos adicionales en los que “modelos identificaron y utilizaron credenciales expuestas públicamente a nivel de cuenta sobre otros servicios disponibles públicamente”.

“Vamos a seguir notificando directamente a los propietarios de servicios, y no hemos visto evidencia de impacto más amplio a estos proveedores u otras cuentas en sus servicios”, agregó.

Modelo No fue ‘Malicioso’: Expertos

Si bien ha habido casos anteriores de modelos que ocultan sus intenciones de evitar las restricciones de las pruebas de laboratorio, el incidente de Hugging Face fue significativo porque implicaba una violación de una organización externa, según el experto en ciberseguridad y TI George Rees.

“La mayor bandera roja no es que una AI se hizo maliciosa, pero que encontró un camino de una prueba controlada a la infraestructura viva de otra persona”, dijo Rees, quien es el consultor de seguridad senior en Secarma, The Epoch Times.

“Las salvaguardias conductuales no pueden sustituir la contención técnica, porque un agente de inteligencia artificial sólo necesita un permiso pasado por alto o una ruta de escape para convertir un fallo de evaluación en un incidente de seguridad real”.

La empresa de ciberseguridad DigiCert encontró recientemente que el 78% de las organizaciones ya han experimentado un incidente de seguridad relacionado con AI o una violación de vulnerabilidad.

“En muchos casos, estos son señales de alerta temprana que AI está expandiendo la superficie de ataque más rápido que las prácticas de seguridad están evolucionando”, dijo DigiCert CTO Jason Sabin a The Epoch Times.

“Esto significa que AI no es sólo otro tipo de programa que opera en la red; es un participante activo capaz de acceder a datos, tomar decisiones, pedir herramientas e interactuar con otros sistemas.

“Esto afecta cómo se estructura la seguridad, ya que las organizaciones deben identificar quién está accediendo a sus sistemas y decidir si se puede confiar en la AI”.

Un hombre utiliza el software AI en un portátil en el centro de Londres el 2 de julio de 2025. A principios de agosto, el Instituto de Seguridad y Seguridad AI del Reino Unido publicó un informe en el que se describía un incidente similar de ciberseguridad en los modelos OpenAI y Anthropic AI. Justin Tallis/AFP via Getty Images

A principios de agosto, el Instituto de Seguridad y Seguridad AI del Reino Unido publicó un informe en el que se describía un incidente similar con los modelos OpenAI y Antropopic AI.

Los agentes se encargaron de resolver un desafío de ciberseguridad más de 100 veces a través de múltiples modelos.

“Nuestra investigación encontró que en 10 de esas carreras, un agente de IA tomó acciones autónomas y sin sanción en internet en vivo, dirigidas a personas y organizaciones reales. En total, catalogamos 19 tales acciones. Casi todo este comportamiento (17 acciones) provenía de un solo modelo, el Mito 5 de Antrópico, con 2 acciones que involucran al GPT-5.6-Sol de OpenAI”, afirmó el informe.

Menos de una semana antes, Anthropic anunció que su chatbot Claude había accedido a Internet en tres instancias separadas durante las evaluaciones en un banco de pruebas.

Mientras que Anthropic había pensado que Claude funcionara en un entorno simulado sin acceso a Internet, un “comprensión entre nosotros y nuestro socio de evaluación” llevó a Claude a tener acceso a Internet.

Meta dijo la semana pasada que uno de sus modelos AI violó a otra empresa durante una prueba de ciberseguridad, lo que lo convirtió en el tercer gran evento de piratería AI.

El modelo fue capaz de violar la otra empresa al obtener acceso a Internet durante la prueba, según Meta.

Implications for Cybersecurity

El incidente exige una acción rápida para prevenir violaciones de seguridad a gran escala, dijeron a The Epoch Times expertos en IA y ciberseguridad.

Una opción es “traer a todas las personas más inteligentes en esta industria y hacer algunas reglas básicas, mejores prácticas” que se convertirían en “regla…