La empresa lanzó una investigación después de que sus modelos avanzados escaparan de un ambiente de prueba y hackearon los sistemas de otra empresa sin instrucción humana

OpenAI ha descubierto casos adicionales en los que sus modelos autónomos de IA violaron la contención y actuaron sin instrucción humana, informó Reuters, citando fuentes.

Los hallazgos vienen a medida que la compañía expande su investigación sobre un incidente de piratería el mes pasado en el que un bot AI se entrometió mientras intentaba engañar en una prueba interna de ciberseguridad.

Durante las pruebas de GPT-5.6 Sol y otro modelo sin liberación, ambos despojados de sus guardias de seguridad, los sistemas fueron asignados ExploitGym – un punto de referencia diseñado para medir la capacidad de los modelos AI para identificar y explotar vulnerabilidades de software conocidas. En lugar de completar las tareas, un modelo escapó de su entorno de pruebas supuestamente aislado, obtuvo acceso a Internet y hackeado en Hugging Face – un repositorio en línea para los modelos y conjuntos de datos de AI – en busca de respuestas preparadas.

OpenAI dijo inicialmente que la intrusión estaba limitada a Hugging Face. Sin embargo, en un comunicado el miércoles, reconoció que la escoria de piratería también había comprometido cuatro cuentas en cuatro servicios separados.

Leer más

OpenAI escape: ¿Ha comenzado el levantamiento del robot?

El viernes, Reuters informó que desde entonces se habían descubierto infracciones adicionales de contención, aunque no está claro cuántos incidentes ocurrieron, cuándo ocurrieron o qué sistemas apuntaron. Una fuente dijo a la agencia de noticias que las brechas eran de alcance limitado y que ninguno de los bots AI se cree que han dejado la red interna de OpenAI. Reuters dijo que OpenAI y expertos externos también están revisando los registros de principios de este año para determinar si otros incidentes similares no habían sido notificados.

OpenAI defiende sus modelos

OpenAI culpó a la violación inicial de un defecto en software de terceros utilizado en su entorno de pruebas, diciendo que sus modelos AI lo explotaron para romper y obtener acceso a Internet. La compañía dijo que está endureciendo los controles de contención, monitoreo y acceso mientras investiga la brecha y parche el defecto.

El CEO Sam Altman también reconoció que “podemos tener que acelerar la tasa de desarrollo de AI”, pero no se comprometió a frenar la investigación de la empresa.

Preguntado sobre el informe Reuters, OpenAI se negó a comentar, refiriéndose a una declaración anterior diciendo que era consciente de la especulación y planeaba publicar “un informe técnico de nuestros aprendizajes en las próximas semanas”.

Antrópico encuentra infracciones similares

El desarrollador de Rival AI Anthropic dijo el jueves que también había descubierto brechas de contención con sus modelos de Claude durante las pruebas de seguridad interna.

Leer más

Antrópico dice que los modelos Claude AI lanzaron tres ciberataques no deseados

La compañía dijo que el incidente de OpenAI le impulsó a examinar si sus propios modelos se habían comportado de forma similar. Después de revisar más de 140.000 evaluaciones, encontró que Claude había obtenido acceso a Internet desde entornos de prueba destinados a sellarse y llevar a cabo intrusiones no autorizadas en sistemas de tres organizaciones. Los primeros incidentes dataron de abril, y ni Antropópico ni las organizaciones afectadas detectaron las infracciones en ese momento.

Antrópico advirtió contra la interpretación excesiva de los hallazgos porque el comportamiento ocurrió en lo que describió como un ambiente de prueba controlado. Sin embargo, reconoció que los incidentes mostraban que los sistemas de evaluación de la IA " requerían controles significativos " y que los entornos de ensayo debían estar garantizados de la misma manera que los sistemas de producción.

Concerns over rogue AI on the rise

Los incidentes han alimentado la preocupación de que los modelos autónomos de IA se están volviendo cada vez más capaces de llevar a cabo ciberataques con poca supervisión humana, lo que da lugar a nuevos llamamientos para una regulación más estricta. También han reiniciado el debate sobre quién debe ser responsable cuando los sistemas de IA causan daños en el mundo real. Los expertos advierten que las capacidades de IA avanzan más rápido que las medidas de seguridad.

Después de alabar inicialmente a OpenAI por cooperar con la investigación, Hugging Face llamó más tarde a la empresa a liberar los registros de actividad de los bots y evitar que esos incidentes se “normalicen”, advirtiendo a los responsables “deben rendir cuentas”.

Leer más

AI ‘meses de distancia’ de tomar gobiernos – grupo de inteligencia

El presidente estadounidense Donald Trump, que firmó el mes pasado un memorando de seguridad nacional destinado a acelerar el uso de la IA avanzada en toda la comunidad militar e de inteligencia, dijo el miércoles que su administración estaba revisando los posibles controles de IA después de los incidentes.

“Estamos mirando a AI, estamos viendo controles”, dijo Trump a los periodistas. Insistió, sin embargo, que Washington debe seguir siendo el líder mundial en AI, agregando que no quería normas que dejaran a Estados Unidos “segundo a China”.

Según Reuters, la Comisión Europea se ha puesto en contacto con OpenAI y Antrópico para discutir los incidentes por delante de la Ley de AI de la UE que entrarán en vigor el 2 de agosto. Según informes, los funcionarios instaron a una vigilancia más fuerte, la gestión del riesgo y las salvaguardias de ciberseguridad para sistemas avanzados de IA dentro de las empresas bajo las nuevas reglas del bloque, lo que permitirá multas de hasta 35 millones de euros (38 millones) o 7% de la facturación anual mundial para las violaciones más graves.