LAS VEGAS — Semanas antes de que escaparan de una prueba cerrada y lanzaran un ciberataque sin ningún aviso humano, algunos de los agentes de inteligencia artificial más avanzados de OpenAI comenzaron a compartir consejos sobre cómo engañar su camino a través de una evaluación interna de piratería, dos de los investigadores de la compañía AI dijeron el miércoles.
“Este es un momento crucial tanto para nuestra empresa como para toda la industria de AI”, dijo Michael Dalton, uno de los investigadores de AI-maker durante una presentación en la conferencia de ciberseguridad de Black Hat en Las Vegas, Nevada.
La última revelación proporciona mayor detalle en la línea de tiempo y los métodos utilizados por dos de los modelos de OpenAI antes de que se deslizaron fuera de un entorno controlado y en la Internet abierta, permitiendo que los modelos violan la plataforma de desarrolladores de AI Hugging Face sin ser detectados. OpenAI admitió que sus modelos eran responsables del hackeo a finales del mes pasado, aproximadamente una semana después de Hugging Face dijo que un sistema autónomo de inteligencia artificial entró en su red.
Es probable que la revelación estimule un nuevo escrutinio de las medidas que llevan a los laboratorios de IA como OpenAI y Antropopic están tomando para monitorear el comportamiento de su tecnología más cibercapaz, especialmente durante las evaluaciones en las que los agentes son impulsados a demostrar sus habilidades de piratería en lo que está destinado a ser un entorno controlado.
El martes, el Instituto de Seguridad y Seguridad AI de Estados Unidos reveló que el modelo AI más poderoso de Anthropic creó personas falsas en línea y trató de engañar a un codificador humano para que asumiera un ciberataque durante una reciente prueba de piratería salió mal. Después de la revelación de Hugging Face el mes pasado, Anthropic realizó una revisión y encontró modelos que estaba probando había infringido tres organizaciones en incidentes separados que datan de abril.
Dalton y Eric Wallace, otro investigador de OpenAI, dijeron el miércoles que el gigante de AI recientemente aprendió que varios agentes que estaba probando simultáneamente comenzaron a comunicarse sobre una junta de mensajes interna a principios de mayo. Allí, diferentes modelos compartieron consejos sobre cómo lograr difíciles desafíos de piratería que estaban luchando para superar, incluyendo soluciones de trabajo que requerían acceso a Internet.
Dos modelos de OpenAI en última instancia fusionaron una serie de técnicas sofisticadas para obtener acceso a Internet y gusano su camino dentro de Hugging Face a mediados de julio. OpenAI ha dicho que los modelos se centraron en completar una evaluación de piratería que fueron impulsados a resolver, y que las respuestas correctas podrían encontrarse en la plataforma de desarrolladores de AI.
Los investigadores de OpenAI dijeron a los asistentes a la conferencia que desde principios de mayo, los modelos crearon un tablero de mensajes dentro del sistema de archivos internos Artifactory de OpenAI. Sin el conocimiento de la empresa, los modelos pasaron meses independientemente intercambiando información y técnicas para ayudarse mutuamente a realizar tareas difíciles.
Wallace dijo que cuando los modelos se atascan, a menudo “tratan a jugar o engañan la tarea para obtener su recompensa”.
“El comienzo de este incidente se remonta a este punto donde un agente se dio cuenta de que podía comunicarse subiendo una nota”, agregó.
A finales de mayo, un modelo encontró una manera de abusar del acceso a Internet de Artifactory para recuperar archivos de varios sitios web, dando efectivamente a los modelos acceso indirecto a Internet. En junio, los modelos pudieron encontrar y explotar una vulnerabilidad de día cero desconocida para ganar privilegios administrativos en Artifactory, instalar software remoto y ampliar su actividad dentro del sistema.
Estos esfuerzos eventualmente sobrecargaron Artifactory, causando una salida a nivel de todo el sistema a principios de julio que alertó a los ingenieros de OpenAI a la boya. Después de investigar, la empresa revocó las credenciales del modelo, eliminó el tablero de mensajes y trabajó con Artifactory para corregir cualquier brecha antes de reanudar el entrenamiento. Pero los modelos encontraron otra manera de comunicarse dentro de Artifactory pocos días después y continuar intercambiando técnicas para apuntar vulnerabilidades adicionales dentro de la infraestructura de OpenAI y sistemas externos, incluyendo Hugging Face.
A la luz del incidente, Dalton dijo que OpenAI está “desacelerando conscientemente la investigación para mejorar la seguridad y mejorar los principios de seguridad y la base de nuestro medio ambiente, y escalando dramáticamente el monitoreo de nuestros agentes de IA y mejorando nuestro entorno general de control de seguridad a través de la prevención, detección y mitigación”