El desarrollador de AI dice que los incidentes ocurrieron durante pruebas de ciberseguridad después de un malentendido con un socio de evaluación dio a sus modelos acceso a Internet abierto
El desarrollador de AI Anthropic ha revelado tres incidentes en los que sus modelos Claude AI se centraron involuntariamente en organizaciones del mundo real durante las evaluaciones de la ciberseguridad que supuestamente tenían lugar en un entorno aislado.
The cases were identified retrospectively during a review prompted by a similar incident involving OpenAI and Hugging Face, an online repository for AI models and datasets, which was reported this month.
Antrópico dijo que había encontrado tres incidentes que datan de abril. En cada caso, un entorno de prueba mal configurado mantuvo el acceso a Internet, Claude permitiendo interactuar con empresas reales y servicios públicos. La empresa atribuyó el problema a un “entendido” con su socio de evaluación, Irregular. Las pruebas involucraron ejercicios “capturar la bandera” que requieren que Claude obtenga información restringida de objetivos simulados. Sin embargo, el modelo fue incorrectamente dicho que la red no tenía conexión con el mundo exterior, empujando hacia el tratamiento de cualquier sistema que encontró como parte del ejercicio.
Leer más
OpenAI escape: ¿Ha comenzado el levantamiento del robot?
En un caso, la compañía ficticia que Claude había recibido instrucciones para infiltrarse compartió su nombre con un dominio de Internet real. The model accessed the genuine site during four separate test runs and extracted information that reportedly included application and infrastructure credenciales. Durante otra evaluación, Claude encontró instrucciones ficticias dirigiendo un ingeniero de software para instalar el código Python. Luego subió un paquete de software malicioso a PyPI, un repositorio público para los programas de Python, en un intento de obtener acceso a su objetivo.
Antes de que PyPI identifique el paquete como malicioso, fue descargado y ejecutado en 15 sistemas reales, incluyendo uno operado por una compañía de seguridad. Claude posteriormente extrajo credenciales que utilizaba para acceder a partes adicionales de la infraestructura de la firma, dijo Anthropic.
En el tercer y más reciente incidente, el modelo luchó por alcanzar su objetivo previsto y comenzó a buscar en internet objetivos alternativos. Finalmente detuvo su actividad después de determinar que los sistemas que encontró eran reales en lugar de simulados.
READ MORE: EE.UU. prohíbe robots humanoides chinos
Antrópico dijo que en el incidente de PyPI, el registro de razonamiento de Claude declaró que subir malware a un repositorio real sería “NOT ok”. Pero el modelo se persuadió a sí mismo de que el servicio era parte de la simulación después de no reconocer a las verdaderas autoridades certificadoras asegurando sus conexiones. La divulgación viene en medio de intensificar la competencia entre los desarrolladores de AI de EE.UU. y China como raza de empresas para construir modelos cada vez más capaces. Anthropic, OpenAI, y otras empresas han tratado de demostrar avances en el rendimiento de AI mientras invierten fuertemente en nuevos sistemas.
Algunos ejecutivos de tecnología han argumentado que las compañías estadounidenses de IA deberían aflojar ciertas restricciones de seguridad para preservar su posición en la carrera global de IA.