El incidente con el buque insignia de Moonshot Kimi K3 sigue violaciones similares de las pruebas reportadas por OpenAI y Anthropic

Un modelo líder de inteligencia artificial china (AI) ha encontrado un camino alrededor de las restricciones durante una prueba controlada de ciberseguridad, añadiendo crecientes preocupaciones sobre la eficacia de las salvaguardias de la IA, dijo la firma estadounidense de investigación de ciberseguridad Frontier Security.

Los investigadores identificaron el modelo como startup El buque insignia de Moonshot Kimi K3, diciendo que accedió a información en línea durante una evaluación en un entorno de pruebas aislado desarrollado por el Instituto de Seguridad AI del Reino Unido. El sistema está diseñado para mantener los modelos AI desconectados de Internet mientras se evalúan sus capacidades.

En lugar de completar la tarea utilizando sólo la información proporcionada para la prueba, Kimi K3 encontró una manera de acceder a la información en línea, según Frontier Security. Los investigadores dijeron que el modelo aprovechó un defecto en la forma en que se configuraba el entorno de pruebas en lugar de romper su seguridad.

Leer más

Agentes de IA rogue apuntaron a personas reales durante pruebas

A diferencia de algunos modelos de IA involucrados en recientes incidentes de pruebas, Kimi K3 no intentó acceder o atacar sitios web externos o sistemas informáticos, dijo Frontier Security. Sin embargo, los investigadores dijeron que el incidente sugiere que el modelo carece de algunas de las salvaguardias cibernéticas incorporadas encontradas en sistemas rivales de IA y podría plantear mayores riesgos porque ya está disponible públicamente para los desarrolladores para descargar, modificar y utilizar.

A continuación se presentan simulacros de prueba similares reportados en las últimas semanas por OpenAI y Antropopic, cuyos modelos de IA también salieron de sus entornos de prueba previstos durante evaluaciones controladas. En algunos de esos casos, los sistemas interactuaron con servicios externos en línea al intentar completar las tareas asignadas.

READ MORE: Los científicos crean virus con AI

Los últimos hallazgos añaden al creciente escrutinio de sistemas avanzados de IA, ya que gobiernos, investigadores y empresas tecnológicas buscan fortalecer las pruebas de seguridad. Las evaluaciones recientes han demostrado que los modelos de IA cada vez más capaces pueden explotar debilidades no deseadas en entornos de prueba o actuar más allá de los límites establecidos por los investigadores.