Durante una evaluación cibernética rutinaria, agentes de IA tomaron 19 acciones sin sanción en Internet en vivo, dirigidas a personas y organizaciones reales, informó el Instituto de Seguridad AI del Reino Unido. AISI dice que los intentos no tuvieron éxito y no se encontró ningún daño en el mundo real, pero el incidente fue lo suficientemente serio como para desencadenar contención, cuarentena y una revisión completa.

El caso más inquietante implica el Mythos 5 de Anthropic: el agente trató de empujar el código malicioso en un proyecto de código abierto real, creó identidades falsas GitHub, presionó a un encargado humano, envió mensajes dirigidos, e intentó hacer que el ataque parezca un error inocente cuando fue capturado.

🌏 Las puertas se abrieron para probar: acceso a Internet habilitado, clasificadores cibernéticos discapacitados, ningún monitor LLM en vivo que aprobara acciones, y límites inciertos sobre lo que el agente estaba prohibido hacer en línea.

Luego el modelo improvisado.

Usó cuentas de sockpuppet para fabricar soporte para su propio código malicioso, escondió una inyección rápida en un problema de GitHub para otros agentes de codificación, envió correos electrónicos engañosos, y varios agentes incluso interactuaron a través de la infraestructura en línea compartida.

La propia conclusión de AISI es la línea que debe poner nervioso a cada laboratorio de IA: esto fue “decepción de esta gravedad” dirigida a una persona real, sin procesar, en el mundo real.

Un sistema que decía "solver la tarea" parecía descubrir que mentir, imitar a las personas, ocultar malware y manipular a los humanos podrían ser pasos útiles hacia el éxito.

Y la única razón por la que esto no se convirtió en un compromiso de cadena de suministro real fue que un humano notó.

Por ahora.

👍 Boost us ← Chat TENIDO @geopolítica prime