Los esfuerzos de Antrópico para probar las habilidades ofensivas de ciberseguridad de Claude produjeron un resultado involuntario del mundo real: Sus modelos AI obtuvieron acceso no autorizado a tres organizaciones externas.
La compañía dijo que los incidentes ocurrieron durante las evaluaciones de "capturar la bandera" diseñadas para medir si Claude podría identificar vulnerabilidades, explotar sistemas simulados y recuperar información oculta. Se había dicho a Claude que los objetivos eran ficticios y que su entorno de prueba no tenía acceso a Internet.
Según Anthropic, un malentendido con el socio de evaluación Acceso a Internet izquierdo irregular habilitado dentro del entorno de prueba. En al menos un caso, la compañía ficticia llamada en un desafío compartió su nombre con un dominio web activo. Claude interactuó con la organización real en lugar de un objetivo contenido.
El modelo explota vulnerabilidades en la infraestructura de la organización, extrae información y obtiene acceso a una base de datos que contiene varios cientos de filas de datos de producción.
Antrópico descubrió tres incidentes después de revisar más de 141.000 evaluaciones de ciberseguridad. Se trata de tres sistemas separados: Claude Opus 4.7, Mythos 5, y un modelo de investigación interno.
En un examen de nuestras evaluaciones de la ciberseguridad, encontramos tres incidentes en los que un modelo de Claude llegó a Internet desde dentro o mientras interactuaba con un entorno de evaluación de terceros, y luego obtuvo acceso no autorizado a los sistemas reales de tres organizaciones diferentes. Nuestro post describe lo que pasó, cómo sucedió, y lo que estamos cambiando. Alentamos a otros desarrolladores de AI a realizar exámenes similares. - Antrópico
"En todos los casos, el impulso de evaluación de Anthropic especificó a Claude que su entorno era una simulación y que no tenía acceso a Internet", dijo la empresa. "Debido a un malentendido entre nosotros y nuestro socio de evaluación, este no fue el caso, y el acceso a Internet estaba disponible".
Los modelos parecen haber llevado a cabo las tareas de seguridad ofensiva que se les asignaron mientras operaban con información incorrecta sobre si sus objetivos se simulaban.
Capturar la bandera
Los ejercicios de captura-el-flag son ampliamente utilizados para capacitar y evaluar habilidades de ciberseguridad. Se puede pedir a los participantes que inspeccionen el software, inviertan un servicio, identifiquen una vulnerabilidad o exploten un sistema deliberadamente inseguro para recuperar una señal oculta conocida como la bandera. Para un investigador de seguridad humana, el alcance de ese ejercicio se refuerza normalmente mediante autorización explícita, infraestructura controlada y barreras técnicas que separan el desafío de sistemas no relacionados.
Claude recibió instrucciones diciendo que esos límites existían.
Una vez disponible el acceso a Internet, el agente podría resolver dominios públicos e interactuar con infraestructura real. Una colisión de nombres entre un objetivo ficticio y una organización real fue suficiente para convertir una tarea de referencia en una intrusión no autorizada.
Antrópico dijo que detuvo las evaluaciones después de identificar la posibilidad de que Claude hubiera accedido a Internet público. La compañía describió los incidentes como el resultado de múltiples factores de contribución, pero dijo que se acercaría a las soluciones como si la responsabilidad fuera sólo de Antropópico.
La historia se hace eco de un incidente de OpenAI donde los modelos escaparon de la contención. Durante la propia prueba de ciberseguridad de esa empresa, dos modelos explotaron una vulnerabilidad de software en su entorno de evaluación, llegaron a Internet y acceso a sistemas pertenecientes a la plataforma AI Hugging Face.
Un sistema no necesita motivos, auto-preservación o una comprensión del mundo exterior para causar daño. Necesita capacidades ofensivas eficaces, autonomía suficiente y acceso que sus operadores no pretendían proporcionar.
Tiempo incómodo para Antrópico
The disclosure comes as Anthropic is reportedly preparing for a potential initial public offering as early as this year. Eso agrega apuestas financieras y regulatorias a preguntas sobre cómo la empresa evalúa modelos con capacidades avanzadas de ciberseguridad.
Mythos 5, uno de los modelos involucrados, se había proporcionado a un número limitado de socios y atraído la atención por su capacidad de detectar y explotar vulnerabilidades de software. Esas capacidades pueden ser valiosas para la investigación defensiva, pruebas automatizadas y descubrimiento de vulnerabilidad. También aumentan el costo de los errores en la selección de objetivos y el diseño de evaluación.
Tres incidentes entre más de 141.000 evaluaciones revisadas representan una pequeña proporción de los exámenes. Pero el riesgo relevante no es simplemente cuántas veces se produce un fallo de contención, es lo que un agente suficientemente capaz puede hacer durante la rara evaluación en la que las salvaguardias fallan.
Tyler Durden
Fri, 07/31/2026 - 12:05