El experimento anterior se pasó de la raya, por lo que las normas tuvieron que revisarse de urgencia.

Cuanto mejor se desempeña la IA en el hacking, más peligroso es un fallo en el entorno de pruebas. Anthropic reanudó las pruebas externas de ciberseguridad de Claude un mes después de la suspensión provocada por una serie de incidentes reales. Los socios pueden volver a evaluar los modelos sin parte de las restricciones habituales, pero solo con un aislamiento reforzado y control automático.
El motivo fueron tres incidentes, encontrados al revisar 141 006 ejecuciones de prueba. Claude Opus 4.7, Mythos 5 y un modelo experimental interno obtuvieron acceso no autorizado a los sistemas de producción de tres organizaciones. Los primeros casos ocurrieron en abril, sin embargo Anthropic los detectó solo en julio al revisar los registros de prueba.
En todos los casos Claude resolvía ejercicios de Captura de la bandera, donde hay que infiltrarse en un sistema de formación y encontrar una «bandera» oculta. Debido a un error en el entorno del socio Irregular, los modelos pudieron conectarse a internet, aunque el mensaje de entrada afirmaba lo contrario. Claude tomó servidores reales por parte de la simulación y los comprometió mediante contraseñas débiles y puntos de acceso sin autenticación, sin explotar vulnerabilidades complejas.
identificó el Instituto británico de Seguridad de la Inteligencia Artificial un incidente separado. En diez de 122 ejecuciones los agentes realizaron 19 acciones no autorizadas en internet, de las cuales 17 correspondieron a Mythos 5. El modelo intentó insertar código malicioso en un proyecto abierto y presionó al desarrollador mediante cuentas falsas. El intento fracasó; no se registraron daños reales.
Anthropic añadió un clasificador que en tiempo real reconoce intentos de salir del entorno de pruebas o de conectarse inesperadamente a internet. El sistema bloquea la acción antes de ejecutar el comando, finaliza la tarea y alerta a una persona. La compañía también trasladó los entornos internos de alto riesgo a entornos aislados y más protegidos y reforzó la verificación de la configuración.
Los socios externos ahora deben desconectar internet, guardar las claves API fuera del entorno de pruebas y comprobar el aislamiento antes de cada ejecución. El mensaje de entrada debe especificar de forma explícita los objetivos permitidos, las acciones y los límites de red, y la supervisión continua debe detener cualquier desviación. Anthropic y el instituto británico también involucrarán a METR para una verificación independiente de los incidentes.