Intento de reforzar la seguridad de un script sencillo acabó provocando justo lo contrario.

Historias sobre cómo los agentes de IA interpretan las órdenes demasiado literalmente dejan de ser curiosidades y conllevan cada vez más pérdida real de datos. El desarrollador Sebastien Gllmt contó que, durante una prueba del script de protección, Claude eliminó alrededor de 700 GB de datos del directorio personal. Junto con los archivos se perdió aproximadamente una semana de trabajo, aunque el script debía precisamente impedir eliminaciones peligrosas.
Gllmt quiso resolver un problema doméstico con archivos temporales que los agentes de IA dejaban en el directorio /tmp. Claude Fable propuso aislar cada agente en una carpeta separada y limpiar la carpeta al finalizar su trabajo. La tarea principal fue comprobar que la limpieza no afecte a procesos activos, a archivos abiertos en el disco y que no salga del directorio temporal.
Tras la observación del desarrollador sobre la complejidad excesiva del código, Fable ejecutó una verificación adicional de seguridad. El sistema de Anthropic consideró el script arriesgado y cambió automáticamente la ejecución primero a Opus 5 y luego a Opus 4.8. Fue Opus 4.8 el que realizó la prueba, comparando la ruta de eliminación con /tmp y con el directorio personal para excluir comandos peligrosos.
La comprobación identificó ambas rutas como peligrosas, pero el error ocurrió en la fase de limpieza posterior a la prueba. El código reutilizó la misma variable para el objetivo de la prueba y para la eliminación de datos temporales. Como resultado, el comando de limpieza recibió la ruta al directorio personal y comenzó a borrar su contenido, aunque la lógica de protección había identificado correctamente esa ruta como no aceptable.
Gllmt detuvo el proceso, pero parte de los datos ya se habían perdido. Además, el directorio /tmp, para cuya limpieza se creó el script, permaneció en su lugar. Más tarde el desarrollador recuperó la mayor parte de la información perdida desde Git, Nix, los registros de sesión y otras fuentes. Sin embargo, el incidente aún afectó aproximadamente una semana de trabajo y mostró el coste de un error en un script automático.
Presumiblemente, el cambio automático a un modelo más débil pudo aumentar el riesgo de error, ya que Fable 5 maneja mejor las tareas de programación que Opus 4.8. Reducir el riesgo de casos similares ayuda aislar comandos peligrosos de los datos de los usuarios, hacer pruebas en copias y mantener copias de seguridad periódicas.