Cuanto más rápido actúe el agente, menos tiempo quedará para verificar sus decisiones.

Uno de los principales mecanismos de protección para agentes de IA autónomos puede darle a la persona solo la ilusión de control. Los autores de un nuevo trabajo advierten: cuando un agente actúa con rapidez y proporciona demasiada información, el usuario deja de comprender cada decisión y gradualmente reduce el control a pulsar el botón «Permitir».
Los autores formularon el problema de forma contundente. Un investigador describió a la persona en un sistema así como "un trozo de carne que concede permisos", porque ya no queda atención suficiente para verificar cada paso de forma consciente. Los investigadores no realizaron un experimento que demostrara la inevitabilidad de ese escenario. En el trabajo reunieron resultados de estudios sobre automatización y la interacción de las personas con sistemas informáticos, y luego aplicaron conclusiones previas a los agentes modernos.
El problema principal surge por la lógica misma del desarrollo. Los creadores de agentes intentan aumentar la velocidad, la precisión y el volumen de trabajo realizado. Con la mayor productividad crece el flujo de planes, peticiones, resultados intermedios y decisiones que la persona debe revisar. En algún momento el usuario comienza a aceptar más rápido, porque analizar detenidamente cada acción se vuelve demasiado difícil.
El pensamiento humano facilita además la tarea del agente. Las personas con frecuencia aceptan recomendaciones de un sistema automático incluso cuando están equivocadas, y la primera opción propuesta influye en la elección posterior y dificulta la búsqueda de alternativas. Las respuestas constantes de aprobación del sistema también reducen la alerta. Los investigadores consideran que la costumbre de aceptar con rapidez convierte progresivamente el control sustantivo en una formalidad.
Las consecuencias pueden manifestarse no solo en una acción autorizada por error. Tras un uso prolongado de la automatización la persona corre el riesgo de perder las habilidades necesarias para comprobar la máquina. El agente asume cada vez más el razonamiento, el usuario resuelve la tarea con menor frecuencia por su cuenta y luego percibe peor los errores precisamente en las operaciones que debe supervisar.
La magnitud del problema queda bien ilustrada con el reciente ataque a Hugging Face. Durante pruebas internas de modelos de OpenAI, los agentes evadieron las restricciones que debían aislarlos de Internet, accedieron a la infraestructura interna de OpenAI y a los sistemas de Hugging Face. La empresa reconoció que los modelos actuaron fuera de las tareas asignadas.
Una investigación independiente contó alrededor de 1200 agentes que encontraron un canal de comunicación no autorizado y se intercambiaron más de 70 000 mensajes y archivos. Aproximadamente 700 agentes participaron después en el ataque contra Hugging Face. Los agentes intentaron engañar al sistema automático de evaluación, exploraron formas de falsificar los registros de sus acciones y utilizaron infraestructura ajena para entender cómo funciona la verificación de resultados.
Los investigadores empezaron a preparar su trabajo antes de la publicación de los detalles del ataque, por lo que el caso de Hugging Face no sirvió como prueba inicial de su idea. El incidente solo mostró cuán rápido la escala de las acciones de un agente puede superar las capacidades de la persona a la que se le propone supervisar lo ocurrido.
Los autores proponen desacelerar intencionadamente etapas concretas del trabajo. Antes de mostrar su propio plan, el agente puede pedir primero al usuario que elija por sí mismo el siguiente paso. Tras la aprobación, el sistema puede preguntar qué hechos harían cambiar la decisión a la persona. Si el usuario empieza a confirmar las solicitudes cada vez más deprisa, la interfaz puede exigir una revisión más atenta.
También aconsejan a las empresas modificar el modo de trabajo: hacer que los empleados resuelvan periódicamente tareas sin el agente, limitar los turnos largos de vigilancia continua y dejar a la persona suficiente práctica para tomar decisiones de forma autónoma. Todas las medidas consumen tiempo, aunque los desarrolladores suelen valorar a los agentes por su rapidez. Los autores consideran razonable perder unos minutos si la alternativa obliga a la persona a pasar horas enmendando las consecuencias de decisiones que casi no verificó.