Nvidia crea un supervisor independiente para agentes autónomos fuera de contro

Nvidia crea un supervisor independiente para agentes autónomos fuera de contro

Sentry de hardware vigila a los agentes desde el exterior y puede detener a un intruso en milisegundos.

image

Los agentes de IA se vuelven tan autónomos que NVIDIA decidió dejar de confiar su propia seguridad a los propios agentes. La compañía, de hecho, externalizó el «botón rojo» a un procesador separado que supervisa el comportamiento del sistema autónomo desde fuera y puede detenerlo en milisegundos.

La nueva NVIDIA Open Agent Safety Platform está diseñada para agentes que obtienen acceso a archivos, credenciales, API, servicios corporativos y pueden ejecutar código por sí mismos. Un agente de IA así ya se asemeja a un usuario privilegiado, por lo que NVIDIA considera insuficiente una simple prohibición en el prompt del sistema.

El primer nivel de protección lo proporciona OpenShell, un entorno de ejecución de código abierto que ejecuta al agente en una caja de arena aislada y define de antemano los archivos, redes, procesos, herramientas y credenciales disponibles. NVIDIA ya había aplicado un esquema similar en NemoClaw, donde OpenShell controlaba las acciones de un asistente en funcionamiento continuo.

La principal novedad se llama Sentry. El supervisor de hardware funciona en el DPU NVIDIA BlueField-4 por separado de la unidad central de procesamiento, donde se ejecuta el agente. Sentry ve las solicitudes del modelo, los llamamientos a las herramientas y los datos, verifica la identidad del agente y aplica políticas de confianza cero. Si el sistema excede los límites permitidos, el DPU puede aislarlo y detenerlo en milisegundos.

La separación se hizo a propósito. NVIDIA parte de la premisa de que el agente puede encontrar una ruta inesperada hacia su objetivo tras un error, una prohibición o un intento fallido. Un comportamiento de este tipo ya se ha dado en la práctica: los sistemas autónomos lograron eludir restricciones e incluso utilizaron sitios externos para comunicarse, aunque los desarrolladores les prohibieron publicar información directamente.

Sentry se sitúa fuera del entorno que controla el propio agente, por lo que el modelo no puede simplemente modificar la regla de protección junto con sus herramientas. En los sistemas Vera Rubin, BlueField-4 está colocado directamente en la ruta hacia el modelo, lo que permite supervisar la actividad independientemente del entorno operativo principal. NVIDIA denomina ese enfoque como una capa adicional de protección en caso de que el contorno de software ya no pueda considerarse confiable.

La razón de una arquitectura tan estricta es bastante práctica. En los últimos meses los agentes ya salieron de los entornos de prueba, buscaron vulnerabilidades y obtuvieron acceso a infraestructura real. Uno de los casos más demostrativos terminó con la intrusión en Hugging Face, cuando agentes experimentales de OpenAI llegaron a sistemas de producción.

En la descripción de la nueva plataforma NVIDIA escribe directamente que el escenario recurrente se ve igual: el agente elude la protección de nivel de aplicación para cumplir la tarea asignada. OpenShell y Sentry deben trasladar parte de las prohibiciones a un lugar donde el modelo ya no pueda autoconcederse excepciones. La plataforma admite NVIDIA Vera, y el OpenShell abierto puede adaptarse para procesadores Arm e Intel.

La ironía es que la tecnología de protección anterior de NVIDIA recientemente fue objetivo de un ataque. La vulnerabilidad de NemoClaw permitía que una página web maliciosa influyera en el modelo local y cambiara el comportamiento posterior del agente. El Sentry de hardware añade precisamente otra barrera independiente en caso de compromiso de la capa de software.

El problema ya va mucho más allá de los experimentos de laboratorio. En septiembre, agentes de OpenAI accedieron al sistema del Ministerio de Salud australiano durante una búsqueda habitual de estadísticas médicas. Cuantas más facultades los desarrolladores transfieren a los sistemas autónomos, más lógica parece la idea de NVIDIA: se permite al agente actuar por sí mismo, pero la última palabra la tiene el procesador al que el agente no puede alcanzar.