Empresas de IA acuerdan cuatro niveles de control tras una serie de incidentes preocupantes.

Los mayores desarrolladores de inteligencia artificial decidieron dejar por escrito reglas que deben impedir que los modelos más potentes se salgan del control. OpenAI, Anthropic, Google, Meta, Nvidia y xAI se unieron al acuerdo voluntario de la Casa Blanca sobre la seguridad de la IA.
Las empresas acordaron establecer cuatro niveles de control. Los desarrolladores deben implantar mecanismos internos de supervisión de los modelos, designar un equipo separado para verificar esos mecanismos, recurrir a auditores externos e independientes y crear un comité ante el consejo de administración. Anthropic ya comenzó a implementar un modelo similar de revisión independiente junto con Accenture.
Los participantes del acuerdo prometen prestar especial atención a las capacidades de la IA en ciberseguridad, biología y química. El documento establece de manera explícita la tarea de evitar situaciones en las que un modelo piratee o acceda a sistemas técnicos por medios que los desarrolladores no habían previsto. Las empresas también acordaron reunirse con regularidad y precisar estándares comunes de seguridad.
El acuerdo fue suscrito por el presidente de OpenAI, Greg Brockman; el director de Anthropic, Dario Amodei; el responsable de Google, Sundar Pichai; el director de Meta, Mark Zuckerberg; el responsable de Nvidia, Jensen Huang; y Elon Musk, en representación de xAI. El documento por ahora no crea obligaciones legales. Los participantes, no obstante, admiten que con el tiempo algunas reglas podrían convertirse en leyes o en requisitos normativos.
La razón para el compromiso colectivo fue bastante práctica. En los últimos meses los desarrolladores reconocieron en varias ocasiones que agentes autónomos habían salido de los entornos de prueba preparados y obtenido acceso a sistemas ajenos. En uno de los experimentos, un modelo de Meta obtuvo acceso a internet por error y aprovechó una vulnerabilidad de un servicio externo.
Los riesgos ya no se limitan a errores habituales de los chatbots. Los modelos más potentes pueden buscar vulnerabilidades, escribir exploits y ejecutar largas cadenas de acciones con casi ninguna intervención humana. OpenAI, Anthropic y Google refuerzan al mismo tiempo la protección contra escenarios relacionados con armas biológicas, porque las nuevas generaciones de modelos mejoran en la resolución de tareas científicas complejas.
Donald Trump, por su parte, mantuvo la línea de promover el rápido desarrollo del sector y la autorregulación en lugar de un control gubernamental estricto previo. El presidente de Estados Unidos calificó el acuerdo como algo parecido a una "constitución" para la industria y dijo que estudia la creación de un consejo de diez personas para supervisar la seguridad de la IA. Paralelamente, la Casa Blanca se prepara para nombrar un nuevo funcionario responsable de la política en materia de inteligencia artificial.
La desconfianza de la sociedad en el sistema de control actual sigue siendo alta. En una encuesta de Reuters/Ipsos realizada entre el 17 y el 20 de septiembre, el 73 % de los encuestados estadounidenses expresó preocupación de que las empresas de IA no hagan lo suficiente para evitar un daño grave a la sociedad. Un 55 % apoyó la idea de frenar el desarrollo de la tecnología.
El nuevo pacto no obliga a los desarrolladores a detener el entrenamiento de modelos potentes ni establece un mecanismo estatal único de autorización antes del lanzamiento. En la práctica, las empresas acordaron convertir el control, la auditoría y la responsabilidad de la dirección en una parte permanente del desarrollo. Hace poco, el intento de los mayores laboratorios de frenar la carrera de forma colectiva generó inquietud por posibles reclamaciones bajo la legislación antimonopolio.
Anthropic ya fue más allá de la promesa general y acordó con Accenture invertir al menos $2.000 millones de dólares en un sistema en el que especialistas externos verificarán los modelos avanzados directamente durante el proceso de desarrollo. Los auditores tendrán la posibilidad de buscar comportamientos peligrosos y evaluar los mecanismos de protección antes del lanzamiento de los sistemas.
OpenAI recientemente compiló por primera vez sus propios incidentes en un informe público separado. La empresa describió seis casos en los que los modelos ocultaron errores, buscaron claves ajenas, publicaron archivos en internet o eligieron de forma autónoma maneras de evadir las restricciones.
Un problema similar apareció en Google. Durante las pruebas, Gemini salió del entorno controlado y accedió a los sistemas de tres empresas reales, tomando servidores externos por parte de la tarea. Episodios como ese explican por qué la promesa de "controlar la IA" ahora incluye no solo filtros de respuestas, sino también la auditoría de las acciones reales de los agentes autónomos.