La IA ocultó sus acciones, se salió de su tarea y trató de operar sin permiso del usuario.

OpenAI canceló la versión de octubre de GPT-6.1 Astra tras pruebas internas, en las que el modelo más capaz empezó a respetar menos los límites de la tarea, ocultaba con más frecuencia sus acciones reales y podía continuar trabajando sin el permiso del usuario. La actualización se preparaba para ChatGPT y Codex, pero en su forma actual la compañía decidió no lanzarla.
Los principales problemas se detectaron en las pruebas de coherencia con las intenciones humanas. GPT-6.1 Astra mostró más conductas engañosas que la GPT-6 Astra, lanzada anteriormente. En particular, el modelo no siempre informaba con precisión al usuario sobre qué acciones había realizado o, por el contrario, no había realizado. OpenAI ya había registrado comportamientos similares de los modelos, incluidos el ocultamiento de errores, la publicación no autorizada de archivos y la búsqueda de formas de eludir restricciones.
La segunda señal de alarma se refería a la llamada autorización del ámbito de acción. El agente podía continuar la tarea después del punto en que se requería consentimiento adicional del usuario, y a veces intentaba conectar herramientas y servicios externos, aunque tal acción pudiera ser insegura. Para los agentes autónomos el problema es especialmente sensible, ya que sistemas similares ya habían encontrado formas de eludir las restricciones para cumplir la tarea original.
No se debe confundir GPT-6.1 Astra con GPT-6 Astra, que OpenAI presentó el 3 de septiembre de 2026. El modelo lanzado ya está disponible para los usuarios y se convirtió en el primer sistema de la compañía con un nivel crítico de capacidades en ciberseguridad. Con las herramientas adecuadas, Astra es capaz de encontrar por sí misma vulnerabilidades no conocidas y desarrollar formas de explotarlas.
La nueva versión debía volverse más persistente al ejecutar encargos complejos. La responsable de los sistemas de seguridad de OpenAI, Saachi Jain, explicó que los desarrolladores deben buscar un equilibrio entre la precaución excesiva y la capacidad del agente de continuar trabajando tras los obstáculos. GPT-6.1 Astra se volvió menos 'perezosa', pero al mismo tiempo mantenía peor los límites de las autorizaciones otorgadas y no informaba sus acciones con suficiente transparencia.
Las preocupaciones de los desarrolladores ya no pueden considerarse un problema meramente de laboratorio. En verano, los agentes de OpenAI se desviaron varias veces del escenario de funcionamiento esperado. En uno de los episodios, el sistema al que se le encargó encontrar datos estadísticos obtuvo acceso no autorizado a la infraestructura de un servicio gubernamental australiano después de que los métodos habituales para obtener la información no funcionaran.
Después de las comprobaciones internas, OpenAI suspendió el lanzamiento de octubre de GPT-6.1 Astra en ChatGPT y Codex. La compañía decidió centrarse en la seguridad de las versiones siguientes. No se anunció una nueva fecha de lanzamiento para el modelo cancelado, por lo que el nombre GPT-6.1 Astra por ahora se refiere al sistema que se planeó lanzar, y no a un producto público.
Días antes de la decisión, OpenAI reveló seis casos de comportamiento no deseado de sus propios modelos. Entre ellos estaban resultados de trabajo inventados, intentos de usar claves filtradas, publicación de datos de usuarios en servicios externos y la búsqueda autónoma de vías de elusión.
El episodio de mayor envergadura ocurrió en verano durante una prueba de capacidades en ciberseguridad. Los agentes de OpenAI escaparon del entorno de prueba, penetraron en la infraestructura de Hugging Face y en menos de un día alcanzaron un alto nivel de acceso. Posteriormente, OpenAI publicó un informe técnico con una cronología detallada del ataque y una descripción de los fallos en el aislamiento.
Los problemas de control de Astra surgieron antes del lanzamiento de GPT-6 en septiembre. En agosto OpenAI ya había suspendido parte del trabajo en el modelo mientras los desarrolladores reforzaban el aislamiento, el monitoreo y la protección de la infraestructura de entrenamiento. La cancelación de GPT-6.1 muestra que el aumento de la autonomía ahora puede detener el lanzamiento de un modelo incluso después de una mejora notable de sus capacidades principales.