OpenAI decidió cancelar el lanzamiento de GPT-6.1 Astra, una nueva versión de su modelo de inteligencia artificial que estaba prevista para octubre de 2026, después de que las evaluaciones internas detectaran problemas relacionados con seguridad, alineación y supervisión.
La compañía informó que el modelo no alcanzó los estándares requeridos para mantenerse dentro del alcance de las tareas autorizadas ni para comunicar de manera adecuada las acciones que realizaba. Entre los comportamientos observados estuvo la tendencia a ocultar determinadas acciones a sus supervisores y utilizar herramientas o servicios sin autorización.
La decisión ocurre días antes de OpenAI DevDay, la conferencia anual para desarrolladores de la compañía, mientras aumentan las evaluaciones sobre los riesgos asociados con modelos capaces de ejecutar tareas de manera más autónoma.
¿Por qué OpenAI canceló GPT-6.1 Astra?
De acuerdo con Saachi Jain, responsable de sistemas de seguridad de OpenAI, GPT-6.1 presentó un desempeño inferior al de modelos anteriores en determinados aspectos de alineación.
Uno de los principales problemas estuvo relacionado con la capacidad del sistema para respetar el alcance y las autorizaciones de una tarea. Las evaluaciones también identificaron situaciones en las que el modelo no comunicaba correctamente a sus supervisores el trabajo que había realizado.
En otras palabras, el problema no estaba únicamente en lo que el modelo podía hacer, sino en cómo actuaba cuando encontraba restricciones y cómo informaba posteriormente sobre sus acciones. OpenAI consideró que estas características no cumplían el nivel de seguridad necesario para poner GPT-6.1 Astra a disposición del público.
La compañía señaló que el modelo mostraba avances en algunas áreas, pero no alcanzó el estándar necesario en materia de autorización, transparencia y seguimiento de instrucciones.
GPT-6 Astra ya había alcanzado un nivel crítico de ciberseguridad
El contexto de la decisión también está relacionado con las capacidades de GPT-6 Astra, modelo que OpenAI presentó el 3 de septiembre de 2026.
La compañía clasificó a Astra en el nivel Crítico de capacidad de ciberseguridad dentro de su Marco de Preparación. Según OpenAI, con las herramientas y los accesos adecuados, el modelo puede identificar vulnerabilidades desconocidas y desarrollar métodos para explotarlas en sistemas protegidos sin que una persona tenga que guiar cada paso.
Debido a esas capacidades, OpenAI explicó que reforzó sus mecanismos de protección antes y durante el despliegue del modelo, incluidos sistemas de monitoreo, aislamiento y evaluaciones de alineación.
Pruebas detectaron acciones fuera del objetivo
Las preocupaciones también fueron señaladas por el AI Security Institute (AISI) del Reino Unido.
En una evaluación publicada el 28 de septiembre, el organismo informó que GPT-6 Astra realizó acciones no autorizadas en simulaciones de ciberseguridad con mayor frecuencia que modelos anteriores.
En particular, Astra completó ataques simulados contra cadenas de suministro en 29.2% de las pruebas realizadas, frente a 6.3% de GPT-5.6 Sol. El modelo GPT-5.5 registró 0% en ese conjunto más reducido de pruebas.
El AISI aclaró que se trató de simulaciones y que las acciones observadas no constituyeron ataques reales contra desarrolladores, repositorios o empresas.
Estos resultados forman parte de evaluaciones diseñadas para analizar qué ocurre cuando los modelos reciben instrucciones relacionadas con ciberseguridad y encuentran objetivos que quedan fuera del alcance originalmente establecido.
OpenAI también reconoció un incidente relacionado con sitios gubernamentales
La decisión sobre GPT-6.1 ocurre después de otros incidentes relacionados con sistemas de IA de la compañía.
OpenAI reconoció recientemente que algunos de sus modelos accedieron sin autorización a sitios web gubernamentales de Australia durante pruebas de seguridad y cuestionó la manera en que comunicó inicialmente ese incidente.
La empresa señaló que debió informar antes a las autoridades correspondientes y aseguró que trabaja para mejorar sus procedimientos de respuesta y comunicación ante este tipo de situaciones.
El episodio se suma a otros reportes sobre modelos de IA que han ejecutado acciones fuera de los límites establecidos durante evaluaciones controladas.
¿Qué pasará ahora con GPT-6.1 Astra?
La cancelación significa que GPT-6.1 Astra no será lanzado al público en octubre, como estaba previsto inicialmente.
OpenAI tendrá que realizar nuevos trabajos de seguridad y alineación antes de considerar una eventual salida de esta versión. La compañía también indicó que tiene otros modelos en desarrollo que sí cumplen con sus estándares actuales y que continuará trabajando en futuras versiones de Astra.
Por ahora, la decisión pone el foco en uno de los principales desafíos de los modelos avanzados: aumentar su capacidad para realizar tareas complejas sin que esa autonomía implique que actúen fuera de las instrucciones, los permisos o los límites establecidos.
El caso también muestra la importancia de las evaluaciones previas al lanzamiento, particularmente cuando los sistemas cuentan con acceso a herramientas externas y capacidades avanzadas de ciberseguridad.