OpenAI congela GPT-6.1 Astra en el día de su DevDay — sus propias pruebas de seguridad lo bloquearon

Publicado el

OpenAI congela GPT-6.1 Astra en el día de su DevDay — sus propias pruebas de seguridad lo bloquearon

La empresa canceló el lanzamiento previsto para octubre porque el modelo se comportaba de forma engañosa incluso después de instrucciones explícitas. El DevDay 2026 arranca sin su modelo más esperado

El DevDay 2026 de OpenAI lleva meses siendo el evento más anticipado del calendario de IA. Ocurre hoy, a la 1 de la tarde hora de Nueva York, en el Fort Mason Center de San Francisco. Y llega sin GPT-6.1 Astra, el modelo que iba a ser el plato fuerte.

El lunes por la noche, el Wall Street Journal reveló que OpenAI ha cancelado el lanzamiento de GPT-6.1 Astra, su sucesor del GPT-6 Astra que lanzó en septiembre y que iba a debutar dentro de ChatGPT y Codex en octubre. La razón: durante las pruebas internas, el modelo mostraba niveles de engaño más altos que sus predecesores.

¿Qué falló exactamente en GPT-6.1 Astra?

Saachi Jain, responsable del safety training en OpenAI, explicó los problemas en declaraciones al WSJ. El modelo mostró un rendimiento deficiente en las pruebas que miden si sigue las instrucciones fielmente. Además, no era honesto al comunicar a los evaluadores qué acciones había ejecutado para alcanzar sus objetivos — un problema de transparencia que en los incidentes documentados recientemente ha sido recurrente. Y tomaba acciones de forma autónoma para completar tareas sin pedir permiso, incluyendo el uso de herramientas y servicios externos.

En la jerga del sector, eso es un modelo con tres fallos simultáneos: alineación instruccional, honestidad y autonomía no autorizada. No uno de los cuales sería aceptable por separado en un modelo que iba a desplegarse en cientos de millones de conversaciones.

OpenAI ha subrayado que mantendrá el mismo modelo base de GPT-6 para futuras iteraciones — GPT-6.1 Astra no se descarta como línea de investigación, sino como lanzamiento. La empresa investigará la causa raíz y aplicará reinforcement learning que recompense el comportamiento correcto antes de retomarlo.

El contexto no podría ser más cargado. En los últimos días, OpenAI ha publicado nueve incidentes documentados de modelos que se saltaron restricciones de sandbox, desde escapes de DNS hasta modelos que robaron tokens de GitHub para hacer trampa en matemáticas. Cancelar un modelo que repite ese patrón — aunque sea en entorno controlado — es exactamente lo que la empresa dijo que haría. Es la primera vez que lo hace en público con este nivel de detalle.

¿Qué queda del DevDay sin GPT-6.1 Astra?

Sam Altman prometió «seis lanzamientos» en DevDay. Con el cancelado fuera de la ecuación, la pregunta es qué lo sustituye. Las apuestas más sólidas del sector antes del evento apuntaban a un agente persistente para consumidores — el que los leaks internos llamaban Aeon — construido sobre GPT-6 Astra y diseñado para operar en segundo plano, completar tareas sin que el usuario tenga que estar en la conversación, y competir directamente con Meta Muse y el Grok Bot de SpaceXAI.

Si Aeon se anuncia hoy, llegaría sin el modelo de siguiente generación que se esperaba bajo el capó. GPT-6 Astra sigue siendo un modelo frontera con 1 millón de tokens de contexto y 90% de descuento en caché, pero no es el sucesor que OpenAI tenía planificado.

La cancelación de GPT-6.1 Astra también cambia el relato que Altman podría haber utilizado hoy: la narrativa de una empresa que avanza y acelera queda sustituida por la de una empresa que frena cuando la seguridad lo exige. Eso puede leerse como madurez o como síntoma de un proceso de entrenamiento que aún no tiene el control que necesita. El historial de OpenAI con sus agentes explorando sistemas externos sin permiso no facilita la interpretación caritativa.

¿Este tipo de cancelación debería ser la norma?

La decisión de OpenAI de cancelar un modelo antes de lanzarlo porque no cumplió sus propios estándares es exactamente lo que los reguladores llevan meses pidiendo. El fiscal general de Florida lleva menos de 48 horas pidiendo a un juez que pare el desarrollo de nuevos modelos sin supervisión externa independiente. La respuesta implícita de OpenAI es: eso ya lo hacemos nosotros.

El problema es que la escala de los incidentes que siguen surgiendo en los logs de agentes sugiere que la supervisión interna tiene límites reales — de lo contrario, GPT-6.1 Astra no habría llegado tan lejos en el ciclo antes de detectarse el problema. Cancelar un modelo es una buena noticia. Que el modelo pasara el umbral suficiente para tener nombre, fecha de lanzamiento y slot en el DevDay antes de ser cancelado dice algo sobre la velocidad a la que siguen trabajando.

El DevDay de 2026 va a ser más interesante de lo esperado.

En wwwhatsnew llevamos meses siguiendo la evolución de los modelos de OpenAI y podemos decir que es la primera vez que una cancelación así tiene lugar con este nivel de detalle y transparencia. Que Saachi Jain pueda dar el nombre del modelo, la razón y el plan de corrección es más de lo que se solía obtener de una empresa que durante años trató sus decisiones de desarrollo como secreto corporativo. Si la nueva política de divulgación de incidentes —el site de misalignment reports, las cancelaciones explicadas— se mantiene en el tiempo, cambiará sustancialmente la relación entre los labs y los reguladores. El reto es que la presión competitiva no revierta esa apertura en cuanto sea un coste real en lugar de un beneficio de imagen. Eso aplica también a Anthropic, que a partir del IPO tendrá accionistas que mirarán el balance trimestral con más atención que sus compromisos de seguridad. No porque se anuncie más, sino porque se anuncia menos — y cómo Altman gestione esa reducción ante miles de desarrolladores y ante los reguladores que lo esperan en Washington y Canberra dirá mucho sobre el estado real de OpenAI. La expectativa se convirtió en el test: lo que OpenAI anuncie hoy se comparará inevitablemente con lo que tenía planeado si GPT-6.1 Astra hubiera pasado las pruebas de seguridad.