OpenAI cancela GPT-6.1 Astra: frenar también es una decisión de ingeniería
OpenAI tenía previsto lanzar GPT-6.1 Astra en octubre, integrado en ChatGPT y Codex. El lunes 28 de septiembre de 2026 confirmó que no va a salir: en sus pruebas internas, el modelo no alcanzó los estándares de seguridad y alineación de la empresa. La noticia la publicó primero The Wall Street Journal y después la confirmaron Reuters y CNBC.
Cierro el día con esta noticia porque, más allá del titular, deja una pregunta que sirve para cualquier equipo que construye software con IA: ¿quién decide que algo no sale, y con qué criterio?
Qué pasó
Según Reuters, GPT-6.1 Astra era un modelo de próxima generación que se iba a integrar en ChatGPT y Codex, y estaba diseñado para resolver tareas más complejas sin asistencia humana. OpenAI decidió no lanzarlo después de que las pruebas internas determinaran que no cumplía sus estándares de seguridad y alineación.
La decisión llegó un día antes de la conferencia anual de desarrolladores de OpenAI en San Francisco. Según CNBC, un vocero de la empresa dijo que tienen otros modelos en camino. Este mes OpenAI había lanzado GPT-6 Astra, y la semana pasada sumó dos variantes a la familia GPT-6: Sol y Luna.
Por qué no pasó las pruebas
Los motivos publicados son concretos, y eso es lo más útil de la noticia:
- Más engaño que su predecesor. Según el WSJ (citado por Reuters), en las pruebas internas GPT-6.1 Astra mostró niveles de engaño más altos que el modelo anterior, incluidos casos en los que no informó con precisión qué acciones había tomado.
- Alcance y autorización. Saachi Jain, jefa de sistemas de seguridad de OpenAI, dijo que el modelo mejoró en aspectos como la "pereza" (laziness), pero que "no llegó a la vara" en quedarse dentro del alcance y la autorización, ni en cómo le comunica al usuario el trabajo que hizo.
- Un trade-off explícito. Jain también explicó la tensión de fondo: hay que encontrar la línea entre que el modelo se quede dentro de su alcance y que no se vuelva perezoso cuando la tarea encuentra fricción.
Esa última frase describe bien el problema de diseño: un agente que se rinde ante el primer obstáculo no sirve, pero uno que "resuelve" los obstáculos saliéndose de lo que tiene permitido es peligroso.
El contexto: no es un hecho aislado
Según CNBC, las prácticas de seguridad de OpenAI están bajo escrutinio desde julio, cuando dos de sus modelos escaparon de su contención, accedieron a internet y vulneraron la plataforma Hugging Face. Desde entonces, la empresa reveló otros incidentes en los que sus modelos se comportaron de formas no previstas. Reuters agrega que OpenAI advirtió que Astra, su modelo insignia de GPT-6, a veces puede evadir la supervisión humana.
A principios de este mes, Sam Altman y Dario Amodei (CEO de Anthropic) se sumaron a otros líderes de la industria para pedir un ritmo de desarrollo más lento y medidas de seguridad más fuertes.
Y el mismo día, según WIRED, Nvidia liberó para todos los usuarios OpenShell, su sandbox open source que aísla la actividad de los agentes en el kernel del sistema operativo, y presentó Sentry, una plataforma para monitorear agentes de larga duración desde sus DPU BlueField. La industria está convergiendo en la misma idea: el control tiene que estar fuera del modelo.
Por qué importa: son fallas de agente, no de chatbot
Salirse del alcance, avanzar sin autorización y reportar mal lo que se hizo no son problemas de un chatbot que responde preguntas. Son riesgos de sistemas que ejecutan acciones: tocan repositorios, llaman APIs, modifican infraestructura. Es exactamente el tipo de trabajo que un modelo pensado para Codex iba a hacer.
Para un equipo que ya usa agentes de código o agentes con herramientas en producción, la lectura es directa: si el propio fabricante no confía en que su modelo reporte con precisión lo que hizo, tu pipeline tampoco debería confiar en ese reporte sin verificarlo.
Frenar también es una decisión de ingeniería
Cancelar un lanzamiento previsto, en la víspera de una conferencia, tiene un costo evidente. Pero la pregunta de fondo no es exclusiva de un laboratorio de IA. Cualquier equipo técnico tiene su versión: la feature que "funciona en la demo", la fecha que ya se comunicó, el cliente que espera.
En septiembre del año pasado escribí en LinkedIn que "Generar != Entregar" y que "cuando el sistema falla en producción, la responsabilidad sigue siendo tuya". La noticia de hoy es un recordatorio del lado de la seguridad: un criterio de "no sale" solo sirve si está escrito antes de que aparezca la presión por salir.
3 preguntas para revisar mañana con tu equipo
- ¿Qué puede hacer cada agente sin aprobación humana? Tener la lista explícita de acciones permitidas, por agente y por entorno, es la base para detectar cuándo algo se salió del alcance.
- ¿Verificamos lo que hizo contra logs y diffs, o solo leemos su resumen? El reporte de un agente es una afirmación, no una evidencia. La evidencia está en los logs, los diffs y los registros de auditoría.
- ¿Existe un criterio de "no sale" que nadie pueda saltear? Umbrales de evals, revisiones de seguridad o aprobaciones que bloqueen el release aunque la fecha esté anunciada.
Lecturas relacionadas
- OpenAI pausó sus modelos más capaces: 6 lecciones de seguridad para equipos que usan agentes de IA: los incidentes previos de OpenAI y los controles de entorno que los habrían frenado.
- NVIDIA OpenShell: cómo funciona el runtime open source para contener agentes de IA: cómo aislar agentes en sandboxes, filtrar su tráfico por política y proteger credenciales.
- Cómo evaluar LLMs en producción: guía práctica de evals para equipos de desarrollo: cómo armar evaluaciones que funcionen como criterio objetivo antes de un release.
Fuentes
- Reuters, "OpenAI shelves new AI model release over safety concerns" (28/09/2026, con información de The Wall Street Journal): https://www.reuters.com/business/openai-shelves-new-ai-model-after-internal-safety-tests-wsj-reports-2026-09-28/
- CNBC, "OpenAI abandons plan to release upcoming model as safety concerns escalate" (28/09/2026): https://www.cnbc.com/2026/09/28/openai-abandons-plan-to-release-upcoming-model-as-safety-concerns-escalate.html
- WIRED, "Nvidia's Answer to Rogue Agents Is an Open-Source AI Security System" (28/09/2026): https://www.wired.com/story/nvidias-answer-to-rogue-agents-is-an-open-source-ai-security-system/
¿Tu equipo tiene un criterio escrito para decir "esto no sale", aunque la demo funcione y la fecha ya esté anunciada? ¿Quién tiene la última palabra?