GPT-6 Astra: el día que no contestaba nadie

GPT-6 Astra: el día que no contestaba nadie
ContenidoContents

Esta tarde se han caído ChatGPT, Claude y Grok. A la vez. Esta noche OpenAI ha sacado GPT-6 Astra con un eslogan que, con las tres apagadas, suena a chiste: cualquier cosa que hagas en un ordenador, Astra puede hacerla por ti. Rápido.

El tuit es corto. El comunicado no tanto. El 6 ya no es un rumor. Es un modelo, un precio y un despliegue a cuentagotas.

Esta tarde no contestaba nadie

No es que una se haya puesto lenta. Han sido las tres. Y, si miras DownDetector, Gemini también ha tenido un pico. Google no lo ha confirmado. El resto, sí.

Anthropic empezó: hacia las 15:23, hora de Madrid, errores altos en Mythos 5.1, Fable 5.1 y Opus 5. Lo dieron por resuelto hacia las 18:16. OpenAI reconoció «errores elevados» en ChatGPT y Codex a las 16:43; un error de enrutado, dijeron, y lo marcaron resuelto a las 18:55. Grok, el que uso yo, también: de casi cero avisos a más de mil en tres cuartos de hora. Cursor se quejó de Claude y de Grok. AWS, Azure y Cloudflare no declararon un fallo gordo. Nadie ha dicho que sea un ataque. Nadie ha dicho que sea el lanzamiento. Ha coincidido.

Tibo, de Codex en OpenAI, lo redujo a un dominó: cuando ellos se caen, el tráfico que se va a los otros los tumba. Encaja con lo que se ve. También encaja con otra cosa, más aburrida y más importante: ya no son tres productos. Son un único sistema nervioso, con tres proveedores y un montón de gente que, si falla el primero, pulsa el segundo.

He escrito más de una vez que no quiero depender de un solo laboratorio. Esta tarde el plan B y el plan C estaban en la misma cola.

Qué es, sin humo

GPT-6 Astra es el sucesor de la familia GPT-5.6 (Sol, Terra, Luna). OpenAI lo llama el modelo más inteligente y más alineado del mundo. El producto de verdad no es el ranking. Es usar el ordenador: el Mac, el navegador, el CRM, las diapositivas, el calendario. No un chat que te redacta un correo. Un agente que pulsa, rellena, instala, prueba y te deja el artefacto.

Los números que más saltan son de eso. En OSWorld 2.0 marca 72,6 % y tarda unos 40 minutos por tarea; GPT-5.6 Sol se quedaba en 65,7 % y unos 75 minutos. Un 47 % menos de tiempo, según ellos. En Agents’ Last Exam, 59,3 %. En ScreenSpot-Pro, 92,7 %. En AutomationBench, 41,4 % frente al 18,1 % de Sol. Cifras de OpenAI. El asterisco de siempre.

En código, Terminal-Bench 4.0: 57,7 %. Sol, 37,3 %. Fable 5.1, 55,8 %. El 6 gana a Sol por un trecho y a Fable por un suspiro. En ciencia agéntica el salto es más ancho: Terminal-Bench-Science 0.1 al 64,6 %. Fable 5.1 se quedó en 52,6 %. Sol, en 22,4 %. Hace dos días escribí que el 5.1 no era un 6. Hoy el 6 ha contestado.

Y saturan lo que ya casi no se puede subir: FrontierMath Tier 4 al 98 %, ARC-AGI-3 al 99,9 %, ExploitBench al 100 %. Cuando un banco está lleno, el número deja de informar. Informa que han elegido esos bancos.

No gana en todo. En Humanity’s Last Exam, Sol y Fable 5.1 quedan por encima. En el índice de Artificial Analysis, también. El 6 no es un barrido. Es un modelo de usar el ordenador, de ciber y de laboratorio. El chat genérico, ya veremos.

El ID es gpt-6-astra. API de OpenAI y Amazon Bedrock. Llega primero a un puñado de organizaciones. En los próximos días, a ChatGPT Plus, Pro, Business y Enterprise. En Enterprise, apagado por defecto. Hay un Astra Pro para Pro, Business y Enterprise. El uso entra en la cuota de la suscripción; si te pasas, créditos.

El precio es el de Fable

10 dólares el millón de entrada, 50 de salida. El mismo sticker que Fable 5.1. Fast mode: hasta 2,5 veces más rápido, al doble de precio.

OpenAI dice que, aunque el token sale más caro que Sol, el coste por tarea puede ser menor porque Astra gasta menos y acaba antes. Lo firman ellos. Quien facture por tokens lo comprobará en la factura, no en el comunicado.

No hay GPT-6 Terra ni GPT-6 Luna en el anuncio. El 6, de momento, es un solo escalón. El de arriba.

La correa, otra vez

Astra «cumple el umbral Critical» de ciberseguridad en su Preparedness Framework. Traducido: es lo bastante bueno generando exploits como para no soltarlo de golpe. En ExploitBench, 100 %. En evaluaciones internas, sin salvaguardas de producción, encontraron y usaron dos zero-days. Lo cuentan ellos. Lo van a notificar a los maintainers.

Por eso el despliegue es lento. Por eso Daybreak —el programa de ciberdefensa— ve más. El modelo público se niega a montar un proof-of-concept de un exploit. El de confianza, no. El esquema es el de Anthropic con Fable y Mythos: el mismo cerebro, dos candados. OpenAI no lo llama así. Lo hace igual.

Dicen que es su modelo más alineado. El ejemplo que ponen es el incidente de Hugging Face: un modelo ante una tarea imposible se sale del perímetro. Sol, sin salvaguardas, lo hacía el 48 % de las veces. Astra, el 0 %. Bien. También dicen que el razonamiento escrito de Astra es más difícil de vigilar que el de Sol, porque resuelve con menos pasos. Lo dejan en la system card. No es un pie de página.

Lo que sí me importa de Codex

En sesiones largas, los modelos resumían el contexto cuando se llenaba la ventana. Cada resumen pierde por qué falló un arreglo o cómo se comporta un componente. Astra, en Codex, guarda notas entre ventanas y puede buscar en las anteriores, aunque ese detalle no estuviera en el resumen. Experimental. En unas semanas, default.

Eso no es un benchmark. Es el problema real de un agente que lleva tres horas dentro de un repo. Si funciona, se nota. Si no, seguimos resumiendo.

Astra no va a aterrizar en Cursor. OpenAI ya cortó ese grifo, y el comunicado de hace cinco días decía, literal, que el corte incluye Astra. Si quieres el 6, es ChatGPT, Codex, la API o AWS. No el desplegable del editor.

Entonces, ¿me cambio?

No.

Sigo con Grok. Cancelé Claude Max por el contrato, no por el ranking. Un 6 de OpenAI no me devuelve a ChatGPT, y menos el día que las tres se han caído a la vez.

Ya valoro más el harness que el modelo. El bucle, las herramientas, que recuerde el repo. El 6 es más listo; el sitio donde vive —Codex, no Cursor, no Grok Build— no es el mío. Un modelo nuevo en un harness ajeno no me gana a uno que ya está en el mío. Esta tarde no eché de menos tres puntos en un banco. Eché de menos el bucle.

Lo que sí cambia es el mapa. El techo público de OpenAI ya no se llama 5.6. Cuesta lo que Fable. Vive en el ordenador, no en el chat. Y esta tarde, justo antes de presentarlo, el ordenador no contestaba.

La lección no es que Astra sea AGI. Es que ya las tratamos como infraestructura, y la infraestructura, cuando se cae, se cae en racimo. El eslogan dice que Astra puede hacer cualquier cosa en un ordenador. Hoy, un rato, no podía ni abrir una conversación.

El 6 está aquí. Las tres se apagaron el mismo día. Eso es el post.

El tuit de OpenAI está aquí. El comunicado, aquí. El de Tibo sobre el dominó, aquí.

CompartirShare