Llegan GPT-6 Sol y Luna: el 6, a mitad de precio

Llegan GPT-6 Sol y Luna: el 6, a mitad de precio
ContenidoContents

Esta mañana Anthropic ha publicado Claude Opus 5.5: rinde como Fable y cuesta como Opus. Esta noche OpenAI añade dos GPT-6 por debajo de Astra. Sol sale a 2 $ el millón de tokens de entrada y 10 $ de salida. Luna, a 0,10 $ y 0,50 $. Es la mitad de lo que costaban Sol y Luna en la generación 5.6, al precio promocional que tenían. Astra no se ha movido: sigue a 10 $ y 50 $.

Hace tres semanas GPT-6 era un solo modelo, Astra, al precio de Fable. Hoy son tres: Astra, Sol y Luna. Terra, el modelo intermedio del 5.6, no tiene versión 6.

No es el veredicto de una tarde dentro de Codex. Es la ficha, leída al lado de la de esta mañana.

Los números, en claro

  • IDs: gpt-6-sol y gpt-6-luna.
  • Contexto: 1.050.000 tokens. Salida: hasta 128.000.
  • Corte de conocimiento: Sol, 20 de abril de 2026. Luna, 18 de mayo. Astra se quedó en el 30 de abril. El barato llega un mes más lejos.
  • Esfuerzo: none, low, medium (el de por defecto), high, xhigh y max. Los gráficos del comunicado no están en medium.
  • El 50 % se mide contra el precio promocional del 5.6. En la tarifa, la promo del Sol 5.6 sigue listada al menos hasta el 21 de noviembre de 2026.

Por millón de tokens, con el prompt por debajo de 272.000 de entrada:

Modelo Entrada Caché Salida
GPT-6 Luna 0,10 $ 0,01 $ 0,50 $
Grok 4.7 2 $ 0,50 $ 6 $
GPT-6 Sol 2 $ 0,20 $ 10 $
Opus 5.5 4 $ 0,20 $ 20 $
GPT-5.6 Sol, promo 4 $ 0,40 $ 20 $
GPT-6 Astra 10 $ 1 $ 50 $

La salida de Luna no baja la mitad: de 1,20 $ a 0,50 $. La entrada sí, de 0,20 $ a 0,10 $. El titular redondea. La tabla no.

Si el prompt pasa de 272.000 tokens, toda la petición va al doble de entrada y de caché, y a una vez y media la salida. El mismo tipo de acantilado que ayer conté en Grok: allí, a partir de 200.000, y con la salida también al doble. Aquí el corte está más lejos y la salida se encarece menos. Sigue siendo un corte de toda la petición, no del tramo que se pasa.

Escribir en caché cuesta 1,25 veces la entrada. El modo rápido, el doble: Sol en rápido y en contexto corto sale a 4 $ y 20 $, la tarifa de esta mañana de Opus 5.5. Batch y Flex, la mitad del estándar. La residencia de datos en la UE, solo con el procesado estándar.

La entrada de Sol ya cuesta lo que la de Grok 4.7. La salida no: 10 $ contra 6 $. La caché, al revés: 0,20 $ contra 0,50 $, el mismo precio de lectura que Opus 5.5, con el token nuevo a la mitad.

Lo que dice OpenAI, con el mando puesto

Entran hoy en ChatGPT Work y en Codex para Plus, Pro, Business, Enterprise y Edu. En el chat normal, todavía no. Free y Go pueden probar Luna en la app de escritorio. En la API, ya. El despliegue dentro de ChatGPT es gradual, a lo largo del día. Tibo, de Codex, carga además un reinicio de cuota en las cuentas Plus, Pro y Business. Eso es un extra de hoy. Lo que alarga la suscripción es que el token cuenta la mitad.

Los bancos son suyos, y mezclan esfuerzos. Las notas de la competencia salen de informes públicos. Lo que miden ellos puede no coincidir con el ChatGPT de producción.

En AutomationBench 1.0.6 —flujos de negocio, 47 herramientas— Sol en xhigh saca un 33,2 % a 0,27 $ por tarea. Astra en low, 30,3 %, a 3,9 veces ese coste. Opus 5 en max, 26,9 %, a 11,1 veces. Fable 5.1 con fallback a Opus 5, en max, 31,4 %, a más de 8,9 veces: el fallback saltó en cerca del 40 % de las tareas y ese dinero no está en la cifra. Sol en su esfuerzo alto gana al Astra barato. Eso dice que el Astra en low pierde contra el Sol en xhigh.

Luna, en high, mejora 5,4 puntos a su predecesora y baja un 58 % el coste por tarea. La nota absoluta no está en la página.

En Agents’ Last Exam, Sol en max marca 56,4 %, por encima del mejor Opus 5 de esa evaluación y un 60 % más barato por tarea. En el lanzamiento de Astra dejé escrito un 59,3 % para el 6 grande. Esta página no reimprime esa celda. Sol se acerca a aquel número.

En DeepSWE 1.1, Sol en max saca 68,8 %. Fable 5 en xhigh, 69,9 %: a un punto, y cerca de un 80 % más barato por tarea. Usan Fable 5 porque, dicen, no tenían la nota del 5.1. Luna en max, 66,6 %, en la zona de Opus 5 y de Fable 5 cuando esos van en medium: un 93 % más barata que Opus y un 96 % más que Fable. El esfuerzo no es el mismo. La palabra «comparable» vive de ese desajuste.

En OSWorld 2.0, recompensa parcial del conjunto offline (publicación v2026.08.08), Sol en xhigh empata con Opus 5 en medium: 60,5 % contra 60,3 %, a cerca de un 80 % menos por tarea. Luna en max supera al Sol 5.6 en medium por una décima parte del coste. Astra sigue siendo, según ellos, el mejor usando el ordenador. El 72,6 % del post de Astra es otra medida.

En factualidad interna —conversaciones reales ya desidentificadas, donde alguien había marcado un error— Sol comete cerca de la mitad de fallos que su predecesor y se acerca a Astra. Luna, en esfuerzo alto, iguala al Sol 5.6 por cerca de una centésima del coste. No es el uso de todos los días: son los hilos que ya habían fallado. Dicen que la longitud de la respuesta casi no mueve la nota.

En alineación, mejoran al 5.6, también en lo de inventarse lo que han hecho al programar. La system card que enlazan es la de Astra. Las pruebas son situaciones difíciles, no la tasa de fallo de un día normal.

Lo que dice quien no firma el comunicado

Artificial Analysis, el mismo día, en esfuerzo max. El índice de inteligencia se queda al nivel del 5.6. Lo que se mueve es la factura.

Sol cuesta 1,06 $ por tarea de ese índice, frente a 1,99 $ del Sol 5.6. Luna, 0,07 $ frente a 0,18 $. Los dos escriben un poco más: 31.000 tokens de salida contra 29.000 en Sol, y 51.000 contra 41.000 en Luna. El descuento aguanta ese extra.

En el índice de agentes de código, medido dentro del arnés de Codex, Sol marca 57, dos puntos por encima del Sol 5.6. Terminal-Bench 4.0, en esa celda, pasa de 37 % a 43 %. SWE-Atlas-QnA, de 54 % a 58 %. 2,99 $ por tarea, cerca de la mitad, y en la frontera de coste. Luna marca 41, dos puntos por debajo de la Luna 5.6. SWE-Atlas baja de 49 % a 44 %. DeepSWE, de 66 % a 64 %. Un 60 % más barata, y un poco peor en código.

En alucinaciones, AA-Omniscience, los dos bajan: Sol del 92 % al 60 %, Luna del 93 % al 77 %. Sol lo consigue callando más. Intenta el 83 % de las preguntas; el 5.6 intentaba el 99 %. Los errores bajan cerca de un cuarto y la precisión también, del 59 % al 54 %. Luna mantiene la precisión, 44 % contra 43 %, e intenta menos. El índice de Sol pasa de 22 a 27. El de Luna, de −10 a 1.

Y hay retrocesos. En GDPval-AA, trabajo de 44 oficios, Sol pierde unos 100 Elo y Luna unos 75. En AA-Briefcase, proyectos de varias semanas, Luna pierde unos 45 y Sol se queda. Han mirado cientos de entregas: la caída viene de presentaciones más pobres y de piezas a las que les falta lo que la rúbrica pedía.

OpenAI vende una brevedad parecida como virtud. Traen el estilo de Astra: menos jerga, menos detalle de poco valor, respuestas algo más cortas. Puede leerse más claro. También puede ser el entregable al que le falta un apartado. Las dos lecturas caben en la misma página.

En el desglose del índice de inteligencia, el Terminal-Bench 4.0 de Sol sale 44 % contra 40 %, no el 43 % contra 37 % del índice de código. Misma prueba, otra celda. Las dos suben poco. No las junto con el 57,7 % de Astra en septiembre: otro arnés, otro esfuerzo.

La caché, que es donde se nota un agente

Además del precio, OpenAI dice que la caché del 6 acierta más por defecto. La lectura cacheada sigue al 10 % de la entrada. Lo nuevo, para quien encadena herramientas, es que cambiar el esfuerzo a mitad de conversación ya no rompe la caché, y encender o apagar herramientas tampoco. Hay puntos de corte para elegir qué prefijo se guarda.

GitHub, según ellos, ha reducido en más de un 50 % la parte del prompt que hay que procesar de nuevo, en miles de millones de peticiones y a lo largo de los últimos meses. No es un dato de esta tarde. Es el argumento con el que dicen que el agente largo sale más barato de lo que sugiere la tarifa de un token nuevo.

Qué significa

No cambio de sitio. Ayer dejé escrito que el 4.7 me importa si el plugin de Moodle sale más limpio y la factura de la semana no se mueve. La entrada de Sol ya está en esos 2 $. La salida sigue más cara, y el sitio donde vive es Codex y ChatGPT Work. Astra no iba a bajar al desplegable de Cursor. Este anuncio tampoco lo nombra.

El mapa de hoy, leído junto al de esta mañana: Opus 5.5 ha puesto el trabajo de Fable a 4 $ y 20 $. Sol, el GPT-6 de en medio, sale a 2 $ y 10 $. Los dos laboratorios han abaratado ese modelo intermedio y han dejado el caro arriba. El índice de fuera dice que el cerebro de Sol apenas se ha movido respecto al 5.6. La factura, sí.

Luna es la otra apuesta: volumen. En el índice de código de Artificial Analysis retrocede dos puntos y escribe más. En el banco de OpenAI, en high, mejora y cuesta bastante menos. Para mucho trabajo barato, miraría Luna. Para el repo, sigo donde estaba.


Fuentes: OpenAI — Introducing GPT-6 Sol and Luna, tuit, Tibo, tarifa de la API, GPT-6 Sol, GPT-6 Luna, Artificial Analysis.

CompartirShare