Llega Claude Sonnet 5.5: cerca de Opus, al precio de Sol

Llega Claude Sonnet 5.5: cerca de Opus, al precio de Sol
ContenidoContents

Hace seis días Anthropic publicó Claude Opus 5.5: rinde como Fable 5.1 en la mayoría del trabajo y cuesta como Opus. Esa misma noche OpenAI sacó GPT-6 Sol a 2 $ el millón de tokens de entrada y 10 $ de salida. Hoy, 28 de septiembre, llega el segundo de la familia 5.5: Claude Sonnet 5.5.

La tarifa del token no se mueve. Sigue a 2 $ y 10 $, la misma que Sonnet 5 y la misma que Sol. Anthropic dice que genera más de un 30 % más rápido que Sonnet 5 y que, en su medición, la tarea sale hasta un 30 % más barata porque gasta menos tokens. Artificial Analysis, el mismo día y en esfuerzo max, mide otra curva en su índice: 7,60 $ por tarea, cerca de un 50 % más que Sonnet 5, con unos 193.000 tokens de salida por tarea. El máximo que han registrado.

No es el veredicto de una tarde dentro de Claude Code. Es la ficha, leída al lado de quien no la firma.

Los números, en claro

  • ID: claude-sonnet-5-5. Sin fecha en el identificador. Disponible hoy en la API de Claude, en AWS, en Google Cloud y en Azure. Retención de datos en cero, como Sonnet 5 y como Opus 5.5.
  • Contexto: 1 millón de tokens. Salida: hasta 128.000. Corte de conocimiento: junio de 2026. Igual que Opus 5.5.
  • Esfuerzo: low, medium, high, xhigh y max. En la API el de por defecto es high. En las apps y en Claude Code, medium. Los niveles están recalibrados respecto a Sonnet 5: la misma palabra no equivale a la misma cantidad de pensamiento.
  • Caché de 5 minutos: lectura 0,20 $, escritura 2,50 $. La de una hora, 4 $. El prompt mínimo que entra en caché baja de 1.024 tokens a 512.
  • Haiku 5.5 llega en las próximas semanas. Si la inferencia tiene que quedarse en EE. UU., entrada y salida van a 1,1 veces.

En junio escribí que Sonnet 5 subía el 1 de septiembre a 3 $ y 15 $. El 10 de agosto Anthropic dejó los 2 $ y 10 $ como tarifa definitiva. La página de precios de la plataforma todavía imprime el escalón de septiembre. claude.com/pricing ya no: Sonnet 5 y Sonnet 5.5 salen los dos a 2 $ y 10 $.

Por millón de tokens. La escritura de caché es la de 5 minutos. Donde no tengo el dato, la celda se queda vacía.

Modelo Entrada Lectura de caché Escritura Salida
Grok 4.7 2 $ 0,50 $ 6 $
Sonnet 5.5 2 $ 0,20 $ 2,50 $ 10 $
GPT-6 Sol 2 $ 0,20 $ 2,50 $ 10 $
Opus 5.5 4 $ 0,20 $ 5 $ 20 $
GPT-6 Astra 10 $ 1 $ 50 $

La entrada de Sonnet ya cuesta lo que la de Grok 4.7. La salida no: 10 $ contra 6 $. La lectura de caché, al revés: 0,20 $ contra 0,50 $, el mismo precio que Opus 5.5 y que Sol. En batch, entrada y salida bajan a la mitad.

En agosto cancelé Max por la marca de agua, no por el modelo. Esta ficha no me devuelve a la suscripción. Cambia lo que paga quien sigue en la API. Sigo programando con Grok: la ficha del 4.7 no se ha movido.

El benchmark, con el esfuerzo delante

Anthropic publica una tabla resumen y no dice el esfuerzo de cada celda. Donde sí lo dice, lo dejo escrito. El 66,4 % de Opus 5.5 en Terminal-Bench 4.0 es su nota en xhigh. En FrontierCode, Sonnet 5.5 saca 52,1 % en xhigh y 46,2 % en max. En el esfuerzo más alto invoca más a menudo la revisión de código, reparte el trabajo en subagentes, y en dos casos que miró Cognition eso acabó en un timeout o en ediciones fuera del alcance de la tarea. FrontierCode penaliza las dos cosas, así que la nota baja.

El 10,3 % de Sonnet 5 en Terminal-Bench 4.0 no es el 80,4 % que cité en junio. Aquel era Terminal-Bench 2.1. Esta es otra prueba.

Prueba Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70,6 % 10,3 % 66,4 % (xhigh) —
FrontierCode 1.1 52,1 % (xhigh) / 46,2 % (max) 42,4 % 54,4 % 49,3 %
CursorBench 4.0 55,5 % 34,1 % 57,8 % —
GDPval-AA v2.1 (Elo) 1844 1449 1846 1487
AA-Briefcase v1.1 (Elo) 1811 1359 1822 1483
Humanity’s Last Exam, con herramientas 64,5 % 54,9 % 67,7 % —
OSWorld 2.1, parcial 80,1 % 57,0 % 81,8 % —
Chartography, sin herramientas 61,6 % 15,6 % 64,4 % 53,6 %

GDPval-AA y AA-Briefcase los midió Artificial Analysis sobre un despliegue previo. Anthropic encontró después un fallo en las salidas estructuradas que podía degradar la respuesta. Esperan que el efecto, si lo hay, sea pequeño y que la nota quede por debajo de la real. El fallo ya está corregido. En Chartography, OpenAI acaba de arreglar un fallo de comprensión de imagen en GPT-6 Sol. Anthropic dice que sus pruebas internas no mueven esa celda, y que Artificial Analysis no espera un cambio grande en Briefcase ni en GDPval. El 81,8 % de Opus en OSWorld coincide con el número del día 22. Allí la fila se llamaba OSWorld 2.0.

En CursorBench, Sonnet 5.5 queda a 2,3 puntos de Opus 5.5. En GDPval-AA, a 2 puntos de Elo: 1844 contra 1846, y unos 400 por encima de Sonnet 5.

Lo que Anthropic quiere que mires es el esfuerzo bajo, no el pico. En Terminal-Bench 4.0, Sonnet 5.5 en medium —el de por defecto en las apps— supera la mejor nota de Sonnet 5 por menos de la décima parte del coste por tarea. En CursorBench, el low ya supera esa mejor nota, también por menos de la décima parte. En AA-Briefcase, el medium la supera por cerca de la novena parte. En FrontierCode, el high —el de por defecto en la plataforma— saca 10 puntos a Sonnet 5 al mismo esfuerzo, por cerca de la quinceava parte del coste, y empata la mejor nota de Sol por cerca de la quinta parte.

En max, en varios de esos bancos, se pone al lado de Opus 5.5. Anthropic lo dice y lo matiza en el mismo párrafo: en su uso, y en el de quienes lo probaron por fuera, Opus 5.5 sigue siendo claramente mejor en el trabajo abierto que pide juicio sostenido. El techo de la casa sigue siendo Fable, a 10 $ y 50 $.

Según Anthropic, es el primer Sonnet que supera Pokémon Rojo trabajando solo con capturas de pantalla. Es una frase de lanzamiento. La dejo porque es concreta, y porque no sustituye a la tabla.

Lo que mide quien no firma el comunicado

Artificial Analysis pone a Sonnet 5.5 (max) en el puesto 2 de su índice de inteligencia: 56, dos puntos por detrás de Opus 5.5 (max, 58) y 18 por delante de Sonnet 5. En Terminal-Bench 4.0, con su arnés, marca 64 %. Sonnet 5 (max) queda 50 puntos por debajo. Opus 5.5 y Astra (xhigh) andan por el 60 %. No es el 70,6 % de la tabla de Anthropic. Otro arnés. Van por separado.

Para llegar ahí gasta unos 193.000 tokens de salida por tarea del índice. Un 60 % más que Opus 5.5 (max) o que Sonnet 5 (max), y cerca de siete veces Astra (max). La factura de esa tarea: 7,60 $, cerca de un 50 % por encima de Sonnet 5. Al precio de Sol, Artificial Analysis lo deja fuera de la frontera de coste de su índice. En esfuerzo high es donde más compite: un poco por detrás de Sol, a prácticamente el mismo coste por tarea. En los esfuerzos bajos, hay configuraciones de Astra o de Sol con un rendimiento equivalente por menos dinero.

En conocimiento factual, AA-Omniscience, acierta el 54 % contra el 66 % de Opus, y alucina menos: 47 % contra 59 %. En Humanity’s Last Exam y en SciCode queda unos 6 puntos por debajo de Opus. Esa distancia no es la celda del 64,5 % con herramientas de la tabla de arriba.

El fallback de Anthropic saltó en cerca del 0,1 % de las tareas del índice, casi todas en Terminal-Bench 4.0, y siempre hacia Sonnet 5. Estas evaluaciones son del despliegue previo, el del fallo de salidas estructuradas. Artificial Analysis dice que el efecto debería ser pequeño, o dejar la nota corta, y que va a repetirlas.

Lo que dicen quienes lo probaron

Citas de la página de lanzamiento. No son un banco público.

Balyasny, en 2.441 tareas privadas de finanzas: por delante de Sonnet 5, con unos 121.000 tokens por respuesta contra 497.000. Box: 2,4 veces más rápido y un 12 % menos de tokens en total, y vuelve a mirar el documento de origen. Base44, en 118 aplicaciones reales: al nivel de Opus 5, con 3,6 iteraciones de media contra 7,7, y la tasa más baja de llamadas a herramientas fallidas entre los modelos que compararon. Unity cuenta la tarea cuando el cambio funciona en ejecución, no cuando el modelo dice que ha terminado. La mayoría del trabajo de Sonnet 5.5 pasó ese filtro, y completó el 90 % de su banco de varios pasos dentro del editor.

En una prueba interna, Anthropic le pasó los materiales de resultados de una cotizada, las transcripciones de la llamada con analistas y una plantilla, y pidió 10 diapositivas. Dos expertos dieron el primer borrador por enviable. Es su prueba, con dos jueces.

Si programas con la API: lo que rompe

Cambiar el ID no basta. La guía de migración es larga. Esto es lo que devuelve un 400, o un 200 que se queda mudo:

  • thinking: disabled ya no existe. Hay que mandar between_tools. Solo vale en low, medium y high. En xhigh o max da 400. Con between_tools el esfuerzo no puede cambiar a mitad de conversación. Si el fallback de servidor te baja a Sonnet 5, allí esa petición corre con el pensamiento apagado.
  • No hay tool use forzado. tool_choice en any o en una herramienta concreta da 400, también al contar tokens. Quedan auto y none. Para que el JSON cuadre con el esquema, auto y la herramienta en strict. Como mucho, 20 herramientas strict. En Bedrock las salidas estructuradas no están para este modelo: auto sin strict, y validas tú.
  • El pensamiento va atado al modelo y a la cuenta. Sonnet 5.5 lee los bloques de Sonnet 5, de Opus 4.8, de Haiku 4.5 y de modelos anteriores. No lee los de Opus 5, de Opus 5.5, de Fable ni de Mythos. La API los descarta, responde 200 y no los cobra. En cuentas creadas a partir del 31 de agosto de 2026, a las 00:00 UTC, el bloque va firmado sobre lo ya dicho: si editas el historial y lo reenvías, 400. La conversación tiene que crecer solo por el final. Y el bloque solo vale en la cuenta que lo creó, o en una cuenta enlazada. Si cambias de cuenta a mitad de sesión en Claude Code, se cae. Lo explican en preserved thinking.
  • La herramienta vieja de ordenador no vale en la API de Claude ni en Google Cloud. Hay que pasar a computer_toolset_20260801. En Bedrock sigue computer_20251124. computer_20250124 no vale en ningún sitio.
  • El asesor admite menos modelos. Opus 4.8, Opus 4.7, Opus 4.6, Sonnet 5 y Sonnet 4.6 como asesor dan 400. El consejo vuelve cifrado: en la respuesta no se lee el texto.
  • El texto largo entre herramientas vuelve dentro de bloques thinking. Con el display por defecto llega vacío. Una interfaz que enseñaba ese texto como progreso se queda muda. Las frases cortas siguen siendo text.

El esfuerzo por defecto de la API es high, y en Claude Code es medium. Si copias la configuración de Sonnet 5, no estás en el mismo punto de la curva. Hay que volver a medir el coste.

La correa, ahora también en Sonnet

Hasta hoy la correa gorda de ciberseguridad era cosa de Fable, de Mythos y, desde el día 22, de Opus 5.5. Sonnet 5.5 es el primer Sonnet que sale con salvaguardas y con fallback de esa clase. Anthropic dice que su capacidad en ciberseguridad es comparable a la de Opus 5.

Buscar y arreglar bugs del propio código sigue en este modelo. La tarea de ciberseguridad de más riesgo se desvía, a la vista, a Sonnet 5. El programa de verificación se amplía para pedir acceso por tramos en Sonnet 5.5, en Opus 5.5 y en los Mythos. Las salvaguardas de biología son las de Sonnet 5. La mayor parte del trabajo de ciencias de la vida sigue igual. Alguna petición de microbiología o de virología puede marcarse por error.

También es el primer Sonnet con clasificadores contra la extracción del razonamiento. Un rechazo trae stop_reason: refusal y puede nombrar la categoría: cyber, bio, frontier_llm, reasoning_extraction o general_harms. El fallback de servidor, en beta y solo en la API de Claude, reintenta cyber y frontier_llm sobre Sonnet 5. No reintenta las otras tres.

En la auditoría automática, unos 1.850 escenarios, mejora o empata a Sonnet 5 en la mayoría de las medidas de alineación y de honestidad. En las pruebas nuevas de contención se acerca a Opus 5.5, el mejor que han medido, en lo poco que intenta salirse de la sandbox, y es el modelo suyo que menos tantea los límites del contenedor. En el conjunto, Opus 5.5 sigue un poco por delante. Dicen que no han visto que persiga objetivos distintos de los del usuario. Y dicen, como en la evaluación reciente, que ningún banco caza todos los fallos.

Qué significa

Para el trabajo acotado —un bug, un documento, unas diapositivas con plantilla— Anthropic quiere que dejes este Sonnet y reserves Opus 5.5 para lo abierto. La tarifa invita a eso: la mitad de entrada y de salida que Opus, la misma lectura de caché, y la escritura de caché de 5 minutos también a la mitad, 2,50 $ contra 5 $.

La frase «hasta un 30 % más barato» cabe en su página. No cabe en el índice de Artificial Analysis. Las dos lecturas pueden ser verdad a la vez. Una está medida en el esfuerzo en el que quieren que vivas: medium en la app y en Claude Code, high en la API, comparado con Sonnet 5. La otra está medida en max, donde este modelo escribe más que ninguno de los que han puesto en esa báscula. Si el agente vive en max, la factura puede subir. Si vive donde Claude Code lo deja por defecto, la apuesta de Anthropic es la contraria, y todavía no hay una medición de fuera publicada en esa celda.


Fuentes: Anthropic — Introducing Claude Sonnet 5.5, ficha del modelo, guía de migración, claude.com/pricing, Artificial Analysis, anuncio.

CompartirShare