Sale Grok 4.7: el mismo precio, la tarea más larga
ContenidoContents
El 16 de agosto escribí que Musk tenía el 4.7 a tres o cuatro semanas, y que ya veríamos: Elon promete fechas como quien pide un café. Hoy, 21 de septiembre, SpaceXAI lo ha publicado. No es el veredicto de una semana de Moodle. Es la ficha, leída despacio.
Qué es, sin humo
Grok 4.7 es, según ellos, su modelo más capaz para programar y para trabajo de conocimiento. La base es nueva y más grande que la del 4.6. El entrenamiento por refuerzo ha sido más largo, sobre una mezcla más dura, con peso en problemas que se miden en horas. Dicen que verifica mejor su propio trabajo, aguanta mejor el contexto largo y entiende de forma nativa el arnés de Grok Bot.
Lo concreto, de la documentación:
- ID:
grok-4.7. - Contexto: 500.000 tokens. El mismo techo que el 4.6.
- Corte de conocimiento: mayo de 2026.
- Entrada: texto e imagen. Salida: texto, sin tope publicado.
- Esfuerzo:
low,medium,high(el de por defecto) oxhigh. - Herramientas en la API: funciones, búsqueda web, búsqueda en X y ejecución de código.
Hoy está en Grok Build, en Cursor (todos los planes), en la API y en OpenRouter, Vercel y Cloudflare. Hay una variante rápida, el doble de velocidad de salida, solo en Cursor y en Grok Build. No está en la API pública y no entra en el tramo gratis de Grok Build.
El precio, que es el del 4.6
El titular del anuncio dice «el doble de rápido, a mitad de precio que los modelos comparables». Contra el 4.6, no: mismo precio y, dicen, misma velocidad. La mitad es contra la fila de al lado.
Por millón de tokens, con el prompt por debajo de 200.000, según la tarifa:
| Modelo | Entrada | Salida |
|---|---|---|
| Grok 4.7 | 2 $ | 6 $ |
| Grok 4.6 | 2 $ | 6 $ |
| GPT-5.6 Sol | 4 $ | 20 $ |
| Fable 5.1 | 10 $ | 50 $ |
La entrada cacheada del 4.7 sale a 0,50 $. En un agente que da vueltas sobre el mismo repo, eso pesa más que el titular.
El umbral de los 200.000 no recarga solo el tramo que se pasa. Si el prompt lo cruza, todos los tokens de esa petición van al doble: 4 $ de entrada y 12 $ de salida. Igual que en el 4.6. Un hilo largo de Grok Build puede cruzarlo sin avisar.
La variante rápida, por debajo de 200.000, es exactamente el doble: 4 $ y 12 $. Por encima, la tabla pone 6 $ de entrada y 18 $ de salida. Eso es una vez y media los 4 $ / 12 $ del contexto largo, no el doble que sugiere la frase de la documentación («twice the standard token rates»). La tabla manda.
El endpoint de Estados Unidos (us.api.x.ai) cobra un 10 % más y, de momento, solo sirve el 4.7 y el 4.6.
Y un detalle que se paga caro si se ignora: recomiendan fijar prompt_cache_key (o la cabecera x-grok-conv-id en Chat Completions). Sin eso, la conversación salta de servidor y pagas la entrada entera aunque el prefijo no haya cambiado.
La tabla, con el esfuerzo puesto
Los porcentajes son de SpaceXAI. La columna del 4.7 está en xHigh. La del 4.6, en High. Sol y Fable 5.1, en Max. No es el mismo mando. El asterisco de DeepSWE marca, además, que ese 71 % es en esfuerzo alto, no en xHigh.
| Prueba | 4.7 | 4.6 | Sol | Fable 5.1 |
|---|---|---|---|---|
| CursorBench 4.0 | 46,3 % | 40,4 % | 41,7 % | 51,8 % |
| DeepSWE v1.1 | 71,0 %* | 65,2 % | 72,7 % | 70,0 % |
| EEBench | 64,0 % | 53,0 % | 39,4 % | 56,4 % |
| AA Briefcase v1.1 | 1.657 | 1.546 | 1.487 | 1.678 |
| Terminal-Bench 4.0 | 38,0 % | 20,3 % | 37,3 % | 57,9 % |
| Harvey (legal) | 19,6 % | 15,8 % | 2,5 % | 6,7 % |
| HealthBench Professional | 56,7 % | 48,5 % | 60,5 % | 62,1 % |
* esfuerzo alto
Cómo lo leo, fila a fila.
En CursorBench, el banco de código de largo recorrido que ellos destacan, gana al 4.6 y a Sol y se queda detrás de Fable. Ahí dicen que están en la frontera del precio-rendimiento. Con 2 $ / 6 $ frente a 10 $ / 50 $, el argumento no es el porcentaje. Es el porcentaje por dólar.
En DeepSWE el 71 % queda por debajo de Sol y por encima de Fable, con el asterisco del esfuerzo. No sirve para decir que ha ganado la fila.
EEBench, ingeniería eléctrica, es el salto más ancho contra el 4.6: once puntos, y por delante de Fable. Es la fila que más se parece a un modelo nuevo, no a un afinado.
AA Briefcase, trabajo de oficina de varias horas, sube respecto al 4.6 y a Sol y se queda a un paso de Fable (1.657 contra 1.678). Trabajo de conocimiento, no código. Comparable.
Terminal-Bench 4.0 casi dobla al 4.6, de 20,3 % a 38,0 %, y empata con Sol. Fable se va a 57,9 %. Hace tres semanas, en el lanzamiento de GPT-6 Astra, OpenAI puso al 6 en 57,7 % en ese mismo banco. El 4.7 no está en esa conversación. Está en la de Sol, más barato.
Harvey lo gana con claridad y el número absoluto sigue siendo bajo: 19,6 %. Un agente legal que acierta una de cada cinco no es una fila para celebrar. Es una fila en la que los demás están peor.
HealthBench mejora al 4.6 y se queda detrás de Sol y de Fable. La clínica no es el argumento.
En seguridad cuentan otra pila, nueva. Dicen que es el modelo suyo más fuerte en rechazos y en resistencia a que le salten las restricciones. En el banco de bioseguridad de LatchBio marcan un 62,4 %. En HackerBench v0.3, el suyo para peticiones de ciber de doble uso, dejan pasar un 3,3 % de las arriesgadas y, dicen, casi no bloquean el trabajo legítimo de seguridad. A socios elegidos les han abierto, por invitación, las capacidades de equipo rojo. Cifras suyas. El método no está en el post.
Lo que voy a mirar yo
Llevo el verano programando con Grok. Empecé por curiosidad y me quedé porque se queda en el repo: un hilo, el diff, el commit, el Hugo. El 4.6 ya me valía para eso.
El 4.7 me importa si aguanta más rato dentro de un plugin de Moodle sin inventarse el tercer archivo, y si la factura de la semana no se mueve. El precio de lista no se ha movido. Lo que sí puede moverse es el esfuerzo: si Grok Build se va a xHigh porque ahora puede, la cuenta no es la del anuncio.
La variante rápida la dejo aparcada. El doble de precio por el doble de velocidad, y solo dentro de Cursor o de Grok Build. Para el día a día, el 4.7 normal.
No cambio de laboratorio por una tabla. Si dentro de unos días el código sale más limpio a la primera, lo diré. Si es el 4.6 con otro número, también.