Grok 4.7 amplía el modelo, no el precio estándar de la API
El nuevo Grok 4.7 de SpaceXAI incorpora un modelo base más grande y entrenamiento para tareas largas, mientras las mediciones independientes aún lo sitúan por detrás de GPT-6 y Claude Fable 5.1.

SpaceXAI lanzó Grok 4.7 el 21 de septiembre con un modelo base más grande y un conjunto de cambios de entrenamiento e inferencia orientados a tareas más largas. El lanzamiento mantiene sin cambios el precio estándar de la API, en 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida. También llega con una ventana de contexto de 500.000 tokens, cuatro niveles de razonamiento y una amplia disponibilidad a través de la API, Cursor, Grok Build, OpenRouter, Vercel y Cloudflare. La cuestión central no es si Grok 4.7 es una versión más grande y más capaz que su predecesor, sino hasta qué punto las pruebas publicadas respaldan esa afirmación cuando se separan los benchmarks del proveedor y la evaluación independiente.
Qué cambia en Grok 4.7
El principal cambio arquitectónico comunicado para Grok 4.7 es el uso de un modelo base más grande. SpaceXAI también afirma que el modelo recibió aprendizaje por refuerzo más prolongado para tareas largas, autoverificación y entrenamiento de contexto largo. No son detalles menores de posicionamiento: describen un modelo concebido para rendir mejor cuando el trabajo se extiende durante muchos pasos, cuando las salidas requieren comprobación y cuando deben mantenerse a la vista grandes cantidades de texto o código. Por tanto, el anuncio presenta Grok 4.7 menos como una actualización limitada de velocidad y más como un intento de mejorar el razonamiento y la persistencia en flujos de trabajo extensos.
El precio estándar de la API sin cambios es una parte destacable del lanzamiento. SpaceXAI fija el precio estándar en 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida, aunque el modelo se describe como más grande y entrenado con métodos adicionales. Para desarrolladores y equipos que ya presupuestan en torno a costes por token, el mensaje es que el nivel de servicio predeterminado no introduce un precio unitario superior para el nuevo modelo. Eso no significa que todos los costes de acceso permanezcan sin cambios: el nivel de servicio más rápido cuesta el doble que el precio estándar, lo que crea una distinción clara entre el acceso base y el servicio de menor latencia.
La ventana de contexto de 500.000 tokens es otro cambio práctico que conviene considerar. Una ventana de contexto de ese tamaño puede, en principio, permitir que un modelo procese grandes bases de código, documentación extensa, prompts con múltiples archivos o historiales de tareas prolongadas sin el mismo grado de recorte. Sin embargo, una gran ventana de contexto es una cifra de capacidad, no una garantía de que el modelo vaya a utilizar todas las partes del contexto con la misma eficacia. El hecho de que Grok 4.7 haya recibido entrenamiento de contexto largo es relevante porque la longitud de contexto por sí sola no demuestra recuperación fiable, priorización ni razonamiento a lo largo de toda la ventana.
Cómo se posiciona el lanzamiento
SpaceXAI pone Grok 4.7 a disposición por varias vías: su API, Cursor, Grok Build, OpenRouter, Vercel y Cloudflare. Esa distribución importa porque coloca el modelo no solo detrás de una API directa, sino también dentro de canales de desarrollo y despliegue donde el cambio de modelo puede formar parte de los flujos de trabajo cotidianos. Por tanto, el lanzamiento se dirige tanto a integradores directos como a usuarios que acceden al modelo mediante plataformas ya utilizadas para programar, construir o encaminar cargas de trabajo de IA. La lista de disponibilidad es un anuncio de la empresa y debe tratarse como tal, no como prueba de rendimiento.
Los cuatro niveles de razonamiento dan a usuarios o desarrolladores una forma de seleccionar cuánto esfuerzo de razonamiento debe aplicar el modelo. La implicación práctica es que no todas las tareas tienen que ejecutarse con el mismo ajuste. Las solicitudes más sencillas pueden no requerir el nivel más alto, mientras que el trabajo más complejo puede asignarse a más razonamiento. Los hechos verificados no especifican cómo difieren los cuatro niveles en latencia, precisión o coste, de modo que cualquier conclusión sobre el mejor ajuste iría más allá de la evidencia. Lo que sí puede decirse es que SpaceXAI expone el razonamiento como una parte configurable del producto, en lugar de ocultarlo por completo detrás de un único modo predeterminado.
La autoverificación también forma parte del método anunciado. En términos generales, la autoverificación indica que el modelo está diseñado para comprobar aspectos de su propia salida durante la generación o el razonamiento. La información del lanzamiento no aporta suficiente detalle para juzgar exactamente cómo se implementa ese proceso ni con qué frecuencia evita errores. Por tanto, debe entenderse como una técnica comunicada, no como prueba de que se hayan resuelto los errores factuales, los fallos de programación o los fallos de razonamiento. La misma cautela se aplica al aprendizaje por refuerzo más prolongado para tareas largas: es relevante para el diseño del modelo, pero su efecto debe evaluarse mediante resultados.
Qué muestran las cifras
SpaceXAI informa de tres resultados de benchmark para Grok 4.7: CursorBench 46,3, DeepSWE 71 y EEBench 64. Estas cifras pertenecen a la categoría de benchmarks del proveedor porque las presenta la empresa que está detrás del modelo. Pueden ser señales útiles sobre las tareas que SpaceXAI quiere enfatizar, especialmente en torno a flujos de trabajo de programación o ingeniería de software sugeridos por los nombres de los benchmarks y por la distribución a través de Cursor. Pero los benchmarks del proveedor no tienen el mismo peso probatorio que las pruebas independientes. Muestran lo que la empresa comunica bajo las condiciones que ha elegido; por sí solos no establecen liderazgo de mercado ni fiabilidad amplia.
El panorama independiente es menos favorable. Artificial Analysis otorga a Grok 4.7 una puntuación de inteligencia de 46, frente a 53 para GPT-6 y 53 para Claude Fable 5.1. En la escala de ese evaluador, Grok 4.7 queda por detrás de los dos modelos líderes citados en la comparación. Artificial Analysis también informa de una gran brecha en Terminal Bench. Estas son mediciones independientes, distintas de las afirmaciones de benchmark de la propia SpaceXAI. No borran la importancia del modelo base más grande ni del precio estándar sin cambios, pero sí limitan cualquier afirmación de que Grok 4.7 haya alcanzado a los competidores más fuertes en inteligencia medida.
La diferencia entre los resultados del proveedor y los independientes es el punto analítico central. Las cifras de SpaceXAI pueden respaldar la idea de que Grok 4.7 mejora en áreas que la empresa mide y promociona. Artificial Analysis respalda una conclusión distinta: en sus pruebas independientes, el modelo todavía va por detrás de GPT-6 y Claude Fable 5.1, con una brecha especialmente grande en Terminal Bench. Ningún conjunto de cifras lo demuestra todo. Los benchmarks del proveedor no pueden resolver una clasificación independiente. Las puntuaciones independientes no pueden describir todas las posibles cargas de trabajo privadas. En conjunto, sugieren un lanzamiento con cambios de ingeniería significativos, pero no uno que, según la evidencia independiente citada, lidere el sector.
Implicaciones prácticas
Para los usuarios de la API, la implicación práctica más clara es que Grok 4.7 cambia las afirmaciones de capacidad sin modificar el precio estándar por token. Un equipo que use el acceso estándar vería la misma tarifa publicada de 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida, al tiempo que obtiene acceso al modelo más grande, la ventana de contexto de 500.000 tokens y los cuatro niveles de razonamiento. Si se necesita el nivel más rápido, el coste cambia de forma material porque es el doble del precio estándar. Por tanto, la estructura de precios separa la actualización del modelo de la prima aplicada al servicio más rápido.
Para tareas largas, el lanzamiento está diseñado para ser más relevante que una actualización de modelo centrada en prompts cortos. El aprendizaje por refuerzo más prolongado para tareas largas, el entrenamiento de contexto largo y la autoverificación apuntan todos a casos de uso en los que el modelo debe mantener instrucciones, procesar material extenso o avanzar por operaciones de múltiples pasos. Aun así, los resultados independientes fijan un límite a las expectativas. Un modelo base más grande y un contexto más largo pueden ayudar en flujos de trabajo complejos, pero la puntuación de 46 de Artificial Analysis frente a 53 para GPT-6 y Claude Fable 5.1 indica que los evaluadores independientes aún observan una brecha de rendimiento en la parte alta.
El resultado es una actualización medida, no un desplazamiento claro de los modelos líderes. Grok 4.7 llega con mayor disponibilidad, un modelo base más grande, entrenamiento para tareas largas, autoverificación, entrenamiento de contexto largo, precio estándar de API sin cambios y un nivel más rápido de mayor coste. Los resultados CursorBench, DeepSWE y EEBench comunicados por SpaceXAI muestran el encuadre de benchmark propio de la empresa. Artificial Analysis aporta el contrapeso independiente, al situar Grok 4.7 por detrás de GPT-6 y Claude Fable 5.1 y señalar una gran brecha en Terminal Bench. El lanzamiento importa, pero la evidencia disponible no respalda tratarlo como el nuevo líder de referencia.
Fuentes
- SpaceXAI releases Grok 4.7MarkTechPost · 21 de septiembre de 2026
- Grok 4.7 is xAI's strongest model yet, but trails Claude Fable 5.1 and GPT-6The Decoder · 21 de septiembre de 2026



