TabbitBlog

Grok 4.7 frente a Grok 4.6: misma tarifa, facturas más largas

Grok 4.7 lista la misma tarifa de API que Grok 4.6: $2/$6 y 500K de contexto. En xhigh usó unos 81.000 tokens de salida por tarea de inteligencia, frente a 36.000.

En este artículo
  1. Ideas clave
  2. El número que decide: misma tarifa de $2/$6, unos 81.000 frente a 36.000 tokens de salida
  3. Especificaciones y precio de un vistazo
  4. Benchmarks, y cuánto confiar en ellos
  5. Dónde Grok 4.7 sí se adelanta
  6. Ejecuciones largas de código dentro de un agente
  7. Documentos y análisis, con una salvedad de presentación
  8. Una tasa de alucinación más baja, no una precisión más alta
  9. Dónde Grok 4.6 sigue siendo el mejor predeterminado
  10. Trabajo corto, donde el pensamiento extra es el producto
  11. Planes de Cursor, si Fast y el esfuerzo no están fijados
  12. Cualquier trabajo que ya aceptas de Grok 4.6
  13. Lo que la gente dijo de verdad
  14. El veredicto
  15. Ejecuta la misma tarea en Tabbit antes de migrar una ruta

Grok 4.7 es el modelo para probar cuando la tarea es larga, usa muchas herramientas y justifica una factura de tokens más alta. Grok 4.6 sigue siendo el predeterminado cuando el trabajo es rutinario y quieres la traza más corta. La tarifa de la API no cambió.

xAI publicó Grok 4.7 el 21 de septiembre de 2026 y dijo que se sirve al mismo precio y a la misma velocidad que Grok 4.6. Las fichas abiertas el 22 de septiembre coinciden en la tarifa y en la ventana de 500K. No coinciden en que una tarea terminada cueste lo mismo. Artificial Analysis, al evaluar Grok 4.7 en xhigh, contó unos 81.000 tokens de salida por tarea del Intelligence Index, frente a unos 36.000 de Grok 4.6 en high. Ese es el número que decide el cambio. (lanzamiento de xAI, ficha de Grok 4.7, ficha de Grok 4.6, Artificial Analysis)

La misma tensión apareció enseguida en Cursor. El 21 de septiembre, u/Dynamix86 escribió que una cuenta Ultra, en extra high y con Fast apagado, quemaba el porcentaje del plan unas 2,5 veces más rápido con Grok 4.7 que con Grok 4.6 en la misma tarea no nombrada, y que la mayor parte del trabajo volvería a 4.6.

Publicación de Reddit de Dynamix86 comparando el uso de Cursor Ultra de Grok 4.7 y Grok 4.6
u/Dynamix86 en r/cursor, 21 de septiembre de 2026: misma tarea, extra high, Fast apagado y una estimación de uso del plan de unas 2,5 veces.

Esa publicación es una cuenta y una tarea. No prueba facturas de API ni la calidad de la respuesta. Sí muestra por qué «el mismo precio» es la primera pregunta equivocada. La visión general de Grok 4.6 cubre el modelo anterior por sí solo. Esta página solo trata la elección entre los dos. Las especificaciones también están en la página de Grok 4.7 (English) y la página de Grok 4.6 (English).

Ideas clave

  • Las dos fichas de API listan $2 / $0,50 en caché / $6 por millón de tokens por debajo de 200K de contexto, y $4 / $1 / $12 por encima de 200K. La ventana de 500K coincide.

  • Grok 4.7 xhigh usó unos 81.000 tokens de salida por tarea de inteligencia de Artificial Analysis, frente a unos 36.000 de Grok 4.6 high y unos 38.000 de Grok 4.6 xhigh. Solo la salida, a $6, sale a unos $0,49 frente a $0,22–$0,23.

  • El movimiento del Intelligence Index es +2, y compara xhigh con high (46 frente a 44). El del Coding Agent Index es +9 con xhigh alineado dentro de Grok Build (56 frente a 47).

  • La tabla de lanzamiento de xAI mejora en cada fila listada, pero las columnas son Grok 4.7 xHigh y Grok 4.6 High. DeepSWE en esa tabla marca high effort para 4.7. Esas brechas no son un experimento del mismo peldaño.

  • Deja Grok 4.6 para el trabajo corto y repetido. Prueba Grok 4.7 cuando una ejecución larga de código o una tarea cargada de documentos falle en 4.6 con la frecuencia suficiente para pagar los tokens extra.

  • Para este artículo no se completó una ejecución de la misma tarea en Tabbit. Una página de modelo no es una victoria medida.

El número que decide: misma tarifa de $2/$6, unos 81.000 frente a 36.000 tokens de salida

El titular del lanzamiento dice que Grok 4.7 es «el doble de rápido, a la mitad del precio de los modelos comparables», y el cuerpo dice que se sirve al mismo precio y a la misma velocidad que Grok 4.6. La primera frase no nombra los modelos comparables ni la unidad de velocidad. La segunda es la que sostienen las fichas de tarifa.

Lo que cambió es cuántos tokens gasta el modelo nuevo. Artificial Analysis escribió que Grok 4.7 xhigh usa aproximadamente 81.000 tokens de salida por tarea del Intelligence Index, frente a 36.000 de Grok 4.6 high, lo que llaman un 125% más. Más adelante en el mismo artículo dicen que 81.000 es más del doble de los 38.000 usados por Grok 4.6 xhigh. Las dos comparaciones importan. La cifra de 36.000 no es un par del mismo esfuerzo. La de 38.000 sí.

Tokens de salida por tarea del Intelligence Index (Artificial Analysis, 21 sep 2026)
Grok 4.7 xhigh     ~81k
Grok 4.6 high      ~36k     (+125% de tokens con una etiqueta de esfuerzo más alta)
Grok 4.6 xhigh     ~38k     (más de 2× tokens con la misma etiqueta de esfuerzo)

Cargo solo de salida a la tarifa compartida de $6 / 1M
81k × $6 / 1M  ≈  $0,49
36k × $6 / 1M  ≈  $0,22
38k × $6 / 1M  ≈  $0,23

Esa cuenta no es una factura. Ignora tokens de entrada, aciertos de caché, llamadas a herramientas, reintentos y cualquier cliente que cobre un porcentaje del plan en lugar de la API. También ignora la puntuación que compraron esos tokens.

En el Intelligence Index la puntuación pasó de 44 para Grok 4.6 high a 46 para Grok 4.7 xhigh. Fuera del trabajo de conocimiento agéntico, Artificial Analysis dijo que Grok 4.7 coincidía en líneas generales con Grok 4.6 high, con Terminal-Bench 4.0 +4,5 puntos y GDP.pdf +3,0 puntos, y con retrocesos en AA-LCR (−3,7 puntos) y AutomationBench-AA (−1,1 puntos). Las puntuaciones absolutas de esas cuatro filas no se imprimieron en el texto del artículo.

El movimiento mayor es el índice de agente de código, y sí es una comparación del mismo esfuerzo. Grok 4.7 xhigh con Grok Build obtuvo 56, frente a 47 de Grok 4.6 xhigh con Grok Build. Dentro de ese harness, DeepSWE v1.1 pasó del 65% al 73%, Terminal-Bench 4.0 del 18% al 33% y SWE-Atlas-QnA del 58% al 63%. Esos números de terminal no son el 38,0% y el 20,3% de la tabla de lanzamiento de xAI, ni el delta de +4,5 puntos del harness unificado. Tres lecturas distintas de Terminal-Bench pueden ser reales si el harness y el esfuerzo difieren.

Usa Grok 4.7 cuando los tokens extra compran una ejecución larga que de otro modo repetirías. Quédate en Grok 4.6 cuando un índice +2, medido entre etiquetas de esfuerzo distintas, no valga aproximadamente el doble de salida.

Especificaciones y precio de un vistazo

Comprobado el 22 de septiembre de 2026 en las dos fichas. «Higher context» en esas fichas significa una petición por encima de 200K tokens. La documentación de Cursor usa un límite de 256K y no es esta tabla.

DimensiónGrok 4.7Grok 4.6Cómo usar la fila
ID del modelo en la APIgrok-4.7grok-4.6Fija el ID. No uses un alias «latest» para comparar.
Ventana de contexto500.000500.000Un cliente puede exponer menos. La página de Grok 4.7 en Cursor describe 256K estándar y 500K de contexto largo.
ModalidadesTexto e imagen de entrada, texto de salidaTexto e imagen de entrada, texto de salidaLos límites de tamaño de imagen están en la documentación compartida, no son un motivo para elegir un ID.
Entrada / caché / salida, hasta 200K$2 / $0,50 / $6 por 1M$2 / $0,50 / $6 por 1MMisma tarifa de lista.
Entrada / caché / salida, por encima de 200K$4 / $1 / $12 por 1M$4 / $1 / $12 por 1MEl multiplicador de contexto largo también coincide.
Corte de conocimientoMayo de 2026, en el índice de modelosNo se repite en la ficha abierta esta fechaNo copies un corte anterior.
Opción FastPublicación de lanzamiento: una variante rápida al doble de velocidad de salida y al doble de precio, sin fila de benchmarkNo consta en la ficha abierta esta fechaNo des por hecho que los dos interruptores Fast son el mismo producto.

La tabla de lanzamiento de xAI también imprime $2 de entrada y $6 de salida para las dos columnas de Grok, junto a GPT-5.6 Sol a $4 / $20 y Fable 5.1 a $10 / $50. Esa tabla compara tarifas de lista. No compara tareas terminadas. Fable 5.1 sigue liderando varias filas propias de xAI; la reseña de Fable 5.1 es el lugar para esas compensaciones, no una afirmación de que Grok lo sustituyó.

La documentación de Grok 4.7 en Cursor, abierta el mismo día y servida en chino en cursor.com/cn/docs/models/grok-4-7, coloca a Grok 4.7 en un pool de uso con Grok 4.6, Grok 4.5 y Composer 2.5. Las tarifas bajo demanda que muestra coinciden con la ficha de API de contexto corto: $2 de entrada, $0,50 en caché, $6 de salida. Fast aparece a $4 / $1 / $12, y la página dice que Fast es la velocidad predeterminada en Pro y superior. La entrada por encima de 256K se factura a 2× en estándar y a 3× la tarifa estándar en Fast, hasta 500K. Un porcentaje de Cursor y un dólar de API son medidores distintos. Compáralos solo después de fijar el esfuerzo y Fast en los dos lados.

Benchmarks, y cuánto confiar en ellos

Dos tablas. La primera es la de lanzamiento de xAI, con las etiquetas de esfuerzo que la página imprimió. La segunda es Artificial Analysis donde las etiquetas coinciden, más las puntuaciones de índice que no.

Tabla de lanzamiento de xAI, 21 de septiembre de 2026Grok 4.7Grok 4.6GPT-5.6 SolFable 5.1
Etiqueta de esfuerzo de la columnaxHigh; DeepSWE marcado high effortHighMaxMax
Tarifa de lista, entrada / salida por 1M$2 / $6$2 / $6$4 / $20$10 / $50
CursorBench 4.046,3%40,4%41,7%51,8%
DeepSWE v1.171,0%65,2%72,7%70,0%
EEBench64,0%53,0%39,4%56,4%
AA Briefcase v1.11.6571.5461.4871.678
Terminal-Bench 4.038,0%20,3%37,3%57,9%
Harvey Legal Agent Benchmark19,6%15,8%2,5%6,7%
HealthBench Professional56,7%48,5%60,5%62,1%

Grok 4.7 va por delante de Grok 4.6 en cada fila de esa tabla. No va por delante de Fable 5.1 en CursorBench, AA Briefcase, Terminal-Bench ni HealthBench Professional. Va por delante de GPT-5.6 Sol en cinco de las siete filas de puntuación y por detrás en DeepSWE y HealthBench. El tamaño de muestra, el harness y los intervalos de confianza no están en la página. El pie del gráfico dice que los benchmarks son resultados direccionales del proveedor.

El diagrama de dispersión de CursorBench en la misma página no incluye Grok 4.6. Para Grok 4.7 muestra una escalera de esfuerzo pronunciada: Extra High 46,3% a unos $6,01 y 70.141 tokens de salida por tarea; High 43,9% a $4,69; Medium 41,6% a $3,49; Low 33,1% a $1,58. «Grok 4.7» sin etiqueta de esfuerzo no es una sola puntuación.

Artificial Analysis, artículo del 21 de septiembre de 2026Grok 4.7Grok 4.6Par de esfuerzoQué se puede decir
Intelligence Index v4.34644xhigh vs high+2 puntos, no un resultado del mismo peldaño
Tokens de salida por tarea de inteligencia~81k~36k high; ~38k xhighmixtoLa factura se mueve más que el índice
Coding Agent Index, Grok Build5647xhigh vs xhigh+9 en el agente de código del proveedor
DeepSWE v1.1, Grok Build73%65%xhigh vs xhighNo es el par 71,0 / 65,2 de la tabla de lanzamiento
Terminal-Bench 4.0, Grok Build33%18%xhigh vs xhighNo es el par 38,0 / 20,3 de xAI
SWE-Atlas-QnA, Grok Build63%58%xhigh vs xhighMás estrecho que el salto de terminal
Elo de AA-Briefcase1.6571.546 en highxhigh vs highSube la calidad analítica, baja la presentación
Elo de GDPval-AA1.6951.605 en highxhigh vs highGanancia en trabajo de conocimiento; Fable 5.1 sigue en 1.735 en el gráfico de xAI
Tasa de alucinación, AA-Omniscience29%34% en highxhigh vs highLa precisión se quedó en 47% frente a 48%

Lee el bloque del agente de código si te importa Grok Build. Lee el bloque de inteligencia si te importa un harness compartido. No los promedies en una frase de «Grok es un 10% mejor». Un comentario de Hacker News hizo la pregunta obvia: ¿por qué comparar 4.7 xhigh con 4.6 high? Las respuestas de ese hilo no coinciden sobre cuándo llegó xhigh a 4.6. Artificial Analysis sí publica una puntuación de agente de código de Grok 4.6 xhigh, así que la etiqueta existe en al menos una evaluación actual. La tabla de lanzamiento sigue sin usarla.

Comentario de Hacker News que pregunta por qué se compara Grok 4.7 xhigh con Grok 4.6 high
AM1010101 en Hacker News, 22 de septiembre de 2026: la comparación del lanzamiento mezcla etiquetas de esfuerzo.

Dónde Grok 4.7 sí se adelanta

Ejecuciones largas de código dentro de un agente

La ganancia más limpia es la del esfuerzo alineado. En Grok Build, el índice de agente de código subió 9 puntos y cada componente subió. El trabajo de terminal se movió más, del 18% al 33% en ese harness. Si tu modo de fallo es una tarea de repositorio de varias horas que se atasca, esta es la fila que justifica una prueba. No dice que Grok Build vaya a ganar a Claude Code o a Codex. Artificial Analysis situó a Grok 4.7 más Grok Build en cuarto lugar entre harness nativos, por detrás de Claude Fable 5.1, GPT-6 Astra y Claude Opus 5.

El salto propio de xAI en Terminal-Bench 4.0, del 20,3% al 38,0%, apunta en la misma dirección y usa etiquetas de esfuerzo no alineadas. Trátalo como evidencia de apoyo del proveedor, no como una segunda medición independiente del resultado de 18 a 33.

Documentos y análisis, con una salvedad de presentación

En AA-Briefcase, Grok 4.7 obtuvo 1.657 Elo, 111 por encima de Grok 4.6 high, justo por detrás de Claude Opus 5 y Claude Fable 5.1 en el texto de Artificial Analysis. La calidad analítica fue 1.994 Elo frente a 1.690. La calidad de presentación fue 1.499 frente a 1.519. El modelo mejoró en el análisis y empeoró un poco en la presentación.

Artificial Analysis describió la misma división con más nitidez en el escenario público de diligencia debida de AA-Briefcase-Lite: Elo analítico de 1.698 a 1.994, Elo de presentación de 1.531 a 1.499. Las presentaciones de ejemplo costaron unos $8 para Grok 4.7 xhigh y unos $4,40 para Grok 4.6 xhigh. Ese par es del mismo esfuerzo y unas 1,8 veces el coste de API a cambio de un análisis más fuerte y una presentación más débil. Es un escenario, no un benchmark universal de oficina. GDPval-AA pasó de 1.605 a 1.695 Elo en el par high frente a xhigh, y el gráfico GDPval de xAI sitúa a Fable 5.1 max en 1.735.

Publicación de Artificial Analysis sobre puntuaciones de AA-Briefcase y el coste de presentaciones de ejemplo de Grok 4.7 y Grok 4.6
Artificial Analysis en X, 22 de septiembre de 2026: sube el Elo analítico, baja el Elo de presentación, presentaciones de ejemplo a unos $8 frente a $4,40 en xhigh.

Una tasa de alucinación más baja, no una precisión más alta

La tasa de alucinación de AA-Omniscience fue del 29% para Grok 4.7 xhigh y del 34% para Grok 4.6 high. La precisión fue del 47% frente al 48%. El índice pasó de 30 a 32. Si necesitas menos respuestas erróneas dichas con seguridad, eso es un cambio real. Si necesitas más respuestas correctas, este par no lo muestra. Las etiquetas de esfuerzo siguen siendo distintas.

Dónde Grok 4.6 sigue siendo el mejor predeterminado

Trabajo corto, donde el pensamiento extra es el producto

Pagar la misma tarifa por aproximadamente el doble de salida es un buen intercambio solo cuando esa salida evita un reintento. Para una extracción acotada, un parche corto o un JSON de estado, la traza más corta de Grok 4.6 es la función. Lectores de Hacker News que miraban el gráfico de tokens de inteligencia llamaron al cambio una regresión de eficiencia de tokens. Ese comentario no añade una medición nueva. Es el mismo gráfico de Artificial Analysis, leído como un problema de coste y no como una subida de capacidad.

Comentario de Hacker News sobre la eficiencia de tokens de Grok 4.7 frente a Grok 4.6
notduckrabbit en Hacker News: el gráfico de tokens del índice de inteligencia se lee como una regresión frente a Grok 4.6.

En las tareas que Artificial Analysis señaló como retrocesos frente a Grok 4.6 high, AA-LCR y AutomationBench-AA, no hay motivo para dejar 4.6. No se publicaron puntuaciones absolutas, así que el tamaño de esas caídas es solo el delta publicado: 3,7 y 1,1 puntos.

Planes de Cursor, si Fast y el esfuerzo no están fijados

Una tarifa de lista de $2/$6 no describe un porcentaje de Cursor Ultra. Los tiempos de Dynamix86 son un registro de un solo usuario: intervalos de Grok 4.7 de 34, 55 y 38 minutos por punto porcentual, frente a 133 y 101 minutos de Grok 4.6 más temprano el mismo día, ambos en extra high con Fast apagado. El autor también leyó un gráfico de Artificial Analysis como $8,82 frente a $3,53 por tarea de agente de código. Esas cifras en dólares fueron la lectura del autor de un gráfico. No se imprimieron como una frase en el artículo de Artificial Analysis abierto para esta página, así que se quedan atribuidas a la publicación.

Una respuesta en el mismo hilo fue más directa: el lanzamiento parecía flojo porque el coste era claramente demasiado alto aunque se dejaran de lado los benchmarks.

Comentario de Reddit de truecakesnake diciendo que Grok 4.7 cuesta demasiado
u/truecakesnake en r/cursor: la objeción es la factura, no un benchmark con nombre.

La documentación de Cursor también dice que Fast es el predeterminado en Pro y superior, al doble de las tarifas de token. Si un lado de una prueba personal es Fast y el otro no, el precio 2× es un ajuste, no un cambio de modelo. El registro de Reddit dice que Fast estaba apagado. Muchas comparaciones casuales no lo estarán.

Cualquier trabajo que ya aceptas de Grok 4.6

Las notas de reseña (English) de Grok 4.6 ya describen un modelo agente de 500K a esta tarifa. Grok 4.7 no añade un nuevo tramo de contexto en la ficha de API, y no baja la tarifa de lista. Si 4.6 ya termina el trabajo y no estás bloqueado en terminales largos o documentos largos, la actualización es opcional. HealthBench Professional sigue por detrás de GPT-5.6 Sol y Fable 5.1 en la propia tabla de xAI (56,7 frente a 60,5 y 62,1), así que un cambio por razonamiento clínico tampoco es la historia.

Lo que la gente dijo de verdad

Los comentarios tempranos se parten en un campo del coste y un campo de la sensación. Los dos tienen horas de vida. Ninguno publicó un prompt, un repositorio o una puntuación.

La factura. La estimación de 2,5× de uso del plan de Dynamix86 y el «el coste es claramente demasiado alto» de truecakesnake se sientan junto al gráfico de tokens. Otro comentarista de Hacker News, notduckrabbit, señaló la misma brecha de eficiencia. Juntos dicen: no migres una ruta de alto volumen el día del lanzamiento.

La sensación. Otros comentarios de r/cursor, publicados la misma tarde, gustaron del modelo y no mencionaron el precio.

Comentario de Reddit que dice que Grok 4.7 no es tan lento como Grok 4.6
u/vandersky_: una impresión temprana de velocidad, sin registro de tiempos.
Comentario de Reddit que compara Grok 4.7 con un Opus que piensa menos de más
u/kodka: una comparación de sensación con Opus, no una tarea compartida.
Comentario de Reddit que prefiere Devin SWE 2.0 a Grok 4.7
u/ImmediateAttention88: prefiere el SWE 2.0 de Devin con Fusion, y sigue usando los dos IDE de agentes.

Los comentarios de velocidad y de «no piensa de más» pueden ser ciertos en una sesión de chat y seguir siendo falsos para un agente de código xhigh que emite 81.000 tokens. «No tan lento como 4.6» no iba acompañado de un recuento de tokens. Artificial Analysis midió unos 188 tokens por segundo en prompts largos y unos 7,1 minutos de tiempo de decodificación por tarea de inteligencia, sin contar el tiempo hasta el primer token ni la sobrecarga. Una primera impresión rápida y una traza larga de agente son compatibles.

La búsqueda en YouTube de «Grok 4.7 vs Grok 4.6» el 22 de septiembre devolvió explicaciones del lanzamiento, incluidos vídeos previos que adivinan recuentos de parámetros. Esos recuentos no están en la página de lanzamiento de xAI, que solo dice «un modelo base nuevo y más grande». Aquí no se usa ningún comentario de vídeo.

El veredicto

No hay un ganador global. Elige según la forma del trabajo y deja la etiqueta de esfuerzo dentro de la decisión.

Carga de trabajoEligePor quéQué vigilar
Extracción corta, clasificación o un parche pequeñoGrok 4.6La ganancia del índice es pequeña y la traza de salida es mucho más cortaNo pagues xhigh por una respuesta de una línea
Trabajo repetido de Cursor en un pool de usoGrok 4.6, salvo que una tarea esté fallandoUn registro Ultra mostró unas 2,5× de uso del plan en extra high con Fast apagadoFija Fast y el esfuerzo antes de culpar al modelo
Código de varias horas en Grok Build o un agente similarPrueba Grok 4.7 xhighCoding Agent Index 56 frente a 47 con xhigh alineadoCompara tareas terminadas, no solo el índice
Modelos de mercado, memorandos y presentaciones objetivoPrueba Grok 4.7 y luego edita la presentaciónEl Elo analítico subió; el Elo de presentación bajó; los ejemplos costaron unos $8 frente a $4,40Reserva una pasada humana en las diapositivas
Llamadas de API de contexto largo por encima de 200KCualquiera, en precioLas dos fichas duplican las tarifas pasados 200KEl límite de 256K de Cursor es otro medidor
Necesitas CursorBench o Terminal-Bench al nivel de FableNo este parFable 5.1 Max está en 51,8% y 57,9% en la tabla de xAIPrecia esa elección en la ficha de Fable, no en la de Grok

Una prueba práctica es una tarea ya aceptada, mismo esfuerzo, Fast apagado, mismo harness. Anota si se completó, las ediciones humanas, los tokens de salida y los dólares de API o el porcentaje del plan. Un acierto no es una tasa.

Ejecuta la misma tarea en Tabbit antes de migrar una ruta

Una fila de benchmark no dice cómo se comporta cada modelo en tus pestañas, documentos e investigación a medias. Tabbit Browser es el espacio de trabajo para esa comprobación: el modelo puede sentarse junto a las páginas que ya estás leyendo, en lugar de un chat aparte que nunca las ve. La guía del navegador agéntico y la guía de razonamiento agéntico separan una puntuación de modelo de un flujo de varios pasos ya terminado. La comparación de navegadores de IA y la guía de Tabbit Browser cubren el producto alrededor del modelo. El recorrido de navegadores de IA de 2026 es el conjunto más amplio si Tabbit no es el cliente que quieres.

Chat nuevo de Tabbit con varios modelos respondiendo qué es Tabbit en paralelo
Tabbit puede poner más de un modelo en la misma pregunta. Esta captura muestra otros modelos, no una ejecución de Grok 4.7 frente a Grok 4.6.

Los dos ID de Grok están registrados para Tabbit. Que Grok 4.7 o Grok 4.6 aparezca en tu selector depende de la cuenta y del listado actual. Este artículo no incluye una transcripción de Tabbit, un registro de tokens ni un ganador. Si los dos ID están disponibles, ejecuta una tarea que ya sepas calificar, mantén el esfuerzo y las herramientas iguales, y quédate en Grok 4.6 si el único cambio es una traza más larga. La guía de prácticas de Tabbit trata el flujo de trabajo del navegador, no afirma que una compilación de Grok venga preinstalada en cada cuenta.

La tarifa de lista de la API, un pool de Cursor y el acceso en Tabbit son tres facturas distintas. No las sumes.

Tabbit Browser

Preguntas frecuentes

¿Grok 4.7 es mejor que Grok 4.6?

Depende de la tarea y del nivel de razonamiento. En el Coding Agent Index de Artificial Analysis, Grok 4.7 xhigh con Grok Build obtuvo 56 frente a 47 de Grok 4.6 xhigh. El Intelligence Index solo pasó de 44 en Grok 4.6 high a 46 en Grok 4.7 xhigh, y algunas tareas no agénticas empeoraron. No hay un ganador único.

¿Grok 4.7 y Grok 4.6 cuestan lo mismo?

En las fichas de modelo de xAI abiertas el 22 de septiembre de 2026, ambos listan $2 por millón de tokens de entrada, $0,50 de entrada en caché y $6 de salida por debajo de 200K de contexto, y $4, $1 y $12 por encima de 200K. Cursor documenta un pool de uso aparte y un nivel Fast. Que la tarifa coincida no significa que una tarea terminada cueste igual.

¿Por qué Grok 4.7 puede costar más si el precio por token no cambió?

Artificial Analysis midió unos 81.000 tokens de salida por tarea del Intelligence Index para Grok 4.7 xhigh, frente a unos 36.000 de Grok 4.6 high y unos 38.000 de Grok 4.6 xhigh. A $6 por millón de tokens de salida, solo esa salida es unos $0,49 frente a $0,22 o $0,23, antes de entrada, caché, herramientas o reintentos.

¿Qué mejoras de benchmark de Grok 4.7 están en el mismo nivel de esfuerzo?

La comparación del Coding Agent Index es xhigh contra xhigh: 56 frente a 47, con DeepSWE 73% frente a 65%, Terminal-Bench 4.0 33% frente a 18% y SWE-Atlas-QnA 63% frente a 58% dentro de Grok Build. La tabla de lanzamiento de xAI compara Grok 4.7 xHigh con Grok 4.6 High, y DeepSWE en esa tabla marca high effort para Grok 4.7. No trates esas filas como una prueba del mismo peldaño.

¿Debo pasar de Grok 4.6 a Grok 4.7 en Cursor?

Prueba una tarea larga de código o de documentos si aceptas un mayor gasto del plan. Un usuario de Cursor Ultra, en extra high y con Fast apagado, estimó unas 2,5 veces el uso del plan y pensaba devolver la mayor parte del trabajo a 4.6. Otros comentarios tempranos dijeron que 4.7 se sentía más rápido o menos propenso a pensar de más. Fija el esfuerzo y Fast antes de comparar.

¿Puedo comparar Grok 4.7 y Grok 4.6 en Tabbit Browser?

Los dos modelos tienen páginas de modelo en Tabbit. Que aparezcan en el selector depende de la cuenta y del listado en vivo. Este artículo no incluye una ejecución de la misma tarea en Tabbit, así que una entrada en el selector no demuestra que un modelo gane un flujo de trabajo.

Da el siguiente paso

Deja que Tabbit trabaje junto a ti.

Investiga entre pestañas, automatiza el trabajo repetitivo del navegador y mantén todo el contexto al alcance.