Grok 4.7 vs GPT-6 Astra: ¿Qué IA gana tu tarea?
Tres nuevos modelos de IA afirman ser los mejores.
YouTube puede reproducir este video con audio en tu idioma: abre ⚙ Configuración → Pista de audio.
Cifras clave
Introducción
Tres nuevos modelos de IA afirman ser los mejores. Grok 4.7. GPT-6 Astra. DeepSeek V4.1 Flash. Pero una puntuación en un gráfico no te dice cuál abrir para tu código, tus problemas complejos, o tu escritura. Así que convertiremos los números publicados en una respuesta clara para cada tarea.
Estás viendo Latent Layer. IA, explicada simplemente — herramientas nuevas, investigación nueva, cómo funciona. Al final, sabrás cómo leer puntuaciones de referencia de IA y elegir el modelo correcto para cada tarea.
Contexto
Aquí está quién es quién. GPT-6 Astra es el nuevo modelo de OpenAI. Grok 4.7 viene de xAI, construido sobre una base modelo nueva y más grande que Grok 4.6. DeepSeek V4.1 Flash es una variante más económica, y aparece en una comparación clave. Usaremos resultados publicados por los creadores, y por Artificial Analysis, un sitio de referencias.
Primero, una idea. Una referencia es un conjunto fijo de preguntas de prueba. Cada modelo obtiene la misma prueba, y un programa califica las respuestas. Eso hace que las puntuaciones sean comparables. Pero cada prueba mide una habilidad estrecha. Entonces la pregunta útil no es qué modelo obtuvo la puntuación más alta. Es qué prueba se parece al trabajo que realmente haces.
Cómo funciona
Leamos las puntuaciones una habilidad a la vez. Comenzamos con razonamiento, luego trabajo de programación, luego uso de computadora. Después, miramos velocidad y costo. Cada paso muestra una forma en que un gráfico puede engañarte, y una forma de leerlo correctamente.
Comienza con razonamiento. GPT-6 Astra obtiene noventa y ocho por ciento en FrontierMath Tier four, una prueba de matemáticas difícil, según OpenAI. OpenAI describe eso como saturado: máximo alcanzado. En nuestra opinión, casi puntuación completa no puede separar modelos fuertes más. Y nuestras fuentes no muestran puntuaciones coincidentes para Grok 4.7, así que no existe comparación directa aún.
Ahora trabajo de programación. Terminal-Bench versión cuatro le da a un modelo una línea de comando y un trabajo que completar. En mi lectura, eso es similar a lo que hace un asistente de programación. Astra obtiene cincuenta y nueve por ciento. Claude Fable 5.1 obtiene cincuenta y dos. DeepSeek V4.1 Flash obtiene veintisiete, justo por delante de Grok 4.7 en veintiséis. Un reporte redondea Astra a sesenta. La brecha es amplia de cualquier forma.
Siguiente, uso de computadora. Esto significa un modelo haciendo clic a través de aplicaciones por ti, como llenar un formulario. En OSWorld dos punto cero, Astra obtiene setenta y dos punto seis por ciento, en aproximadamente cuarenta minutos por tarea. Su predecesor, GPT-5.6 Sol, obtiene sesenta y cinco punto siete por ciento en aproximadamente setenta y cinco minutos. Eso es precisión más alta en aproximadamente cuarenta y siete por ciento menos tiempo. Velocidad y precisión mejoraron juntas.
Ahora, ¿cómo fue construido Grok 4.7? Comienza desde una base modelo nueva y más grande. Luego viene el aprendizaje por refuerzo. El modelo intenta tareas, se califica, y se ajusta. La ejecución de Grok fue más larga, en una mezcla más difícil de tareas, ponderada hacia problemas que tardan muchas horas en completarse. El objetivo es trabajos largos y difíciles. Las puntuaciones publicadas muestran cuán lejos ese objetivo todavía tiene que ir.
¿Por qué puede una IA de inicio rápido aún sentirse lenta? Porque la velocidad tiene dos partes. Tiempo al primer token es la espera antes de que aparezcan palabras. Para Grok 4.7 eso es punto nueve cero segundos, que es rápido. Luego viene la velocidad de salida. Grok 4.7 escribe cuarenta tokens por segundo. Un token es una pequeña pieza de una palabra. Artificial Analysis llama eso notablemente lento.
Además, Grok 4.7 es hablador. Ejecutando el mismo Índice de Inteligencia, produjo doscientos cuarenta millones de tokens. El modelo mediano produjo ochenta y ocho millones. Los modelos habladores tardan más, y pueden costar más por tarea. GPT-6 Astra va al otro lado. En máximo esfuerzo usa veintisiete mil tokens de salida por tarea, aproximadamente un tercio de los setenta y ocho mil usados por Claude Fable 5.1.
Ahora costo, que es fácil de malinterpretar. Los precios de lista son por millón de tokens. Grok 4.7 cuesta dos dólares para entrada y seis para salida. Astra cuesta diez y cincuenta. Pero pagas por cada token usado, y Grok usa muchos. En el mismo índice, una tarea cuesta tres dólares setenta y cuatro con Grok, y tres dólares veintiséis con Astra. Claude Fable 5.1 cuesta siete dólares sesenta y tres. Estos fueron medidos en fechas diferentes, así que trátalos como una guía.
Qué significa
Ahora la parte práctica. Aquí está lo que estos números cambian para ti. Clasificamos por trabajo: programación, razonamiento difícil, tareas de computadora, y trabajo diario más ligero. Esta es mi lectura de las puntuaciones publicadas, así que trátalo como opinión, no como hecho. Tus propias pruebas siempre vienen primero.
Ayuda de programación: elige GPT-6 Astra. Lidera Terminal-Bench por un amplio margen. Razonamiento difícil: Astra de nuevo, ya que es el único con puntuaciones publicadas en nuestras fuentes. Haciendo clic a través de aplicaciones: Astra, más rápido y más preciso que su predecesor. Para trabajos ligeros y económicos, prueba DeepSeek V4.1 Flash primero. Adelanta ligeramente a Grok 4.7 en Terminal-Bench, y es la variante más económica.
Un número resume la brecha general. En el Índice de Inteligencia de Artificial Analysis, GPT-6 Astra obtiene cincuenta y tres, al nivel de Claude Fable 5.1. Grok 4.7 obtiene cuarenta y seis. En pruebas de programación, Grok 4.7 y DeepSeek Flash se quedan muy atrás. Pero Grok 4.7 tiene una ventana de contexto de cinco cien mil tokens, espacio para documentos muy largos. Ninguna prueba publicada muestra qué tan bien usa ese espacio.
¿Qué hay de escribir? Correos, ensayos, historias. Aquí los números van silenciosos. Ninguna fuente independiente que encontramos publica rankings de escritura aún. Ejecuta el mismo prompt en cada modelo y juzga por ti mismo. Ese es tu dato. Usa una tarea real, las mismas instrucciones cada vez, y compara las respuestas lado a lado.
La otra cara
Un número merece una pausa. La tasa de alucinación de GPT-6 Astra cayó de noventa y dos por ciento a cincuenta y uno por ciento en máximo esfuerzo. Eso es aproximadamente uno en dos. Mejor que antes, pero verifica hechos que importan. Una alucinación es una respuesta confiada que es incorrecta.
Uno más límite. En GDPval-AA versión dos, una prueba de trabajo de conocimiento profesional, Astra cae aproximadamente cuarenta y cinco puntos Elo contra GPT-5.6 Sol. Elo es una calificación construida a partir de comparaciones directas, como en el ajedrez. En tareas de conocimiento profesional como escritura legal, una caída de cuarenta y cinco puntos significa que Astra puede no ser mejor. Prueba tu dominio. Además, solo la variante Flash de DeepSeek se cubre aquí.
Conclusión
Aquí está el método completo. Lee referencias correctamente. Verifica la fuente. Encuentra el máximo. Elige tu herramienta. Una puntuación te dice dónde comenzar a probar. Tu propia tarea te dice dónde terminar. Más guías simples para nuevas herramientas de IA están esperando en este canal.
Fuentes
Cada cifra de este video se verificó con estas fuentes. Las citas se muestran en el idioma original de la fuente.
- x.ai/news/grok-4-7
“Grok 4.7 uses a new, larger base model compared to Grok 4.6.”
“It was trained with a longer reinforcement learning run on a harder mix of tasks, weighted toward problems that take many hours to complete.”
“The model is priced starting at $2 per million input tokens and $6 per million output tokens.”
Última verificación: 2026-09-24 - artificialanalysis.ai/articles/benchmarking-gpt-6-astra
“GPT-6 Astra scores 59% on Terminal-Bench v4.0, ahead of Claude Fable 5.1 (52%) and 19 points ahead of GPT-5.6 Sol (40%).”
“ahead of Claude Fable 5.1 (52%)”
“At max effort, Astra uses 27k output tokens per task, about a third of Claude Fable 5.1 (max with fallback) at 78k”
Última verificación: 2026-09-24 - the-decoder.com/xai-launches-grok-4-7-at-bargain-prices-but-benchmarks-reve
“Even the cheaper DeepSeek V4.1 Flash edges past it at 27 percent.”
“On Terminal-Bench 4.0, Grok 4.7 hits just 26 percent, versus 60 percent for GPT-6 Astra”
Última verificación: 2026-09-24 - openai.com/index/gpt-6-astra/
“Astra saturates FrontierMath Tier 4 with a 98% score”
“scoring 72.6% at roughly 40 minutes per task”
“compared with 65.7% at roughly 75 minutes”
Última verificación: 2026-09-24 - artificialanalysis.ai/models/grok-4-7
“has a time to first token (TTFT) of 0.90s”
“At 40 tokens per second, Grok 4.7 (xhigh) is notably slow”
“It generated 240M tokens, which is very verbose in comparison to the median of 88M.”
Última verificación: 2026-09-24 - Cálculo propio
GPT-6 Astra achieves OSWorld 2.0 tasks 47% faster than GPT-5.6 Sol = (75-40)/75*100
- Cálculo propio
GPT-6 Astra uses about one-third the output tokens of Claude Fable 5.1 = 27000/78000
Correcciones
Sin correcciones desde su publicación.