Grok 4.7 vs GPT-6 Astra: Qual IA Vence Sua Tarefa?
Três novos modelos de IA afirmam ser os melhores.
O YouTube pode tocar este vídeo com áudio no seu idioma: abra ⚙ Configurações → Faixa de áudio.
Números-chave
Introdução
Três novos modelos de IA afirmam ser os melhores. Grok 4.7. GPT-6 Astra. DeepSeek V4.1 Flash. Mas uma pontuação em um gráfico não diz qual abrir para seu código, seus problemas difíceis ou sua escrita. Então vamos transformar os números publicados em uma resposta clara para cada tarefa.
Você está assistindo Latent Layer. IA, explicada simplesmente — novas ferramentas, nova pesquisa, como funciona. Ao final, você saberá como ler pontuações de benchmark de IA e escolher o modelo certo para cada tarefa.
Contexto
Aqui está quem é quem. GPT-6 Astra é o novo modelo da OpenAI. Grok 4.7 vem de xAI, construído em uma base nova, modelo maior que Grok 4.6. DeepSeek V4.1 Flash é uma variante mais barata, e aparece em uma comparação chave. Vamos usar resultados publicados pelos criadores e por Artificial Analysis, um site de benchmark.
Primeiro, uma ideia. Um benchmark é um conjunto fixo de perguntas de teste. Cada modelo recebe o mesmo teste, e um programa marca as respostas. Isso torna as pontuações comparáveis. Mas cada teste mede uma habilidade estreita. Então a pergunta útil não é qual modelo pontuou mais alto. É qual teste parece o trabalho que você realmente faz.
Como funciona
Vamos ler as pontuações uma habilidade de cada vez. Começamos com raciocínio, depois trabalho estilo codificação, depois uso de computador. Depois disso, olhamos para velocidade e custo. Cada passo mostra uma forma como um gráfico pode enganar você, e uma forma de lê-lo corretamente.
Comece com raciocínio. GPT-6 Astra pontua noventa e oito por cento em FrontierMath Tier four, um teste de matemática difícil, segundo OpenAI. OpenAI descreve isso como saturado: limite atingido. Em nossa visão, pontuações quase cheias não podem separar modelos fortes mais. E nossas fontes não mostram pontuações correspondentes para Grok 4.7, então não existe comparação direta ainda.
Agora trabalho estilo codificação. Terminal-Bench versão quatro dá a um modelo uma linha de comando e uma tarefa para terminar. Na minha leitura, isso é próximo do que um assistente de codificação faz. Astra pontua cinquenta e nove por cento. Claude Fable 5.1 pontua cinquenta e dois. DeepSeek V4.1 Flash pontua vinte e sete, apenas à frente de Grok 4.7 em vinte e seis. Um relatório arredonda Astra para sessenta. A diferença é ampla de qualquer forma.
Depois, uso de computador. Isso significa um modelo clicando em aplicativos para você, como preencher um formulário. Em OSWorld dois ponto zero, Astra pontua setenta e dois ponto seis por cento, em cerca de quarenta minutos por tarefa. Seu antecessor, GPT-5.6 Sol, pontua sessenta e cinco ponto sete por cento em cerca de setenta e cinco minutos. Isso é maior precisão em cerca de quarenta e sete por cento menos tempo. Velocidade e precisão melhoraram juntas.
Agora, como foi Grok 4.7 construído? Começa de uma base nova, modelo maior. Depois vem aprendizado por reforço. O modelo tenta tarefas, é pontuado, e se ajusta. A execução de Grok foi mais longa, em uma mistura mais difícil de tarefas, ponderada para problemas que levam muitas horas para completar. O objetivo é trabalhos longos e difíceis. Os números publicados mostram o quão longe esse objetivo ainda tem que ir.
Por que uma IA de início rápido ainda pode parecer lenta? Porque velocidade tem duas partes. Tempo até o primeiro token é a espera antes das palavras aparecerem. Para Grok 4.7 isso é ponto nove zero segundos, que é rápido. Depois vem velocidade de saída. Grok 4.7 escreve quarenta tokens por segundo. Um token é uma pequena parte de uma palavra. Artificial Analysis chama isso de notavelmente lento.
Além disso, Grok 4.7 é tagarela. Executando o mesmo Índice de Inteligência, produziu duzentos e quarenta milhões de tokens. O modelo mediano produziu oitenta e oito milhões. Modelos tagarelas levam mais tempo, e podem custar mais por tarefa. GPT-6 Astra vai de outra forma. Em esforço máximo usa vinte e sete mil tokens de saída por tarefa, cerca de um terço de setenta e oito mil usados por Claude Fable 5.1.
Agora custo, que é fácil de entender errado. Os preços de lista são por milhão de tokens. Grok 4.7 custa dois dólares para entrada e seis para saída. Astra custa dez e cinquenta. Mas você paga por cada token usado, e Grok usa muitos. Em o mesmo índice, uma tarefa custa três dólares setenta e quatro com Grok, e três dólares vinte e seis com Astra. Claude Fable 5.1 custa sete dólares sessenta e três. Estes foram medidos em datas diferentes, então trate-os como um guia.
O que significa
Agora a parte prática. Aqui está o que esses números mudam para você. Organizamos por tarefa: codificação, raciocínio difícil, tarefas de computador e trabalho cotidiano mais leve. Isso é minha leitura dos números publicados, então trate isso como opinião, não fato. Seus próprios testes sempre vêm primeiro.
Ajuda de codificação: escolha GPT-6 Astra. Lidera Terminal-Bench por uma margem ampla. Raciocínio difícil: Astra novamente, porque é o único com pontuações publicadas em nossas fontes. Clicando aplicativos: Astra, mais rápido e preciso que seu antecessor. Para trabalhos leves e baratos, teste DeepSeek V4.1 Flash primeiro. Fica à frente de Grok 4.7 em Terminal-Bench, e é a variante mais barata.
Um número resume a diferença geral. Em Artificial Analysis Intelligence Index, GPT-6 Astra pontua cinquenta e três, no nível com Claude Fable 5.1. Grok 4.7 pontua quarenta e seis. Em testes estilo codificação, Grok 4.7 e DeepSeek Flash ficam muito atrás. Mas Grok 4.7 tem uma janela de contexto de cinco cem mil tokens, espaço para documentos muito longos. Nenhum teste publicado mostra com que eficiência usa esse espaço.
E quanto à escrita? Emails, ensaios, histórias. Aqui os números ficam em silêncio. Nenhuma fonte independente que encontramos publica rankings de escrita ainda. Execute o mesmo prompt em cada modelo e julgue você mesmo. Isso são seus dados. Use uma tarefa real, as mesmas instruções cada vez, e compare as respostas lado a lado.
O outro lado
Um número merece uma pausa. A taxa de alucinação de GPT-6 Astra caiu de noventa e dois por cento para cinquenta e um por cento em esforço máximo. Isso é aproximadamente um em dois. Melhor que antes, mas verifique fatos que importam. Uma alucinação é uma resposta confiante que está errada.
Mais uma limitação. Em GDPval-AA versão dois, um teste de trabalho de conhecimento profissional, Astra cai cerca de quarenta e cinco pontos Elo contra GPT-5.6 Sol. Elo é uma classificação construída a partir de comparações diretas, como no xadrez. Em tarefas de conhecimento profissional como escrita legal, uma queda de quarenta e cinco pontos significa que Astra pode não ser melhor. Teste seu domínio. Além disso, apenas a variante Flash de DeepSeek é coberta aqui.
Conclusão
Aqui está o método completo. Leia benchmarks corretamente. Verifique a fonte. Encontre o limite. Escolha seu modelo. Uma pontuação diz onde começar a testar. Sua própria tarefa diz onde terminar. Mais guias simples para novas ferramentas de IA estão esperando neste canal.
Fontes
Cada número deste vídeo foi conferido com estas fontes. As citações aparecem no idioma original da fonte.
- x.ai/news/grok-4-7
“Grok 4.7 uses a new, larger base model compared to Grok 4.6.”
“It was trained with a longer reinforcement learning run on a harder mix of tasks, weighted toward problems that take many hours to complete.”
“The model is priced starting at $2 per million input tokens and $6 per million output tokens.”
Última verificação: 2026-09-24 - artificialanalysis.ai/articles/benchmarking-gpt-6-astra
“GPT-6 Astra scores 59% on Terminal-Bench v4.0, ahead of Claude Fable 5.1 (52%) and 19 points ahead of GPT-5.6 Sol (40%).”
“ahead of Claude Fable 5.1 (52%)”
“At max effort, Astra uses 27k output tokens per task, about a third of Claude Fable 5.1 (max with fallback) at 78k”
Última verificação: 2026-09-24 - the-decoder.com/xai-launches-grok-4-7-at-bargain-prices-but-benchmarks-reve
“Even the cheaper DeepSeek V4.1 Flash edges past it at 27 percent.”
“On Terminal-Bench 4.0, Grok 4.7 hits just 26 percent, versus 60 percent for GPT-6 Astra”
Última verificação: 2026-09-24 - openai.com/index/gpt-6-astra/
“Astra saturates FrontierMath Tier 4 with a 98% score”
“scoring 72.6% at roughly 40 minutes per task”
“compared with 65.7% at roughly 75 minutes”
Última verificação: 2026-09-24 - artificialanalysis.ai/models/grok-4-7
“has a time to first token (TTFT) of 0.90s”
“At 40 tokens per second, Grok 4.7 (xhigh) is notably slow”
“It generated 240M tokens, which is very verbose in comparison to the median of 88M.”
Última verificação: 2026-09-24 - Nosso cálculo
GPT-6 Astra achieves OSWorld 2.0 tasks 47% faster than GPT-5.6 Sol = (75-40)/75*100
- Nosso cálculo
GPT-6 Astra uses about one-third the output tokens of Claude Fable 5.1 = 27000/78000
Correções
Nenhuma correção desde a publicação.