Latent Layer

Grok 4.7 vs GPT-6 Astra : Quel IA gagne votre tâche ?

Trois nouveaux modèles d'IA prétendent être les meilleurs.

Publié 2026-09-24Dernière vérification 2026-09-245 min de lecture

YouTube peut lire cette vidéo avec l'audio dans votre langue : ⚙ Paramètres → Piste audio.

Chiffres clés

66%
Score OSWorld 2.0 — GPT-5.6 Sol
Voir la source ↗
73%
Score OSWorld 2.0 — GPT-6 Astra
Voir la source ↗
40 tokens/s
Vitesse de sortie Grok 4.7
Voir la source ↗
88M
Jetons de sortie sur une suite de tests — Median model
Voir la source ↗
240M
Jetons de sortie sur une suite de tests — Grok 4.7
Voir la source ↗
46
Intelligence Index — Grok 4.7
Voir la source ↗
53
Intelligence Index — GPT-6 Astra
Voir la source ↗
51%
Taux d'hallucination Astra, maximum d'effort
Voir la source ↗

Introduction

Trois nouveaux modèles d'IA prétendent être les meilleurs. Grok 4.7. GPT-6 Astra. DeepSeek V4.1 Flash. Mais un score sur un graphique ne vous dit pas lequel ouvrir pour votre code, vos problèmes difficiles, ou votre écriture. Nous allons donc transformer les nombres publiés en une réponse claire pour chaque travail.

Vous regardez Latent Layer. L'IA expliquée simplement — nouveaux outils, nouvelles recherches, comment ça marche. À la fin, vous saurez comment lire les scores de référence IA et choisir le bon modèle pour chaque travail.

Contexte

Voici qui est qui. GPT-6 Astra est le nouveau modèle d'OpenAI. Grok 4.7 vient de xAI, construit sur un nouveau modèle de base plus grand que Grok 4.6. DeepSeek V4.1 Flash est une variante moins chère, et elle apparaît dans une comparaison clé. Nous utiliserons les résultats publiés par les fabricants, et par Artificial Analysis, un site de benchmarking.

D'abord, une idée. Un benchmark est un ensemble fixe de questions de test. Chaque modèle reçoit le même test, et un programme marque les réponses. Cela rend les scores comparables. Mais chaque test mesure une compétence étroite. Donc la question utile n'est pas quel modèle a marqué le plus haut. C'est quel test ressemble à la tâche que vous faites réellement.

Comment ça marche

Lisons les scores une compétence à la fois. Nous commençons par le raisonnement, puis le travail de style de codage, puis l'utilisation informatique. Après cela, nous examinons la vitesse et le coût. Chaque étape montre une façon dont un graphique peut vous induire en erreur, et une façon de le lire correctement.

Commençons par le raisonnement. GPT-6 Astra marque quatre-vingt-dix-huit pour cent sur FrontierMath Tier quatre, un test mathématique difficile, selon OpenAI. OpenAI décrit cela comme saturé : plafond atteint. Selon nous, les notes presque parfaites ne peuvent pas séparer les modèles forts davantage. Et nos sources ne montrent aucun score correspondant pour Grok 4.7, donc aucune comparaison directe n'existe encore.

Maintenant le travail de style de codage. Terminal-Bench version quatre donne à un modèle une ligne de commande et un travail à terminer. Selon ma lecture, c'est proche de ce qu'un assistant de codage fait. Astra marque cinquante-neuf pour cent. Claude Fable 5.1 marque cinquante-deux. DeepSeek V4.1 Flash marque vingt-sept, juste devant Grok 4.7 à vingt-six. Un rapport arrondit Astra à soixante. L'écart est large de toute façon.

Ensuite, l'utilisation informatique. Cela signifie qu'un modèle clique sur les applications pour vous, comme remplir un formulaire. Sur OSWorld deux point zéro, Astra marque soixante-douze point six pour cent, en environ quarante minutes par tâche. Son prédécesseur, GPT-5.6 Sol, marque soixante-cinq point sept pour cent en environ soixante-quinze minutes. C'est une plus grande précision en environ quarante-sept pour cent moins de temps. La vitesse et la précision se sont améliorées ensemble.

Maintenant, comment Grok 4.7 a-t-il été construit ? Il part d'un nouveau modèle de base plus grand. Puis vient l'apprentissage par renforcement. Le modèle tente les tâches, obtient une note, et s'ajuste. L'exécution de Grok a été plus longue, sur un mélange plus difficile de tâches, pondéré vers les problèmes qui prennent de nombreuses heures à compléter. L'objectif est les tâches longues et difficiles. Les scores publiés montrent à quel point cet objectif doit encore aller.

Pourquoi une IA à démarrage rapide peut-elle encore sembler lente ? Parce que la vitesse a deux parties. Le temps au premier jeton est l'attente avant l'apparition des mots. Pour Grok 4.7, c'est point neuf zéro secondes, ce qui est rapide. Puis vient la vitesse de sortie. Grok 4.7 écrit quarante jetons par seconde. Un jeton est un petit morceau d'un mot. Artificial Analysis appelle cela remarquablement lent.

De plus, Grok 4.7 est bavard. En exécutant le même Intelligence Index, il a produit deux cent quarante millions de jetons. Le modèle médian a produit quatre-vingt-huit millions. Les modèles bavards prennent plus longtemps, et peuvent coûter plus par tâche. GPT-6 Astra va l'autre sens. Au maximum d'effort, il utilise vingt-sept mille jetons de sortie par tâche, environ un tiers des soixante-dix-huit mille utilisés par Claude Fable 5.1.

Maintenant le coût, ce qui est facile à mal lire. Les prix de liste sont par million de jetons. Grok 4.7 coûte deux dollars pour l'entrée et six pour la sortie. Astra coûte dix et cinquante. Mais vous payez pour chaque jeton utilisé, et Grok en utilise beaucoup. Sur le même index, une tâche coûte trois dollars soixante-quatorze avec Grok, et trois dollars vingt-six avec Astra. Claude Fable 5.1 coûte sept dollars soixante-trois. Ceux-ci ont été mesurés sur différentes dates, donc traitez-les comme un guide.

Ce que ça change

Maintenant la partie pratique. Voici ce que ces nombres changent pour vous. Nous trions par travail : codage, raisonnement difficile, tâches informatiques, et travaux quotidiens plus légers. C'est ma lecture des scores publiés, donc traitez-le comme une opinion, pas comme un fait. Vos propres tests toujours en premier.

Aide au codage : choisir GPT-6 Astra. Il mène Terminal-Bench par une large marge. Raisonnement difficile : Astra à nouveau, puisque c'est le seul avec des scores publiés dans nos sources. Cliquer sur les applications : Astra, plus rapide et plus précis que son prédécesseur. Pour les tâches légères et moins chères, testez d'abord DeepSeek V4.1 Flash. Il dépasse Grok 4.7 sur Terminal-Bench, et c'est la variante moins chère.

Un nombre résume l'écart global. Sur Artificial Analysis Intelligence Index, GPT-6 Astra marque cinquante-trois, au niveau de Claude Fable 5.1. Grok 4.7 marque quarante-six. Sur les tests de style de codage, Grok 4.7 et DeepSeek Flash sont loin derrière. Mais Grok 4.7 a une fenêtre de contexte de cinq cent mille jetons, espace pour de très longs documents. Aucun test publié ne montre à quel point il utilise cet espace.

Qu'en est-il de l'écriture ? E-mails, essais, histoires. Ici les chiffres sont silencieux. Aucune source indépendante que nous avons trouvée ne publie les classements d'écriture encore. Exécutez la même invite sur chaque modèle et jugez-vous vous-même. C'est vos données. Utilisez une tâche réelle, les mêmes instructions à chaque fois, et comparez les réponses côte à côte.

L'autre point de vue

Un nombre mérite une pause. Le taux d'hallucination de GPT-6 Astra est tombé de quatre-vingt-douze pour cent à cinquante-et-un pour cent au maximum d'effort. C'est environ une sur deux. Mieux qu'avant, mais vérifiez les faits qui comptent. Une hallucination est une réponse confiante qui est fausse.

Une limite de plus. Sur GDPval-AA version deux, un test du travail professionnel, Astra baisse environ quarante-cinq points Elo contre GPT-5.6 Sol. Elo est une cote construite à partir de comparaisons directes, comme aux échecs. Dans les tâches de connaissance professionnelle comme la rédaction juridique, une baisse de quarante-cinq points signifie que Astra peut ne pas être meilleur. Testez votre domaine. De plus, seule la variante Flash de DeepSeek est couverte ici.

À retenir

Voici la méthode entière. Lire les benchmarks correctement. Vérifier la source. Trouver le plafond. Choisir votre outil. Un score vous dit où commencer à tester. Votre propre tâche vous dit où finir. D'autres guides clairs vers les nouveaux outils d'IA attendent sur cette chaîne.

Sources

Chaque chiffre de cette vidéo a été vérifié auprès de ces sources. Les citations sont affichées dans la langue d'origine.

  1. x.ai/news/grok-4-7
    “Grok 4.7 uses a new, larger base model compared to Grok 4.6.”
    “It was trained with a longer reinforcement learning run on a harder mix of tasks, weighted toward problems that take many hours to complete.”
    “The model is priced starting at $2 per million input tokens and $6 per million output tokens.”
    Dernière vérification: 2026-09-24
  2. artificialanalysis.ai/articles/benchmarking-gpt-6-astra
    “GPT-6 Astra scores 59% on Terminal-Bench v4.0, ahead of Claude Fable 5.1 (52%) and 19 points ahead of GPT-5.6 Sol (40%).”
    “ahead of Claude Fable 5.1 (52%)”
    “At max effort, Astra uses 27k output tokens per task, about a third of Claude Fable 5.1 (max with fallback) at 78k”
    Dernière vérification: 2026-09-24
  3. the-decoder.com/xai-launches-grok-4-7-at-bargain-prices-but-benchmarks-reve
    “Even the cheaper DeepSeek V4.1 Flash edges past it at 27 percent.”
    “On Terminal-Bench 4.0, Grok 4.7 hits just 26 percent, versus 60 percent for GPT-6 Astra”
    Dernière vérification: 2026-09-24
  4. openai.com/index/gpt-6-astra/
    “Astra saturates FrontierMath Tier 4 with a 98% score”
    “scoring 72.6% at roughly 40 minutes per task”
    “compared with 65.7% at roughly 75 minutes”
    Dernière vérification: 2026-09-24
  5. artificialanalysis.ai/models/grok-4-7
    “has a time to first token (TTFT) of 0.90s”
    “At 40 tokens per second, Grok 4.7 (xhigh) is notably slow”
    “It generated 240M tokens, which is very verbose in comparison to the median of 88M.”
    Dernière vérification: 2026-09-24
  6. Notre calcul
    GPT-6 Astra achieves OSWorld 2.0 tasks 47% faster than GPT-5.6 Sol = (75-40)/75*100
  7. Notre calcul
    GPT-6 Astra uses about one-third the output tokens of Claude Fable 5.1 = 27000/78000

Corrections

Aucune correction depuis la publication.