Latent Layer

Grok 4.7 vs GPT-6 Astra: quale IA vince il tuo compito?

Tre nuovi modelli di IA affermano di essere i migliori.

Pubblicato 2026-09-24Ultima verifica 2026-09-245 min di lettura

YouTube può riprodurre questo video con l'audio nella tua lingua: ⚙ Impostazioni → Traccia audio.

Numeri chiave

66%
OSWorld 2.0 score — GPT-5.6 Sol
Vedi fonte ↗
73%
OSWorld 2.0 score — GPT-6 Astra
Vedi fonte ↗
40 tokens/s
Velocità di output di Grok 4.7
Vedi fonte ↗
88M
Token di output su una suite di test — Median model
Vedi fonte ↗
240M
Token di output su una suite di test — Grok 4.7
Vedi fonte ↗
46
Intelligence Index — Grok 4.7
Vedi fonte ↗
53
Intelligence Index — GPT-6 Astra
Vedi fonte ↗
51%
Tasso di allucinazione di Astra, massimo sforzo
Vedi fonte ↗

Introduzione

Tre nuovi modelli di IA affermano di essere i migliori. Grok 4.7. GPT-6 Astra. DeepSeek V4.1 Flash. Ma un punteggio su un grafico non ti dice quale aprire per il tuo codice, i tuoi problemi difficili o la tua scrittura. Quindi trasformeremo i numeri pubblicati in una risposta chiara per ogni lavoro.

Stai guardando Latent Layer. IA, spiegata semplicemente — nuovi tool, nuova ricerca, come funziona. Alla fine, saprai come leggere i punteggi dei benchmark di IA e scegliere il modello giusto per ogni lavoro.

Contesto

Ecco chi è chi. GPT-6 Astra è il nuovo modello di OpenAI. Grok 4.7 viene da xAI, costruito su un nuovo modello base più grande di Grok 4.6. DeepSeek V4.1 Flash è una variante più economica e appare in un confronto chiave. Useremo i risultati pubblicati dai creatori e da Artificial Analysis, un sito di benchmarking.

Prima, un'idea. Un benchmark è un insieme fisso di domande di test. Ogni modello riceve lo stesso test e un programma valuta le risposte. Questo rende i punteggi comparabili. Ma ogni test misura un'unica abilità ristretta. Quindi la domanda utile non è quale modello ha ottenuto il punteggio più alto. È quale test assomiglia al lavoro che fai effettivamente.

Come funziona

Leggiamo i punteggi un'abilità alla volta. Iniziamo con il ragionamento, poi il lavoro di stile codifica, poi l'uso del computer. Dopo, guardiamo la velocità e il costo. Ogni fase mostra un modo in cui un grafico può ingannarti e un modo di leggerlo correttamente.

Inizia con il ragionamento. GPT-6 Astra ottiene il novantotto percento su FrontierMath Tier four, un test di matematica difficile, secondo OpenAI. OpenAI lo descrive come saturo: limite raggiunto. Nel nostro parere, i voti quasi pieni non possono separare i modelli forti. E le nostre fonti non mostrano punteggi equivalenti per Grok 4.7, quindi non esiste ancora un confronto diretto.

Ora il lavoro di stile codifica. Terminal-Bench versione quattro dà a un modello una riga di comando e un lavoro da completare. Secondo la mia lettura, è vicino a quello che fa un assistente di codifica. Astra ottiene il cinquantanove percento. Claude Fable 5.1 ottiene il cinquantadue. DeepSeek V4.1 Flash ottiene il ventisette, appena davanti a Grok 4.7 al ventisette. Un rapporto arrotonda Astra a sessanta. Il divario è ampio in ogni caso.

Successivamente, l'uso del computer. Questo significa un modello che clicca nelle app per te, come compilare un modulo. Su OSWorld 2.0, Astra ottiene il 72.6 percento, in circa quaranta minuti per attività. Il suo predecessore, GPT-5.6 Sol, ottiene il 65.7 percento in circa settantacinque minuti. Questa è una precisione più alta in circa il quarantasette percento di tempo in meno. Velocità e precisione migliorate insieme.

Ora, come è stato costruito Grok 4.7? Inizia da un nuovo modello base più grande. Poi arriva l'apprendimento per rinforzo. Il modello tenta attività, riceve punteggi e si regola. La corsa di Grok è stata più lunga, su un mix di attività più difficile, ponderato verso problemi che richiedono molte ore per completare. L'obiettivo è lavori lunghi e difficili. I punteggi pubblicati mostrano quanto lontano quell'obiettivo deve ancora andare.

Perché un'IA che parte veloce può ancora sembrare lenta? Perché la velocità ha due parti. Il tempo al primo token è l'attesa prima che appaiano le parole. Per Grok 4.7 è 0.90 secondi, che è veloce. Poi viene la velocità di output. Grok 4.7 scrive quaranta token al secondo. Un token è un piccolo pezzo di una parola. Artificial Analysis lo definisce notevolmente lento.

Inoltre, Grok 4.7 è loquace. Eseguendo lo stesso Intelligence Index, ha prodotto duecentoquaranta milioni di token. Il modello mediano ha prodotto ottantotto milioni. I modelli loquaci impiegano più tempo e possono costare di più per lavoro. GPT-6 Astra va dall'altro lato. Al massimo sforzo utilizza ventisette mila token di output per attività, circa un terzo dei settantotto mila utilizzati da Claude Fable 5.1.

Ora il costo, che è facile da fraintendere. I prezzi di listino sono per milione di token. Grok 4.7 costa due dollari per input e sei per output. Astra costa dieci e cinquanta. Ma paghi per ogni token utilizzato e Grok ne usa molti. Su lo stesso indice, un'attività costa tre dollari settantaquattro con Grok e tre dollari ventisette con Astra. Claude Fable 5.1 costa sette dollari sessantatre. Questi sono stati misurati in date diverse, quindi trattali come una guida.

Cosa significa

Ora la parte pratica. Ecco cosa cambiano questi numeri per te. Ordiniamo per lavoro: codifica, ragionamento difficile, attività di computer e lavoro quotidiano più leggero. Questa è la mia lettura dei punteggi pubblicati, quindi trattala come opinione, non fatto. I tuoi test personali vengono sempre per primi.

Aiuto con la codifica: scegli GPT-6 Astra. Guida Terminal-Bench di un ampio margine. Ragionamento difficile: Astra di nuovo, poiché è l'unico con punteggi pubblicati nelle nostre fonti. Cliccando sulle app: Astra, più veloce e accurato del suo predecessore. Per lavori leggeri ed economici, prova DeepSeek V4.1 Flash per primo. Sorpassa Grok 4.7 su Terminal-Bench ed è la variante più economica.

Un numero riassume il divario complessivo. Su Artificial Analysis Intelligence Index, GPT-6 Astra ottiene cinquantatre, al livello di Claude Fable 5.1. Grok 4.7 ottiene quarantasei. Su test di stile codifica, Grok 4.7 e DeepSeek Flash rimangono molto indietro. Ma Grok 4.7 ha una finestra di contesto di cinquecentomila token, spazio per documenti molto lunghi. Nessun test pubblicato mostra quanto bene lo utilizza.

E per quanto riguarda la scrittura? Email, saggi, storie. Qui i numeri diventano silenziosi. Nessuna fonte indipendente che abbiamo trovato pubblica ancora classifiche di scrittura. Esegui lo stesso prompt su ogni modello e giudica tu stesso. Questi sono i tuoi dati. Usa un compito reale, le stesse istruzioni ogni volta e confronta le risposte fianco a fianco.

L'altra faccia

Un numero merita una pausa. Il tasso di allucinazione di GPT-6 Astra è sceso dal novantadue percento al cinquantuno percento al massimo sforzo. Sono circa uno su due. Meglio di prima, ma controlla i fatti che contano. Un'allucinazione è una risposta sicura che è sbagliata.

Un altro limite. Su GDPval-AA versione due, un test di lavoro di conoscenza professionale, Astra cala di circa quarantacinque punti Elo rispetto a GPT-5.6 Sol. Elo è un rating costruito da confronti diretti, come negli scacchi. Nei compiti di conoscenza professionale come la scrittura legale, un calo di quarantacinque punti significa che Astra potrebbe non essere migliore. Prova il tuo dominio. Inoltre, qui è coperta solo la variante Flash di DeepSeek.

In sintesi

Ecco l'intero metodo. Leggi i benchmark correttamente. Controlla la fonte. Trova il limite. Scegli il tuo tool. Un punteggio ti dice dove iniziare a testare. Il tuo compito ti dice dove finire. Altre guide semplici per i nuovi tool di IA ti stanno aspettando in questo canale.

Fonti

Ogni dato di questo video è stato verificato con queste fonti. Le citazioni sono riportate nella lingua originale.

  1. x.ai/news/grok-4-7
    “Grok 4.7 uses a new, larger base model compared to Grok 4.6.”
    “It was trained with a longer reinforcement learning run on a harder mix of tasks, weighted toward problems that take many hours to complete.”
    “The model is priced starting at $2 per million input tokens and $6 per million output tokens.”
    Ultima verifica: 2026-09-24
  2. artificialanalysis.ai/articles/benchmarking-gpt-6-astra
    “GPT-6 Astra scores 59% on Terminal-Bench v4.0, ahead of Claude Fable 5.1 (52%) and 19 points ahead of GPT-5.6 Sol (40%).”
    “ahead of Claude Fable 5.1 (52%)”
    “At max effort, Astra uses 27k output tokens per task, about a third of Claude Fable 5.1 (max with fallback) at 78k”
    Ultima verifica: 2026-09-24
  3. the-decoder.com/xai-launches-grok-4-7-at-bargain-prices-but-benchmarks-reve
    “Even the cheaper DeepSeek V4.1 Flash edges past it at 27 percent.”
    “On Terminal-Bench 4.0, Grok 4.7 hits just 26 percent, versus 60 percent for GPT-6 Astra”
    Ultima verifica: 2026-09-24
  4. openai.com/index/gpt-6-astra/
    “Astra saturates FrontierMath Tier 4 with a 98% score”
    “scoring 72.6% at roughly 40 minutes per task”
    “compared with 65.7% at roughly 75 minutes”
    Ultima verifica: 2026-09-24
  5. artificialanalysis.ai/models/grok-4-7
    “has a time to first token (TTFT) of 0.90s”
    “At 40 tokens per second, Grok 4.7 (xhigh) is notably slow”
    “It generated 240M tokens, which is very verbose in comparison to the median of 88M.”
    Ultima verifica: 2026-09-24
  6. Nostro calcolo
    GPT-6 Astra achieves OSWorld 2.0 tasks 47% faster than GPT-5.6 Sol = (75-40)/75*100
  7. Nostro calcolo
    GPT-6 Astra uses about one-third the output tokens of Claude Fable 5.1 = 27000/78000

Correzioni

Nessuna correzione dalla pubblicazione.