Latent Layer

Grok 4.7 gegen GPT-6 Astra: Welche KI gewinnt für deine Aufgabe?

Drei neue KI-Modelle behaupten, die besten zu sein.

Veröffentlicht 2026-09-24Zuletzt geprüft 2026-09-245 Min. Lesezeit

YouTube kann dieses Video mit Ton in deiner Sprache abspielen: ⚙ Einstellungen → Audiospur.

Kennzahlen

66%
OSWorld 2.0 Bewertung — GPT-5.6 Sol
Quelle ansehen ↗
73%
OSWorld 2.0 Bewertung — GPT-6 Astra
Quelle ansehen ↗
40 tokens/s
Grok 4.7 Ausgabegeschwindigkeit
Quelle ansehen ↗
88M
Ausgabe-Token auf einer Test-Suite — Median model
Quelle ansehen ↗
240M
Ausgabe-Token auf einer Test-Suite — Grok 4.7
Quelle ansehen ↗
46
Intelligence Index — Grok 4.7
Quelle ansehen ↗
53
Intelligence Index — GPT-6 Astra
Quelle ansehen ↗
51%
Astra Halluzinations-Rate, maximale Anstrengung
Quelle ansehen ↗

Einleitung

Drei neue KI-Modelle behaupten, die besten zu sein. Grok 4.7. GPT-6 Astra. DeepSeek V4.1 Flash. Aber eine Punktzahl auf einer Grafik sagt dir nicht, welches du für deinen Code, deine schwierigen Probleme oder dein Schreiben öffnen sollst. Also werden wir die veröffentlichten Zahlen in eine klare Antwort für jede Aufgabe verwandeln.

Du schaust Latent Layer. KI einfach erklärt – neue Tools, neue Forschung, wie es funktioniert. Am Ende wirst du wissen, wie man KI-Benchmark-Scores liest und das richtige Modell für jede Aufgabe wählst.

Hintergrund

Hier ist wer wer ist. GPT-6 Astra ist das neue Modell von OpenAI. Grok 4.7 kommt von xAI, aufgebaut auf einem neuen, größeren Basismodell als Grok 4.6. DeepSeek V4.1 Flash ist eine günstigere Variante und erscheint in einem Schlüsselvergleich. Wir werden Ergebnisse verwenden, die von den Machern und von Artificial Analysis, einer Benchmark-Website, veröffentlicht wurden.

Zuerst eine Idee. Ein Benchmark ist ein fester Satz von Testfragen. Jedes Modell bekommt die gleiche Prüfung und ein Programm bewertet die Antworten. Das macht Scores vergleichbar. Aber jede Prüfung misst eine enge Fähigkeit. Also ist die nützliche Frage nicht, welches Modell am höchsten abschnitt. Es ist, welche Prüfung aussieht wie die Arbeit, die du tatsächlich machst.

So funktioniert es

Lasst uns die Scores eine Fähigkeit nach der anderen lesen. Wir beginnen mit Reasoning, dann Coding-Stil-Arbeit, dann Computernutzung. Danach schauen wir auf Geschwindigkeit und Kosten. Jeder Schritt zeigt einen Weg, wie ein Diagramm dich täuschen kann, und einen Weg, es richtig zu lesen.

Beginnen wir mit Reasoning. GPT-6 Astra erreicht 98 Prozent beim FrontierMath Tier 4, einem schwierigen Mathematik-Test nach OpenAI. OpenAI beschreibt das als gesättigt: Obergrenze erreicht. In unserer Ansicht können nahezu volle Punkte starke Modelle nicht mehr unterscheiden. Und unsere Quellen zeigen keine übereinstimmenden Scores für Grok 4.7, es gibt also noch keinen direkten Vergleich.

Jetzt Coding-Stil-Arbeit. Terminal-Bench Version 4 gibt einem Modell eine Kommandozeile und eine Aufgabe zu erledigen. Nach meiner Lesart ist das nah dran an dem, was ein Coding-Assistent macht. Astra erreicht 59 Prozent. Claude Fable 5.1 erreicht 52. DeepSeek V4.1 Flash erreicht 27, gerade vor Grok 4.7 mit 26. Ein Bericht rundet Astra auf 60. Die Lücke ist breit auf jeden Fall.

Nächste: Computernutzung. Das bedeutet ein Modell, das durch Apps für dich klickt, wie zum Ausfüllen eines Formulars. Bei OSWorld 2.0 erreicht Astra 72.6 Prozent, in etwa 40 Minuten pro Aufgabe. Sein Vorgänger, GPT-5.6 Sol, erreicht 65.7 Prozent in etwa 75 Minuten. Das ist höhere Genauigkeit in etwa 47 Prozent weniger Zeit. Geschwindigkeit und Genauigkeit verbesserten sich zusammen.

Nun, wie wurde Grok 4.7 aufgebaut? Es beginnt mit einem neuen, größeren Basismodell. Dann kommt Verstärkungslernen. Das Modell versucht Aufgaben, wird bewertet und passt sich an. Groks Lauf war länger, auf einer schwierigeren Aufgabenmischung, gewichtet nach Problemen, die viele Stunden zum Erledigen brauchen. Das Ziel ist lange, schwierige Aufgaben. Die veröffentlichten Scores zeigen, wie weit dieses Ziel noch gehen muss.

Warum kann eine schnell startende KI sich immer noch langsam anfühlen? Weil Geschwindigkeit zwei Teile hat. Zeit bis zum ersten Token ist das Warten bevor Worte erscheinen. Für Grok 4.7 ist das 0.90 Sekunden, was schnell ist. Dann kommt Ausgabegeschwindigkeit. Grok 4.7 schreibt 40 Token pro Sekunde. Ein Token ist ein kleines Stück eines Wortes. Artificial Analysis nennt das bemerkenswert langsam.

Außerdem ist Grok 4.7 gesprächig. Bei Ausführung desselben Intelligence Index produzierte es 240 Millionen Token. Das Median-Modell produzierte 88 Millionen. Gesprächige Modelle brauchen länger und können pro Aufgabe mehr kosten. GPT-6 Astra geht den anderen Weg. Bei maximaler Anstrengung nutzt es 27.000 Ausgabe-Token pro Aufgabe, etwa ein Drittel der 78.000, die von Claude Fable 5.1 verwendet werden.

Jetzt Kosten, was leicht zu missinterpretieren ist. Listenpreise sind pro Million Token. Grok 4.7 kostet 2 Dollar für Eingabe und 6 für Ausgabe. Astra kostet 10 und 50. Aber du zahlst für jedes Token, das verwendet wird, und Grok nutzt viele. Bei demselben Index kostet eine Aufgabe 3 Dollar 74 Cent mit Grok und 3 Dollar 26 Cent mit Astra. Claude Fable 5.1 kostet 7 Dollar 63 Cent. Diese wurden an verschiedenen Daten gemessen, also behandle sie als Leitfaden.

Was das bedeutet

Jetzt der praktische Teil. Hier ist, was diese Zahlen für dich ändern. Wir sortieren nach Aufgabe: Coding, schwieriges Reasoning, Computer-Aufgaben und leichtere alltägliche Arbeit. Das ist meine Lesart der veröffentlichten Scores, also behandle es als Meinung, nicht als Fakt. Deine eigenen Tests kommen immer zuerst.

Coding-Hilfe: Wähle GPT-6 Astra. Es führt Terminal-Bench mit großem Abstand an. Schwieriges Reasoning: Astra wieder, da es das einzige mit veröffentlichten Scores in unseren Quellen ist. Durch Apps klicken: Astra, schneller und genauer als sein Vorgänger. Für leichte, günstigere Aufgaben teste DeepSeek V4.1 Flash zuerst. Es übertrifft knapp Grok 4.7 auf Terminal-Bench und es ist die günstigere Variante.

Eine Zahl fasst die gesamte Lücke zusammen. Beim Artificial Analysis Intelligence Index erreicht GPT-6 Astra 53, auf gleicher Höhe mit Claude Fable 5.1. Grok 4.7 erreicht 46. Bei Coding-Stil-Tests liegen Grok 4.7 und DeepSeek Flash weit zurück. Aber Grok 4.7 hat ein Kontextfenster von 500.000 Token, Platz für sehr lange Dokumente. Kein veröffentlichter Test zeigt, wie gut es diesen Platz nutzt.

Wie sieht es mit Schreiben aus? E-Mails, Essays, Geschichten. Hier werden die Zahlen still. Keine unabhängige Quelle, die wir fanden, veröffentlicht Schreib-Rankings noch. Führe dieselbe Aufforderung auf jedem Modell aus und urteile selbst. Das sind deine Daten. Verwende eine echte Aufgabe, die gleichen Anweisungen jedes Mal und vergleiche die Antworten nebeneinander.

Die Gegenseite

Eine Zahl verdient eine Pause. GPT-6 Astras Halluzinations-Rate fiel von 92 Prozent auf 51 Prozent bei maximaler Anstrengung. Das ist ungefähr eins zu zwei. Besser als vorher, aber überprüfe Fakten, die wichtig sind. Eine Halluzination ist eine sichere Antwort, die falsch ist.

Noch eine Grenze. Beim GDPval-AA Version 2, einem Test der professionellen Wissensarbeit, fällt Astra etwa 45 Elo-Punkte gegen GPT-5.6 Sol. Elo ist eine Bewertung aus direkten Vergleichen aufgebaut, wie im Schach. Bei professionellen Wissensaufgaben wie Legal Writing bedeutet ein 45-Punkte-Fall, Astra könnte nicht besser sein. Teste deine Domäne. Außerdem wird nur die Flash-Variante von DeepSeek hier abgedeckt.

Fazit

Hier ist die ganze Methode. Lese Benchmarks richtig. Überprüfe die Quelle. Finde die Obergrenze. Wähle dein Tool. Ein Score sagt dir, wo du mit dem Testen anfangen sollst. Deine eigene Aufgabe sagt dir, wo du aufhören sollst. Mehr einfache Anleitungen zu neuen KI-Tools warten auf diesem Kanal.

Quellen

Jede Zahl in diesem Video wurde mit diesen Quellen abgeglichen. Zitate stehen in der Originalsprache der Quelle.

  1. x.ai/news/grok-4-7
    “Grok 4.7 uses a new, larger base model compared to Grok 4.6.”
    “It was trained with a longer reinforcement learning run on a harder mix of tasks, weighted toward problems that take many hours to complete.”
    “The model is priced starting at $2 per million input tokens and $6 per million output tokens.”
    Zuletzt geprüft: 2026-09-24
  2. artificialanalysis.ai/articles/benchmarking-gpt-6-astra
    “GPT-6 Astra scores 59% on Terminal-Bench v4.0, ahead of Claude Fable 5.1 (52%) and 19 points ahead of GPT-5.6 Sol (40%).”
    “ahead of Claude Fable 5.1 (52%)”
    “At max effort, Astra uses 27k output tokens per task, about a third of Claude Fable 5.1 (max with fallback) at 78k”
    Zuletzt geprüft: 2026-09-24
  3. the-decoder.com/xai-launches-grok-4-7-at-bargain-prices-but-benchmarks-reve
    “Even the cheaper DeepSeek V4.1 Flash edges past it at 27 percent.”
    “On Terminal-Bench 4.0, Grok 4.7 hits just 26 percent, versus 60 percent for GPT-6 Astra”
    Zuletzt geprüft: 2026-09-24
  4. openai.com/index/gpt-6-astra/
    “Astra saturates FrontierMath Tier 4 with a 98% score”
    “scoring 72.6% at roughly 40 minutes per task”
    “compared with 65.7% at roughly 75 minutes”
    Zuletzt geprüft: 2026-09-24
  5. artificialanalysis.ai/models/grok-4-7
    “has a time to first token (TTFT) of 0.90s”
    “At 40 tokens per second, Grok 4.7 (xhigh) is notably slow”
    “It generated 240M tokens, which is very verbose in comparison to the median of 88M.”
    Zuletzt geprüft: 2026-09-24
  6. Eigene Berechnung
    GPT-6 Astra achieves OSWorld 2.0 tasks 47% faster than GPT-5.6 Sol = (75-40)/75*100
  7. Eigene Berechnung
    GPT-6 Astra uses about one-third the output tokens of Claude Fable 5.1 = 27000/78000

Korrekturen

Keine Korrekturen seit der Veröffentlichung.