Latent Layer

Grok 4.7 vs GPT-6 Astra: AI Mana yang Menang untuk Tugas Anda?

Tiga model AI baru mengklaim yang terbaik.

Diterbitkan 2026-09-24Terakhir diverifikasi 2026-09-244 menit baca

YouTube dapat memutar video ini dengan audio dalam bahasa Anda: buka ⚙ Setelan → Trek audio.

Angka kunci

66%
Skor OSWorld 2.0 — GPT-5.6 Sol
Lihat sumber ↗
73%
Skor OSWorld 2.0 — GPT-6 Astra
Lihat sumber ↗
40 tokens/s
Kecepatan output Grok 4.7
Lihat sumber ↗
88M
Output tokens di satu test suite — Median model
Lihat sumber ↗
240M
Output tokens di satu test suite — Grok 4.7
Lihat sumber ↗
46
Intelligence Index — Grok 4.7
Lihat sumber ↗
53
Intelligence Index — GPT-6 Astra
Lihat sumber ↗
51%
Tingkat hallucination Astra, maximum effort
Lihat sumber ↗

Pembuka

Tiga model AI baru mengklaim yang terbaik. Grok 4.7. GPT-6 Astra. DeepSeek V4.1 Flash. Tapi skor di grafik tidak mengatakan yang mana dibuka untuk kode, masalah sulit, atau menulis. Jadi kami ubah angka yang dipublikasikan menjadi satu jawaban jelas untuk setiap tugas.

Anda menonton Latent Layer. AI, dijelaskan sederhana — alat baru, penelitian baru, cara kerjanya. Pada akhirnya Anda akan tahu cara membaca skor AI benchmark dan pilih model yang tepat untuk setiap tugas.

Konteks

Inilah siapa siapanya. GPT-6 Astra adalah model baru dari OpenAI. Grok 4.7 berasal dari xAI, dibangun di atas model dasar yang baru, lebih besar dari Grok 4.6. DeepSeek V4.1 Flash adalah varian lebih murah, dan muncul dalam satu perbandingan kunci. Kami gunakan hasil yang dipublikasikan pembuat, dan oleh Artificial Analysis, situs benchmark.

Pertama, satu ide. Benchmark adalah kumpulan tetap pertanyaan ujian. Setiap model dapat tes yang sama, dan program tandai jawaban. Itu buat skor dapat dibanding. Tapi setiap tes ukur satu keterampilan sempit. Jadi pertanyaan berguna bukan model mana skor tertinggi. Itu tes mana terlihat seperti pekerjaan yang benar-benar Anda lakukan.

Cara kerjanya

Mari baca skor satu keterampilan setiap waktu. Mulai dengan reasoning, lalu coding-style work, lalu computer use. Setelah itu, kami lihat kecepatan dan biaya. Setiap langkah tunjukkan satu cara grafik dapat menyesatkan Anda, dan satu cara membacanya dengan benar.

Mulai reasoning. GPT-6 Astra skor ninety-eight percent di FrontierMath Tier four, tes math sulit, menurut OpenAI. OpenAI jelaskan itu saturated: ceiling reached. Di pandangan kami, nilai penuh dekat tidak pisahkan model kuat lagi. Dan sumber kami tunjukkan tidak cocok skor untuk Grok 4.7, jadi tidak ada head-to-head lagi.

Sekarang coding-style work. Terminal-Bench version four beri model command line dan tugas untuk selesai. Dalam baca saya, itu dekat dengan apa asisten coding lakukan. Astra skor fifty-nine percent. Claude Fable 5.1 skor fifty-two. DeepSeek V4.1 Flash skor twenty-seven, tepat depan Grok 4.7 di twenty-six. Satu laporan bulatkan Astra ke sixty. Celahnya lebar bagaimanapun.

Selanjutnya, computer use. Ini berarti model klik aplikasi untuk Anda, seperti isi formulir. Di OSWorld two point zero, Astra skor seventy-two point six percent, dalam sekitar forty minutes per task. Pendahulunya, GPT-5.6 Sol, skor sixty-five point seven percent dalam sekitar seventy-five minutes. Itu akurasi lebih tinggi dalam sekitar forty-seven percent waktu lebih sedikit. Kecepatan dan akurasi meningkat bersama.

Sekarang, bagaimana Grok 4.7 dibangun? Mulai dari model dasar yang baru, lebih besar. Lalu reinforcement learning. Model coba tugas, dapat skor, dan sesuaikan. Jalannya Grok lebih lama, di bauran tugas lebih sulit, tertimbang ke masalah yang ambil banyak jam selesai. Tujuannya tugas panjang, sulit. Yang dipublikasikan skor tunjukkan seberapa jauh tujuan itu masih harus pergi.

Mengapa AI mulai cepat masih terasa lambat? Karena kecepatan punya dua bagian. Time to first token adalah tunggu sebelum kata muncul. Untuk Grok 4.7 itu point nine zero seconds, yang cepat. Lalu output speed. Grok 4.7 tulis forty tokens per second. Token adalah potongan kecil dari kata. Artificial Analysis sebut itu notably slow.

Juga, Grok 4.7 sangat bicara. Jalankan Intelligence Index sama, itu hasilkan two hundred forty million tokens. Median model hasilkan eighty-eight million. Model bicara ambil waktu lebih lama, dan biaya lebih per tugas. GPT-6 Astra pergi cara lain. Di maximum effort itu gunakan twenty-seven thousand output tokens per task, tentang sepertiga dari the seventy-eight thousand gunakan Claude Fable 5.1.

Sekarang biaya, yang mudah untuk salah baca. Harga daftar per million tokens. Grok 4.7 biaya two dollars untuk input dan six untuk output. Astra biaya ten dan fifty. Tapi Anda bayar untuk setiap token gunakan, dan Grok gunakan banyak. Di indeks sama, tugas biaya three dollars seventy-four dengan Grok, dan three dollars twenty-six dengan Astra. Claude Fable 5.1 biaya seven dollars sixty-three. Ini ukur di tanggal berbeda, jadi anggap sebagai panduan.

Artinya

Sekarang bagian praktis. Inilah apa angka ini ubah untuk Anda. Kami urutkan pekerjaan: coding, reasoning sulit, computer tasks, dan kerja sehari-hari lebih ringan. Ini baca saya skor yang dipublikasikan, jadi anggap opini, bukan fakta. Tes Anda selalu datang pertama.

Bantuan coding: pilih GPT-6 Astra. Itu memimpin Terminal-Bench dengan margin lebar. Reasoning sulit: Astra lagi, karena itu satu-satunya dengan skor dipublikasikan di sumber kami. Klik apps: Astra, lebih cepat dan akurat dari pendahulunya. Untuk kerja ringan, lebih murah, tes DeepSeek V4.1 Flash pertama. Itu lampaui Grok 4.7 di Terminal-Bench, dan itu varian lebih murah.

Satu angka rangkum celah keseluruhan. Di Artificial Analysis Intelligence Index, GPT-6 Astra skor fifty-three, level dengan Claude Fable 5.1. Grok 4.7 skor forty-six. Di tes coding-style, Grok 4.7 dan DeepSeek Flash ketinggalan jauh. Tapi Grok 4.7 punya context window dari five hundred thousand tokens, ruang dokumen sangat panjang. Tidak ada tes dipublikasikan tunjukkan seberapa bagus itu gunakan ruang.

Bagaimana menulis? Email, esai, cerita. Di sini angka jadi senyap. Tidak ada sumber independen dapat peringkat menulis lagi. Jalankan prompt sama di setiap model dan nilai sendiri. Itu adalah data Anda. Gunakan tugas nyata, instruksi sama setiap waktu, dan bandingkan jawaban berdampingan.

Sisi lain

Satu angka patut dijeda. Tingkat hallucination GPT-6 Astra turun dari ninety-two percent ke fifty-one percent di maximum effort. Itu kira-kira satu dalam dua. Lebih baik dari sebelum, tapi periksa fakta yang penting. Hallucination adalah jawaban percaya diri yang salah.

Satu batas lagi. Di GDPval-AA version two, tes kerja pengetahuan profesional, Astra turun sekitar forty-five Elo points lawan GPT-5.6 Sol. Elo adalah rating dibangun dari perbandingan head-to-head, seperti catur. Di tugas pengetahuan profesional seperti penulisan hukum, penurunan forty-five point berarti Astra mungkin tidak lebih baik. Tes domain Anda. Juga, hanya varian Flash dari DeepSeek tercakup di sini.

Kesimpulan

Inilah metode seluruhnya. Baca benchmark benar. Periksa sumber. Temukan ceiling. Pilih alat Anda. Skor katakan di mana untuk mulai testing. Tugas Anda sendiri katakan di mana selesai. Panduan plain lebih untuk alat AI baru menunggu di saluran ini.

Sumber

Setiap angka di video ini sudah dicek dengan sumber-sumber ini. Kutipan ditampilkan dalam bahasa asli sumbernya.

  1. x.ai/news/grok-4-7
    “Grok 4.7 uses a new, larger base model compared to Grok 4.6.”
    “It was trained with a longer reinforcement learning run on a harder mix of tasks, weighted toward problems that take many hours to complete.”
    “The model is priced starting at $2 per million input tokens and $6 per million output tokens.”
    Terakhir diverifikasi: 2026-09-24
  2. artificialanalysis.ai/articles/benchmarking-gpt-6-astra
    “GPT-6 Astra scores 59% on Terminal-Bench v4.0, ahead of Claude Fable 5.1 (52%) and 19 points ahead of GPT-5.6 Sol (40%).”
    “ahead of Claude Fable 5.1 (52%)”
    “At max effort, Astra uses 27k output tokens per task, about a third of Claude Fable 5.1 (max with fallback) at 78k”
    Terakhir diverifikasi: 2026-09-24
  3. the-decoder.com/xai-launches-grok-4-7-at-bargain-prices-but-benchmarks-reve
    “Even the cheaper DeepSeek V4.1 Flash edges past it at 27 percent.”
    “On Terminal-Bench 4.0, Grok 4.7 hits just 26 percent, versus 60 percent for GPT-6 Astra”
    Terakhir diverifikasi: 2026-09-24
  4. openai.com/index/gpt-6-astra/
    “Astra saturates FrontierMath Tier 4 with a 98% score”
    “scoring 72.6% at roughly 40 minutes per task”
    “compared with 65.7% at roughly 75 minutes”
    Terakhir diverifikasi: 2026-09-24
  5. artificialanalysis.ai/models/grok-4-7
    “has a time to first token (TTFT) of 0.90s”
    “At 40 tokens per second, Grok 4.7 (xhigh) is notably slow”
    “It generated 240M tokens, which is very verbose in comparison to the median of 88M.”
    Terakhir diverifikasi: 2026-09-24
  6. Perhitungan kami
    GPT-6 Astra achieves OSWorld 2.0 tasks 47% faster than GPT-5.6 Sol = (75-40)/75*100
  7. Perhitungan kami
    GPT-6 Astra uses about one-third the output tokens of Claude Fable 5.1 = 27000/78000

Koreksi

Tidak ada koreksi sejak diterbitkan.