Grok 4.7 對決 GPT-6 Astra:哪款 AI 能贏得你的工作?
三款新 AI 模型聲稱是最好的。Grok 4.7。GPT-6 Astra。DeepSeek V4.1 Flash。但圖表上的一個分數不會告訴你該選哪款來處理你的程式碼、你的難題或你的寫作。所以我們要把公開的數字轉換成一個明確的答案,針對每項工作。
YouTube 可用您的語言播放本影片的音訊:開啟 ⚙ 設定 → 音軌。
關鍵數字
開場
三款新 AI 模型聲稱是最好的。Grok 4.7。GPT-6 Astra。DeepSeek V4.1 Flash。但圖表上的一個分數不會告訴你該選哪款來處理你的程式碼、你的難題或你的寫作。所以我們要把公開的數字轉換成一個明確的答案,針對每項工作。
你正在看 Latent Layer。AI 用簡單方式解釋 — 新工具、新研究、運作原理。到了最後,你會知道怎麼讀 AI 基準測試分數,選對適合每項工作的模型。
背景
這是誰是誰。GPT-6 Astra 是 OpenAI 的新模型。Grok 4.7 來自 xAI,基於新的、更大的基礎模型,比 Grok 4.6 更大。DeepSeek V4.1 Flash 是較便宜的變體,它出現在一項重要比較中。我們使用製造商發布的結果,以及 Artificial Analysis 基準測試網站的結果。
首先,一個想法。基準測試是一組固定的測試問題。每個模型都得到相同的測試,一個程式標記答案。那使分數可以比較。但每個測試只測量一個狹隘的技能。所以有用的問題不是哪個模型得分最高。而是哪個測試看起來像你實際做的工作。
運作方式
讓我們一次讀一個技能的分數。我們從推理開始,然後是編碼風格的工作,然後是電腦使用。之後,我們看速度和成本。每一步顯示一個圖表可能誤導你的方式,以及正確的讀法。
從推理開始。GPT-6 Astra 得分 98% 在 FrontierMath Tier four 上,一個困難的數學測試,根據 OpenAI。OpenAI 將其描述為飽和:達到上限。在我們的觀點中,接近滿分無法區分強大的模型了。我們的來源沒有顯示 Grok 4.7 的匹配分數,所以還沒有正面對比。
現在編碼風格的工作。Terminal-Bench version four 給一個模型一個命令行和一個要完成的工作。在我的閱讀中,那接近編碼助手所做的事。Astra 得分 59%。Claude Fable 5.1 得分 52%。DeepSeek V4.1 Flash 得分 27%,剛好領先 Grok 4.7 的 26%。一個報告將 Astra 四捨五入到 60%。差距無論哪種方式都很大。
接下來,電腦使用。這意味著一個模型點擊應用程式為你,例如填寫一個表單。在 OSWorld 2.0 上,Astra 得分 72.6%,大約每個任務四十分鐘。它的前身,GPT-5.6 Sol,得分 65.7%,大約七十五分鐘。那是更高的準確度,時間少約 47%。速度和準確度一起改進。
現在,Grok 4.7 是如何製造的?它從一個新的、更大的基礎模型開始。然後是強化學習。模型嘗試任務、獲得分數、和調整。Grok 的運行更長、在一個更難的任務組合上、加權朝向需要許多小時完成的問題。目標是長期、艱難的工作。公開的分數顯示那個目標還要走多遠。
為什麼一個快速啟動的 AI 還是感覺慢?因為速度有兩個部分。首個 token 的時間是字詞出現前的等待。對於 Grok 4.7 那是 0.90 秒,那很快。然後是輸出速度。Grok 4.7 每秒寫 40 個 token。token 是一個小部分的詞彙。Artificial Analysis 稱那明顯很慢。
另外,Grok 4.7 很健談。運行相同的 Intelligence Index,它產生 240 百萬 token。中位數模型產生 88 百萬。健談的模型需要更長時間,每個工作可能成本更高。GPT-6 Astra 走另一條路。在最大努力下它使用 27,000 個輸出 token,每個任務,大約 Claude Fable 5.1 使用的 78,000 的三分之一。
現在成本,容易誤讀。列表價格是每百萬 token。Grok 4.7 輸入成本 $2、輸出 $6。Astra 成本 $10 和 $50。但你為每個使用的 token 付款,Grok 使用許多。在相同的索引上,一個任務成本 $3.74 與 Grok,和 $3.26 與 Astra。Claude Fable 5.1 成本 $7.63。這些是在不同日期測量的,所以將它們視為指南。
代表什麼
現在是實際部分。這是這些數字如何改變你的。我們按工作排序:編碼、困難推理、電腦任務和較輕的日常工作。這是我對公開分數的閱讀,所以將其視為意見,而不是事實。你的自己的測試總是首先。
編碼幫助:選擇 GPT-6 Astra。它以很大的差距領先 Terminal-Bench。困難推理:Astra 再次,因為它是唯一有我們來源中公開分數的。點擊通過應用程式:Astra,比它的前身更快、更準確。對於輕量、更便宜的工作,測試 DeepSeek V4.1 Flash 首先。它略勝 Terminal-Bench 上的 Grok 4.7,它是更便宜的變體。
一個數字總結整體差距。在 Artificial Analysis Intelligence Index 上,GPT-6 Astra 得分 53,相等與 Claude Fable 5.1。Grok 4.7 得分 46。在編碼風格測試上,Grok 4.7 和 DeepSeek Flash 落後很遠。但 Grok 4.7 有一個 500,000 token 的上下文視窗,非常長文件的空間。沒有公開測試顯示它如何使用那個空間。
寫作呢?電子郵件、論文、故事。這裡數字安靜。我們找不到獨立來源發布寫作排名。運行相同的提示在每個模型上,自己判斷。那是你的數據。使用真實的任務、每次相同的指令,和比較答案並排。
另一種觀點
一個數字值得暫停。GPT-6 Astra 的幻覺率從 92% 下降到 51%,在最大努力下。那大約是一在二中。比以前好,但檢查重要的事實。幻覺是一個有信心但錯誤的答案。
再一個限制。在 GDPval-AA version two 上、一個專業知識工作的測試、Astra 下降約 45 個 Elo 分數對陣 GPT-5.6 Sol。Elo 是從正面比較構建的評分、如象棋。在專業知識任務中、如法律寫作、45 分的下降意味著 Astra 可能不更好。測試你的領域。另外,只有 Flash 變體的 DeepSeek 在這裡涵蓋。
重點整理
這是整個方法。正確地讀基準測試。檢查來源。找到上限。選擇你的工具。一個分數告訴你在哪裡開始測試。你自己的任務告訴你在哪裡結束。更多易懂的指南新 AI 工具在這個頻道。
資料來源
本影片的每個數字都已依據以下來源核實。引文以來源的原始語言呈現。
- x.ai/news/grok-4-7
“Grok 4.7 uses a new, larger base model compared to Grok 4.6.”
“It was trained with a longer reinforcement learning run on a harder mix of tasks, weighted toward problems that take many hours to complete.”
“The model is priced starting at $2 per million input tokens and $6 per million output tokens.”
最後核實: 2026-09-24 - artificialanalysis.ai/articles/benchmarking-gpt-6-astra
“GPT-6 Astra scores 59% on Terminal-Bench v4.0, ahead of Claude Fable 5.1 (52%) and 19 points ahead of GPT-5.6 Sol (40%).”
“ahead of Claude Fable 5.1 (52%)”
“At max effort, Astra uses 27k output tokens per task, about a third of Claude Fable 5.1 (max with fallback) at 78k”
最後核實: 2026-09-24 - the-decoder.com/xai-launches-grok-4-7-at-bargain-prices-but-benchmarks-reve
“Even the cheaper DeepSeek V4.1 Flash edges past it at 27 percent.”
“On Terminal-Bench 4.0, Grok 4.7 hits just 26 percent, versus 60 percent for GPT-6 Astra”
最後核實: 2026-09-24 - openai.com/index/gpt-6-astra/
“Astra saturates FrontierMath Tier 4 with a 98% score”
“scoring 72.6% at roughly 40 minutes per task”
“compared with 65.7% at roughly 75 minutes”
最後核實: 2026-09-24 - artificialanalysis.ai/models/grok-4-7
“has a time to first token (TTFT) of 0.90s”
“At 40 tokens per second, Grok 4.7 (xhigh) is notably slow”
“It generated 240M tokens, which is very verbose in comparison to the median of 88M.”
最後核實: 2026-09-24 - 我們的計算
GPT-6 Astra achieves OSWorld 2.0 tasks 47% faster than GPT-5.6 Sol = (75-40)/75*100
- 我們的計算
GPT-6 Astra uses about one-third the output tokens of Claude Fable 5.1 = 27000/78000
更正
發布以來無更正。