Grok 4.5 上線:同一題,token 只花 Opus 的四分之一
便宜又快,什麼任務值得換它上?
同一道 SWE-Bench Pro 的程式題,Grok 4.5 平均花 15,954 個 output token 就把它解掉,Claude Opus 4.8 要花 67,020 個。同一題,token 花掉四分之一。
這是 SpaceXAI(原 xAI)7 月 8 日推出、7 月 9 日公開上線的旗艦模型 Grok 4.5,最搶眼的一個數字。馬斯克給它的定位是「Opus 級(Opus-class)模型,但更快、更省 token、成本更低」,稍後又補了一句「大致等同 Opus 4.7,但快得多」。
所以先把期待放對地方:Grok 4.5 不是要當「最聰明的那個」。在 SpaceXAI 自己公布的四項 benchmark 裡,Claude Fable 5 四項全勝。Grok 4.5 真正想賣的,是同樣一件事,它用更少的 token、更少的錢做完。這對每天大量呼叫模型的人來說,是可以換算成帳單的差別。
便宜在哪:價格和 token 各省一截
先看價格。Grok 4.5 定價 $2/M input、$6/M output;對照 Claude Opus 4.7 的 $5/$25,輸出價格大約是四成。
再疊上 token 效率。上面那道 SWE-Bench Pro 的題目,Grok 4.5 每題平均少吐了五萬個 token。價格便宜、又吐得少,兩件事會相乘:跑一批同樣的任務,帳單差距會比單看單價更大。
| 項目 | Grok 4.5 | Opus(對照) |
|---|---|---|
| Output 單價 | $6 / M | $25 / M(Opus 4.7) |
| SWE-Bench Pro 每題 output token | 約 15,954 | 約 67,020(Opus 4.8 max) |
一個提醒:4.2 倍這個差距是 SWE-Bench Pro 單一 benchmark 的官方自測,別把它讀成「所有任務都省四倍」。但方向很清楚——它省的是「單位任務成本」,不是省在偶爾一次。
它擅長什麼:和 Cursor 一起練出來的底子
Grok 4.5 的強項落在 coding 和 agentic 任務,這不是巧合。據官方說法,它建立在 1.5T 參數的 V9 基礎模型上,在 Memphis 資料中心用數萬顆 NVIDIA GB300 GPU 訓練,並且和 SpaceX 六月以 600 億美元收購的 Cursor 一同訓練,資料涵蓋程式、科學、工程、數學。
換句話說,它的訓練夥伴本身就是一個天天在寫程式、跑 agent 的編輯器。官方把它的能力範圍畫在 coding、app 開發、office 文書、研究、寫作到日常知識任務——是一個想被當「日常主力」用的模型,不是特化玩具。
Benchmark 怎麼看:不是冠軍,但站得住
把官方那張表攤開,故事會更誠實一點。四項 benchmark 裡,Grok 4.5 對 Opus 4.8 是二勝二負:贏在 DeepSWE 1.0 和 Terminal-Bench 2.1,輸在 DeepSWE 1.1 和 SWE-Bench Pro。而 Claude Fable 5 四項全部第一,連 GPT-5.5 和 Opus 4.8 一起壓過去。
所以它站在哪裡,其實不難定位:分數頂端有人,Grok 4.5 咬在第二群、和 Opus 4.8 互有勝負,但用更少的 token 和更低的價格到達那裡。對很多實際場景,這個位置已經夠用。
什麼任務值得換它上
把上面的東西收成一個可以照做的取捨:
- 值得先讓它上的:大量、成本敏感、重複性高的 coding 與 agentic 任務——批次改 code、跑測試、樣板生成、agent 迴圈裡一步步的工具呼叫。這些地方 token 用量會累積,省一截就是省帳單。
- 仍該交給分數最高的:關鍵路徑、對準確率要求高、錯一次代價大的題目。這種時候差幾分是差很多,別為了省 token 冒險。
- 怎麼試:它在 Cursor 全方案、Grok Build 都設成可直接選的模型,換一個下拉選單就能拿自己的真實任務比一次,看輸出品質掉不掉、token 帳單降多少,再決定把多少任務交給它。
這不是「換掉誰」的問題,比較像替工具箱多加一把便宜順手的螺絲起子:一般任務先用它,精細的再換更精密的那把。
在哪用、哪裡還用不到
入口鋪得很廣:Grok app(X Premium 與 SuperGrok 訂閱)、xAI API、Grok Build 的預設模型、Cursor 全方案,還做成 Word、PowerPoint、Excel 的外掛;開發者這邊,OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic 等 gateway 也都接了。
唯一的空白是歐盟——產品和 API console 目前都還沒開放,官方說預計七月中。人在 EU 的讀者,這幾天先當作預告看。
把它擺回一句話:Grok 4.5 不是這週分數最高的模型,但很可能是「同一件事最省」的那個。想省 token、想壓帳單,先拿一批例行任務丟給它試;要頂尖準確率的題,還是留給榜首。
SOURCES
- A Introducing Grok 4.5
- A SpaceXAI Docs — Release Notes
- B SpaceXAI releases Grok 4.5, which Elon describes as an 'Opus-class model'
- B Scoop — SpaceXAI launches new model, Grok 4.5
- B Grok 4.5 — What xAI's Own Benchmarks Actually Show vs Opus 4.8
- B SpaceXAI Releases Grok 4.5, a Cursor-Trained Model
- A Grok 4.5 — Intelligence, Performance & Price Analysis
- A Grok 4.5 Testing Results — How SpaceXAI's New Model Performs on Real Professional Work (GDPval+)
來源分級:A = 一手公告/論文/官方文件 · B = 可信媒體 · C = 可參考但需脈絡 · D = 觀察用,不可當事實。
UPDATE HISTORY
- First published.
- 獨立第三方評測出爐,結果剛好分兩面。Artificial Analysis 的 Intelligence Index 給 Grok 4.5(high)54 分、排第四,落在 Claude Fable 5、GPT-5.5、Opus 4.8 之後——不是馬斯克稱的「多項第一」。但 Snorkel 用專家出題的 GDPval+ 真實職場任務測,Grok 4.5 平均通過率 29%,反而高過 GPT-5.5(22%)與 Opus 4.8(21%),是前沿模型裡最高的。兩個數字不衝突,剛好印證本文的取捨:論綜合「聰明度」它在第二群,但換算成「每塊錢做完的實際工作」它很有競爭力。
本文由 AI 協助研究與起草,矽基前沿編輯部編修,總編輯廖玄同審閱定稿。 編輯方針與 AI 使用說明