輝達說 Vera Rubin NVL72 跑 DeepSeek-R1 時,同樣一百萬瓦能吐出的 token,是 GB200 NVL72 的 10 倍。這個數字很亮眼,卻還不能放進你的電費或雲端成本試算表:公開資料沒有寫明比較的是哪個版本的 GB200,也沒有給絕對 token/s 與實測功耗。
缺的版本號很要緊。SiliconANGLE 報導,CoreWeave 把同類優化套回 GB200 NVL72 後,三個月內讓它的每百萬瓦吞吐提高 4 倍以上。當分母自己快速變動,「10 倍」同時混進了新硬體、網路、推論軟體與調校進度,無法只歸功於 Rubin GPU。
這不表示 Vera Rubin 沒有大幅進步。CoreWeave 已在完整機櫃上跑出 DeepSeek-R1,輝達也把 token 吞吐除以受限的電力預算,這比只比峰值 FLOPS 更接近機房現實。讀者該保留的,是這個單位;該補上的,是分母的版本與成本邊界。
為什麼追 Claude、GPT、Gemini、Grok 的人該在意這串數字?因為 tokens/MW 正是決定這些模型每一次推論要燒多少電、多少錢的底層變數。電力是這一輪競賽的硬天花板——四家陣營誰能在同樣一百萬瓦下多服務一批請求,誰就有更低的邊際成本去擴大 context、降價,或撐住免費額度。看懂一則「每瓦快 N 倍」到底成不成立,等於看懂下一季這幾家的推論成本會不會真的往下走。輝達這次只交出漂亮的分子,分母的版本號還沒給。
10 倍的分子很新,分母沒有版本號
「每秒每百萬瓦 token 數」可以把它想成一條固定電力額度下的產能:同樣一百萬瓦,誰能在相同使用體驗下產出更多 token,誰就能用有限的機房電力服務更多請求。對電力已卡住擴建速度的 AI 雲端,這比單顆 GPU 的理論算力更接近營收能力。
輝達官方頁面寫得很直接:CoreWeave 在 Vera Rubin NVL72 上跑 DeepSeek-R1,得到 Grace Blackwell NVL72 的 10 倍 tokens/s/MW;相較 GB200 NVL72,每百萬 token 成本可到十分之一。Vera Rubin NVL72 是整座機櫃系統,包含 72 顆 Rubin GPU、36 顆 Vera CPU,以及 260 TB/s 的 NVLink 6 全對全互連。
問題藏在「GB200 NVL72」這個名稱裡。硬體型號相同,不代表測試基準相同:推論引擎、量化格式、排程、模型核心、驅動與韌體每更新一次,舊機櫃都可能多吐一批 token。SiliconANGLE 的報導稱,同樣的優化讓 GB200 的每百萬瓦吞吐在三個月內提高逾 4 倍;輝達與 CoreWeave 的公開頁面卻沒有交代 10 倍分母採用哪一天、哪套版本的 GB200。
因此,現有資料足以支持「Vera Rubin 在這次合作夥伴測試中領先」,還不足以回答兩個更實際的問題:如果把最新軟體同等用力地調校在兩代硬體上,差距還有多少?既有 GB200 用戶該先升級軟體,還是直接換機櫃?
同一頁的倍數,各自在比不同對手
讀輝達這次發布稿,另一個陷阱是把整頁倍數看成同一場測試。它們其實各有不同的比較對象與限制:
| 公開宣稱 | 比較對象 | 已知工作範圍 | 不能直接推出 |
|---|---|---|---|
| 10× tokens/s/MW | GB200 NVL72 | CoreWeave、DeepSeek-R1 | 所有模型都快 10 倍;電費少 90% |
| 1/10 每百萬 token 成本 | GB200 NVL72 | 輝達未公開完整成本公式 | 含網路、冷卻、融資的總持有成本也剩 1/10 |
| NVLink 6 超過 2× 吞吐 | 現成乙太網路 | 複雜工作負載 | 比上一代 NVLink 快 2 倍 |
| Spectrum-X 1.6× RDMA 頻寬 | 現成乙太網路 | 橫向擴充網路 | 整座機房吞吐都快 1.6 倍 |
| 共同封裝光學 5× 低功耗、10× MTBI | 可插拔光收發器 | 交換器光學元件 | 完整機櫃功耗少 5 倍 |
這些比較可以各自成立,但不能串成「每一層都快幾倍,所以整體一定更省幾倍」。系統裡的瓶頸會移動,元件指標也不會直接相乘。把比較對象逐列寫出來,就能看出哪些數字在談機櫃產能,哪些只談網路或光學元件。
少了這六欄,10 倍不能進成本試算
一個可供外部團隊重算的推論 benchmark,至少要讓人看見六組資料:
- 絕對值:兩邊各自的 token/s 與實測機櫃功耗,而不只有倍數。
- 服務條件:輸入、輸出長度,併發數、batch 大小,以及每位使用者的延遲目標。
- 模型配方:DeepSeek-R1 的權重版本、量化格式、品質檢查與推測解碼設定。
- 系統版本:推論引擎、驅動、韌體、模型核心,以及兩邊投入多少調校時間。
- 測試範圍:機櫃數、運行時間、誤差範圍、可用率,能否由外部團隊重現。
- 成本邊界:價格是否含網路、冷卻、軟體、融資、機房利用率與廠務用電。
上述欄位在輝達的公開文章裡都不完整。這會限制結論的用途:10 倍是特定模型、特定互動目標與合作夥伴調校下的一個測試點,不是任何模型、任何機房都能套用的固定乘數。TECHi 的方法盤點也指出,缺少機房電力使用效率、閒置時間與非運算開銷,便不能把 throughput/MW 的差距直接寫成省九成能源。
CoreWeave 是有實際部署能力的雲端業者,也是輝達合作夥伴。這使它的實機結果比紙上規格更有價值,同時仍屬雙方共同發布的證據,尚未等同獨立第三方重現。
把供應商 benchmark 當成四欄帳本
以後再看到「每瓦快 N 倍」,不用先研究整張晶片架構圖。把宣稱抄進四欄就好:
- 分子是什麼? 是 token/s、符合延遲門檻的請求數,還是理論峰值?
- 分母是哪個版本? 硬體型號之外,軟體、韌體、模型與調校日期是否一致?
- 體驗條件相同嗎? 模型品質、序列長度、併發與回應延遲有沒有對齊?
- 成本算到哪裡? 只算加速器,還是把網路、冷卻、利用率與機房用電一起算進去?
Vera Rubin 的首批數字已經說明,tokens/MW 很可能成為 AI 基建比 FLOPS 更實用的共同語言。要讓這套語言從發布會走進採購表,下一份 benchmark 最該新增的規格,不是另一個更大的倍數,而是每一個分母的版本號。
SOURCES
- A NVIDIA Vera Rubin Driving Performance Per Watt, Lowest Token Cost for Partners Worldwide
- A CoreWeave Completes Industry-First Bring-Up and Validation of NVIDIA Vera Rubin NVL72
- B Nvidia doubles down on AI factories as it showcases massive Vera Rubin performance gains
- B NVIDIA’s 10× Vera Rubin result needs the missing math
來源分級:A = 一手公告/論文/官方文件 · B = 可信媒體 · C = 可參考但需脈絡 · D = 觀察用,不可當事實。
本文由 AI 協助研究與起草,矽基前沿編輯部編修,總編輯廖玄同審閱定稿。 編輯方針與 AI 使用說明