矽基前沿 [Si]gnals
封面以每瓦 token 10 倍與 GB200 三個月也提升 4 倍為主標,兩座 AI 機櫃站在可移動的測量基準上,藍色註記寫著分母在動

Vera Rubin 每瓦快 10 倍,輝達沒寫是哪版 GB200

舊機三個月也快了四倍。

輝達說 Vera Rubin NVL72 跑 DeepSeek-R1 時,同樣一百萬瓦能吐出的 token,是 GB200 NVL72 的 10 倍。這個數字很亮眼,卻還不能放進你的電費或雲端成本試算表:公開資料沒有寫明比較的是哪個版本的 GB200,也沒有給絕對 token/s 與實測功耗。

缺的版本號很要緊。SiliconANGLE 報導,CoreWeave 把同類優化套回 GB200 NVL72 後,三個月內讓它的每百萬瓦吞吐提高 4 倍以上。當分母自己快速變動,「10 倍」同時混進了新硬體、網路、推論軟體與調校進度,無法只歸功於 Rubin GPU。

這不表示 Vera Rubin 沒有大幅進步。CoreWeave 已在完整機櫃上跑出 DeepSeek-R1,輝達也把 token 吞吐除以受限的電力預算,這比只比峰值 FLOPS 更接近機房現實。讀者該保留的,是這個單位;該補上的,是分母的版本與成本邊界。

為什麼追 Claude、GPT、Gemini、Grok 的人該在意這串數字?因為 tokens/MW 正是決定這些模型每一次推論要燒多少電、多少錢的底層變數。電力是這一輪競賽的硬天花板——四家陣營誰能在同樣一百萬瓦下多服務一批請求,誰就有更低的邊際成本去擴大 context、降價,或撐住免費額度。看懂一則「每瓦快 N 倍」到底成不成立,等於看懂下一季這幾家的推論成本會不會真的往下走。輝達這次只交出漂亮的分子,分母的版本號還沒給。

10 倍的分子很新,分母沒有版本號

「每秒每百萬瓦 token 數」可以把它想成一條固定電力額度下的產能:同樣一百萬瓦,誰能在相同使用體驗下產出更多 token,誰就能用有限的機房電力服務更多請求。對電力已卡住擴建速度的 AI 雲端,這比單顆 GPU 的理論算力更接近營收能力。

輝達官方頁面寫得很直接:CoreWeave 在 Vera Rubin NVL72 上跑 DeepSeek-R1,得到 Grace Blackwell NVL72 的 10 倍 tokens/s/MW;相較 GB200 NVL72,每百萬 token 成本可到十分之一。Vera Rubin NVL72 是整座機櫃系統,包含 72 顆 Rubin GPU、36 顆 Vera CPU,以及 260 TB/s 的 NVLink 6 全對全互連。

問題藏在「GB200 NVL72」這個名稱裡。硬體型號相同,不代表測試基準相同:推論引擎、量化格式、排程、模型核心、驅動與韌體每更新一次,舊機櫃都可能多吐一批 token。SiliconANGLE 的報導稱,同樣的優化讓 GB200 的每百萬瓦吞吐在三個月內提高逾 4 倍;輝達與 CoreWeave 的公開頁面卻沒有交代 10 倍分母採用哪一天、哪套版本的 GB200。

因此,現有資料足以支持「Vera Rubin 在這次合作夥伴測試中領先」,還不足以回答兩個更實際的問題:如果把最新軟體同等用力地調校在兩代硬體上,差距還有多少?既有 GB200 用戶該先升級軟體,還是直接換機櫃?

同一頁的倍數,各自在比不同對手

讀輝達這次發布稿,另一個陷阱是把整頁倍數看成同一場測試。它們其實各有不同的比較對象與限制:

公開宣稱比較對象已知工作範圍不能直接推出
10× tokens/s/MWGB200 NVL72CoreWeave、DeepSeek-R1所有模型都快 10 倍;電費少 90%
1/10 每百萬 token 成本GB200 NVL72輝達未公開完整成本公式含網路、冷卻、融資的總持有成本也剩 1/10
NVLink 6 超過 2× 吞吐現成乙太網路複雜工作負載比上一代 NVLink 快 2 倍
Spectrum-X 1.6× RDMA 頻寬現成乙太網路橫向擴充網路整座機房吞吐都快 1.6 倍
共同封裝光學 5× 低功耗、10× MTBI可插拔光收發器交換器光學元件完整機櫃功耗少 5 倍

這些比較可以各自成立,但不能串成「每一層都快幾倍,所以整體一定更省幾倍」。系統裡的瓶頸會移動,元件指標也不會直接相乘。把比較對象逐列寫出來,就能看出哪些數字在談機櫃產能,哪些只談網路或光學元件。

少了這六欄,10 倍不能進成本試算

一個可供外部團隊重算的推論 benchmark,至少要讓人看見六組資料:

  1. 絕對值:兩邊各自的 token/s 與實測機櫃功耗,而不只有倍數。
  2. 服務條件:輸入、輸出長度,併發數、batch 大小,以及每位使用者的延遲目標。
  3. 模型配方:DeepSeek-R1 的權重版本、量化格式、品質檢查與推測解碼設定。
  4. 系統版本:推論引擎、驅動、韌體、模型核心,以及兩邊投入多少調校時間。
  5. 測試範圍:機櫃數、運行時間、誤差範圍、可用率,能否由外部團隊重現。
  6. 成本邊界:價格是否含網路、冷卻、軟體、融資、機房利用率與廠務用電。

上述欄位在輝達的公開文章裡都不完整。這會限制結論的用途:10 倍是特定模型、特定互動目標與合作夥伴調校下的一個測試點,不是任何模型、任何機房都能套用的固定乘數。TECHi 的方法盤點也指出,缺少機房電力使用效率、閒置時間與非運算開銷,便不能把 throughput/MW 的差距直接寫成省九成能源。

CoreWeave 是有實際部署能力的雲端業者,也是輝達合作夥伴。這使它的實機結果比紙上規格更有價值,同時仍屬雙方共同發布的證據,尚未等同獨立第三方重現。

把供應商 benchmark 當成四欄帳本

以後再看到「每瓦快 N 倍」,不用先研究整張晶片架構圖。把宣稱抄進四欄就好:

  1. 分子是什麼? 是 token/s、符合延遲門檻的請求數,還是理論峰值?
  2. 分母是哪個版本? 硬體型號之外,軟體、韌體、模型與調校日期是否一致?
  3. 體驗條件相同嗎? 模型品質、序列長度、併發與回應延遲有沒有對齊?
  4. 成本算到哪裡? 只算加速器,還是把網路、冷卻、利用率與機房用電一起算進去?

Vera Rubin 的首批數字已經說明,tokens/MW 很可能成為 AI 基建比 FLOPS 更實用的共同語言。要讓這套語言從發布會走進採購表,下一份 benchmark 最該新增的規格,不是另一個更大的倍數,而是每一個分母的版本號。

SOURCES

  1. A NVIDIA Vera Rubin Driving Performance Per Watt, Lowest Token Cost for Partners Worldwide
  2. A CoreWeave Completes Industry-First Bring-Up and Validation of NVIDIA Vera Rubin NVL72
  3. B Nvidia doubles down on AI factories as it showcases massive Vera Rubin performance gains
  4. B NVIDIA’s 10× Vera Rubin result needs the missing math

來源分級:A = 一手公告/論文/官方文件 · B = 可信媒體 · C = 可參考但需脈絡 · D = 觀察用,不可當事實。

本文由 AI 協助研究與起草,矽基前沿編輯部編修,總編輯廖玄同審閱定稿。 編輯方針與 AI 使用說明

AGENT FAN LETTER

訂閱《四大 Agent 追星週報》

每週五,把 Anthropic、OpenAI、Google、SpaceX 這週最好看的新一集寄給你。

巨頭劇情 · 新功能實測 · Agent 對決 · 下週追星清單。

免費 · 隨時取消 · 不轉售你的 email。

MACHINE-READABLE SUMMARY

Topic
前沿基建
Key claims
  • 輝達稱 CoreWeave 在 Vera Rubin NVL72 上跑 DeepSeek-R1,每秒每百萬瓦 token 吞吐是 Grace Blackwell NVL72 的 10 倍。
  • SiliconANGLE 報導,同樣的優化套回 GB200 NVL72,三個月內讓每百萬瓦吞吐提高逾 4 倍。
  • 公開材料沒有交代 GB200 的軟體與韌體版本、絕對 token/s、實測機櫃功耗及完整測試設定。
  • 10 倍 tokens/MW 不能直接換算成省 90% 電費或每百萬 token 的完整總持有成本。
Entities
NVIDIA · Vera Rubin NVL72 · GB200 NVL72 · CoreWeave · DeepSeek-R1 · NVLink 6 · Spectrum-X
Taiwan relevance
medium
Confidence
medium
Last updated
2026-07-25
Canonical URL
https://signals.tw/articles/nvidia-vera-rubin-tokens-per-megawatt/

SUGGESTED CITATION

如果 AI agent / 研究 / 報導要引用本文,建議格式如下:

矽基前沿 · 前沿基建線(編輯:廖玄同),《Vera Rubin 每瓦快 10 倍,輝達沒寫是哪版 GB200》,矽基前沿 [Si]gnals,2026-07-25。https://signals.tw/articles/nvidia-vera-rubin-tokens-per-megawatt/

AI agents / search engines may quote, summarize, and cite with attribution and a link back to the canonical URL above. See /for-ai-agents for full policy.