Rubin 來襲前,英偉達把 Blackwell 榨出 4 倍能效,GB300 訓練重新整理紀錄

軟體護城河越挖越深

2026-07-22 18:55
封面圖
封面圖

新一代 Rubin 平臺還沒大規模鋪開,英偉達已經先把手裡的 Blackwell 狠狠最佳化了一遍。在新舊平臺交替的當口,這家公司披露了一組相當提氣的數字:僅靠軟體棧最佳化,就把已部署硬體的潛力又挖深了一大截。

最直觀的是能效。英偉達稱,僅僅三個月,GB200 NVL72 在執行 DeepSeek R1 0528 模型時,每兆瓦算力吞吐量(TPS/MW)就提升了 4 倍。這背後是四個月裡完成的 38 項重大最佳化迭代,經過超過 25 萬次模擬配置篩選,並累計消耗 140 萬 GPU 小時實測驗證。更關鍵的是,逾 90% 的最佳化能跨模型複用,意味著客戶不用換一張卡,升級軟體就能吃到能效紅利。

訓練側的數字更誇張。GB300「Blackwell Ultra」在 256 卡規模下,對 DeepSeek-V3 671B 模型預訓練跑出每 GPU 1648 TFLOPs 的吞吐量,較上代 GB200 的 606 TFLOPs 提升約 3 倍,創下該任務全球最高紀錄。而且這不是一次性峰值——從 2025 年 11 月的 1088 TFLOPs/GPU,到 2026 年 6 月的 1648,六個月累計提升了 1.5 倍。

框架協同的增益同樣驚人。在 PyTorch 原生的 TorchTitan 上,GB300 對 DeepSeek-V3 671B 的訓練效能較未最佳化基線提升 6 倍;JAX 框架下截至 2026 年 7 月每 GPU 吞吐量達 4082 Tokens/s,較今年 1 月提升約 10 倍。大規模擴充套件效率也逼近理論上限:256 到 1024 卡區間內,Megatron Core 達 98.5%,TorchTitan 與 JAX 均達 97%,核心功臣是 NVL72 內建的 800 Gb/s Scale-Out 網路。

把鏡頭切到下一代,Vera Rubin 的體量更嚇人:同等 150MW 功耗下,其 Token 吞吐可達約 80 萬 Tokens/s,而 GB200 約 8 萬,差距正好約 10 倍。但 Blackwell 早已鋪滿全球無數資料中心,英偉達這招和當年 Hopper 世代如出一轍——新平臺推進的同時,持續用軟體最佳化延長存量硬體的投資回報週期。

說到底,對雲廠商和自建算力的企業來說,最實在的判斷是:買英偉達不只是買一堆卡,更是買它那條越滾越深的軟體護城河。硬體迭代再快,真正黏住客戶的,往往是這些「不換硬體也能白嫖效能」的最佳化節奏。