Rubin 来袭前,英伟达把 Blackwell 榨出 4 倍能效,GB300 训练刷新纪录

软件护城河越挖越深

2026-07-22 18:55
封面图
封面图

新一代 Rubin 平台还没大规模铺开,英伟达已经先把手里的 Blackwell 狠狠优化了一遍。在新旧平台交替的当口,这家公司披露了一组相当提气的数字:仅靠软件栈优化,就把已部署硬件的潜力又挖深了一大截。

最直观的是能效。英伟达称,仅仅三个月,GB200 NVL72 在运行 DeepSeek R1 0528 模型时,每兆瓦算力吞吐量(TPS/MW)就提升了 4 倍。这背后是四个月里完成的 38 项重大优化迭代,经过超过 25 万次模拟配置筛选,并累计消耗 140 万 GPU 小时实测验证。更关键的是,逾 90% 的优化能跨模型复用,意味着客户不用换一张卡,升级软件就能吃到能效红利。

训练侧的数字更夸张。GB300「Blackwell Ultra」在 256 卡规模下,对 DeepSeek-V3 671B 模型预训练跑出每 GPU 1648 TFLOPs 的吞吐量,较上代 GB200 的 606 TFLOPs 提升约 3 倍,创下该任务全球最高纪录。而且这不是一次性峰值——从 2025 年 11 月的 1088 TFLOPs/GPU,到 2026 年 6 月的 1648,六个月累计提升了 1.5 倍。

框架协同的增益同样惊人。在 PyTorch 原生的 TorchTitan 上,GB300 对 DeepSeek-V3 671B 的训练性能较未优化基线提升 6 倍;JAX 框架下截至 2026 年 7 月每 GPU 吞吐量达 4082 Tokens/s,较今年 1 月提升约 10 倍。大规模扩展效率也逼近理论上限:256 到 1024 卡区间内,Megatron Core 达 98.5%,TorchTitan 与 JAX 均达 97%,核心功臣是 NVL72 内置的 800 Gb/s Scale-Out 网络。

把镜头切到下一代,Vera Rubin 的体量更吓人:同等 150MW 功耗下,其 Token 吞吐可达约 80 万 Tokens/s,而 GB200 约 8 万,差距正好约 10 倍。但 Blackwell 早已铺满全球无数数据中心,英伟达这招和当年 Hopper 世代如出一辙——新平台推进的同时,持续用软件优化延长存量硬件的投资回报周期。

说到底,对云厂商和自建算力的企业来说,最实在的判断是:买英伟达不只是买一堆卡,更是买它那条越滚越深的软件护城河。硬件迭代再快,真正黏住客户的,往往是这些「不换硬件也能白嫖性能」的优化节奏。