GB200 NVL72是Blackwell架构的旗舰产品,算力跨越式提升带来推理市场的革命性机遇。信达证券报告显示,GB200 NVL72在FP4精度下FLOPS达10000 TFLOPS,相比H100提升405%。即便假设单张GPU价格为3.5万美元,单位美元可提供的算力相对H100仍实现倍增。功耗方面,单张GPU功耗相对H100提升71%但算力提升405%,单位算力能耗大幅下降。FP4精度已可在大模型推理中广泛应用且无显著精度损失,B系列在推理领域的优势有望推动云端两旺。
GB200 NVL72算力跨越式提升的三大维度
FP4精度带来405%算力提升,单位美元算力倍增
GB200 NVL72在FP4精度下FLOPS达10000 TFLOPS,相比H100(1979 TFLOPS,最低以FP8计算)提升405%。即使假设单张GPU价格为3.5万美元,单位美元可提供的算力相对H100仍实现大幅增长。FP8相比FP16/BF16峰值性能接近翻倍,FP4作为FP8的继承和发展进一步放大了性价比优势。
单位算力能耗大幅下降,存储效率倍增
功耗方面,GB200单张GPU功耗相对H100提升71%(从700W提升至1200W),但算力提升405%,单位算力所耗费的能量大幅减少。FP8精度下运算对内存耗用相对较小,单位存储可提供的运算能力倍增。在AI数据中心能耗成为核心瓶颈的背景下,单位算力能耗的优化具有重大战略意义。
FP4推理精度无显著损失,推理市场成B系列主战场
研究表明网络可以使用FP4精度进行训练而不会有显著的精度损失。由于模型推理中不需要对模型参数进行更新,相对训练对于精度的敏感性有所下降,B系列相对于训练在推理领域更有优势。FP4精度下生成的图片与FP16相比在视觉上无显著差异,推理市场有望成为B系列的核心应用场景。
表2:GB200 NVL72 vs H100算力与能效对比| 指标 | H100 | GB200 NVL72 | 提升幅度 |
|---|
| FP4 TFLOPS | 1,979 | 10,000 | +405% |
| 单GPU功耗(W) | 700 | 1,200 | +71% |
| 内存带宽(GB/s) | 3,352 | 8,000 | +139% |
| 系统级功耗/GPU(W) | 1,275 | 1,667 | +31% |
| 单位算力能耗变化 | - | - | 大幅下降 |