发布会上英伟达表示 GB200 相较于 H200 在 1.8T 参数的 GPT-MoE 模型上的推理性能将提升 30 倍,然而,这一数据是基于一个非常特定的最佳场景得出的。需要明确的是,这一场景在理论上确实可以实现,但并不能完全代表市场中的普遍应用场景。解释 30 倍性能提升的一个关键因素是将 GB200 NVL 在 FP4 下的性能与 H200 和 B200 在 FP8 量化下的性能进行对比,而且比较基准选取的是最不适合 H200 的 64GPU 张量并行,根据Semianalysis 模拟分析,这一情形下实际性能提升仅有 18 倍,如果在更贴近现实的情况下,性能提升幅度将更低。