返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

ScaleUp网络需求分析

AI大模型训练与推理的计算范式正在重塑数据中心网络架构。东吴证券报告指出,Scale Out网络实现集群内(如万卡集群)所有GPU互联,连接规模大;Scale Up网络实现超节点内(如NVL72)所有GPU互联,单卡带宽高。以NVL72计,Scale Up单卡带宽7200Gb/s是Scale Out(800Gb/s)的9倍。并行计算中,张量并行传输数据量(85GB)是数据并行(741MB)的115倍,催生了高带宽Scale Up需求。AEC作为铜连接方案,在10m以内的Scale Up互联中兼具成本和性能优势。

并行计算范式变革催生Scale Up网络需求

张量并行传输数据量达85GB,为数据并行的115倍

AI训推需要分布式并行计算,主要包含数据并行、流水线并行和张量并行三类。GPT-3B模型基于32个GPU训练数据显示:张量并行(TP)需传输约85GB数据、680条125MB消息;流水线并行(PP)约1GB/16条;数据并行(DP)仅741MB/17条。张量并行传输数据量远高于其他并行方式,且矩阵运算后需要高频低时延同步,催生了高带宽Scale Up网络需求。

模型内存墙+算力内存墙逐代放大,显存池化需Scale Up

单一大模型参数量与单卡显存的差距(模型内存墙)、单卡算力与单卡显存的差距(算力内存墙)均逐代放大。推理计算生成的KVCache占用显存可达模型的50%甚至以上。单卡运算时需从多张卡显存读取参数和数据,目前产业化应用最优解是使用Scale Up网络将显存池化,如NVL72方案。

Scale Up与Scale Out核心差异:带宽vs规模

Scale Out网络最大GPU数可达746496张,单卡带宽800Gb/s,实现集群内大规模互联;Scale Up网络最大GPU数72张,单卡带宽7200Gb/s,为Scale Out的9倍,实现超节点内高带宽互联。Scale Up源于AI训推的新兴需求,不构成对Scale Out光互联的侵蚀,而是增量市场。AEC在10m以内柜间/柜内Scale Up互联中,相比光连接在成本、功耗、稳定性上更具优势。
表2:Scale Out与Scale Up网络对比(NVL72+CX-8网卡+三层Quantum-X800 IB网络)
网络类型最大GPU数(张)单卡带宽(Gb/s)
Scale Out746,496800
Scale Up727,200
点击阅读报告原文: 【东吴证券】AI算力跟踪深度:辨析Scale Out与Scale Up——AEC在光铜互联夹缝中挤出市场的What、Why、How-250106(33页)
相关报告