返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

GPGPU与ASIC路线对比

近期博通市值突破万亿美元,市场对ASIC芯片的热情高涨。国盛证券却指出,对于中国算力市场,GPGPU与ASIC的技术特性决定了不同的适用阶段。ASIC硬件虽在同等制程下拥有更高理论算力,但编译器开发难度与软件生态门槛使其更适合业务成熟后的降本优化。中国当下的核心任务是快速构建能用的算力底座,GPGPU将是未来2-3年的主旋律。

架构之争:GPGPU大小核vs ASIC脉动阵列

理解GPGPU与ASIC的本质差异,需从芯片微架构层面拆解矩阵运算过程。Transformer算法的核心是“矩阵乘法”,通过大量单一的矩阵运算实现“大力出奇迹”。两种芯片架构对此采取了截然不同的实现路径。

GPGPU以英伟达A100为代表,芯片由Tensor Core(TU)与DCU小核两大部分组成。DCU中的每个小核心从HBM中取出数据传送给TU,连续多个cycle后填满TU,执行一次矩阵乘法并得出结果。DCU部分负责向量运算、加减乘除等非矩阵运算,赋予GPGPU通用计算能力。这种架构的优点是灵活、易编程、生态成熟,代价是芯片面积中需保留“不参与矩阵运算”的DCU部分。

ASIC以谷歌TPU为代表,采用脉动阵列取数法,芯片抛弃DCU部分只保留TU。CPU与编译器直接从HBM取数灌入TU进行运算。省去DCU空间后可堆积更多TU,实现更高算力密度;脉动阵列装满速度更快,运算效率更高。但ASIC在稀疏数据场景下效率下降,而AI数据大多稀疏;且ASIC编译器需协调多个计算单元指令流,设计复杂度远超GPGPU。

以Groq为例,芯片内部甚至增设了专门协调不同计算单元指令流的专用模块(Supperlane),保证脉动阵列在串联工作流模式下稳定运行。这揭示了一个关键事实:ASIC的硬件设计仅是开始,编译器才是决定性能能否释放的核心。

四年做编译器:ASIC开发的长周期特性

Groq的研发历程生动诠释了ASIC开发的真实节奏。2016年由谷歌TPU架构师Jonathan Ross创立,2020年发布硬件架构论文,随后的四年时间里团队主要投入编译器和软件生态的研发。2022-2023年持续发布编译器相关论文,直至2024年因推理速度走红。可谓“两年做硬件,四年完善编译器”。

ASIC编译器为何如此艰难?Groq的功能单元需同时支持ICU(指令控制)、MEM(内存操作)、VXM(向量运算)、MxM(矩阵乘法)、SXM(数据流操作)、C2C(芯片间通信)六大类数十条指令,编程时需对多个功能单元的指令集进行并行设计。这既增加了开发复杂度,也使新用户面临更高的学习成本。

对于中国芯片行业,ASIC的开发节奏意味着更长的回报周期。在制程受限的背景下,编译器完成度不高的ASIC芯片,其实际竞争力会显著弱于GPGPU架构。国盛证券判断,中国需要在2-3年内快速部署可用的算力,GPGPU凭借设计人才储备丰富、客户使用习惯成熟、软件生态完备等优势,是更为现实的路径。

GPGPU先行,ASIC长期空间不容忽视

国盛证券的判断并非否定ASIC的全部价值,而是强调分阶段推进的必要性。当下的中国算力市场,正处于模型能力快速迭代、互联网厂商快速扩充算力争夺客户入口的阶段。绝大多数B端客户尚未开启AI化进程,快速补充能用、易用的国产算力是当务之急。

GPGPU架构经过英伟达多年积累,在全球范围内积累了丰富的设计人才储备,客户对CUDA等软件环境和使用习惯也最为熟悉。对国产算力厂商而言,GPGPU路径意味着更低的开发风险、更快的客户导入速度和更确定的市场需求。这不代表要抛弃ASIC之路,在GPGPU构型之上,可以通过对DCU中不同算力精度小核的取舍,强化芯片的FP16精度算力,实现更优追赶。

往长期看,ASIC在中国仍有明确前景。当中国AI模型的竞争格局逐渐清晰,头部玩家的业务颗粒度逐渐变大,确定的专用需求空间足以支持ASIC的发展费用时,ASIC的性价比优势将充分显现。中国芯片厂商在手机芯片等领域积累的优秀架构能力,也有凭借ASIC性价比再次焕发生机的机会。从国际经验看,博通指引2027年AI业务潜在市场规模600-900亿美元,足以说明ASIC的长期空间。
表2:Groq功能单元指令支持
功能单元指令类型描述
ICUNOP/IFetch/Sync/Notify/Config控制指令流、屏障通知、低功耗配置
MEMRead/Write/Gather/Scatter内存读写、间接寻址存取
VXMunary/binary/type conversion/ReLU/TanH/Exp/RSqrt向量运算、激活函数、类型转换
MxMLW/IW/ABC/ACC权重加载、矩阵乘法累加
SXMShift/Permute/Distribute/Rotate/Transpose数据流重排、旋转、转置
C2CDeskew/Send/Receive芯片间通信

中国特色ASIC之路:在GPGPU构型上做减法

国盛证券提出了中国特色的ASIC推进策略:并非全盘复制谷歌TPU的脉动阵列路线,而是在GPGPU构型之上做渐进式优化。具体而言,通过保留GPGPU架构中成熟的DCU调度能力,同时对DCU中不同算力精度的小核进行取舍,强化AI推理最核心的FP16精度算力,实现“通用性妥协最小化、AI效率最大化”的平衡。

这一策略的优势在于:第一,基于GPGPU架构的编译器难度相对可控,可缩短芯片从设计到商用的周期;第二,保留DCU部分使芯片在面对稀疏数据时仍保持较高效率,避免脉动阵列的适用性瓶颈;第三,客户可在熟悉的软件生态下工作,降低迁移成本。这是对“制程受限下如何追赶”这一命题的务实回答。

将视野放至海外最新趋势,博通于2024年12月发布3.5D封装技术,提出“芯片公司专注算核设计,通信与封装由专业厂商完成”的分工模式。这与中国特色的ASIC演进思路异曲同工——通过产业链协同,降低单一芯片公司的开发门槛,提升整个算力体系的构建效率。
点击阅读报告原文: 通信行业深度:从技术演进看国产算力投资机会黎明已经到来-241225(14页)
相关报告