英伟达H100与谷歌TPUv5在芯片照片上看起来越来越像——都由计算核、存储、I/O组成,都采用先进封装和HBM内存。但两者在商业模式上有本质区别:GPU是“万能钥匙”,ASIC是“定制锁芯”。申万宏源这份报告指出,ASIC与GPU的边界正逐渐模糊,真正的分野在于——ASIC与下游场景高度耦合,而GPU需照顾所有场景。在推理需求爆发的拐点上,这种差异正转化为数十亿美元的市场切换。
技术边界趋同:ASIC与GPU在“趋同”而非“对立”
从技术发展视角看,ASIC与GPU并非割裂的技术路线。
英伟达GPU基于冯诺依曼架构,运算中与寄存器高频交换数据,对存储容量要求高,且保留图形渲染、视频编解码等功能模块——但这些模块在AI计算中大部分闲置。谷歌TPU采用脉动阵列架构,专为矩阵计算设计,计算结果可直接传递给下一个计算单元,减少不必要的数据交换。
但随着模型结构变化和应用场景丰富,两者边界正逐渐模糊。英伟达在GPU中持续增加AI专用计算单元(Tensor Core),谷歌在TPU中不断扩展通用计算能力。从芯片照片看,两者均由计算核、存储模块和I/O模块组成。
真正的差异在商业模式:ASIC是专用芯片,GPU是通用芯片。
成本效益对比:ASIC在推理场景的优势已被充分验证
ASIC的核心价值在于面向特定场景的高效率与低TCO(总持有成本)。
能效比优势:谷歌TPUv5实测能效比达英伟达H200的1.46倍,BERT模型推理任务中每瓦特性能提升3.2倍。三大设计原则支撑:算力密度优化(3D堆叠)、电压域精细管理(动态电压频率调整DVFS)、内存墙突破(HBM3e带宽1.2TB/s)。
成本优势:亚马逊Trainium2训练成本较GPU方案降低40%,推理成本降低55%。在万卡级集群中,ASIC方案可节省初始投资约12亿美元。
ASIC与GPU核心差异对比| 维度 | ASIC(专用芯片) | GPU(通用芯片) | 差异来源 |
|---|
| 设计目标 | 特定场景(文字推理/视频推理) | 覆盖全场景(含图形渲染) | 商业模式 |
| 能效比 | TPUv5达H200的1.46倍 | 基准水平 | 脉动阵列 vs 冯诺依曼架构 |
| 推理成本 | Trainium2较GPU低55% | 基准水平 | 无需冗余功能模块 |
| 单颗均摊成本 | 谷歌TPU约1000美元(200万颗规模) | 含芯片厂商利润(英伟达净利率57%) | 规模效应 vs 外采成本 |
| 迭代节奏 | 1-1.5年迭代一款 | 2年一代架构 | 定制化 vs 通用化 |
| 典型代表 | 谷歌TPU、亚马逊Trainium、华为昇腾 | 英伟达H100/B200、AMD MI300X | - |
自研的经济账:谷歌2023年自用TPU超200万颗,假设年研发成本20亿美元,单颗均摊仅1000美元。而英伟达FY2025数据中心计算芯片收入1022亿美元、净利率57%,单颗GPU中约57%为利润。自研ASIC起量后可有效摊薄刚性成本,摆脱对外部供应商依赖并实现软硬件协同优化。
推理场景:ASIC优势最突出的战场
AI推理与训练对芯片的需求有本质不同:
- 训练:性能最重要,决定模型能力→吸引用户→通用GPU(英伟达)最优
- 推理:吞吐越高越好,成本越低越好→ASIC可发挥其成本效率优势
推理收入公式:收入 =(价格/token)×(吞吐量,tokens/秒)。在价格/Token相对稳定时,总吞吐越高收入越高,硬件性能直接决定“生产速度”。
Token消耗量的指数级增长印证推理需求爆发:OpenRouter统计日Token消耗量一年内从不足0.5T升至近5T,翻了近10倍。ChatGPT C端WAU达7亿,接近全球成年人10%——这种量级的推理需求下,ASIC的低成本优势正从“锦上添花”变为“生死攸关”。
产业格局:从“GPU独大”到“ASIC+GPU并行”
ASIC并非要取代GPU,而是形成“训练用GPU、推理用ASIC”的分工格局。
海外:谷歌TPU已迭代至第七代Ironwood(性能接近B200、支持9216颗芯片超节点),亚马逊Trainium/Inferentia持续迭代,微软Maia、Meta MTIA加速推进。2025年9月OpenAI成为博通定制ASIC第四名客户并签下近百亿订单。
国内:百度昆仑芯P800万卡集群点亮、中标中国移动超10亿元;阿里平头哥PPU超越A800、签约联通16384张算力卡;华为昇腾950分PR/DT型号适配不同推理阶段。
AMD预计2028年全球AI芯片市场超5000亿美元,其中25%将由AI ASIC服务(约1250亿美元)。博通预计2027年大客户ASIC可服务市场600-900亿美元。ASIC正从“辅助角色”走向“半壁江山”。