返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

GPU与LPU芯片行业前景

2025年底英伟达以200亿美元收购Groq,2026年GTC即推出LPU产品,推理Token成本降至传统方案的十分之一——AI芯片行业正在经历一场从“单芯霸权”到“异构共生”的深刻变革。鼎惟咨询这份188页的报告预测,推理市场规模将超越训练,CPU价值被重新评估,ASIC在边缘端成为必然选择。GPU+LPU的异构协同正在定义下一代AI算力基础设施的标准。

行业拐点——推理超越训练,异构芯片时代开启

2025年,推理需求占比首次超过50%

2025年是AI芯片行业的分水岭。报告明确指出,推理需求占比首次超过50%,标志着AI产业的重心正从“训练”向“推理”加速转移。这一拐点对芯片行业的影响远超预期:训练是集中式、可预判的“重体力活”,而推理是分散式、不可预测的“长尾场景”,两者对芯片架构的要求截然不同。

报告分析,推动这一拐点的三大驱动力包括:DeepSeek等开源模型带来的算法效率革命、OpenClaw等AI智能体平台对低延迟推理的刚性需求、以及TPU等ASIC量产为推理场景提供的专用计算替代方案。AI芯片行业正从“训练芯片主导”走向“训练+推理双轮驱动”的新格局。

GPU与LPU的分工:预填充vs解码

报告将推理过程拆解为两个关键子阶段,并清晰界定了GPU与LPU的分工。预填充阶段(Prefill)是当用户请求到达时,系统将其转换为Token序列,并由GPU集群进行并行、密集的计算,以生成整个序列的上下文理解。这一阶段需要大规模并行计算,对算力、内存、通信要求高,是GPU的主场。

解码阶段(Decode)是基于预填充的结果,模型以自回归方式逐个预测并生成下一个Token,直至输出完成。此阶段对延迟极其敏感,需要快速响应,是LPU的主场。报告指出,英伟达通过AFD架构将两者分离,让Rubin GPU主导预填充、Groq LPU专攻解码,系统整体推理效率(吞吐量/瓦特)最高可提升35倍。

GPU前景——架构迭代与生态护城河的双轮驱动

三年三级跳:从Blackwell到Rubin到Feynman

英伟达的GPU架构迭代速度正在空前加快。报告详细梳理了从2024年到2028年的GPU路线图:2024年Blackwell启动双芯封装,晶体管数达2080亿;2026年Rubin引入Vera CPU与HBM4,FP4稠密算力达50 PFLOPs,内存带宽超22TB/s;2028年Feynman架构首用3D逻辑堆叠替代2.5D拼接,配合定制HBM,并前瞻性引入CPO光电共封装与全光互联。

报告特别指出,Feynman架构的3D逻辑堆叠将彻底颠覆存算路径,打破传统电互联的物理瓶颈,为超大规模算力集群铺就底层高速公路。GPU的未来不仅在于算力的提升,更在于存算架构的物理级重构。

CUDA生态:最深的护城河与最大的变数

报告指出,CUDA生态是英伟达GPU最深的护城河——90%+的AI框架原生支持CUDA,客户迁移成本极高。但DeepSeek带来的底层代码从CUDA向CANN迁移的趋势,对这条护城河构成了前所未有的挑战。

英伟达的应对策略是软硬件协同,将DeepSeek的算法红利转化为自身系统演进的驱动力。依托Dynamo等软件层实现单GPU产出数量级的提升,形成“算法冲击-系统优化-生态固化”的闭环。报告认为,CUDA生态仍将是GPU领域的统治性力量,但其统治力正在从“绝对垄断”向“相对优势”转变。

GPU的不可替代性:训练与预填充的绝对主导

尽管ASIC和LPU在特定场景展现出优势,但报告指出GPU在训练和预填充阶段具有不可替代性。训练大模型高度依赖密集的矩阵运算和灵活的编程模型,这正是GPU最擅长的领域。英伟达的Rubin GPU将训练大模型所需GPU数量减少至四分之一,AI推理Token成本降低至十分之一。

在预填充阶段,大规模并行计算对算力、内存、通信的要求极高,通用GPU的灵活性使其能够适应不断变化的模型架构和算法创新。报告认为,只要AI模型架构仍在快速演进,通用GPU就仍将是训练和预填充阶段的最优选择。

LPU前景——推理专用芯片的黄金赛道

200亿美元收购Groq:买下推理时代的“关键生产力”

2025年底,英伟达以约200亿美元获得Groq的LPU技术非独占授权并吸纳其核心团队,这是AI芯片行业标志性的事件。报告用“不是买公司,而是买下一个时代的关键生产力”来形容这一收购的战略意义。

Groq LPU采用片上大容量SRAM作为主存,带宽达150TB/s,延迟仅5-20纳秒,远低于HBM的100-150纳秒。LPU将延迟敏感的解码任务从GPU卸载至专用流水线,Token生成速度达H100的6倍,单Token成本降至四分之一,推理能耗降至三分之一。报告指出,这一收购在推理范式转移的前夜完成了战略卡位,使英伟达从“训练霸主”跃升为“训练+推理双范式控制者”。

LPU产品路线图:从独立机架到原生融合

报告详细梳理了英伟达LPU的产品路线图。短期策略以独立LPX机架验证市场、证明高性能推理可行。2026年推出的LP30和LP35采用三星4nm工艺,LP30单片集成500MB SRAM,单芯片提供1.2 PFLOPs FP8算力。LP35新增NVFP4数值格式支持,优先保障上市时间。

远期策略是在Feynman平台通过3D堆叠实现LPU与GPU的原生架构融合。LP40采用台积电N3P工艺与CoWoS-R封装,原生支持NVLink协议,直接与Feynman平台完成全链路协同设计。报告认为,英伟达正在构筑“芯片级确定性执行”取代“系统级调度”的下一代推理架构。

LPU对芯片行业格局的深远影响

报告指出,LPU的出现正在深刻改变AI芯片行业的竞争格局。首先,LPU的SRAM架构开辟了绕开HBM与CoWoS的全新技术路径,对传统存储器和先进封装产业链产生深远影响。其次,LPU将推理成本压缩至传统方案的十分之一,将大幅降低AI应用的商业化门槛,加速AI智能体的规模化落地。

更深远的影响在于竞争维度的升维。英伟达通过“GPU+LPU”的异构协同,将竞争从单一芯片性能比拼拉升到系统级架构与全栈优化能力之争。竞争对手若只关注单芯片性能提升,将难以在系统级的Token成本竞争中胜出。

CPU与ASIC——重构中的算力三角

CPU价值重估:从“配角”到“超级周期”

报告指出,推理时代正在重新评估CPU的价值。Agentic AI的兴起使CPU不再只是“配角”——在Agent工作负载中,CPU消耗了50%至90%的总延迟。AI推理引发了服务器CPU的供需倒挂,行业配置比例向1:1~1:2靠拢,CPU成为算力新瓶颈,定价权与稀缺性强势回归。

英伟达Vera CPU首次独立销售,切入英特尔、AMD主导的服务器CPU直销市场。报告认为,传统x86双寡头格局正在瓦解,CPU市场正进入“群雄割据”的新阶段。英伟达有望借助Grace平台积累的协同设计经验,将Vera打造成下一代AI基础设施的通用计算底座。

ASIC:云端补充者,边缘必然选择

报告对ASIC的前景给出了清晰判断。在云端市场,ASIC的核心价值是优化推理侧成本,但始终是英伟达GPU的“成本补充者”,受限于系统级TCO和技术迭代速度,无法撼动英伟达的主导地位。

在边缘端市场,ASIC则是“核心主场”。AI向手机、机器人、物联网设备渗透时,对实时性、低功耗、低成本的要求使ASIC成为必然选择。报告指出,英伟达的策略是“GPU主导+ASIC补充”,通过云端“芯片-系统-生态”三层防御构筑壁垒,同时边缘端布局自研ASIC与物理AI主动反攻。

行业前景与投资逻辑

2026-2028年的三大趋势预判

报告基于对GPU、LPU、CPU、ASIC四类芯片的深入分析,提出了2026-2028年AI芯片行业的三大趋势。

趋势一是异构计算成为标配。单一芯片类型的方案将难以满足AI推理的多样化需求,CPU+GPU+DPU+LPU的四芯协同将成为高端AI算力基础设施的标配架构。

趋势二是推理成本持续下降。LPU的引入将推理Token成本降至传统方案的十分之一,AI智能体的商业化门槛大幅降低,有望催生新一轮应用爆发。

趋势三是边缘计算加速渗透。ASIC在边缘端的“必然选择”地位将推动AI从云端向终端设备下沉,手机、汽车、机器人、物联网设备的AI芯片需求将迎来爆发式增长。

产业链投资的关键环节

报告隐含的投资线索包括五个关键环节。其一,LPU的SRAM架构将开辟绕开HBM与CoWoS的全新技术路径,SRAM相关产业链将受益于推理芯片需求的爆发。其二,CPO光互联技术落地将推动硅光芯片、光引擎、ELS光源等上游环节的价值重估。其三,800V HVDC供电架构将推动第三代半导体(GaN、SiC)在数据中心领域的规模化应用。其四,太空计算将推动太空光伏产业链从百亿级向万亿级跃迁。其五,量子计算的Ising模型为AI控制面与量子硬件的融合提供了新的产业方向。
点击阅读报告原文: 鼎帷咨询:2026英伟达人工智能发展战略研究报告(188页)
相关报告