返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

GPU算力演进趋势

GPU已接过CPU的接力棒,成为驱动算力革命的新引擎。国信证券报告指出,英伟达单个GPU在AI推理方面的性能10年提升了1000倍,CUDA核心数从2008年的240个增至2022年的18432个。但性能提升伴随功耗从175W升至700W,每GFLOPS成本年降幅已放缓至24%。算力成本下降速度放缓为中国芯片业迎来追赶窗口,而新技术突破(碳化硅、石墨烯、量子计算)正等待时机。

CPU受阻,GPU接棒:从Tick-Tock到并行计算

2016年英特尔放弃Tick-Tock战略——2007年45nm、2010年32nm、2012年22nm、2014年14nm均如期完成,但10nm卡壳长达7年。与此同时,单核CPU性能增速从1986-2003年每年52%降至2011-2018年仅7%。摩尔定律遭遇硅物理极限、制造成本飙升(EUV光刻机)、功耗增加、设计复杂度四重挑战。

2006年英伟达发布CUDA架构(统一计算设备架构),允许软件使用GPU进行加速通用处理。CUDA旨在与C、C++、Fortran、Python配合使用,使并行编程更易访问。2007年CUDA SDK公开,此后英伟达显卡均包含支持CUDA运算的核心。CPU核心数扩展有限,GPU核心数扩展却容易得多——GeForce 8800 GTX(2006)核心数不适用,GeForce GTX 280(2008)240个,H100(2022)18432个。GPU架构从Tesla到Blackwell约每2年迭代一次。

1000倍性能提升:算法与指令优化贡献96%

英伟达首席科学家比尔·戴利披露,单个GPU在AI推理性能10年提升1000倍,分解为:算法优化16倍(简化数字表示方式)、指令优化12.5倍(高级指令组织GPU工作)、结构优化2倍、制程进步2.5倍。可见性能提升主体是算法与指令优化,而非制程进步。

记者乔尔·赫鲁斯卡2020年撰文称“黄氏定律根本不存在”,称其为建立在摩尔定律收益之上的“幻觉”。非营利研究机构Epoch发现,2006-2021年间GPU性价比(FLOPs/$)每2.5年翻一番,比黄氏定律预测慢得多。英伟达GPU功率从Tesla架构175W升至Volta 300W、Hopper H100 700W、Blackwell GB200 1000W——英伟达通过堆核心与功耗实现了“速度标榜”,而非真正遵循摩尔定律的“功率不变、速度翻倍”。

算力成本降幅放缓:中国的追赶窗口

每GFLOPS成本(调整至2022年美元)趋势显示,1945年以来77年年复合成本降幅40.24%,1961年以来61年39.27%,1997年以来25年45.79%,2011年以来12年35.28%,2015年以来8.3年24.14%。算力成本下降速度明显放缓。

这意味着:想获得更大算力需支付更高成本(H100最高炒至3-4万美元/块);体积无法更小(手持设备短期难享GPU革命成果);有利于中国芯片业追赶(先发者比较优势缩小);等待新技术突破(碳化硅、石墨烯、金刚石、其他III-V族/II-VI族化合物、量子计算)。

英伟达在GPU领域的领先地位短期内难以撼动,但算力成本降幅放缓为中国芯片业赢得了宝贵时间窗口。随着大模型军备竞赛持续,算力需求仍将指数级增长。

GPU应用场景:从图像处理到通用计算的百年跨越

GPU早期是图像处理设备。1995年3DFX Voodoo显卡市场份额85%,英伟达凭借适配微软Direct3D 7标准的Geforce256(1999)迅速崛起,2000年收购3DFX。2003年发现GPU可解决一般线性代数问题且比CPU更快,催生GPGPU概念。GPGPU是GPU与CPU之间的并行处理,将数据迁移到图形形式后用GPU扫描分析可大幅提高速度。

GPU应用已从图像处理扩展至三大算力场景:比特币挖矿(14年全网算力增4万亿倍)、云计算(2024年市场6760亿美元)、新能源汽车(车载芯片算力从1T到2000TOPS)。2023年英伟达H100最高炒至3-4万美元/块,算力军备竞赛仍在持续。
点击阅读报告原文: 科技周期探索之七:2016-2030年:通用人工智能时代的到来-241209(53页)
相关报告