返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

NPU异构计算架构

生成式AI在端侧的落地,需要重新思考计算架构。中邮证券《端侧大模型近存计算,定制化存储研究框架》报告指出,CPU擅长顺序控制和即时性,GPU适合并行数据流处理,而NPU专为AI打造,擅长标量、向量和张量数学运算。按需型、持续型、泛在型三类AI用例对功耗和时延的要求截然不同,单一处理器无法高效应对所有需求,异构计算成为必然选择。瑞芯微、寒武纪、芯原股份等国内厂商正加速NPU在端侧AIoT、汽车电子等场景的渗透。本文从NPU演进、异构计算策略、国内厂商布局三个维度,解析NPU在端侧大模型中的核心地位。

NPU十五年演进——从音频CNN到多模态大模型的专用之路

NPU自2015年发展至今,始终与AI模型需求同步进化。早期(2015-2016年)面向音频和语音AI用例,基于CNN,主要需要标量和向量运算。2016年起,拍照和视频AI大受欢迎,模型复杂度提升(Transformer、RNN、LSTM、高维CNN),工作负载需要大量张量数学运算,NPU因此增加了张量加速器和卷积加速器,大幅提升处理效率。张量加速器的优势在于:N×N矩阵乘法需读取2N²个值并执行2N³次操作,张量加速器每次内存访问的计算操作比率为N:1,远高于标量/向量加速器。2023年,LLM(如Llama2-7B)和LVM(如Stable Diffusion)使模型大小提升超一个数量级,除计算外还需重点优化内存和系统设计,减少数据搬移。2024年,多模态大模型普及,NPU需支持更高效的推理和更自然的交互。NPU通过降低部分可编程性,换取更高的峰值性能、能效和面积效率,与AI行业方向保持高度一致。

按需/持续/泛在型用例的处理器选择——NPU在能效上胜出

生成式AI用例分为三类:按需型(用户触发、需立即响应,如拍照编辑、代码生成)、持续型(运行时间长,如语音识别、实时翻译)、泛在型(后台常开,如预测性AI助手)。不同用例对KPI要求不同——按需型重时延,小模型时CPU合适,大模型(数十亿参数)则GPU/NPU更佳;持续型和泛在型重电池续航和能效,NPU是最佳选择。另一个关键区分在于模型是内存限制型还是计算限制型。大语言模型(LLM)生成文本时受内存带宽限制,需关注处理器内存效率;大视觉模型(LVM)可能受计算限制,GPU或NPU均可,但NPU能效更高。例如,个人助手需同时运行自动语音识别(ASR)、LLM、文本生成语音(TTS)多个模型,需跨NPU、GPU、CPU、传感处理器分布处理。对于PC上的个人助手(始终开启),应在NPU上运行以最大限度地节能。异构计算的核心原则是"在工具箱中选择合适的工具"——根据模型类型、功耗预算、时延要求灵活分配负载。
不同处理器在不同AI用例中的适用性
处理器擅长领域适用AI场景能效特点
CPU顺序控制、即时响应小模型按需型中等
GPU并行数据流处理大模型按需型、计算密集较低
NPU标量/向量/张量数学持续型/泛在型、大模型推理最高

国内NPU厂商进展——瑞芯微、寒武纪、芯原各具特色

瑞芯微NPU IP历经四代迭代,从RK1808的3TOPS到RK3588/RK3576的6TOPS自研NPU,可支持端侧0.5B-3B参数模型,实现每秒生成10 token以上。RK3588采用4核A76+4核A55,带6TOPS NPU,已应用于教育平板、AI玩具、桌面机器人等。公司2024年营收约31亿元,创历史新高,净利润同比增长超300%。寒武纪提供云边端一体、软硬件协同的系列化智能芯片,产品覆盖云端、边缘端训练/推理,已服务大模型算法公司、服务器厂商等。芯原股份的NPU IP被82家客户用于142款AI芯片,全球出货超1亿颗,在嵌入式AI/NPU领域全球领先,并积极布局AR/VR眼镜芯片一站式定制。北京君正、国科微、全志科技等也在各自领域(安防、车载、工业)集成自研NPU。端侧AI的算力需求从0.2TOPS到6TOPS不等,国内NPU厂商已形成多层次产品矩阵,覆盖IoT、手机、汽车、安防等广泛应用场景。

异构计算的实现依赖先进封装——CUBE+NPU+3D堆叠协同

异构计算不仅仅是处理器选择,还需要物理实现层面的支持。不同功能的芯片(CPU、GPU、NPU、DRAM)需通过先进封装集成在一起,实现高性能、低功耗、小尺寸。华邦CUBE即是一种面向端侧AI的定制化3D DRAM,与SoC(含NPU)通过TSV或混合键合堆叠,形成完整的近存计算单元。在AI-ISP架构中,CUBE作为L4缓存,配合NPU实现大算力。预计未来端侧AI芯片将普遍采用"NPU+CUBE+先进封装"的三位一体方案,在成熟制程下实现高带宽、低功耗、高性价比的端侧大模型部署。
点击阅读报告原文: 【中邮证券】电子:端侧大模型近存计算,定制化存储研究框架-250219(67页)
相关报告