平安证券AI系列专题报告指出,AI处理的重心正在向边缘转移。AI端侧应用通过本地化数据处理实现低延迟、高隐私与强交互体验。NPU专为神经网络计算设计,功耗控制是其核心优势——处理相同AI任务时NPU耗电量远低于GPU,同时可释放CPU和GPU资源提升系统整体效率。随着生成式AI蓬勃发展,边缘AI设备对NPU的需求持续增长,AI增强型SoC通过集成NPU突破传统处理器能效瓶颈。
AI处理重心向边缘转移,NPU成关键
生成式AI的蓬勃发展推动推理向端侧迁移。高通指出,DeepSeek R1的推出标志着推理向端侧迁移,推动AI模型向轻量化、高效、定制化演进。数量可观的生成式AI模型可从云端分流到终端上运行。AI端侧应用通过本地化数据处理实现低延迟、高隐私与强交互体验,覆盖智能家居、可穿戴设备、AI玩具等消费级产品。
NPU(神经网络处理器)专为神经网络计算设计,可高效执行大规模矩阵运算,尤其擅长卷积神经网络(CNN)的卷积操作。NPU速度优于CPU但略逊于GPU,核心优势在于功耗控制——处理相同任务时NPU耗电量远低于GPU。同时,NPU处理AI任务时可释放CPU和GPU资源,提升系统整体运行效率,尤其适用于需要长期运行且功耗敏感的边缘AI场景。
NPU架构演进与技术特点
2015年NPU主要面向音频和语音AI用例设计,支持简单CNN及标量/向量运算;2016年后随着拍照、视频AI兴起,面对Transformer、RNN等复杂模型的张量运算需求,NPU增加张量加速器和卷积加速。
NPU两大核心技术特点:一是模拟人类神经网络运作方式,通过并行处理优化芯片内“任务流”分配,减少运算资源闲置;二是采用“近行运算”或“内存运算”技术,缩短数据传输距离,降低能耗并提升存取速度,实现存储与运算一体化。当前AI PC和手机芯片普遍将CPU、GPU、NPU整合为SoC,三者相辅相成——NPU作为AI硬件加速器专注于边缘AI负载,补充而非取代CPU和GPU。
端侧NPU应用场景持续拓展
NPU凭借低功耗特性成为边缘设备的理想选择,主要应用于人脸识别、语音识别、自动驾驶、智能相机等领域。在AI智能眼镜中,视觉理解模型进步驱动ISP向高端迭代,同时NPU为图像处理提供本地AI算力支撑。在AI耳机中,NPU支持语音唤醒、实时翻译、降噪等音频AI功能。在AI玩具中,NPU使端侧设备具备情感识别、语音交互等能力。
炬芯科技第一代三核异构芯片采用基于存内计算(CIM)架构的NPU,单核可提供100GOPs算力,能效比高达6.4TOPS/W。乐鑫ESP32-S3/P4支持本地神经网络计算,端云协同(豆包大模型)。泰凌微TL721x边缘AI平台支持谷歌LiteRT、TVM等开源模型,工作电流低至1mA量级,适合电池供电产品。
投资建议与核心标的
边缘AI驱动NPU在AIoT端侧设备中渗透率持续提升。建议关注在NPU和AI算力方向布局领先的国产SoC厂商:瑞芯微(旗舰RK3588集成NPU)、全志科技(异构计算+NPU)、恒玄科技(可穿戴AI芯片BES2800)、炬芯科技(三核异构+CIM NPU)、乐鑫科技(ESP32-S3边缘AI)、泰凌微(TL721x边缘AI平台)。