8月21日,DeepSeek-V3.1更新特别提到使用UE8M0 FP8 Scale精度——这是针对下一代国产芯片设计的参数精度,标志着国产大模型与国产芯片从“适配”走向“共同设计”。申万宏源研究这份报告梳理了国产AI芯片软件生态、模型生态和互联生态三大维度的演变趋势。
软件生态:从框架适配到全栈开源
国产AI芯片软件生态已形成从框架适配(PyTorch/TensorFlow)、编译器(TVM/MLIR)到工具链的全栈能力,通过类CUDA架构、统一精度标准和开源社区推动产业链协同。
华为昇腾:CANN全面开源开放,采用木兰宽松许可证v2,支持商用和二次分发。新增200+深度优化算子、80+融合算子、100+通信和矩阵运算API,显著降低开发门槛。CANN对标CUDA之于英伟达,是高效调用昇腾芯片的关键。
寒武纪:拥有完整的软件堆栈,SDK中包含各类库,自有智能编程语言BANG底层算子处于国产算力第一梯队(略少于华为)。开源了PyTorch设备后端扩展插件Torch-MLU,自PyTorch1.3版本开始就支持寒武纪MLU系列作为加速后端。目前与阿里Qwen、阶跃星辰等大模型积极适配。
海光信息:兼容“类CUDA”环境,已与国内外主流大模型全面适配,兼顾推理与训练需求,全面支持300+AI应用场景。
沐曦MXMACA兼容CUDA,阿里平头哥和百度昆仑芯均兼容CUDA,燧原Topsrider自研生态。经过近两年迭代与生态开发,下游用户易用性已有极大提升。
国产AI芯片软件工具是否兼容CUDA| 厂商 | 软件工具 | 是否兼容CUDA | 生态路线 |
|---|
| 华为 | CANN | 不兼容 | 自研全栈 |
| 寒武纪 | MLU/BANG | 不兼容 | 自研路线 |
| 海光信息 | 类CUDA | 兼容 | 兼容路线 |
| 沐曦 | MXMACA | 兼容 | 兼容路线 |
| 阿里平头哥 | — | 兼容 | 兼容路线 |
| 百度昆仑芯 | — | 兼容 | 兼容路线 |
模型生态:从硬件适配到协同设计
国产芯片与AI模型的协同已超越简单的硬件适配,进入算子与模型架构共同演进的阶段。
8月21日,DeepSeek在官方公众号发布V3.1版本模型,特别提到使用了UE8M0 FP8 Scale的参数精度,是针对即将发布的下一代国产芯片设计。未来DeepSeek将在模型训练和推理端采用英伟达+国产芯片双生态。这一改动有助于建立国产算力-国产AI模型生态闭环——由于DeepSeek是开源模型,多数2B应用会选择在其基座模型上进行微调,后续应用爆发后对国产算力的需求有望大幅提升。
国产AI模型公司与国产AI芯片企业正紧密合作。DeepSeek-V3.2-Exp与华为昇腾实现Day0支持并开源推理代码,与寒武纪实现Day0适配并开源vLLM-MLU源代码,与海光DCU实现无缝适配与深度调优。GLM-4.6在寒武纪芯片上实现FP8+Int4混合量化部署,为首套在国产芯片投产的一体化解决方案。通义千问在2025阿里云栖大会上宣布选择开放路线,旨在吸引更多第三方GPU和交换机厂商加入,构建支持异构计算的开放算力体系。
互联生态:华为与海光两大体系雏形初定
国内华为、海光牵头的两大超节点生态体系雏形初具。
华为开放灵衡统一总线(Unified Bus),支持超节点内不同类型、不同距离的组件统一互联,组件包括CPU、NPU、GPU、MEM、DPU、SSU和Switch等。访问无协议转换开销,提供统一的编程模型。支持超节点以大于90%的线性度从单节点扩展到8192卡,未来将提升至15488卡甚至更大规模;支持超节点通过UBeE构建百万卡规模的集群,兼容以太组网。灵御部署形态的核心是UB Switch。
海光信息开放CPU互联总线协议HSL,面向GPU、IO、OS、OEM等产业全栈。核心内容包括开放完整总线协议、提供IP参考设计、开放指令集等。产业上下游伙伴可通过海光系统互联总线实现更高效的系统连接——降低访问延迟、自定义简化协议栈、提升链路利用率、支持缓存一致性和自由的多链路扩展。当前加入HSL协议的参与者包括寒武纪、沐曦、摩尔线程等。