DeepSeek R1模型没有完全使用CUDA标准库,而是自行编写部分PTX(NV芯片底层语言机器码)实现更高效率。申万宏源计算机团队认为,CUDA壁垒正在弱化——DeepSeek绕开CUDA标准库反而获得更高效率,意味着CUDA并非最优解。新兴算子需求提升的背景下,英伟达和国产AI芯片站在同一起跑线,国产AI芯片追赶窗口期已到来。海光信息兼容CUDA路线、华为昇腾全栈自有路线双线并行,国产算力性能与生态双双突破。昇腾910C推理性能达H100六成,海光DCU已完成DeepSeek V3/R1适配,国产算力正从“能用”迈向“好用”。
CUDA壁垒弱化——DeepSeek绕开标准库证实非最优解
DeepSeek R1模型没有完全使用CUDA标准库,而是自行编写部分PTX(NV芯片的底层语言机器码)。这意味着CUDA并非不可替代的最优解——DeepSeek团队绕开CUDA标准库反而获得了更高的效率。此外,在新的模型架构趋势下(MoE、线性注意力等),新兴算子的需求提升,这个领域英伟达和其他国产AI芯片站在同一起跑线。CUDA生态的壁垒主要体现在:与AI开发框架厂商的紧密支持、CUDA中的众多针对性优化、以及庞大的用户群体(迁移其他平台需要学习成本)。但DeepSeek的实践证明了绕过CUDA的可行性,为国产AI芯片生态突破打开了窗口。
海光信息——兼容CUDA路线,类CUDA属性降低迁移成本
海光DTK(DCU计算平台)基于开源ROCm定制,封装了ROCm生态相关组件并针对DCU硬件适配优化。DTK在结构上与CUDA高度相似,分为应用程序、软件驱动、硬件驱动和芯片四个层级。HIPify工具集帮助开发人员实现CUDA到HIP的自动源码级转换——由于HIP语言本身与CUDA语言相似度较高,大多数情况下将“cuda”字符替换为“hip”即可完成语言转换,实现源码级别的兼容。海光DCU已完成DeepSeek V3、R1及Janus-Pro的适配,用户可在“光合开发者社区”直接访问和下载相关模型。DTK支持TensorFlow、PyTorch、Caffe等主流大模型框架,同时支持百度飞桨,开发人员在生态迁移上学习成本较低。
华为昇腾——全栈自有路线,有望成全球AI算力“第二极”
与海光“类CUDA”路线不同,华为昇腾采用全栈自有方式。自2018-2019年发布昇腾系列硬件开始,持续完善自身软件工具链,现已形成AI开发框架MindSpore+GPU计算平台CANN全栈自有工具栈。CANN目前提供超过1400个硬件亲和的高性能算子,全面支持主流大模型所需基础算子和80多个大模型融合算子,可覆盖主流AI框架的算子加速需求。昇腾910C推理性能已达英伟达H100的六成。DeepSeek官方在GitHub上详细说明了用华为昇腾NPU做推理的方法,华为昇腾社区的MindIE框架已成功适配DeepSeek-V3的BF16版本。申万宏源认为,华为路线虽难以复制、更为困难,但市场份额一旦突破某一阈值(参考操作系统约16%),将有望成为全球AI算力“第二极”。
表:国产AI芯片主要厂商路线对比| 厂商 | 技术路线 | 代表产品 | 核心优势 |
|---|
| 海光信息 | 兼容CUDA(基于ROCm) | DCU系列 | 类CUDA属性,迁移成本低 |
| 华为昇腾 | 全栈自有 | 昇腾910系列 | 工具链完备,生态自控 |
| 寒武纪 | 全栈自有 | MLU系列 | 早期布局,AI加速 |