返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

DeepSeek技术架构创新

招商证券AIGC系列报告详细拆解了DeepSeek-V3的核心技术创新。V3通过MLA(多头潜在注意力)、DeepSeekMoE(混合专家模型)、MTP(多token预测)、FP8精度训练和并行优化等系列创新,实现了高性能与低成本的双重突破。本文基于招商证券研报,深入解析DeepSeek的技术架构与降本原理。

MLA——多头潜在注意力如何提升推理效率

MLA(Multi-Head Latent Attention)是DeepSeek-V3的核心创新之一,其借助低秩键值联合压缩,使模型性能优于传统MHA(多头注意力),同时KV缓存量显著减少。在自回归生成过程中,模型需逐步生成每个token并缓存所有历史token的Key和Value矩阵。

以图书馆管理作类比:MHA方法中每个研究小组(头)需要查阅完整书籍库(原始Key和Value),优点是可深度研究不同领域,但缺点是存储压力大、空间浪费。MLA类似引入智能压缩技术,将书籍转换为精华摘要(低秩压缩),每个小组根据摘要展开研究,必要时还原细节,从而在降低KV缓存的同时维持模型性能。这一机制使DeepSeek-V3推理效率大幅提升。

DeepSeekMoE——细分专家提升模型性价比

DeepSeekMoE架构是V3的另一核心创新。与稠密模型“众人拾柴”的方式不同,MoE模型采取“术业有专攻”理念,每次让若干个合适专家协作完成任务。DeepSeekMoE有两个关键理念:将专家细分为更小粒度以实现更高专业化;隔离共享专家以减少路由专家之间的知识冗余。

DeepSeek-V3每个Transformer层包含256个专家和1个共享专家,基座模型总参数达6710亿,但每次token仅激活8个专家、370亿参数。在激活专家和总专家参数数量相同的情况下,DeepSeekMoE大幅超越GShard等传统MoE架构,预训练速度更快,推理速度也优于同等参数规模的稠密模型。

MTP、FP8精度训练与并行优化

DeepSeek-V3还通过多项工程优化进一步提升效率。MTP(Multi-token Prediction)通过将单token生成转变为多token生成,增加训练信号密度,提高数据效率,使模型能够预先规划表示以更好地预测未来标记。

FP8混合精度训练采用8位二进制表示数字,相比FP32和FP16精度降低但占用空间小、计算快。DeepSeek在训练时大部分核心计算内核采用FP8精度,包括前向传播、激活反向传播和权重反向传播,使计算速度相比BF16方法提升一倍,同时显著降低内存消耗。

并行优化方面,DualPipe算法实现高效的流水线并行,流水线气泡更少,在前向和后向过程中重叠计算和通信,解决跨节点专家并行引入的大量通信开销。通过这些优化,DeepSeek-V3得以在不使用昂贵的张量并行(TP)的情况下完成训练。
DeepSeek-V3核心技术创新与效果总结
技术模块核心机制主要效果
MLA低秩键值联合压缩减少KV缓存,推理效率大幅提升
DeepSeekMoE256专家+共享专家,每次激活8个671B总参数,仅37B激活
MTP单token→多token生成提升训练信号密度和数据效率
FP8精度训练混合精度,核心计算用FP8计算速度较BF16提升一倍
DualPipe流水线并行+通信重叠减少流水线气泡,降低通信开销

R1的强化学习探索——从Zero到正式版的进化路径

DeepSeek-R1-Zero首次公开证明LLM推理能力可通过纯强化学习激励,无需监督微调(SFT)作为前期步骤。模型在训练过程中自主产生“aha moment”,开始学会通过重新评估初始方法来分配更多思考时间,展示了自我验证、反思和思维链等能力的涌现。

但R1-Zero存在可读性差和语言混杂等问题。DeepSeek-R1在此基础上补充了冷启动SFT环节,构建少量Long-CoT数据微调模型。训练分为四阶段:冷启动微调、推理导向的RL训练(引入语言一致性奖励)、拒绝抽样+监督微调、适用于所有场景的RL训练。这一流程使模型在保持推理能力的同时大幅提升了输出稳定性和可读性。
点击阅读报告原文: 计算机行业AIGC系列报告之DeepSeek深度解析:DeepSeek推动高性能AI普惠AI生态繁荣发展-250204(17页)
相关报告