行业更新 低资源消耗。大模型常用的优化算法 kv-cache 显存占用很高,MLA 通过低秩联合压缩键值方法实现瘦身,将原本庞大的键值矩阵压缩成一个较小的潜在向量(latent vector),实验显示,deepseek 在采用此技术后,相较于之前版本,KV 缓存大小减少了 93.3%从而大幅减少所需的缓存容量。由于缓存的压缩,数据读取和处理量大幅减少,推理速度显著提升,相对基准系统吞吐量(完成工作量)提升 3-7 倍。计算复杂度降低使模型在处理长序列数据时优势尽显,能高效理解长篇文章、迅速而有逻辑地生成文本。和 DeepSeek 67B 相比,使用了 MLA 的 DeepSeek V2 (总参数量 236B,激活参数量 21B)模型效果显著提升,节省 42.5%的训练成本,减少了 93.3%