从实验结果上看,MLA 压缩后实现的模型性能优于传统的 MHA。虽然 GQA 和 MQA 也对传统的 MHA 进行了压缩,但是这两种方法往往使得模型性能受损,表现不如 MHA。而从实验结果上看,MLA 是优于 MHA 的:1)MLA 所需的 KV cache 相比其他几种注意力机制更少;2)与 MHA 相比,MLA 在困难测评集上表现更好,且 MLA 的 KV cache 仅为 MHA的 14%(Small MoE)和 4%(Large MoE)(图表 26)。2)DeepSeek V2 以 21B 的激活参数(共 236B 参数,每个 token 激活 8 个专家),达到了与开源 Llama 3 70B 可比的水平,在近似大小开源模型中表现优异。最终,DeepSeek V2 相比其前一代模型 DeepSeek 67B(稠密架构),性能更强,训练成本节省 42.5%,KV cache 降低了 93.3%。