Deepseek 团队用在技术报告中直观地概括了目前模型取得的效果。V2 版本的 Deepseek 模型在参数量方面达到 236B。借助 YaRN 优化的长度外推训练方法,开源模型的上下文 能力得以扩展到了 128k 大小,在官网/API调用对话上下文能力支持 32k 大小。由于模型使用 MoE 技术进行小专家混合的特性,模型在推理时的激活参数仅 21B,有助于模型实现高推理速度。在训练成本与训练效率方面,相比 V1 的稠密模型,Deepseek-V2 节约了42.5%的训练成本,减少了推理时 93.3%的 KV-cache 显存占用,将生成的吞吐量也提升到了原来的 5.76 倍。图