小米自研大模型的技术迭代正在加速。国信证券2024年小米AI布局专题报告显示,2024年11月,MiLM2完成从一代到二代的全面升级,在10大能力维度上平均提升超45%。MiLM2构建了从0.3B到30B的完整模型矩阵,端侧4B模型已成功部署,性能全面超越同参数规模的Qwen2.5-3B和Llama3.2-3B;云端30B模型在指令遵循、常识推理和阅读理解方面表现优异。技术架构上,SUBLLM结构使训练和推理速度分别提升34%和52%,TransAct结构化剪枝仅用8%训练计算量即完成4B模型剪枝,MoE结构(2B×8)在保持性能的同时解码速度提升50%。小米“轻量化、本地部署”的技术路线正在从愿景走向现实。
技术突破——SUBLLM与TransAct的创新架构
小米大模型团队在预训练、量化、推理加速等方向做了大量技术探索和创新。SUBLLM模型结构是其中的核心突破——模型能够区分重要token和不重要token,通过差异化的计算资源分配,训练和推理速度分别提升34%和52%,在不牺牲模型性能的前提下显著提升效率。
TransAct大模型结构化剪枝方法是端侧部署的关键技术。该方法仅用8%的训练计算量即从6B模型剪枝出4B模型,训练效率大幅提升,同时实现KV Cache下降50%、推理速度提升20%(小米14手机测试)。此外,INTRADoc注意力机制通过屏蔽无关文档,让每个token的概率仅取决于同一文档中的上文信息,有效消除潜在干扰信息。Mixture of Diverse Size Experts结构在每一层中设计大小不同的专家结构,并引入专家对分配策略,在多个GPU之间均匀分配工作负载。这些技术创新共同构成了小米大模型“轻量化、本地部署”的技术底座。
模型矩阵——0.3B-30B全覆盖,MoE结构提升效率
小米自研大模型团队构建了灵活的模型矩阵,参数规模覆盖0.3B、0.7B、1.3B、2.4B、4B、6B、13B、30B等多个量级,充分考虑多元化的业务场景及资源限制。
在终端(on-device)场景,0.3B到6B的模型可完成具体、低成本任务,微调后可达百亿参数内开源模型效果。6B到13B的模型支持多任务微调,达到几百亿开源模型效果。30B模型专为云端设计,具备坚实的zero-shot/上下文学习能力,能够完成复杂的多任务。
MiLM2系列还加入了两个MoE(混合专家)结构的模型:MiLM2-0.7B×8和MiLM2-2B×8。以MiLM2-2B×8为例,根据评测结果,该模型在整体性能上与MiLM2-6B不相上下,而解码速度实现了50%的提升,大幅提升了运行效率。MoE结构通过激活部分专家网络而非全部参数,在保持性能的同时显著降低计算开销,特别适合端侧部署场景。
性能对比——端侧4B全面领先,云端30B超越竞品
MiLM2-4B模型是端侧部署的代表。该模型总共40层,实际总参数量3.5B,目前已在设备端成功部署。在权威基准测试中,MiLM2-4B表现全面超越同参数规模竞品:GPQA得分29.29(Qwen2.5-3B为26.30,Llama3.2-3B为27.27),BBH得分60.06(Qwen2.5-3B为56.30,Llama3.2-3B为47.28),GSM8K得分78.17(Qwen2.5-3B为79.10,Llama3.2-3B为33.80),MATH得分43.64(Qwen2.5-3B为42.60,Llama3.2-3B为17.96)。在DROP、MULTI-NLI、WorldSense等推理和阅读理解任务上同样领先。
云端MiLM2-30B-Chat模型表现同样出色。在FollowBench-zh中文指令遵循评测中,MiLM2-30B-Chat得分62.7(优于Qwen2.5-32B-Instruct的55.8和GPT-3.5的55.2);在IFEval英文指令严格准确率中达86.0%(优于Qwen2.5-32B的82.5和GPT-4的85.4)。这些评测结果验证了小米大模型“端云并重”策略的有效性——端侧模型满足实时、隐私场景需求,云端模型处理复杂、多任务场景,共同支撑“人车家全生态”的AI能力需求。
表2:MiLM2端侧模型与竞品基准测试对比| 基准 | MiLM2-4B | Qwen2.5-3B | Llama3.2-3B |
|---|
| GPQA | 29.29 | 26.30 | 27.27 |
| BBH | 60.06 | 56.30 | 47.28 |
| GSM8K | 78.17 | 79.10 | 33.80 |
| MATH | 43.64 | 42.60 | 17.96 |