返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

端侧AI模型压缩技术

大模型如何在端侧有限硬件资源上运行?模型压缩是关键答案。东吴证券研报指出,量化、剪枝、蒸馏是三大核心技术。量化从32bits降至8bits可将内存降为1/4、计算成本降为1/16;剪枝删除冗余参数使计算和内存需求同时降低25%;蒸馏让27B大模型"教"出2B小模型,性能接近但尺寸缩小超90%。苹果更以3.7bits量化搭配精度恢复适配器,实现近乎无损的压缩效果。端侧AI的百花齐放,离不开模型压缩技术的持续突破。

量化——低精度表示开启端侧AI部署之门

量化是用低精度数值表示模型参数的核心压缩技术。从32位浮点数(FP32)转化为8位整数(INT8),内存开销降为原来的1/4,计算成本降为原来的1/16。这一数量级的压缩使得原本需要14GB DRAM的7B半精度模型,可以在更小的内存空间内运行,让端侧设备部署大模型成为可能。

苹果在量化精度上的探索更进一步。公司使用混合精度量化将模型压缩至3.7bits,并通过加入准确率恢复适配器实现近乎无损的量化压缩。量化后IFEval指令遵循准确率从97.9%恢复至100.6%,GSM8K数学推理从91.3%恢复至96.0%,基本达到未量化模型的性能水平。各家小模型因数据集选择、压缩精度、量化混合方式的差异,预计将带来端侧小模型的百花齐放。微软3.8B参数的Phi-3-mini在4bits量化下仅需1.8GB DRAM,证明了量化技术的实际部署价值。

剪枝——删除冗余参数提升效率

剪枝通过删除不必要的神经元、权重参数或节点来压缩模型。以示意图为例,修剪前需要执行32次乘法累加和存储32个权重参数;修剪后只需24次乘法累加和24个参数,计算复杂性和内存需求同时降低25%。这种结构化的参数删除在保持模型核心能力的同时,显著降低了端侧部署的硬件门槛。

苹果的AFM-on-device模型正是由剪枝后的6.4B模型蒸馏而来。剪枝策略的关键在于识别哪些参数对模型输出影响最小——通过权重幅值判断或基于梯度信息的重要性评估。在端侧AI场景中,剪枝后的模型在推理速度、功耗和内存占用方面均有明显改善,尤其适合对实时性要求较高的应用场景如语音助手、图像处理等。

蒸馏——大模型"教"小模型的智慧传承

知识蒸馏将大模型(教师模型)的知识迁移到小模型(学生模型)。大模型输出包含丰富的软标签信息,小模型通过学习这些软标签来模仿大模型的行为,实现"用更少的参数获得接近的性能"。Gemma的2B和9B模型均由27B的Gemma模型蒸馏而来,训练数据量从2T到6T tokens不等。

蒸馏的核心价值在于"智能化压缩"——不只是简单地减少参数,而是保留大模型的推理能力和知识结构。蒸馏技术的进步正在改变端侧AI的开发范式:先训练千亿参数的大模型,再蒸馏出数十亿参数的端侧小模型。这种方法使端侧模型能够继承大模型的核心能力,大幅缩短端侧模型的迭代周期。蒸馏技术配合高质量数据集和先进训练方法,是端侧AI性能持续提升的关键驱动力。

参数量-性能的取舍与新创新方向

端侧模型面临参数量与性能的根本性权衡。从测试数据看,Gemini Nano 1(1.8B)全面弱于Nano 2(3.25B),说明参数规模仍是决定性能下限的关键因素。但同等参数规模下,技术创新带来的性能差异同样显著——Gemma2相比Gemma1在参数相近的情况下MMLU提升约10个百分点,体现出架构和训练方法的改进价值。

多重制约下,各类创新方向百花齐放。高质量数据集的构建、高效的训练方式(如更优的预训练策略)、先进的压缩方法(如混合精度量化)都是当前的热点方向。苹果的精度恢复适配器技术展示了如何在极限压缩后修复性能损失,谷歌的多阶段蒸馏策略验证了分层知识迁移的有效性。这些技术创新共同推动端侧AI在有限的硬件资源上实现越来越强的智能表现。
模型压缩三大技术对比
技术原理效果代表案例
量化降低数值表示精度(32bit→8bit/4bit)内存降为1/4,计算降为1/16苹果3.7bits量化+恢复适配器
剪枝删除不必要的神经元/权重参数计算和内存同时降低约25%AFM-on-device由6.4B剪枝而来
蒸馏大模型(教师)训练小模型(学生)小模型获得接近大模型的能力27B蒸馏出2B/9B Gemma模型
点击阅读报告原文: 电子行业深度报告:端侧AI模型创新快速迭代看好苹果引领AI硬件起飞-250223(21页)
相关报告