AI正从云端走向终端,端侧AI正掀起新一轮人机交互革命。东吴证券研报显示,端侧AI市场规模将从2023年的不到2000亿元增长至2028年的超1.9万亿元,年复合增长率高达58%。苹果通过"本地30亿参数模型+私有云+第三方大模型"三层架构实现系统级AI,谷歌Gemini Nano持续迭代小模型性能。从模型压缩技术创新到硬件内存升级,从多模态UI交互到Agent自主决策,端侧AI的底层逻辑正在发生深刻变革。
AI自主化能力跃升——从指令驱动到意图驱动
AI自主化能力正沿着"以指令为中心"到"以意图为中心"持续提升。根据智能化分级标准,L1-L3级智能体在用户指令被动驱动下工作,而L4级以上智能体能够理解用户历史数据、感知当前状况并在适当时主动提供个性化服务。大模型和智能体正驱动下一代终端操作系统,从单点AI增强→OS智能化改造→以AI为中心的全新OS逐步演进。
当前端侧模型性能和云端大模型仍有较大差距,基于用户场景的端云协同AI将构筑全局化智能。端侧适合无网、隐私要求高、响应要求高的场景,云端适合需要大模型复杂推理的场景。苹果通过小型本地模型+私有云模型+第三方大模型三层架构实现系统级AI,编排层(Orchestration)协调多个模型,根据用户请求调用对应能力的模型,实现用户体验的一致性。
端侧模型快速迭代——技术创新大于参数量提升
端侧小模型性能持续提升。Gemma2较Gemma1在MMLU测试提升约10个百分点,GSM8K数学推理提升9个百分点。模型性能与参数规模呈明显正向关系:Gemma-2 2B到9B的表现提升远高于9B到27B的提升,说明小模型的优化空间更大。但数据集的差异、蒸馏技术的使用会带来相同模型规模的巨大性能差异——苹果3B的AFM-on-device性能远高于开源的OpenELM-3B。
参数量对模型表现影响巨大。Gemini Nano 1(1.8B)全面弱于Nano 2(3.25B),Nano 2的MMLU准确率55.8%仅为Gemini Pro的78%,MBPP编程测试27.2%仅为Pro的45%。端侧模型需进一步提升参数量以提高各类任务能力,但受限于硬件,小模型的技术创新更加积极,以提升有限参数量下的性能表现。
模型压缩三大技术——量化、剪枝、蒸馏
量化/剪枝/蒸馏是主要的模型压缩方式。量化用低精度数值表示参数,从32bits转化为8bits后内存开销为原来的1/4,计算成本仅为原来的1/16。剪枝删除不必要的神经元/权重参数,修剪后计算复杂性和内存均可降低25%。蒸馏将大模型作为教师模型,用其输出训练一个性能接近但更轻量化的学生模型——Gemma的2B和9B模型由27B模型蒸馏而来。
苹果使用混合精度量化实现3.7bits的量化水平后,加入准确率恢复适配器实现近乎无损的量化压缩:IFEval指令遵循从量化后的97.9%恢复至100.6%,GSM8K数学推理从91.3%恢复至96.0%。参数量-性能的取舍带来更多样化的创新方向,高质量数据集、高效训练方式、先进压缩方法等方向百花齐放。
Agent架构——从LLM到VLA再到个性化内存操作
Agent模型的演进从基础LLM到VLA模型再到个性化Agent。基础模型需引入新的输入类型成为VLA模型(Vision-Language-Action Model),融合视觉、语言和动作的多模态范式。Transformer架构带来状态-动作交互策略学习机遇,通过模糊匹配而非精准映射学习策略,大幅提升泛化能力。消费电子GUI是最先落地的场景。
个人LLM大模型需具备三大能力:任务执行(将用户指令转化为操作行动)、情境感知(感知用户及环境当前状态)、记忆(记录用户数据实现自我进化)。任务执行过程中需要任务分解/规划(推理能力)、切换任务(个性化调整权重)、检索历史数据(内存操作能力)。Agent架构的复杂度提升对硬件提出了更高要求,尤其是内存和算力的协同升级。
端侧小模型性能对比(MMLU基准测试)| 模型 | 参数量 | MMLU得分 | 训练数据量 | 备注 |
|---|
| Gemma-1 2B | 2B | 42.3 | 2T tokens | 谷歌2024年2月发布 |
| Gemma-2 2B | 2B | 52.2 | 2T tokens | 谷歌2024年6月发布 |
| Mistral 7B | 7B | 62.5 | - | - |
| LLaMA-3 8B | 8B | 66.4 | - | Meta开源模型 |
| Gemma-2 9B | 9B | 71.3 | - | 谷歌小模型标杆 |
| AFM-on-device | 3B | - | - | 苹果端侧模型 |