返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

2026端侧AI行业报告

AI正从云端走向终端,端侧AI正掀起新一轮人机交互革命。东吴证券研报显示,端侧AI市场规模将从2023年的不到2000亿元增长至2028年的超1.9万亿元,年复合增长率高达58%。苹果通过"本地30亿参数模型+私有云+第三方大模型"三层架构实现系统级AI,谷歌Gemini Nano持续迭代小模型性能。从模型压缩技术创新到硬件内存升级,从多模态UI交互到Agent自主决策,端侧AI的底层逻辑正在发生深刻变革。

AI自主化能力跃升——从指令驱动到意图驱动

AI自主化能力正沿着"以指令为中心"到"以意图为中心"持续提升。根据智能化分级标准,L1-L3级智能体在用户指令被动驱动下工作,而L4级以上智能体能够理解用户历史数据、感知当前状况并在适当时主动提供个性化服务。大模型和智能体正驱动下一代终端操作系统,从单点AI增强→OS智能化改造→以AI为中心的全新OS逐步演进。

当前端侧模型性能和云端大模型仍有较大差距,基于用户场景的端云协同AI将构筑全局化智能。端侧适合无网、隐私要求高、响应要求高的场景,云端适合需要大模型复杂推理的场景。苹果通过小型本地模型+私有云模型+第三方大模型三层架构实现系统级AI,编排层(Orchestration)协调多个模型,根据用户请求调用对应能力的模型,实现用户体验的一致性。

端侧模型快速迭代——技术创新大于参数量提升

端侧小模型性能持续提升。Gemma2较Gemma1在MMLU测试提升约10个百分点,GSM8K数学推理提升9个百分点。模型性能与参数规模呈明显正向关系:Gemma-2 2B到9B的表现提升远高于9B到27B的提升,说明小模型的优化空间更大。但数据集的差异、蒸馏技术的使用会带来相同模型规模的巨大性能差异——苹果3B的AFM-on-device性能远高于开源的OpenELM-3B。

参数量对模型表现影响巨大。Gemini Nano 1(1.8B)全面弱于Nano 2(3.25B),Nano 2的MMLU准确率55.8%仅为Gemini Pro的78%,MBPP编程测试27.2%仅为Pro的45%。端侧模型需进一步提升参数量以提高各类任务能力,但受限于硬件,小模型的技术创新更加积极,以提升有限参数量下的性能表现。

模型压缩三大技术——量化、剪枝、蒸馏

量化/剪枝/蒸馏是主要的模型压缩方式。量化用低精度数值表示参数,从32bits转化为8bits后内存开销为原来的1/4,计算成本仅为原来的1/16。剪枝删除不必要的神经元/权重参数,修剪后计算复杂性和内存均可降低25%。蒸馏将大模型作为教师模型,用其输出训练一个性能接近但更轻量化的学生模型——Gemma的2B和9B模型由27B模型蒸馏而来。

苹果使用混合精度量化实现3.7bits的量化水平后,加入准确率恢复适配器实现近乎无损的量化压缩:IFEval指令遵循从量化后的97.9%恢复至100.6%,GSM8K数学推理从91.3%恢复至96.0%。参数量-性能的取舍带来更多样化的创新方向,高质量数据集、高效训练方式、先进压缩方法等方向百花齐放。

Agent架构——从LLM到VLA再到个性化内存操作

Agent模型的演进从基础LLM到VLA模型再到个性化Agent。基础模型需引入新的输入类型成为VLA模型(Vision-Language-Action Model),融合视觉、语言和动作的多模态范式。Transformer架构带来状态-动作交互策略学习机遇,通过模糊匹配而非精准映射学习策略,大幅提升泛化能力。消费电子GUI是最先落地的场景。

个人LLM大模型需具备三大能力:任务执行(将用户指令转化为操作行动)、情境感知(感知用户及环境当前状态)、记忆(记录用户数据实现自我进化)。任务执行过程中需要任务分解/规划(推理能力)、切换任务(个性化调整权重)、检索历史数据(内存操作能力)。Agent架构的复杂度提升对硬件提出了更高要求,尤其是内存和算力的协同升级。
端侧小模型性能对比(MMLU基准测试)
模型参数量MMLU得分训练数据量备注
Gemma-1 2B2B42.32T tokens谷歌2024年2月发布
Gemma-2 2B2B52.22T tokens谷歌2024年6月发布
Mistral 7B7B62.5--
LLaMA-3 8B8B66.4-Meta开源模型
Gemma-2 9B9B71.3-谷歌小模型标杆
AFM-on-device3B--苹果端侧模型
点击阅读报告原文: 电子行业深度报告:端侧AI模型创新快速迭代看好苹果引领AI硬件起飞-250223(21页)
相关报告