2024年初中国日均token调用量约1000亿,到2026年3月已飙升至140万亿——两年增长逾千倍。推理已占机器学习计算80%-90%需求,一个对话式AI的年推理耗电量可能超出训练数十倍。清华大学联合Linux基金会发布的这份报告,首次从系统级视角对主流大语言模型进行单位token能耗测评,覆盖文本、代码、多模态三类场景,测算了8款主流模型在真实硬件配置下的能效表现。
行业痛点——算力狂飙下的三重困境
模型需求飞速增长与能耗天花板
大语言模型的能力在过去数年间实现了跨越式提升——MMLU从60分跃升至90分以上,模型参数在五年内增长5000倍。但能力跃迁的另一面是能耗的指数级攀升。2025年全球数据中心用电激增17%,推理已占机器学习计算80%-90%需求。从经济账来看,每百万token推理电费可达1.4元,占API定价的7%-28%。中国日均token调用量从2024年初的约1000亿飙升至2026年3月的140万亿。
三重困境
算力狂飙导致供需失衡,模型需求飞速增长与数据中心基础设施扩展速度存在巨大落差。成本透明缺失,企业难以在模型能力、推理速度和运营成本之间找到可量化的决策依据。选型信息碎片化,模型能力榜单、硬件性能评测、场景适配建议分散在不同来源,缺乏统一的系统级视角。
三类场景能耗总览——谁是最优配置
报告测算了Gemma4-31B、GPT-OSS-120B、Llama4-Maverick、Qwen3.5-397B、MiniMax-M2.1、DeepSeek-V4、Mistral-Med-3.5、MiMo-V2-Flash等主流模型在文本、代码、多模态三类场景下的最低单位token能耗。
Gemma4-31B在文本场景以0.35 J/token、代码场景0.47 J/token、多模态场景0.84 J/token的表现成为全局最低能耗标杆,且跨任务稳定,是Dense架构的能效标杆。GPT-OSS-120B在文本场景0.37 J/token、代码场景0.53 J/token,采用MoE+FP8低比特量化路线。Llama4-Maverick在多模态场景0.86 J/token,是多模态场景的最佳选择。场景负载决定能耗基线:文本<图像<代码。
关键发现——批处理大小是第一驱动力
能耗随批处理大小增大单调下降——合理配置并发数对降低推理成本的收益超过模型选型本身。同硬件下模型间能耗差距也可能较大——Qwen3.5-397B与Llama4-Maverick在相同硬件、相同精度条件下能耗差距达3倍以上。MoE+低比特量化能效优势显著,GPT-OSS-120B为代表的MoE配合FP8低精度路线在能效和吞吐之间取得最好平衡。
推理引擎影响——换引擎=换表现
DeepSeek-V4在vLLM引擎下文本场景能耗为4.43 J/token,切换到SGLang后骤降至0.97 J/token,降幅达78%;吞吐量从487 tok/s提升至2763 tok/s,提升5.7倍。推理引擎对能效的影响可能超过模型架构本身。模型架构创新必须与推理框架协同,能效评测需区分“模型自身能效”和“当前框架适配下的实测能效”。
生产选型推荐
文本场景能效极致推荐Gemma4-31B(TP=2, BS=128, 0.348 J/tok),2卡即可部署;文本吞吐优先推荐GPT-OSS-120B(TP=8, BS=128, 0.373 J/tok, 4013 tok/s)。代码吞吐优先推荐MiniMax-M2.1(TP=8, BS=256, 0.864 J/tok, 4180 tok/s);代码能效优先推荐GPT-OSS-120B(TP=8, BS=128, 0.535 J/tok)。图像能效优先推荐Gemma4-31B(TP=2, BS=128, 0.467 J/tok);图像吞吐优先推荐Llama4-Maverick(TP=8, 3365 tok/s)。