合理配置并发数对降低推理成本的收益超过模型选型本身。推理引擎对能效的影响可能超过模型架构本身。MoE+FP8低比特量化路线在能效和吞吐之间取得最好平衡。清华大学联合Linux基金会发布的这份报告揭示了LLM能效优化的三大核心规律,并给出了从实验室到生产环境的可操作选型建议。
能效优化的核心发现
规律一——批处理大小是能效第一驱动力
能耗随批处理大小增大单调下降。报告通过系统级实测证实,合理配置并发数对降低推理成本的收益超过模型选型本身。在Gemma4-31B的测试中,BS从8提升至128时,单位token能耗持续下降,呈现出明确的单调递减关系。
这一发现具有直接的工程指导意义:在部署推理服务时,优先优化批处理大小配置,往往比更换模型获得更大的能效提升。批处理大小的优化是降低推理成本最直接的杠杆。
规律二——MoE+FP8低比特量化能效最优
以GPT-OSS-120B为代表的MoE架构配合FP8低精度路线,在能效和吞吐之间取得了最好的平衡。文本场景0.373 J/token配合4013 tok/s的吞吐,代码场景0.535 J/token配合3846 tok/s的吞吐——这一组合证明了稀疏架构与低精度量化协同优化的价值。
MoE架构通过条件计算降低每次推理激活的参数数量,而FP8量化降低了单次计算的能耗。两者叠加产生的能效增益超过了单一优化手段。
规律三——推理引擎影响可能超模型架构
DeepSeek-V4在vLLM引擎下文本能耗4.43 J/token,切换到SGLang后骤降至0.97 J/token——同一模型、同一硬件,仅更换推理引擎,能耗降幅达78%,吞吐量提升5.7倍。
这一发现重塑了LLM能效优化的优先级:推理引擎选型应放在与模型选型同等重要的位置。模型架构创新必须与推理框架协同,能效评测需区分“模型自身能效”和“当前框架适配下的实测能效”。
GPU利用率与TPOT的权衡
高GPU利用率≠高能效
GPU利用率集中在40%-70%,批处理大小变化的影响有限。场景对GPU利用率影响较大——代码场景下GPU利用率整体高于文本场景。GPT-OSS-120B等GPU利用率低但能效好,而Mistral-Medium-3.5等利用率高但能效差。能耗和GPU利用率之间存在一定的负相关性。
能耗-延迟的天然权衡
TPOT随批处理大小增大而增大,是摊薄能耗的天然代价。部分模型在高并发时TPOT恶化严重,框架适配不足的模型即使在低并发下TPOT也偏离瓶颈。部署时需在能耗优化与延迟约束之间找到平衡点。
部署配置建议
Gemma4-31B的详细测试显示:TP=2是能效甜点,TP=4因通信开销抵消计算收益,TP=1在大BS下出现能耗反弹。TP增大显著降低TPOT,BS增大则推高TPOT。推荐部署配置为TP=2/4,BS=64/128。