当前大语言模型的能耗测量依赖NVML接口,只能获得芯片级平均功耗,无法定位到Token级的瞬态能耗特征。清华大学联合Linux基金会的报告提出了一个硬件级解决方案——在芯片供电轨道上串联精密分流电阻,利用1kHz高精度电流监控芯片采样,实现Token级瞬态能量特征捕捉。这将为LLM能效优化打开一个全新维度:精确定位Tensor Core矩阵运算的功耗峰值、量化通信能耗、支撑亚毫秒级动态电压频率调整。
当前能耗测量的局限
NVML接口的精度瓶颈
当前能耗获取高度依赖NVML或类似系统驱动接口,只能获得芯片级的平均功耗读数。采样频率通常仅为数十赫兹,无法捕捉毫秒级、微秒级的瞬态功耗变化。这意味着现有能耗数据掩盖了模型推理过程中不同阶段(预填充、解码、通信)的能耗差异,无法指导精细化的能效优化。
平均功耗掩盖了真实能耗特征
模型推理过程中,矩阵运算、数据传输、通信同步等不同阶段的功耗特征差异巨大。仅看平均功耗无法区分哪些Token消耗了更多能量,也无法定位能耗的峰值时刻。这导致编译器优化、算子重排、电压频率调整缺乏精确的数据支撑。
硬件方案——高精度能耗测量平台
侵入式供电轨测量方案
报告提出了高精度能耗测量平台的硬件方案:摒弃传统PMIC读数,在芯片供电轨道上进行侵入式能耗测量。供电轨串联精密分流电阻,利用高精度电流监控芯片进行1kHz实时采样。采样数据经时间标定,实现Token级瞬态能量特征捕捉。
RK3588概念验证平台
RK3588边缘计算节点平台已完成概念验证。该平台验证了高精度采样方案的可行性,为后续在更大规模GPU集群上部署该测量方案奠定了基础。
Token级能耗测量的未来价值
精确定位功耗峰值
高精度测量将揭示大规模并行下的通信能耗,精确定位Tensor Core矩阵运算和存储控制器总线切换时的功耗峰值。这些瞬态特征在平均功耗读数中完全被掩盖。
捕捉长尾能耗效应
复杂调度下的缓存失效、指令分配不均等长尾能耗效应将被量化。这将为编译器算子重排提供精确的数据支持,优化能效表现。
支撑动态电压频率调整
测量数据将支持亚毫秒级的功率预测模型,在Token级计算负载到来前精准调整供电轨电压。这种主动式电压频率调整比当前的响应式调整更高效,可进一步降低能耗。
描绘模型运行不同阶段的能耗特征
最终目标是定位Token能耗给系统的能耗优化提供精确指导——不同的模型架构、不同的任务类型、不同的批处理配置,其Token级能耗特征图谱将为能效优化开辟全新维度。