xLLM 的投机推理架构设计 梁志伟 .pdf
1、xLLMxLLM的投机推理架构设计的投机推理架构设计演讲人:梁志伟京东/算法工程师目录目录01投机推理加速原理从自回归瓶颈到 draft/verify/rejection sampling,解释为什么能加速且保持分布正确性。02投机推理技术演进对比无模型、EAGLE/MTP/DFlash 等候选生成路径和系统代价。03xLLM投机推理架构设计展开 runtime、worker-local loop、模型适配、KV cache 正确性与分布式执行。04投机推理未来展望面向 Premium Latency 和 Mass Serving 的动态控制与成本权衡。05xLLM项目介绍介绍 xLLM 系统
2、架构、开源项目、GitHub 与用户群入口。投机推理加速原理投机推理加速原理原理与收益边界自回归推理的核心矛盾自回归推理的核心矛盾用户希望低延迟连续输出,但模型只能逐用户希望低延迟连续输出,但模型只能逐 token token 串行生成串行生成用户希望用户希望服务体验像连续、稳定、实时的流。低首低首 token token 延迟延迟尽快看到第一个输出稳定稳定 TPOT TPOTtoken 间隔稳定可预期连续流式输出连续流式输出/高并发高并发多用户同时获得平滑体验模型现实模型现实自回归依赖决定:下一个 token 必须等待上一个 token 的采样结果。Prefill Prefill 可并行可并
3、行p1p1p2p2p3p3p4p4p5p5p6p6一次并行处理上下文一次并行处理上下文上下文作为整体进入 target model,计算密度相对更高。Decode Decode 必须串行必须串行token_1token_1targetforwardtoken_2token_2targetforwardtoken_3token_3targetforward.token_ntoken_ntargetforwarddecode decode 阶段的系统代价阶段的系统代价Weight ReadWeight Read每步读取模型权重KV Cache ReadKV Cache Read访问历史上下文状态S
4、cheduler WaitScheduler Wait并发排队与批处理等待投机推理:一次验证多个投机推理:一次验证多个 token token投机推理的加速原理投机推理的加速原理小模型快速起草候选小模型快速起草候选tokentoken,大模型一次批量验证,最终输出仍由大模型保证,大模型一次批量验证,最终输出仍由大模型保证投机推理的过程投机推理的过程小模型先起草,再由大模型批量验证和纠错小模型先起草,再由大模型批量验证和纠错1 1小模型生成小模型生成 draft tokens draft tokens草稿模型基于当前上下文,快速连续生成多个候选 token。当前上下文当前上下文wantwantD
5、raft ModelDraft Model低成本起草draft tokensdraft tokenstotoeateatanan2 2大模型验证大模型验证 draft tokens draft tokens主模型一次 forward 批量验证候选序列,连续匹配的 token 可直接接受。context+draft tokenscontext+draft tokenswantwanttotoeateatananTarget ModelTarget Model一次批量验证target outputstarget outputstotoeateata a 3 3拒绝采样拒绝采样遇到首个不匹配 tok
6、en 后,在拒绝点回退并重新采样。连续匹配前缀连续匹配前缀totoeateat 首个拒绝点首个拒绝点anan a aResampleResample回退后重采样a a投机推理不是直接采用小模型输出,而是让小模型先起草,再由大模型验证和纠错。投机推理不是直接采用小模型输出,而是让小模型先起草,再由大模型验证和纠错。redred 如何保证如何保证模型精度模型精度贪婪采样追求贪婪采样追求 token token 完全一致;拒绝采样追求最终生成分布与完全一致;拒绝采样追求最终生成分布与 target model target model 对齐对齐A AGreedy verificationGreedy





点击查看更多