从 Token 数量到 Token 密度:万亿参数规模下的高效智能体智能.pdf
1、如果一个如果一个 Token 值值 0.001 元元万亿参数模型每刻至少烧掉一辆特斯拉万亿参数模型每刻至少烧掉一辆特斯拉效率,是智能体时代的第一问题效率,是智能体时代的第一问题从从 Token 数量到数量到 Token 密密度:度:周俊蚂蚁集团副总裁万亿参数规模下的高效智能体智能万亿参数规模下的高效智能体智能目录目录01020304架构设计预训练&智能体数据评测结果能力释放效率突破现有差距定位与展望今天的今天的 LLM LLM 开发者面临一个不可能三角开发者面临一个不可能三角快快 推理成本低,但参数有限做不了复杂任务推理成本低,但参数有限做不了复杂任务强强 能力顶配,但能力顶配,但 GQAGQ
2、A 注意力成本指数级增长注意力成本指数级增长智智 智能体能力智能体能力 聊天能力聊天能力+工具调用工具调用三者不是独立问题三者不是独立问题共享同一个根源:架构共享同一个根源:架构 训练训练 智能体的割裂设计智能体的割裂设计修任意一个,另外两个会反过来限制你GQA GQA 注意力的隐性成本注意力的隐性成本注意力复杂度=O(n)上下文翻倍,成本翻四倍32K 上下文:60%FLOPs 花在注意力上256K 256K 上下文:上下文:85%FLOPs 85%FLOPs 花在注意力上花在注意力上万亿参数规模下,这是结构性问题不是加算力能解决的85%85%的算力的算力不在思考不在思考GQA 注意力在 25
3、6K 上下文下的 FLOPs 占比注意力注意力 FLOPs FLOPs 占比:占比:GQA vs GQA vs 混合线性混合线性01020304050607080901004K8K32K128K256KGQA注意力混合线性注意力 这里开始,算力在做无用功这里开始,算力在做无用功聊天聊天 智能体智能体一次工具调用错误的后果一次工具调用错误的后果=10=10 次聊天幻觉次聊天幻觉聊天幻觉:可追问纠正,过程可逆工具调用错误:工具调用错误:APIAPI 已发出,后果不可逆已发出,后果不可逆指令微调是水中加盐,不是大海对聊天模型说请做智能体=对短跑运动员说请跑马拉松仅在模拟器里训智能体仅在模拟器里训智能
4、体=在游泳池里练高山滑雪在游泳池里练高山滑雪197 个 MCP 服务器 2,400+真实工具 真实执行验证过滤三重矛盾的共享根源三重矛盾的共享根源注意力瓶颈注意力瓶颈 压制能力释放压制能力释放Token Token 低效低效 智能体失败智能体失败聊天训练聊天训练 无法获得智能体能力无法获得智能体能力解法:协同设计解法:协同设计从架构到训练到智能体,系统性重新设计从架构到训练到智能体,系统性重新设计架构设计架构设计7 7 份线性注意力份线性注意力 +1+1份份 MLAMLA7 7层层 Lightning O(n)Lightning O(n)降为降为 O(n)O(n),处理全局上下文,处理全局上下
5、文1 1层层 MLA MLA 低秩低秩KVKV压缩,捕捉关键信息压缩,捕捉关键信息效果:效果:256K 256K 上下文上下文不可用不可用 标准配置标准配置成本从指数级降至线性级成本从指数级降至线性级不可用不可用标准配置标准配置7:1 混合线性注意力让 256K 上下文成为标配缩放定律:缩放定律:M=8 M=8 是最优甜点是最优甜点M=21:1比例,效果等同纯MLA小模型M=4等价参数减半的纯模型M=8 M=8 最优甜点不失精度,最大降成本M=16M=16出现明显退化两个规模,同一架构两个规模,同一架构Ling-2.6-flashLing-2.6-flash3232 层层 4096 4096维
6、维 104B 104B参数参数 1 1稠密稠密+31MoE+31MoELing-2.6-1TLing-2.6-1T8080 层层 8192 8192维维 万亿级激活万亿级激活 4 4稠密稠密+76MoE+76MoE共享:共享:256256 专家专家 每每 8+18+1 激活激活 2 25 56K6K 上下文上下文MoEMoE without the pain without the pain 无辅助损失路由无辅助损失路由 前端稠密层前端稠密层专家偏置专家偏置 +FP32+FP32路由路由 +sigmoid+sigmoid 评分评分路由输出路由输出 2.5 2.5 倍缩放倍缩放 更纯净梯度,更稳





点击查看更多