面向超大规模教育场景的 Agent 系统架构演进与工程实践.pdf
1、面向超大规模教育场景的面向超大规模教育场景的AgentAgent系系统架构演进与工程实践统架构演进与工程实践演讲人:王搂科大讯飞/高级系统架构师目录目录问题与挑战:教育超复杂场景下AI系统面临的挑战分析03WISH平台的核心定位:Agent时代的运行时底座引擎托管与治理:如何把数百个引擎纳入统一框架大模型时代的弹性底座:突破单云容量边界的跨云调度体系演进展望:从确定性的运行时底座走向动态的、可自治的Agent基础设施问题与挑战教育超复杂场景下AI系统面临的挑战分析教育教育AIAI应用应用开发面临开发面临的新的新挑战挑战 针对复杂需求,大模型的能力大模型的能力依然无法将意图理解和行动规划意图理解
2、和行动规划做到鲁棒好用鲁棒好用的水平,需要 AI 方案架构师设设计施工图计施工图(一个复杂 DAG,组合多个AI模型),并在上线后收集数据不停迭代收集数据不停迭代方能满足教育场景的高要求 在辅导答疑、智能批改辅导答疑、智能批改等教育核心场景中,涉及几十上百个引擎几十上百个引擎,单次任务的持续时间可能长达单次任务的持续时间可能长达数分钟数分钟,期间涉及多轮交互多轮交互,交互形式实时与异步同时存在,实时与异步同时存在,使开发、调试、发布、运维全部进入高复杂度区间 复杂AI应用的施工图已演变成超复杂超复杂DAGDAG,静态的链路流程静态的链路流程应对教育场景对效果和性能的要求已有些捉襟见“单能力、细
3、窄串行链路、单轮、半双工、短会单能力、细窄串行链路、单轮、半双工、短会话话”局面发生了深刻的变化.“多能力、长肥复杂多能力、长肥复杂DAGDAG、多轮、全双工、长会话、多轮、全双工、长会话”教育教育AIAI引擎引擎开发面临的新挑战开发面临的新挑战大尺寸模型的高额落地成本大尺寸模型的高额落地成本,迫使企业不断优化模型的部署和推理成本模型引擎崩溃卡死频发,迫切需要有效手段解决快速保留故障现场以及避免连锁反应造成雪崩避免连锁反应造成雪崩等问题形态一:引擎单机单卡可容纳形态二:引擎单机多卡可容纳形态三:引擎多机多才能容纳AIAI系统负载系统负载均衡面临的均衡面临的新挑战新挑战 引擎数量众多,引擎数量众
4、多,数百个引擎在生产环境运行,统一管统一管理理、统一调度统一调度迫在眉睫 引擎的输入输出差距巨大引擎的输入输出差距巨大,可能是数十数十MM的图片的图片,可能是一段数分钟的音视频数分钟的音视频,也可能是一段数数MM的文本的文本 引擎的处理能力和处理时长差异极大,引擎的处理能力和处理时长差异极大,可能可以同时处理几百个,也可能同时只能处理几个,处理时间更是从几毫秒到几分钟不等 AI引擎专属调度策略的诉求,需要考虑诸如kv cachekv cache命命中中等大模型场景专属的问题 AI系统引擎侧扇出情况严重,存在百倍放大百倍放大的场景传统负载均衡成立的两个基本前提两个基本前提:queryquery大
5、小均衡大小均衡 后端承载能力均衡后端承载能力均衡query 不均承载不均传统负载均衡假设失效AIAI系统运维面临的新挑战系统运维面临的新挑战1/21/2AI 系统变为“多层网络多层网络”,任意节点缺一不可缺一不可,不同节点配比不同配比不同系统的可观测和问题定位难度飙升,如何在上千节点、海量数据、异步系统中快速定位问题AI引擎对于资源的要求不再一视同仁对于资源的要求不再一视同仁,对于计算资源的要求千差万别AIAI系统运维面临的新挑战系统运维面临的新挑战2 2/2/2公有云计算资源受限,可能需要跨地域、跨公有云调度资源跨地域、跨公有云调度资源才能满足资源要求模型的巨大尺寸对AI引擎的快速拉起提出了
6、超高的要求,跨云拉取上百上百G G模型的模型的长长耗时(可达小时级),耗时(可达小时级),对于快速扩容的影响极为不利跨云跨云跨地跨地域域小结小结AI应用开发多能力串联的复杂施工图,全双工的多轮长会话,固定链路流程导致DAG超复杂AI引擎开发引擎形态多样,多引擎多实例组合,大模型引擎PD分离AI系统负载均衡传统负载均衡假设失效,引擎数量众多,引擎负载特征差异大,大模型对kv cache亲和要求AI系统基础设施调度和运维AI系统变成多层网络,计算资源差异大,跨地域跨公有云调度,模型尺寸超大,资源成本压力大WISH平台的核心定位Agent时代的运行时底座数据中枢数据中枢:是各种模型和引擎数据的收集、





点击查看更多