返回顶部
返回首页 会员充值 我的足迹 返回上一页
跳转三个皮匠报告小程序

3刘星言-客服领域Agent模型的内外兼修之道.pdf

2026-07-18
文档编号:1279953
文档页数:20
文档大小:1.49MB
下载积分:VIP专享
文档格式:PDF

1、云技术服务云技术服务AgentAgent的内外兼修的内外兼修演讲嘉宾演讲嘉宾:刘星言:刘星言阿里云智能 算法专家目录CONTENT01业务背景与挑战业务背景与挑战02模型外的系统设计模型外的系统设计03模型内的训练优化模型内的训练优化04总结总结01云小二业务背景与挑战:构建通用自主Agent的必要性云小二 Aivis:云技术服务专家的AI伙伴目标:最大化人工技术客服对AI回复的采纳率定位:工具增强的云技术服务AI Agent时效性 1 min 工具调用云技术领域专精多轮对话规模化场景覆盖人性化回复约束条件【代码Agent】人性化要求不高业务逻辑特殊性低。【对比深度搜索Agent】时效性要求不

2、高交互模式相对固定(澄清+执行)发现:AI与人工专家的鸿沟高达50%【数据洞察】在60%-70%的服务工单中,提供给模型的上下文信息(对话历史、参考文档)足以支撑人工客服做出预期回复。然而,模型生成内容与 人工回复的一致性只有约10%。根因:AI与人类专家的决策鸿沟来自?AI Agent 模型需要内/外兼修02云小二Agent 系统设计构建高质量的信息环境云小二 Agent 链路结构GeneralReasoner+ExpertTips+Tools ExpertReasonerSkill-like通用 Reasoner 整体系统架构检索参考文档、经验、以及历史工单轨迹。早期对话压缩和关键信息提取

3、,可异步。基于对话上下文判定每个参考信息是否相关、提取相应证据片段,评估置信度,提供决策建议。基于上下文、在线阅读器的输出、相关参考文档片段,生成思考过程和单步行动决策。中短期记忆管理:提升当前会话的信噪比【上下文管理器】对话压缩:压缩早期对话内容(可按需展开)关键信息提取:提取并历史对话的关键信息(如用户提供的ID、报错码、重要参数等)【在线阅读器】会基于对话和当前问题,评估每份参考资料,输出:1)相关性;2)强相关的“证据”;3)置信度;4)后续决策的行动建议。【经验按需加载与拆分】许多专家经验是与特定场景绑定的;动态加载场景相关的经验 部分经验与工具结果绑定例如,当某工具被调用后,其返回

4、结果会附带上这段解读指南。长期记忆:将历史工单抽象为轨迹和经验【挑战】直接使用历史工单作为参考,噪声巨大且低效。【解决方案】将原始工单抽象为结构化的“处理轨迹”。【结果】加入轨迹搜索后,回复内容召回率+5%03模型训练优化:对齐专家思考与决策训练范式的选择与洞察【SFT vs RL】SFT建立先验,RL主导性能提升【可验证任务RLVR】如路由选择、相关性判定易于通过强化学习优化可通过SFT+RL将能力蒸馏到专用小模型上蒸馏,性价比高。【不可验证任务】如回复生成、文本创作等奖励通常基于LLM-judge可对比参考答案(如有)给出评分Reasoner Agent 对齐的挑战1.数据噪声:人工轨迹缺

5、失潜在操作日志、不规范、内容不完整或错误。精细化数据质控、过滤、重写2.资源有限:无法进行超大规模训练,必须追求高性价比方案。数据质量优于数量3.不可规则验证:只有参考答案,没有唯一标准答案。奖励信号优化4.模仿天花板:模型的行为与有噪声的人工行为不一致时,不应简单惩罚。多金标扩充从噪声数据中提炼训练数据(1)工单消息拆分;(2)初筛质控;(3)精细化决策轨迹构建金标扩充:突破单一金标的路径局限瓶颈:仅模仿历史人工的单一行为,会限制模型的探索性和上限不一致 错误多金标扩充:模型输出多个候选决策,专家/LLM-judge 验证可用性。奖励机制:只要与任何一个金标决策一致,就能获得正向奖励。【结果】常规问题采纳率不同场景+3+7%;难问题+10%04总结Takeaway【模型外】-构建高信噪比的信息环境中短期记忆管理(对话压缩、在线阅读)长期记忆(工单轨迹&经验)【模型内】-SFT+RLVR-专用小模型精细化数据构建:正向推理、反向思维链、模型重写多金标强化学习Q&A演讲嘉宾演讲嘉宾:刘星言:刘星言

3刘星言-客服领域Agent模型的内外兼修之道.pdf_第1页
3刘星言-客服领域Agent模型的内外兼修之道.pdf_第2页
3刘星言-客服领域Agent模型的内外兼修之道.pdf_第3页
3刘星言-客服领域Agent模型的内外兼修之道.pdf_第4页
3刘星言-客服领域Agent模型的内外兼修之道.pdf_第5页

点击查看更多