AI Agent的决策过程就像一个黑箱——模型调用了哪些工具?Token消耗在哪里?为什么某次对话响应慢了10秒?华为云AgentArts通过Trace、Span、Metric、Log四维数据,将Agent从“黑箱”变为“透明视图”。本文从调用链、指标、日志三个维度,拆解AI智能体可观测性的落地实践。
可观测性的核心——Trace与Span体系
Trace——一次请求的完整生命周期
Trace记录从请求发起到最终返回结果的完整过程。当用户通过API发起一次请求时,系统会为该请求创建一个Root Span;请求执行过程中每经过一个子步骤(如调用大模型、执行工具等),系统会自动创建一个Span并挂载到Root Span下,形成完整的调用树。
三种Span类型的应用场景
平台支持按三种Span类型分类筛选。ALL Span:查看所有子请求的完整请求链路,适合全面分析整个调用流程。Root Span:用户发起的整次请求入口,适合快速统计调用次数、概览请求状态。Model Span:大模型调用节点,适合聚焦模型调用性能分析。
四维可观测数据——链路、元数据、指标、日志
链路信息——数据流转追踪
在左侧调用树中单击目标Span节点,可在“链路信息”页签查看该节点的具体输入与输出内容。如果调用过程中节点发生报错,报错节点的“链路信息”将展示相应报错详情,快速定位问题根因。
元数据——运行环境的关键上下文
元数据是运行过程中的键值对集合,用于存储运行实例的补充信息,例如应用程序版本、运行环境、调用模型名称或其他需关联的自定义信息。以JSON格式展示并支持一键复制。
标注——自定义分类与筛选
标注是附加在Span上的自定义信息,可以使用标注对Trace数据进行分类、筛选或标记特殊事件。标注数据支持按场景筛选并回流至评测集,用于对特定场景下的智能体进行定向评估。每条数据最多支持添加20个标注,最多支持创建500个标注。
指标与日志——性能监控与故障排查
指标以折线图形式直观展示当前Span的关键性能指标,涵盖Token消耗趋势与平均响应时间变化(前后15分钟)。日志展示智能体在运行过程中产生的事件记录,包含时间戳与详细内容,详细记录智能体的思考过程、工具调用的原始输入输出信息。
三大数据来源与接入方式
平台原生自动上报
在AgentArts平台内创建的单智能体、工作流及多智能体应用,系统默认开启自动上报。提交发布智能体版本时,用户可以保持开启或手动关闭。仅通过API调用产生的数据才会上报,控制台调试和编排预览不计入统计。
高代码智能体托管上报
本地开发的智能体可通过SDK集成托管至平台运行时,并配置数据上报开关。支持在“智能体运行时”、“沙箱工具”和“网关”三个维度查看运行日志。日志数据上报至云日志服务LTS。
第三方智能体OpenTelemetry上报
使用LangChain等框架开发的第三方智能体,可通过观测OpenAPI将Trace和Metric数据上报至平台。数据格式遵循OpenTelemetry协议,开发者可使用OTel SDK快速对接。上报数据可在“智能体列表”页面筛选“第三方托管”类型进行查看。
四个典型可观测性应用场景
场景一:模型调用链路优化——通过调用链分析查看每个Span的耗时,定位最长耗时的组件。例如发现某个工具调用耗时过长,可进一步分析其输入输出,优化调用逻辑。
场景二:模型输出不符合预期——查看模型节点的Span详细信息,发现模型生成的参数名称与工具预期不一致,优化Prompt调整参数名称后调用成功。
场景三:Token消耗异常,成本飙升——调用链分析发现模型在多次对话中反复调用高成本的长文本生成服务,增加上下文判断逻辑避免重复生成,引入缓存机制。
场景四:智能体评测——通过观测功能收集特定场景下的Trace数据进行回流,构建评测集,通过评估结果识别高频问题。