返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

智能体评估评测集

智能体上线前如何量化它的能力?修改了一句Prompt后,智能体变聪明了还是变笨了?华为云AgentArts的评估体系给出了答案——评测集提供“考卷”,评估器扮演“阅卷官”,评估任务组织“模拟考试”。本文从评测集构建、评估器选择到评估任务执行,完整拆解智能体评估的三大核心要素。

评估体系全景——三大核心要素

AgentArts的评估功能由三个核心要素构成。评测集——用于评估的数据集,通常包含输入数据(input)和预期输出(reference_output)。评估对象——被评估的目标,可以是一个智能体,也可以是评测集中的数据本身。评估器——定义评估的维度和评分标准,负责自动打分。

两种评估模式

离线评估在应用正式发布前通过预设场景评估响应。支持两种模式:评估智能体——让智能体现场作答,然后评估其回答与参考答案之间的差异;评估评测集——不运行智能体,直接对评测集中的数据用AI评判质量。在线评估应用上线后基于Trace数据设置自动化任务,自动采样、获取输入输出并进行评分。

评测集构建——三种方式覆盖不同场景

人工创建

支持单轮对话和多轮对话两种类型。单评测集最多支持5000条数据、50个配置列。数据类型支持String、Integer、Float、Boolean。手动添加适用于少量临时性测试数据,批量导入支持csv、xlsx、jsonl格式文件。

AI智能合成

智能合成功能通过大模型技术对原始种子样本进行语义理解、风格迁移和场景扩展。适用场景包括:生产环境数据扩容与衍生、样本缺口弥补、合成对抗测试样本、安全合规与红线探测。平台赠送1次智能合成任务额度,合成样本数范围1-500条。

Trace数据回流

将应用上线后在真实场景下产生的Trace数据进行回流与标注,沉淀到数据集中。单次回流最多选择200条数据。支持回流trace_id、span_id、input、output等字段,将“线上实战”转化为“数据资产”。

评估器体系——40+预置评估器的能力图谱

评估器分为预置评估器和自定义评估器两大类。

预置评估器分类

根据判定原理分为模型判定(依托大模型作为裁判)和代码判定(通过确定性代码逻辑进行二元判断)。覆盖以下评估维度:

输出质量类:正确性、AI味检查、任务完成度、创意性、文本可用性、简洁性、细节丰富度。安全与合规类:不敏感性、争议性、性别歧视、恶意性、安全风险漏放、有害性、犯罪性、拒答检测、指令遵从度。幻觉与准确类:幻觉现象、引用相关性、知识问答-真实准确。工具与轨迹类:轨迹质量、工具参数正确性、工具选择质量、轨迹-工具参数填充正确性。多轮对话类:轮次相关性、知识保持、对话完整性、主题遵从、角色遵从。

自定义评估器

支持三种创建方式:模型判定——编写Prompt定义评估标准;自适应判定——输入自然语言规则,系统自动转化为评估步骤;代码判定——编写可执行代码函数进行程序化比对。

评估任务执行与结果分析

离线评估任务创建

选择“任务类型”为“离线评估”,配置评估对象(智能体或评测集)、选择评测集、选择评估器并进行字段映射(确保input映射至input、actual_output映射至actual_output)。支持“立即执行”和“稍后执行”两种执行类型。

在线评估任务创建

选择“任务类型”为“在线评估”,配置评估对象、评估粒度(调用链/模型/Root Span/工具)、采样策略(采样比例、采样总数上限1-500、时间范围回流新数据/回流历史数据、重复频率天/周/不重复)。

评估结果对比

对比功能采用控制变量实验思路,支持最多5个评估任务进行对比(基于同一评测集、状态为成功或部分成功)。对比报告包含总览(综合得分、雷达图)、评估器指标(柱状图)、评估器运行时指标(耗时和Tokens消耗)。通过数据明细对比可深入分析特定数据项在不同评估任务中的表现。
点击阅读报告原文: 华为云:2026智能体平台 AgentArts 智能体运营运维报告(245页)
相关报告