核心概念
评估生命周期
了解 AIDX 评估如何从明确的测试边界推进到可追溯的发现、报告和受控的版本比较。
AIDX 评估生命周期将一次性测试转化为可重复的证据流程。它把待测系统、观察到的行为、风险发现和报告连接起来,让团队能够依据结果采取行动,并衡量随时间发生的变化。
评估生命周期为何重要
一条完整的证据链
将测试设置、执行记录、发现和报告纳入一个结构化流程,而不是分散在不同脚本和风险记录中。
团队可以共同使用的证据
为业务、技术、安全和合规团队提供统一记录,用于审查、整改和审批决策。
不止一个评分
将汇总指标、风险维度、测试用例证据、结论和建议转化为团队可以采取行动的风险画像。
从单次测试到持续比较
复用具有可比性的评估来验证整改、跟踪版本变化,并形成可重复的治理证据。
评估流程
定义范围
确定风险问题、待测目标和版本边界。
配置评估
选择评估方法和相关测试材料。
执行测试用例
将每个测试输入发送给待测目标,并保留其追踪记录。
评估响应
应用评估器,并为每个有效测试用例记录结果。
审查证据
从汇总指标逐层查看影响该指标的测试用例。
创建报告并比较结果
汇集证据、受测版本和局限性。
定义范围
范围决定评估可以支持哪些结论。先明确风险问题,再确定需要测试的具体系统行为。
- 待测目标
- 接受行为测试的模型、聊天机器人或应用程序。
- 版本边界
- 该结果所代表的模型版本和重要应用配置。
- 使用边界
- 证据需要代表的用户、任务、语言和场景。
配置评估
一项评估会把一个具名方法应用到一个已定义的待测目标和范围。应根据风险问题选择方法,而不是根据期望得到的评分来选择。
- 评估方法
- 定义待测行为、评估器、指标计算方式和解读规则。
- 测试材料
- 该方法所使用的选定数据集、提示词、攻击方式、类别或标准。
- 方法版本
- 标识评估器和评分规则,使结果可以正确复现和比较。
执行测试用例
每个测试用例都会向待测目标发送一个测试输入,并记录返回的响应。追踪记录从这里开始,在评估期间补充完整。
- 追踪记录
- 一个测试用例中相互关联的测试输入、目标响应、执行元数据、评估器结果和解释。
- 稳定执行
- 在一次运行中,目标版本、系统指令、检索、护栏和其他重要配置保持不变。
评估响应
特定方法的评估器会评估每条已记录的响应,并在其追踪记录中附加结果和解释。随后,可以将有效的测试用例结果聚合为指标。
- 测试用例结果
- 评估器对一条响应作出的结论,以及支持该结论的证据。
- 执行错误
- 超时、响应格式错误、评估器故障,或请求未到达待测目标、未产生可评估响应的情况。有效的安全拒绝属于测试用例结果,而不是执行错误。
审查证据
结果由测试用例结果及其聚合得到的特定方法指标组成。审查时,应从总体信号逐层深入到底层证据。
| 层级 | 用途 |
|---|---|
| 汇总指标 | 了解特定方法的总体信号 |
| 维度 | 定位影响结果的主要领域 |
| 类别 | 识别集中的行为问题或控制薄弱点 |
| 测试用例 | 检查输入、响应、结果和解释 |
创建报告并比较结果
报告会汇集结果以及待测目标、方法、测试材料和评估器版本,并记录覆盖率、错误和局限性。这些信息决定两份报告是否可以比较。
只有当两份结果在范围、方法、测试材料、评估器、指标和执行条件方面兼容时,报告比较才有意义。
| 比较方式 | 用途 | 参照对象 | 关键规则 |
|---|---|---|---|
| 比较自身版本 | 跟踪同一待测目标不同版本之间的改进或退步 | 该待测目标版本历史中上一份具有可比性的报告 | 改变待测目标版本,同时保持评估条件不变 |
| 与 Baseline 比较 | 将当前结果与预先选定的参照点进行比较 | 固定且已批准的待测目标版本,或由方法定义的参照 | 仅使用范围、方法版本和指标定义均兼容的 Baseline |
也可以将上一份报告指定为 Baseline,但两种比较回答的问题不同:版本比较用于跟踪同一待测目标随时间发生的变化,而 Baseline 比较用于衡量当前结果与一个固定参照点之间的距离。