核心概念

评估生命周期

了解 AIDX 评估如何从明确的测试边界推进到可追溯的发现、报告和受控的版本比较。

AIDX 评估生命周期将一次性测试转化为可重复的证据流程。它把待测系统、观察到的行为、风险发现和报告连接起来,让团队能够依据结果采取行动,并衡量随时间发生的变化。

评估生命周期为何重要

可重复

一条完整的证据链

将测试设置、执行记录、发现和报告纳入一个结构化流程,而不是分散在不同脚本和风险记录中。

共享上下文

团队可以共同使用的证据

为业务、技术、安全和合规团队提供统一记录,用于审查、整改和审批决策。

可执行

不止一个评分

将汇总指标、风险维度、测试用例证据、结论和建议转化为团队可以采取行动的风险画像。

持续

从单次测试到持续比较

复用具有可比性的评估来验证整改、跟踪版本变化,并形成可重复的治理证据。

评估流程

  1. 定义范围

    确定风险问题、待测目标和版本边界。

  2. 配置评估

    选择评估方法和相关测试材料。

  3. 执行测试用例

    将每个测试输入发送给待测目标,并保留其追踪记录。

  4. 评估响应

    应用评估器,并为每个有效测试用例记录结果。

  5. 审查证据

    从汇总指标逐层查看影响该指标的测试用例。

  6. 创建报告并比较结果

    汇集证据、受测版本和局限性。

定义范围

范围决定评估可以支持哪些结论。先明确风险问题,再确定需要测试的具体系统行为。

待测目标
接受行为测试的模型、聊天机器人或应用程序。
版本边界
该结果所代表的模型版本和重要应用配置。
使用边界
证据需要代表的用户、任务、语言和场景。

配置评估

一项评估会把一个具名方法应用到一个已定义的待测目标和范围。应根据风险问题选择方法,而不是根据期望得到的评分来选择。

评估方法
定义待测行为、评估器、指标计算方式和解读规则。
测试材料
该方法所使用的选定数据集、提示词、攻击方式、类别或标准。
方法版本
标识评估器和评分规则,使结果可以正确复现和比较。

执行测试用例

每个测试用例都会向待测目标发送一个测试输入,并记录返回的响应。追踪记录从这里开始,在评估期间补充完整。

追踪记录
一个测试用例中相互关联的测试输入、目标响应、执行元数据、评估器结果和解释。
稳定执行
在一次运行中,目标版本、系统指令、检索、护栏和其他重要配置保持不变。

评估响应

特定方法的评估器会评估每条已记录的响应,并在其追踪记录中附加结果和解释。随后,可以将有效的测试用例结果聚合为指标。

测试用例结果
评估器对一条响应作出的结论,以及支持该结论的证据。
执行错误
超时、响应格式错误、评估器故障,或请求未到达待测目标、未产生可评估响应的情况。有效的安全拒绝属于测试用例结果,而不是执行错误。

审查证据

结果由测试用例结果及其聚合得到的特定方法指标组成。审查时,应从总体信号逐层深入到底层证据。

层级用途
汇总指标了解特定方法的总体信号
维度定位影响结果的主要领域
类别识别集中的行为问题或控制薄弱点
测试用例检查输入、响应、结果和解释

创建报告并比较结果

报告会汇集结果以及待测目标、方法、测试材料和评估器版本,并记录覆盖率、错误和局限性。这些信息决定两份报告是否可以比较。

只有当两份结果在范围、方法、测试材料、评估器、指标和执行条件方面兼容时,报告比较才有意义。

比较方式用途参照对象关键规则
比较自身版本跟踪同一待测目标不同版本之间的改进或退步该待测目标版本历史中上一份具有可比性的报告改变待测目标版本,同时保持评估条件不变
与 Baseline 比较将当前结果与预先选定的参照点进行比较固定且已批准的待测目标版本,或由方法定义的参照仅使用范围、方法版本和指标定义均兼容的 Baseline

也可以将上一份报告指定为 Baseline,但两种比较回答的问题不同:版本比较用于跟踪同一待测目标随时间发生的变化,而 Baseline 比较用于衡量当前结果与一个固定参照点之间的距离。