参考资料
术语表
AIDX 文档中平台对象、评估方法、证据和指标的定义。
当你不熟悉某个方法、指标或对象名称时,可以查阅本术语表。各方法专属页面仍是了解具体评估如何计算和解读结果的权威来源。
平台对象
- 工作区
- 用户配置待测目标、创建评估和访问结果的组织边界。
- 待测目标
- 接受行为评估的模型、聊天机器人或 AI 应用程序。
- 目标版本
- 针对待测目标声明的版本或配置边界。模型、提示词、检索、工具或护栏发生变化时,可能形成新的实际版本。
- 连接
- AIDX 用来向待测目标发送输入并接收响应的端点和请求设置。
- 评估
- 在声明的范围内,使用一个具名测试方法针对待测目标进行的一次配置化运行。
- 评估运行
- 处理测试用例、收集响应、评定结果并生成评估结果的执行实例。
- 报告
- 由评估范围、方法、汇总指标、发现和选定证据组成,可供审查的内容集合。
测试证据
- 测试用例
- 可独立评估的最小单元,通常包含一个输入或场景,以及待测目标响应和评估器结果。
- 数据集
- 用于配置和执行评估的一组已版本化测试用例或源材料。
- 提示词
- 发送给待测目标的一条输入消息或指令。在多轮评估中,一个测试用例可能包含多条提示词。
- 场景
- 用于测试超出单个孤立问题之外行为的真实上下文、用户意图或交互路径。
- 政策来源
- 转化为可测试对齐要求的内部政策、法规、标准或行为准则。
- 攻击方法
- 用于测试护栏能否被绕过的可重复转换方式或对抗性策略。
- 证据
- 支持结果的已记录输入、响应、评分、分类、解释和元数据。
- 失败用例
- 结果达到方法所定义的失败条件,或暴露出需要审查行为的测试用例。
评估方法
- BenchDX
- 在正常、真实使用场景下,针对主要 AI 风险类别进行的基准安全测试。
- RobustDX
- 针对越狱、提示词注入、编码、操纵及相关攻击进行的对抗性鲁棒性测试。
- HalluDX(即将推出)
- 规划中的幻觉测试评估,用于衡量事实可靠性、重复响应一致性和陈述层面的风险暴露。
- AlignDX(即将推出)
- 规划中的对齐测试评估,使用从政策生成的真实场景,通常包含多轮交互。
- 黑盒评估
- 根据可观察的输入和输出开展测试,无需访问模型权重或内部实现。
- 红队测试
- 有目的地进行对抗性测试,尝试让系统违反其护栏或预期边界。
- 基准安全性
- 系统在普通但可能存在风险的用户交互中表现出的安全程度,而不是在蓄意攻击下的表现。
指标与评分
- 测试用例评分
- 评估器对一个测试用例给出的结果。其量表和含义由评估方法定义。
- 平均分
- 纳入统计的测试用例评分的算术平均值。务必检查其中包含哪些测试用例、维度和排除项。
- 通过率
- 已评估测试用例中达到所定义通过条件的比例。
- 攻击成功率(ASR,通用术语)
- 一种通用对抗评估指标,表示攻击达到方法所定义的不安全或违反政策结果的比例。当前 RobustDX 指南以五分制鲁棒性评分为主要指标;除非结果页明确显示 ASR,否则不要将两者混用。
- 风险指数
- 在所定义量表上表达风险暴露程度的特定方法聚合指标。比较数值前请确认其方向。
- 维度
- 较宽泛的分析分组,例如安全领域、攻击类型、主题或政策领域。
- 类别
- 维度下更具体的分组,用于定位风险并确定其优先级。
- 阈值
- 用于判定通过或失败、风险等级或资格等级的已声明界线。
- 百分位
- 待测目标在指定比较群组中的相对位置。它不同于原始评分。
- DX-Score
- 在 DX-Score General 中,BenchDX 平均分和 RobustDX 平均分各自按五分制衡量,两者相加得到十分制综合评分。
范围与版本管理
- 受测范围
- 结果所适用的系统身份、版本、配置、接口、预期用途和部署边界。
- 方法版本
- 生成结果时所使用的评估方法和评分规则版本。
- 测试套件版本
- 标准化评估包所使用的已版本化测试用例和配置集合。
- Baseline 版本
- 用于排名或资格结果的固定比较群组和计算上下文。
- 可复现性
- 根据所保留的范围、版本、设置和证据理解或重复得到结果的程度。
- 重新测试
- 待测目标、数据集、方法或重要配置发生变化后执行的新评估。
DX-Score 证书术语
- DX-Score Certified
- 在相同 DX-Score General 方法和 Baseline 下,受测结果达到固定群组第 50 百分位或以上的资格等级。
- DX-Score Excellence
- 在相同 DX-Score General 方法和 Baseline 下,受测结果进入固定群组前 20% 的资格等级。
- 验证 ID
- 附在 DX-Score 证书记录上、用于公开验证的标识符。