参考资料

术语表

AIDX 文档中平台对象、评估方法、证据和指标的定义。

当你不熟悉某个方法、指标或对象名称时,可以查阅本术语表。各方法专属页面仍是了解具体评估如何计算和解读结果的权威来源。

平台对象

工作区
用户配置待测目标、创建评估和访问结果的组织边界。
待测目标
接受行为评估的模型、聊天机器人或 AI 应用程序。
目标版本
针对待测目标声明的版本或配置边界。模型、提示词、检索、工具或护栏发生变化时,可能形成新的实际版本。
连接
AIDX 用来向待测目标发送输入并接收响应的端点和请求设置。
评估
在声明的范围内,使用一个具名测试方法针对待测目标进行的一次配置化运行。
评估运行
处理测试用例、收集响应、评定结果并生成评估结果的执行实例。
报告
由评估范围、方法、汇总指标、发现和选定证据组成,可供审查的内容集合。

测试证据

测试用例
可独立评估的最小单元,通常包含一个输入或场景,以及待测目标响应和评估器结果。
数据集
用于配置和执行评估的一组已版本化测试用例或源材料。
提示词
发送给待测目标的一条输入消息或指令。在多轮评估中,一个测试用例可能包含多条提示词。
场景
用于测试超出单个孤立问题之外行为的真实上下文、用户意图或交互路径。
政策来源
转化为可测试对齐要求的内部政策、法规、标准或行为准则。
攻击方法
用于测试护栏能否被绕过的可重复转换方式或对抗性策略。
证据
支持结果的已记录输入、响应、评分、分类、解释和元数据。
失败用例
结果达到方法所定义的失败条件,或暴露出需要审查行为的测试用例。

评估方法

BenchDX
在正常、真实使用场景下,针对主要 AI 风险类别进行的基准安全测试。
RobustDX
针对越狱、提示词注入、编码、操纵及相关攻击进行的对抗性鲁棒性测试。
HalluDX(即将推出)
规划中的幻觉测试评估,用于衡量事实可靠性、重复响应一致性和陈述层面的风险暴露。
AlignDX(即将推出)
规划中的对齐测试评估,使用从政策生成的真实场景,通常包含多轮交互。
黑盒评估
根据可观察的输入和输出开展测试,无需访问模型权重或内部实现。
红队测试
有目的地进行对抗性测试,尝试让系统违反其护栏或预期边界。
基准安全性
系统在普通但可能存在风险的用户交互中表现出的安全程度,而不是在蓄意攻击下的表现。

指标与评分

测试用例评分
评估器对一个测试用例给出的结果。其量表和含义由评估方法定义。
平均分
纳入统计的测试用例评分的算术平均值。务必检查其中包含哪些测试用例、维度和排除项。
通过率
已评估测试用例中达到所定义通过条件的比例。
攻击成功率(ASR,通用术语)
一种通用对抗评估指标,表示攻击达到方法所定义的不安全或违反政策结果的比例。当前 RobustDX 指南以五分制鲁棒性评分为主要指标;除非结果页明确显示 ASR,否则不要将两者混用。
风险指数
在所定义量表上表达风险暴露程度的特定方法聚合指标。比较数值前请确认其方向。
维度
较宽泛的分析分组,例如安全领域、攻击类型、主题或政策领域。
类别
维度下更具体的分组,用于定位风险并确定其优先级。
阈值
用于判定通过或失败、风险等级或资格等级的已声明界线。
百分位
待测目标在指定比较群组中的相对位置。它不同于原始评分。
DX-Score
在 DX-Score General 中,BenchDX 平均分和 RobustDX 平均分各自按五分制衡量,两者相加得到十分制综合评分。

范围与版本管理

受测范围
结果所适用的系统身份、版本、配置、接口、预期用途和部署边界。
方法版本
生成结果时所使用的评估方法和评分规则版本。
测试套件版本
标准化评估包所使用的已版本化测试用例和配置集合。
Baseline 版本
用于排名或资格结果的固定比较群组和计算上下文。
可复现性
根据所保留的范围、版本、设置和证据理解或重复得到结果的程度。
重新测试
待测目标、数据集、方法或重要配置发生变化后执行的新评估。

DX-Score 证书术语

DX-Score Certified
在相同 DX-Score General 方法和 Baseline 下,受测结果达到固定群组第 50 百分位或以上的资格等级。
DX-Score Excellence
在相同 DX-Score General 方法和 Baseline 下,受测结果进入固定群组前 20% 的资格等级。
验证 ID
附在 DX-Score 证书记录上、用于公开验证的标识符。