开始使用
运行首次评估
创建 BenchDX 评估,通过 Evaluation Trigger 连接待测模型,监控每个测试用例并查看已完成的结果。
本教程将按照当前 BenchDX 工作流,从创建评估一直讲到获得完整结果。教程使用 Evaluation Trigger,因此无需编写 API 集成代码,即可在平台内完成首次运行。
开始之前
创建评估前,请准备好以下内容:
| 准备内容 | 用途 |
|---|---|
| 已启用 BenchDX 的工作区 | LLM → BenchDX 菜单要求有效模块代码为 bench-dx,且成员拥有适当的访问权限。 |
| 足够的 BenchDX 点数 | 创建评估时,会从当前工作区扣除点数。 |
| 模型名称和版本 | 用于标识待测模型。你也可以在评估对话框中创建新的名称与版本。 |
| 可访问的待测模型 API | Evaluation Trigger 需要其 URL、必要请求头、请求格式,以及包含模型答案的 JSON 路径。 |
1. 创建基准评估
打开 LLM → BenchDX,然后完成以下创建流程:

选择 Create Evaluation
输入评估名称,使待测模型和测试目的便于日后识别。
选择模型
选择 Model Name 和 Model Version,也可以在同一对话框中创建。
选择基准来源
选择 Category和一个或多个风险分类;也可以选择 Standard 和一个或多个支持的评估标准。
继续进入 Cost Review
检查测试用例数量、单价、总费用、当前工作区余额和剩余余额。
选择 Confirm & Create
确认模型版本、基准来源和费用均正确后,再创建评估。
创建后,Request Tutorial会自动打开。在模型响应开始返回之前,评估将保持 Awaiting Trigger 状态。
2. 配置 Evaluation Trigger
打开新评估并选择 Evaluation Trigger。触发模板会告诉 AIDX 如何调用待测模型,以及从何处提取答案。

创建或选择触发模板
仅当已验证模板与当前待测目标 API 契约相同时,才复用该模板。
配置目标地址
输入待测模型 URL,并且只添加该端点要求的请求头。
映射请求
定义请求负载,并在需要插入每个 BenchDX 提示词的位置放置
{{prompt}}。例如,接收 query 字段的待测目标可使用{"query":"{{prompt}}"}。映射响应
按待测目标的响应结构进行映射,并在包含模型答案的 JSON 路径放置
{{response}}。按需测试并保存
运行模板测试,确认 AIDX 提取的是实际答案文本,而非空值或外层对象;若模板流程要求保存,再保存模板。
3. 发送评估请求
选择 Send Evaluation Requests 并确认。AIDX 会通过已保存的模板发送所有待处理的基准提示词,提取对应答案,并保留原始追踪信息用于评估。
4. 监控进度并处理错误
打开 Process Details,或使用 Progress 列中的眼睛按钮,查看各个测试用例。

| 测试用例状态 | 含义 |
|---|---|
Awaiting Trigger | 提示词尚未发送至待测模型。 |
Sent | 请求已发送至待测模型。 |
Responded | 已收到并记录模型响应。 |
Evaluated | 该测试用例的分析已完成。 |
Error | 无法处理请求或响应。 |
单条追踪记录的正常流程为 Awaiting Trigger → Sent → Responded → Evaluated。在评估层级,BenchDX 会依次进入 Awaiting Trigger、Processing、 Analyzing 和 Completed。
5. 查看 BenchDX 结果
当评估达到 Completed 状态后,选择其名称打开 BenchDX 仪表板。请按以下顺序查看结果:
Evaluation Summary
确认评估名称、类型、所选数据集、测试数量、创建日期、平均评分和评分中位数。
Conclusion and Suggestions
阅读系统生成的评估结论和后续行动建议。
Performance Radar and Test Distribution
比较各维度的平均评分,并检查测试用例的分布情况。
Model Version Comparison
如果已有另一版本的评估结果,请选择该版本,并与当前版本比较各维度评分。
Detailed Results and Score Definition
展开各维度,检查分类评分和评分分布,并使用页面显示的 1–5 分定义解读结果。