核心概念
待测目标
固定待测目标的版本、参数和行为边界,再判断其接口是否适合使用无代码 Evaluation Trigger。
明确定义要测试的模型或应用程序,并在评估期间固定其版本和重要参数。具有简单 HTTP 请求与响应接口的待测目标通常可以通过无代码 Evaluation Trigger 连接。
待测目标类型
| 待测目标类型 | 测试内容 | Trigger 适用性 |
|---|---|---|
| 托管模型 | 固定的模型版本和服务配置 | 具有可调用的推理端点时适用 |
| 聊天机器人 | 聊天机器人后端、指令、检索和过滤器 | 其 API 能反映面向用户的实际行为时适用 |
| AI 应用程序 | 应用程序生成的最终响应 | 一次请求能够返回一条可评估响应时适用 |
固定待测目标版本和参数
记录可能改变待测目标响应的设置,并在整个运行期间保持这些设置不变。
| 固定项 | 需要记录 |
|---|---|
| 模型版本 | 提供商、模型 ID、检查点、微调版本或应用程序版本 |
| 系统配置 | 系统提示词、检索或知识库版本、护栏和过滤器 |
| 生成参数 | temperature、top_p、最大输出长度、seed 或同类设置 |
| 连接协议 | 目标 URL、请求结构、响应路径和会话行为 |
检查 Evaluation Trigger 兼容性
Evaluation Trigger 会将每条 AIDX 提示词发送给待测目标,并在不编写自定义集成脚本的情况下提取答案。
| Trigger 可用的条件 | 要求 |
|---|---|
| 待测目标可访问 | AIDX 能够使用支持的请求头调用其 HTTP 端点 |
| 请求可映射 | 提示词可以插入到结构稳定的请求体中 |
| 响应可映射 | 每次请求都能在稳定的 JSON 路径中返回答案文本 |