附录 D:Golden Dataset 与验收指标库
老板怎么用: 不先说清「什么叫做好了」就没法验收。你签验收前可要求团队用这份 Golden Dataset 和指标库给出量化门禁——没达标的项目不签字,避免凭「感觉不错」上线后出问题。
不先定义「什么叫准」,就没法验收。 EDD(评估驱动开发)要求在动手做之前先备好评估样本和指标。这份 Golden Dataset 既是 PoC 验收依据,也是后续每次迭代的回归门禁。
📎 技术深读:评测脚本、LLM-as-Judge 的工程实现,见 Harness Agent Book · 附录 D。本附录给 Agent 落地工程师视角的样本与指标模板。
Golden Dataset 四类样本
每类都要有,缺一类都会在上线后爆雷。
| 类型 | 作用 | 建议条数 |
|---|---|---|
| 典型样本 | 覆盖最常见的正常情况 | ≥ 20 |
| 边界样本 | 临界、模糊、易错的情况 | ≥ 10 |
| 失败样本 | 已知 AI 会答错的,用来防回退 | ≥ 10 |
| 高风险样本 | 答错代价大的(合规、金额、对外) | ≥ 5 |
样本拆分
不要把所有样本都放在一个池子里反复调。建议至少拆三份:
| 数据集 | 用途 | 建议 |
|---|---|---|
| 开发集 | 日常调 prompt、调规则 | 可频繁查看和修改 |
| 验收集 | PoC 验收时使用 | 少看少调,避免过拟合 |
| 回归门禁集 | 上线后每次改动必跑 | 高风险样本稳定保留 |
样本表模板
| # | 数据集 | 类型 | 输入 | 期望输出 / 判定标准 | 来源 | 标注人 | 备注 |
|---|---|---|---|---|---|---|---|
| 1 | 开发集 | 典型 | 真实业务 | ||||
| 2 | 验收集 | 边界 | |||||
| 3 | 回归门禁集 | 失败 | 复盘记录 | 防回退 | |||
| 4 | 回归门禁集 | 高风险 | 必须人审 |
验收指标库(按场景挑 3–5 个)
| 指标 | 定义 | 适用场景 |
|---|---|---|
| 准确率 | 判定正确的比例 | 分类 / 抽取 |
| 召回率 | 该命中的命中了多少 | 检索 / 风险预警 |
| 引用可信度 | 答案是否有可核对的出处 | 知识库问答 |
| 人工采纳率 | 人直接采用 AI 输出的比例 | 起草 / 推荐 |
| 节省时间 | 相比人工节省的工时 | 所有 |
| 风险预警命中率 | 真实风险被预警到的比例 | 舆情 / 合规 |
| 首响时间 | 从触发到出结果的时长 | 客服 / 工单 |
| 用户满意度 | 使用方主观评分 | 所有 |
| 成本 / 次 | 单次调用的 token / 算力成本 | 所有 |
| 延迟 | 从触发到输出的端到端耗时 | 所有 |
| 高风险漏报率 | 高风险样本漏掉的比例 | 合规 / 金额 / 对外 |
| 类别级准确率 | 每个类别单独计算准确率 | 分类 / 分流 |
类别级指标模板
| 类别 | 样本数 | 准确率 | 漏报率 | 验收线 | 判定 |
|---|---|---|---|---|---|
| 普通 | |||||
| 边界 | |||||
| 高风险 | 漏报 = 0 |
判定方式
| 方式 | 用在哪 | 注意 |
|---|---|---|
| 精确匹配 | 分类、抽取字段 | 最可靠 |
| 规则打分 | 格式、字段完整性 | 需先定义规则 |
| LLM-as-Judge | 回答质量、语气、引用一致性 | 高风险场景必须保留人工复核 |
| 人工评审 | 高风险、主观 | 抽样即可 |
本模板对应正文:第 22 章「什么叫做好了」、第 12 章(案例内的效果评估段)。