附录 D:Golden Dataset 与验收指标库

老板怎么用: 不先说清「什么叫做好了」就没法验收。你签验收前可要求团队用这份 Golden Dataset 和指标库给出量化门禁——没达标的项目不签字,避免凭「感觉不错」上线后出问题。

不先定义「什么叫准」,就没法验收。 EDD(评估驱动开发)要求在动手做之前先备好评估样本和指标。这份 Golden Dataset 既是 PoC 验收依据,也是后续每次迭代的回归门禁。

📎 技术深读:评测脚本、LLM-as-Judge 的工程实现,见 Harness Agent Book · 附录 D。本附录给 Agent 落地工程师视角的样本与指标模板

Golden Dataset 四类样本

每类都要有,缺一类都会在上线后爆雷。

类型作用建议条数
典型样本覆盖最常见的正常情况≥ 20
边界样本临界、模糊、易错的情况≥ 10
失败样本已知 AI 会答错的,用来防回退≥ 10
高风险样本答错代价大的(合规、金额、对外)≥ 5

样本拆分

不要把所有样本都放在一个池子里反复调。建议至少拆三份:

数据集用途建议
开发集日常调 prompt、调规则可频繁查看和修改
验收集PoC 验收时使用少看少调,避免过拟合
回归门禁集上线后每次改动必跑高风险样本稳定保留

样本表模板

#数据集类型输入期望输出 / 判定标准来源标注人备注
1开发集典型真实业务
2验收集边界
3回归门禁集失败复盘记录防回退
4回归门禁集高风险必须人审

验收指标库(按场景挑 3–5 个)

指标定义适用场景
准确率判定正确的比例分类 / 抽取
召回率该命中的命中了多少检索 / 风险预警
引用可信度答案是否有可核对的出处知识库问答
人工采纳率人直接采用 AI 输出的比例起草 / 推荐
节省时间相比人工节省的工时所有
风险预警命中率真实风险被预警到的比例舆情 / 合规
首响时间从触发到出结果的时长客服 / 工单
用户满意度使用方主观评分所有
成本 / 次单次调用的 token / 算力成本所有
延迟从触发到输出的端到端耗时所有
高风险漏报率高风险样本漏掉的比例合规 / 金额 / 对外
类别级准确率每个类别单独计算准确率分类 / 分流

类别级指标模板

类别样本数准确率漏报率验收线判定
普通
边界
高风险漏报 = 0

判定方式

方式用在哪注意
精确匹配分类、抽取字段最可靠
规则打分格式、字段完整性需先定义规则
LLM-as-Judge回答质量、语气、引用一致性高风险场景必须保留人工复核
人工评审高风险、主观抽样即可

本模板对应正文:第 22 章「什么叫做好了」、第 12 章(案例内的效果评估段)。