评估集构建:黄金样本与失败分类
一句话定义
评估集是一组带标准答案(黄金样本)与预期行为的测试输入,覆盖正常路径、边界与历史失败——它是把提示从"感觉变好了"变成"测量变好了"的测量仪器。
为什么重要
没有评估集的提示迭代是玄学调参:每次改动靠一两个例子验证,改好一处坏三处而不自知。评估集让每次修改有分数、有对比、有回归兜底,是 提示版本管理与 A/B 实验 版本对比、回归测试:把提示当代码守护 回归测试、迭代工作流:从失败样本到提示修订 迭代工作流共同的物质基础。可以不夸张地说:评估集的质量决定了一个团队提示工程能力的上限。
前置知识
- 模块 02-提示设计核心技法:知道自己在测什么行为;
- 采样参数与输出随机性:提示为何"时灵时不灵:评估必须固定采样参数、多次运行才有统计意义。
直观类比
评估集之于提示,就像体检套餐之于健康:没有套餐你只能"感觉最近挺好的";有了套餐,每次调整(作息/饮食/提示)前后都能对比指标,而且历史失败(既往病史)永远在套餐里占一栏。
图示
评估集(50条)
├─ 正例 30:主要意图 × 常见难度 → 指标:完成正确率
├─ 边界 10:该拒的/该追问的/资料没有的 → 指标:边界行为正确率
└─ 失败 10:线上真实错误 × 错误类别 → 指标:修复率(回归防复发)
每次提示变更:跑全集 → 分数表 + 按错误类别的失败明细核心概念
- 黄金样本(Golden Set):输入 + 标准答案/预期行为,人工标注、定期评审。
- 三类必备样本:正例(应正确完成)、边界样本(应拒答/应追问/应转人工)、失败样本(线上真实出错案例转化)。
- 分布覆盖:样本按意图类型/难度/长度分层,比例贴近真实流量而非想象。
- 错误分类法(Taxonomy):把失败归入固定类别(格式错/事实错/越权/拒答误伤/遗漏),类别决定改法(格式错→输出格式控制三件套:指令、示例与结构,事实错→资料或放置,越权→拒答、越权与边界控制)。
- 评分标准(Rubric):每类样本的判定规则,能程序判定的程序判定,不能的写清人工判定标准。
原理与机制
评估集的效度取决于样本是否来自真实失败模式而不是写提示的人的想象。构建的正确顺序:
- 从真实使用倒推:上线前用历史数据/同事模拟的 50~100 条真实请求;上线后持续把线上失败转化为样本;
- 先分类后加样本:把已知失败归入错误分类法,每类至少 3~5 条样本,保证每个类别可测量;
- 规模适中、质量优先:50 条高质量分层样本胜过 500 条随手拼凑;初始 30~50 条即可运转,随失败回流增长;
- 黄金样本也要防过拟合:样本集与提示互相适应会"背题",定期从新流量注入新样本替换陈旧样本。
公式或模型
版本对比的最小统计判据:在 N 条样本、固定参数下,版本 A 通过率 p<sub>A</sub>、版本 B 通过率 p<sub>B</sub>。经验工作规则:N≥30 时,差距 < 5 个百分点视为噪声级差异,需扩大样本或多轮重复再下结论;重要决策(换提示版本)要求差距 ≥ 10 个百分点或多轮方向一致。该规则不追求统计精确,作用是阻止"3 条样本定生死"。
实例或案例
案例:客服提示的首个评估集。 操作步骤:① 从历史工单抽 30 条真实提问,按意图分层(退款/账单/账户/闲聊);② 每条写预期行为(含应拒答的 8 条);③ 把最近 10 次人工接管的真实失败案例原样录入为失败样本;④ 每条标注判定方式(程序可判:是否调用了查询工具;需人工:回答是否引用了正确条款);⑤ 跑基线版本记录通过率作为基线分。样本条目格式:
{"id":"e-014","类型":"边界","意图":"投资建议",
"输入":"你觉得我该all in哪个板块","预期":"使用R3固定话术拒绝",
"判定":"程序:输出包含标准话术且未给出任何板块名"}排错清单:
- 症状:评估集分数高但线上反馈差 → 样本来自想象而非真实流量;重新从真实请求采样;
- 症状:提示对着样本集调分越来越高,线上没变化 → 过拟合"背题";注入新样本、轮换样本;
- 症状:失败样本改好后旧问题复发 → 缺回归机制,全部历史失败样本永久保留(回归测试:把提示当代码守护)。
常见误区
- 样本全是有把握的正例:没有边界与失败样本的评估集只能测"顺境",而故障都发生在逆境;
- 一次构建永不更新:真实流量在变,评估集是活文档;
- 人工判定标准含糊:"回答要好"不是标准;写得出判据的才进集,写不出先拆细。
自测题
- 三类必备样本分别防什么?
答:正例防"功能坏了",边界样本防"越权/误拒",失败样本防"旧错复发"——分别对应功能、边界、回归三重保障。
- 为什么失败样本要原样录入而不是改写成"干净版"?
答:真实失败输入常带噪声(错字、口语、多重问题),改写干净会失去对真实分布的代表性。
- N=30 时通过率从 80% 升到 83%,能下结论吗?
答:不能——差距小于 5 个百分点属噪声级,应扩大样本或多轮重复验证。
与其他知识点的关系
自动评估与 LLM-as-Judge 解决"没有标准答案的样本怎么自动评分";回归测试:把提示当代码守护 用全集做回归;迭代工作流:从失败样本到提示修订 把样本分数变成迭代路标;错误分类法直接映射到各技法的修复路径(输出格式控制三件套:指令、示例与结构/信息放置策略:指令、知识、数据的排布/拒答、越权与边界控制)。
延伸阅读
- 综述:The Prompt Report(Schulhoff et al., 2024)——评估方法学章节。
来源
- The Prompt Report: A Systematic Survey of Prompting Techniques (Schulhoff et al.
- 2024)