迭代工作流:从失败样本到提示修订

进阶05-评测与迭代⏱ 25 分钟已审校
学习进度:

一句话定义

成熟的提示迭代是一个闭环:收集失败 → 归因分类 → 定向修复 → 评估验证 → 回归守护 → 发布观察——每一步都有工具与方法,而不是"改话术碰运气"。

为什么重要

前面所有知识点(技法、组织、评测)只有装进一个工作流才能持续产出价值。多数团队的提示迭代停在"看到 bad case → 凭感觉改 → 换个说法试试"的循环里,越改越乱。本知识点把 评估集构建:黄金样本与失败分类~回归测试:把提示当代码守护 的零件组装成一条可执行的生产线,并给出每个环节的常见跑偏与纠偏方法——这是全库的"总装车间"。

前置知识

直观类比

像维修车间的标准流程:故障车进来先上检测线(归因分类)而不是拿扳手乱敲;查明是电路就不修发动机(定向修复);修完全车复检(回归)再交车(发布),病历(失败样本)留档。

图示

失败收集 → 归因五分类 → 定向修复(一次一类)→ 目标样本验证
   ↑                                              ↓ 全集回归
观察线上 ← 发布 ← 绿灯 ← 失败样本回流(永久化)

核心概念

  • 失败收集:三个来源——评估集红灯、线上 bad case(人工标注/用户反馈/转人工记录)、回归复发。
  • 归因五分类:格式失稳 / 事实错误 / 推理跳步 / 越权或误拒 / 组织缺陷(信息放错位置或被淹没)——每类有默认修复路径。
  • 定向修复:一次只修一类(与 提示版本管理与 A/B 实验 一版一意图对齐),选对工具而不是加更多话术。
  • 验证与守护:修复后先跑目标样本,再跑全集回归,绿灯才可发布。
  • 收益盘点:按错误类别统计修复前后的分数变化,识别"投入产出比最高"的下一类问题。

原理与机制

迭代效率的分水岭在归因:同一个表面症状("答非所问")可能有完全不同的根因,用错工具就白费功夫。归因五分类与默认修复路径的映射:

分类典型症状默认修复路径
格式失稳解析失败、字段漂移三件套一致性 + 重试回路(输出格式控制三件套:指令、示例与结构/校验-重试回路:让输出自修复)
事实错误编造、引错资料资料准入与放置(信息放置策略:指令、知识、数据的排布/长文档组织:分块、裁剪与引用定位),而不是加"请别编"
推理跳步多条件判断出错CoT/分解(思维链(CoT):让推理显式化/任务分解与规划提示)
越权/误拒边界行为错误边界条款重写 + 双向样本(拒答、越权与边界控制)
组织缺陷规则失效、资料被忽略结构与排布调整(结构化上下文:分段、标签与命名/信息放置策略:指令、知识、数据的排布)

第二条机制:修复的边际收益递减。同一类问题反复修不动时,说明到了该换层的时候——话术层修不动换组织层,组织层修不动换架构层(拆任务、加工具、换模型),而不是在同一层无限加提示词。

公式或模型

本节不适用——迭代效率用"每类问题的修复转化率"(修后目标样本通过率提升)盘点,数据来自评估分数表。

实例或案例

案例:一轮完整的迭代。 症状:客服机器人把"发票丢了怎么补"答成了退款流程。操作步骤:① 归因:目标词"补发票"检索未命中发票资料,属于组织缺陷(资料没进来),不是话术问题;② 修复:资料库补发票条目 + 检索关键词扩充(检索侧)+ 证据区放置核对(信息放置策略:指令、知识、数据的排布);③ 验证:目标样本 5 条通过;④ 回归:全集红灯 0,发现一个边界样本从绿变红(误拒),追加一轮 拒答、越权与边界控制 修复;⑤ 发布 + 变更说明(提示版本管理与 A/B 实验);⑥ 失败样本永久入集。周会盘点模板:

本周修复:组织缺陷 ×2(补发票/补保修),事实错误 ×1(日期引错)
转化率:组织缺陷 5/6 → 保持优先投入
新发现问题:边界误拒率上升(疑似 R3 条款过宽)→ 下周主攻

排错清单:

  • 症状:修好一个坏三个 → 没跑全集回归就发布,或一次修了多类;
  • 症状:同类问题修了三遍还犯 → 修复没进"永久层"(只改了话术没改机制),升级到组织/架构层;
  • 症状:团队为"谁来定 bad case"吵架 → 归因五分类提供共同语言,按类别而非按人分派。

常见误区

  • 把迭代等同于改话术:五类问题里只有一类真正靠话术解决,其余各有对应工具;
  • 无归因直接改:改动无法归因、验证无的放矢,效率最低的循环;
  • 只修不盘:不按类别盘点收益,就不知道下一个主攻方向,迭代变成随机游走。

自测题

  1. "答非所问"直接去改话术,为什么常常无效?

答:它只是症状——根因可能是资料没进来(组织)、检索没命中、或推理跳步;归因分类决定正确的修复工具。

  1. 同类问题修三遍还复发说明什么?

答:修复停留在话术层而根因在机制层(组织/权限/架构);按边际收益递减原则升级修复层。

  1. 迭代闭环里"失败样本回流"起什么作用?

答:把每次失败永久转化为测试用例(进 回归测试:把提示当代码守护 套件),让修复可验证、复发可报警。

与其他知识点的关系

本条是 评估集构建:黄金样本与失败分类~回归测试:把提示当代码守护 的总装线;归因映射反向调用 02/03/04 模块的技法;架构层升级的判断与 任务分解与规划提示(拆任务)和跨站的模型选型话题衔接。

延伸阅读

  • 综述:The Prompt Report(Schulhoff et al., 2024)——提示优化的系统化方法。

来源

  • The Prompt Report: A Systematic Survey of Prompting Techniques (Schulhoff et al.
  • 2024)