自动评估与 LLM-as-Judge

进阶05-评测与迭代⏱ 30 分钟已审校
学习进度:

一句话定义

LLM-as-Judge 用另一个(或同一个)模型按明确的评分量表(Rubric)对输出打分或比对,把无法程序判定的"质量"变成可批量测量的分数——但 Judge 本身也是随机系统,必须校准。

为什么重要

评估集里最容易卡住的一步:50 条样本里 30 条能程序判定,剩下 20 条"回答是否专业、语气是否合适"人工判又贵又慢。LLM-as-Judge 让这类样本可以自动评分,评估才能规模化、才能进 CI。但直接"让 GPT 打个分"会得到不稳定的噪声——本知识点教的是把 Judge 当成一个需要提示工程与校准的下游系统来建设。

前置知识

直观类比

请一位阅卷官(Judge)帮你批作文:你得先给他评分细则(量表)和标准卷(校准集),试批几份和你的批改对答案(算一致率),合格才让他上岗——直接把一摞卷子丢给他"打个分",你会得到随机的分数。

图示

被评输出 ─┐
参考答案 ─┼→ Judge 提示(量表+证据要求+输出Schema)→ 结构化分数
量表      ┘        ↑ 校准集(人工判定样本)→ 一致率 ≥0.8 才启用
成对比较:顺序A-B 与 B-A 各跑一次,两次一致才计分(去位置偏差)

核心概念

  • 评分量表(Rubric):分维度的判定规则,每档有可观察的判据(如"事实准确性:3=全部依据资料;2=部分偏差;1=与资料矛盾")。
  • 成对比较(Pairwise):让 Judge 比较 A/B 两个输出哪个更好——比绝对打分稳定得多,适合版本对比。
  • 参考答案比对:给出黄金答案,Judge 判断输出与参考在要点上的覆盖/矛盾。
  • 位置偏差与自偏好:Judge 倾向偏好先出现的答案、或偏好自家模型的风格——用交换顺序、多次投票对冲。
  • 校准集:一小批已有人工判定的样本,用于测量 Judge 与人工的一致率(一致性 <80% 的 Judge 不可用)。

原理与机制

可靠的 Judge 系统由四个部件构成,缺一就是"掷骰子":

  1. 结构化量表进提示:逐维度打分 + 每档判据 + "引用原文证据再给分"的要求(强迫 Judge 先找证据防走神);输出结构化 JSON(结构化输出:JSON/YAML 与 Schema 约束)方便统计;
  2. 去偏机制:成对比较交换顺序跑两次、方向一致才计分;单输出评分固定温度取中位数;
  3. 校准:用人 judged 样本算一致率,低于阈值就修量表(通常问题出在判据含糊);
  4. 分离评估:评测用的 Judge 模型与被评系统尽量不同源,避免风格自偏好。

机制性提醒:Judge 评"格式对不对、要点全不全"很可靠,评"创造性、深度"很弱——量表设计要扬长避短,把主观维度拆成可观察判据("是否包含风险提示")而不是抽象形容词("是否优秀")。

公式或模型

Judge 校准的量化指标:人工判定集合 H(n 条),Judge 判定 J,一致率

agree(J, H) = |{i : J<sub>i</sub> = H<sub>i</sub>}| / n

工程阈值:agree ≥ 0.8 才可用于回归门禁;0.6~0.8 只做探索性参考;< 0.6 必须修量表。成对比较的一致性用"交换顺序后翻转率"衡量,翻转率 > 15% 说明判据不稳。

实例或案例

案例:客服回答质量的 Judge 上岗。 操作步骤:① 拆维度:事实依据(程序可判引用,转 回归测试:把提示当代码守护)、完整性、语气合规;② 完整性维度写量表(3 档,每档列可观察判据);③ 造 30 条校准集(人工判定);④ Judge 提示要求先摘录证据再给分,输出 {"维度":"完整性","证据":"…","分":2};⑤ 算一致率,0.82 通过上岗;⑥ 回归中自动跑全集并输出分数表。Judge 提示骨架:

你是评估员。根据以下量表给回答打分,先摘录回答中的证据,再给分。
量表「事实依据」:
3分=所有事实均可在<资料>中找到对应句子
2分=大部分有依据,1处无依据
1分=存在与资料矛盾的陈述
输出 JSON:{"证据":"摘录原文","分":1|2|3,"理由":"≤30字"}
禁止评资料中不存在的内容。

排错清单:

  • 症状:分数批次间大幅波动 → 温度过高或量表含糊;降温 + 判据可观察化;
  • 症状:总是给高分(都 3 分)→ 量表档距太小或 Judge 迎合;拉开档距、要求引用反例;
  • 症状:与人工一致率上不去 → 逐条看分歧样本,通常是判据有两个可解释口径,改写消歧。

常见误区

  • 无量表裸评:"你觉得这个回答好吗"得到的是风格偏好不是质量测量;
  • 不校准直接进 CI:Judge 噪声会随机卡住或放行版本,门禁失去公信力;
  • 让 Judge 评它评不了的东西:创造性、战略深度交给人工抽样,Judge 只管可观察判据。

自测题

  1. 为什么成对比较比绝对打分更稳?

答:比较任务只需相对判断,不受打分尺度漂移影响;配合交换顺序可消位置偏差。

  1. Judge 一致率 0.7,能进回归门禁吗?

答:不能——阈值 0.8,0.7 只做参考;先修量表(找分歧样本消歧)再上岗。

  1. 哪类维度不适合交给 Judge?

答:高度主观且无可观察判据的维度(创造性、深度),应人工抽样;可观察化后再自动评。

与其他知识点的关系

评估集构建:黄金样本与失败分类 的判定标准是量表的输入;回归测试:把提示当代码守护 用校准过的 Judge 做自动回归;Judge 的多次投票思路与 自洽性(Self-Consistency):用多次采样投票换稳定 同构;量表输出遵循 结构化输出:JSON/YAML 与 Schema 约束 的结构化纪律。

延伸阅读

  • 论文:Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena(Zheng et al., 2023)——Judge 偏差与可靠性的系统研究。

来源

  • Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena (Zheng et al.
  • 2023)