自洽性(Self-Consistency):用多次采样投票换稳定
一句话定义
自洽性(Self-Consistency)对同一问题用温度 > 0 采样多条推理路径,对最终答案做多数投票,用"共识"替代"单次豪赌"来提升正确率。
为什么重要
它是把 采样参数与输出随机性:提示为何"时灵时不灵 的随机性从敌人变成资源的第一个技法:单条思维链会随机出错,但"多条独立推理得出同一答案"的概率结构使得正确答案更可能胜出。在正确率比成本重要的场景(评测基准、高风险判定、数据标注质量抽检),这是不训练模型就能拿到的最实惠提升。同时你必须会算它的成本账——它不便宜。
前置知识
- 思维链(CoT):让推理显式化:投票对象是各条 CoT 的最终答案;
- 采样参数与输出随机性:提示为何"时灵时不灵:温度参数决定路径多样性——温度 0 下自洽性退化为无意义(N 条相同输出)。
直观类比
面对一道争议题,问一个专家可能翻车,独立问五位专家取多数意见翻车概率小得多——前提是他们独立思考(温度带来路径差异)而不是互相通气(路径同质)。
图示
┌─ 路径1 → 推理 → 答案:B ┐
同一问题 ──┼─ 路径2 → 推理 → 答案:B ├→ 投票:B×3,A×1 → 输出 B(置信 0.75)
(温度0.7) └─ 路径3 → 推理 → 答案:B ┘ (×n 条并行)核心概念
- 采样宽度(n):同题生成的路径条数,常见 3~10。
- 答案抽取:从每条推理链的答案区提取规范化答案(如"42"、"正面"),投票前必须归一化("42 元"与"42.0 元"算同一答案)。
- 多数投票(Majority Vote):取出现次数最多的答案;平票时可用置信度或首轮答案打破。
- 一致性作为置信度:最高票占比本身是有用的置信信号——占比低说明问题对模型困难,可路由到人工或改写重试。
原理与机制
为什么投票有效:单条路径出错是随机的、路径间相关性低的错误在投票中被稀释;正确路径的答案往往彼此一致。论文在算术与常识推理基准上获得大幅提升。工程推论:
- 多样性是前提:温度过低 → 路径同质 → 投票无效;温度过高 → 路径全错 → 投票选出的也是错的,存在最优温度带(常用 0.5~0.8,需实测);
- 只对"答案可枚举/可归一"的任务投票:分类、选择、数值答案适合;开放式生成(文案)没有票可投;
- 成本线性放大:n 条路径 ≈ n 倍 token 成本与延迟,因此生产上常组合使用——低风险请求走单路,高风险请求才升级为 n 路投票(级联策略)。
公式或模型
设 n 条路径各自的规范化答案为 a<sub>1</sub>, …, a<sub>n</sub>,候选答案集合 A,输出
answer = argmax<sub>a∈A</sub> |{ i : a<sub>i</sub> = a }|
置信度 = 最高票数 / n。工程规则:置信度 < 阈值(如 0.5)时拒绝输出并转人工/重试——投票不仅给答案,还给了"该不该信"的度量。
实例或案例
案例:工单自动分级的置信度路由。 任务:把工单分为 P0~P3 四级,分错 P0 的代价极高。操作步骤:① 普通工单走单路(温度 0)保成本;② 模型输出"涉及资金/安全"关键词的工单升级为 n=5、温度 0.7 的自洽性投票;③ 置信度 = 最高票/5;④ 置信度 ≥ 0.8 自动采纳,0.5~0.8 转二次复核,< 0.5 直接人工。结果:高准确率与可控成本的折中。投票提示骨架(循环调用实现):
{同一 CoT 提示,固定不变}
调用 n=5 次(temperature=0.7)
从每次输出的「答案:X」行抽取 X,归一化后计数
输出最高票;同时输出(最高票数/5)作为置信度排错清单:
- 症状:投票结果与单路差不多 → 检查温度是否太低导致路径同质;
- 症状:票数分散、置信度常年低 → 任务本身歧义大,先改提示或补示例(回到 零样本、少样本与示例工程)而不是加宽 n;
- 症状:答案归一化把不同答案误并 → 抽取规则写进代码并加测试,不要让字符串比较决定投票。
常见误区
- 在温度 0 下做自洽性:N 条完全相同的输出,投票毫无意义,白花 n 倍钱;
- 对开放式生成投票:文案、摘要没有规范答案空间,硬投票只会选出"最平庸"的版本;
- 把置信度当准确率:一致性高只说明模型自洽,不代表正确(模型可能一致地错)——高风险场景仍需抽验校准。
自测题
- 为什么自洽性要求温度 > 0?
答:需要路径间多样性,温度 0 采样出的路径相同,投票退化为单次输出。
- n=5、最高票 3,置信度多少?决策是什么?
答:0.6;按预设阈值路由(如需 ≥0.8 则转复核),不能只取答案不看置信度。
- 为什么"一致地错"是可能的,如何发现?
答:若提示或示例引导了系统性偏差,所有路径会共享偏差;用带标准答案的小评估集抽验校准。
与其他知识点的关系
采样参数与输出随机性:提示为何"时灵时不灵 提供参数基础;自动评估与 LLM-as-Judge 的 LLM-as-Judge 是另一种"用多视角换可靠"的评估侧兄弟方法;级联路由的成本思想与 上下文窗口与注意力预算 预算原则同源。
延伸阅读
- 论文:Self-Consistency Improves Chain of Thought Reasoning in Language Models(Wang et al., 2022)。
来源
- Self-Consistency Improves Chain of Thought Reasoning in Language Models (Wang et al.
- 2022)