遇到需要多步推理的题,模型常沿着一条最先生成的路径继续往下走。自洽采样(Self-consistency)把这个过程改成:在同一道题、同一组条件下,独立生成多条有差异的推理路径,再把每条路径最后得到的答案放在一起比较,选择最常出现、最一致的答案。它是在生成阶段改变答案的选择方式,替代的是链式思维提示里的单一路径贪心解码。1
关键在“只比较最后的答案”。不同路径可以采用不同的拆解顺序或中间步骤,只要它们最后落到同一个可比较的答案,就形成了收敛信号。这个方法利用的前提是:复杂推理题可能有多条思路,却能指向同一个结果。论文在算术推理和常识推理任务上测试了这一解码策略。
它适合有明确答案、能够归一比较的任务,例如计算、选择题、规则推断和部分事实问答。使用时可以让模型先独立生成若干路径,再提取每条路径的最终答案,统一答案格式,最后统计共识。路径数量增加会带来更多调用和更高成本;答案本身无法归一、问题允许多个同样合理的解释,或者任务重视表达过程时,多数共识可能会压平有价值的差异。共识提供的是路径层面的稳定信号,关键事实仍需单独核验。
CALL · 直接粘贴
用「自洽采样」比较这个问题的多条推理路径。
模型接下来应先独立生成路径,再只比较最终答案,并说明答案是否收敛、哪些条件让路径产生分歧。


Comments