自洽性是一种用于大型语言模型的解码策略,旨在提升多步推理任务的性能。该方法不通过单次贪婪或采样生成一个答案,而是针对同一提示生成多条独立的推理路径,然后通过对最终答案进行多数投票来汇总结果。这种方法利用了这样一种直觉:虽然单个推理链可能包含错误,但正确答案往往在多样化的采样路径中更一致地出现。
该技术由谷歌研究和斯坦福大学的研究人员于2022年提出,由王学智及其同事领导。它被设计为对思维链提示的一种简单、无需训练的增强方法,而思维链提示已表明,引导逐步推理能提升算术、常识和符号推理基准的性能。自洽性在此基础上,用多次采样取代单次贪婪解码路径,通常使用高于零的温度设置以鼓励多样性,然后选择在所有采样中出现频率最高的答案。
机制与实现
自洽性完全在推理时运行,无需修改模型的权重或架构。该过程包括三个步骤:首先,用问题提示模型,并指示其逐步推理;其次,以非零温度对模型进行多次采样(通常为5到40次),产生多样化的推理链;第三,将每条链的最终答案分组,并选择最常见的答案作为最终输出。聚合步骤可以简单到多数投票,也可以根据模型的置信度或推理路径长度使用加权投票。
该方法在与思维链提示结合时尤为有效,但也可应用于标准提示。在实践中,采样次数是一个关键超参数:更多采样通常能提高准确性,但会增加计算成本。研究表明,对于许多任务,超过约40次采样后收益递减,尽管最优值因问题类型和模型规模而异。
性能提升
实证评估表明,自洽性在多个基准上显著提升了准确性。在GSM8K数据集(小学算术应用题)上,该方法将单次思维链采样的准确性从约56%提升至使用40次采样的自洽性下的超过74%,应用于540B参数模型时。类似增益在SVAMP数据集(从约79%提升至84%)和AQuA数据集(代数应用题,从约39%提升至55%)上也有观察到。
对于常识推理任务,如CommonsenseQA和StrategyQA基准,自洽性也提供了持续改进,尽管相对增益小于算术问题。该方法已被证明适用于不同规模的模型,从约100B参数范围的较小模型到前沿模型,并且它现在是许多生产系统中的标准测试时技术。
与其他解码方法的比较
自洽性不同于其他基于采样的方法,如束搜索或top-k采样,因为它显式地聚合多条完整的推理路径,而不是选择单个高概率序列。与温度缩放不同,后者控制随机性但仍产生一个输出,自洽性使用温度生成多样性,然后通过投票解决。它也区别于基于RLHF的方法,因为它不需要额外训练或奖励模型。
该技术与基于验证器的方法互补,后者使用单独模型对候选答案评分。一些系统将自洽性与学习验证器结合以加权投票,尽管原始方法使用未加权的多数投票。与探索固定部分序列集的束搜索相比,自洽性探索完整的独立轨迹,使其对推理中的局部错误更鲁棒。
应用与用例
自洽性已在人工智能研究和工业界广泛采用。它在推理准确性至关重要的领域尤其有价值,如数学问题求解、代码生成和医学问答。在大型语言模型API中,开发者通常将自洽性实现为后处理步骤,在返回响应前采样多个补全并聚合结果。
该技术也已扩展到推理之外的其他任务,包括事实验证和开放域问答。在这些设置中,多数投票有助于过滤幻觉或不一致的答案。一些生成式AI产品在内部使用自洽性以提高可靠性,尽管额外推理成本可能显著,尤其是对于大型模型。
局限性与考虑
自洽性的主要缺点是计算成本。生成多个采样会成倍增加推理时间和令牌使用量,这对于实时应用或使用非常大的模型时可能难以承受。研究人员已探索减少这种开销的方法,例如在出现自信多数时提前停止的自适应采样,或使用较小模型进行初始采样、较大模型进行验证。
另一个局限性是自洽性不保证正确性。如果模型对错误答案存在系统性偏差,多数投票将强化该错误。该方法还假设正确答案是最常见的,这对于有许多合理答案或提示模糊的任务可能不成立。此外,自洽性要求模型产生可解析的最终答案,这对于自由形式生成任务可能具有挑战性。
与其他测试时技术的关系
自洽性是更广泛的测试时计算方法家族的一部分,这些方法在不重新训练的情况下提升模型性能。它与束搜索和核采样密切相关,但独特地侧重于答案聚合。该技术可与提示工程策略(如少样本提示和思维链)结合,并常与温度调优一起使用以平衡多样性和连贯性。
近期研究探索了更复杂的聚合方法,如按相似性聚类推理路径或使用模型自身的置信度分数加权投票。一些方法通过将多数答案反馈给模型进行进一步推理来迭代细化答案。这些扩展旨在提高准确性和效率,尽管原始多数投票公式仍是最广泛使用的。
对人工智能研究与实践的影响
自推出以来,自洽性已成为推理基准中的标准基线,并在机器学习文献中频繁被引用。它表明,仅通过解码策略即可实现显著的性能提升,将部分研究焦点从模型架构转向推理时计算。该技术影响了后续关于测试时训练和自适应计算的研究,并且它现在是OpenAI和Google DeepMind研究论文及生产系统中的常见组件。
该方法还强调了采样多样性的重要性,导致进一步研究温度、采样策略和提示变化如何影响推理质量。随着大型语言模型持续扩展,自洽性仍然是提升复杂任务准确性的实用工具,尤其是在计算预算允许多次采样的环境中。
未来方向
正在进行的研究旨在使自洽性更高效和鲁棒。一个方向是学习预测自洽性何时有帮助,使系统能选择性地仅对困难问题应用。另一个是开发更好的聚合函数,考虑答案置信度和推理路径质量。还有兴趣将自洽性应用于多模态模型和涉及长形式生成的任务,其中多数投票不太直接。
截至2020年代中期,自洽性仍是一个活跃研究领域,新变体定期出现。其简单性和有效性使其成为AI从业者工具包中的常用工具,并且随着模型和推理技术的发展,它可能继续保持相关性。