译自英文

采样温度是一个参数,通过重新缩放生成模型采样所依据的概率分布来控制其输出的随机性,低值产生更可预测的文本,高值产生更多样化的文本。

采样温度是在从概率模型生成文本或其他内容时使用的一个参数,它通过重新缩放模型在抽取下一个值之前用于采样下一个token的概率分布,来控制输出的随机性或者确定性。它是大型语言模型及其他自回归模型的API和接口中最常暴露的设置之一。

工作原理

自回归语言模型在每一步都会生成一个关于可能的下一个token的概率分布,通常通过对模型的原始输出分数(即logits)施加softmax函数来计算。这个过程发生在推理阶段,即模型的权重已经通过训练固定之后。温度通过将logits除以一个温度值后再进行softmax步骤来应用。温度为1.0时,分布保持不变,与模型计算的结果相同。温度低于1.0会锐化分布,使最可能的token更可能被选中,并减少低概率token出现的几率;当温度趋近于0时,近似于总是从最高概率的token中选择一个,有时称为贪婪解码。温度高于1.0则会使分布变得平坦,使低概率token有相对更好的被选择机会,这增加了输出的多样性和不可预测性,但也可能增加幻觉的风险,因为通过采样更可能选择虽然概率较低但不正确的token。

其他采样控制的关系

温度通常与其他解码控制方法结合使用而不是单独使用。使用top-p采样(也称为核采样)可以将模型的抽样限制在累计概率超过阈值p的最小token集合内,这可以防止温度调高时偶尔选择到极不可能的token。Top-k采样则类似地将抽样限制在前k个最可能的token。这些设置相互作用:高温配合宽松的top-p或top-k限制可能产生不连贯的文本,而温度接近或等于零配合严格限制则会产生高度重复的确定性输出,这在代码生成或数据提取等任务中有时是受欢迎的,因为这类任务更倾向于一个单一、一致的答案,而不是创意变化。

实际应用

低或零温度设置通常用于需要一致性和正确性的任务,例如事实性问题回答、结构化数据提取、数学计算和代码生成,在这些任务中,措辞变化不重要且可能引入错误。生成冗长中间推理链的推理模型通常以低温运行,以保持该过程的稳定性。较高温度用于以多样性优势的任务,例如头脑风暴、创意写作、用于聊天机器人或游戏角色的对话,以及一些Text-to-image generation生成的应用场景,其中从同一输入产生多个不同结果可能是有用的。由于温度直接在可预测性与多样性之间进行权衡,它常常是Prompt工程指导中的一个话题,并且评估套件和基准测试通常将温度设置为零或接近零,以便运行之间保持结果可复现。温度不会影响模型的内在知识或推理能力;它仅改变模型在其训练已经使其具有可行性的输出之间进行选择的方式,这就是为什么提高温度可以产生更多样化的答案,但不一定更准确的答案的原因。

分类:large-language-models·natural-language-processing
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史