译自英文

温度缩放是机器学习中的一种技术,用于调整模型输出概率分布的锐度,从而控制生成样本的随机性。它在大语言模型中广泛使用,以平衡创造性与连贯性。

温度缩放是机器学习深度学习中的一项基础技术,它在应用softmax函数之前,对神经网络的原始输出分数(logits)进行修改。通过将logits除以温度参数T,得到的概率分布会变得更尖锐(当T < 1时)或更平坦(当T > 1时)。这种调整直接影响生成模型中的采样随机性,使其成为生成式AI系统中的关键控制参数,尤其是在大语言模型中。

该概念源于统计力学,其中温度用于描述粒子系统的随机性,并在2010年代初期被引入神经网络领域。在实践中,温度缩放通常在推理阶段(而非训练阶段)应用,并且与其他校准方法有所不同,尽管它有时也用于校准目的。其主要用途是在确定性输出与多样性输出之间进行权衡。

机制与数学表述

在神经网络中,最后一层为每个类别或标记生成原始分数z_i。softmax函数将这些分数转换为概率:p_i = exp(z_i / T) / sum_j exp(z_j / T)。其中温度T是一个正标量。当T = 1时,softmax函数保持不变。当T < 1时,logits被放大,使得概率分布更加尖锐,模型输出更加确定和集中。当T > 1时,logits被缩小,使得分布更加平坦,输出更加多样和随机。

例如,在基于Transformer (architecture)的语言模型中,温度设为0.1时,对于相同的提示词,模型可能会产生几乎相同的输出;而温度设为1.5时,则会产生更多样化、有时甚至出人意料的响应。温度T的选择通常取决于具体任务:对于事实性问答,倾向于使用较低温度;对于创意写作或头脑风暴,则倾向于使用较高温度。

在大语言模型中的作用

大语言模型中,温度缩放是向用户公开的标准采样参数。像OpenAIAnthropicGoogle DeepMind这样的公司都在其API接口中提供了温度设置。例如,OpenAI的GPT-4 API允许温度值在0到2之间,默认值为0.7。Anthropic的Claude模型同样支持温度调整,Google的Gemini模型也提供了温度选项。

该技术应用于标记生成步骤中。在模型为下一个标记生成logits后,应用温度缩放,然后通过采样方法(如top-k或nucleus采样)选择最终标记。温度与这些采样策略相互作用:高温结合top-p采样可以产生多样且连贯的文本。

与模型校准的关系

温度缩放也是一种众所周知的校准技术。在分类任务中,模型的预测概率往往过于自信。通过在验证集上学习单一的温度参数(使用交叉熵损失),可以重新校准概率,使其更准确地反映真实准确率。这一应用由Guo等人(2017)在其论文《On Calibration of Modern Neural Networks》中推广。然而,在生成任务中,温度通常根据经验设定,而非通过学习获得。

实践指导与默认设置

实践者通常根据期望的输出特性来调整温度。对于代码生成或数学问题等任务,较低的温度(0.1-0.3)有助于减少错误。对于对话或创意写作,通常使用0.7-1.0左右的温度。一些系统采用动态温度调度,即在生成过程中动态调整温度(例如,开始时使用较高温度以增加多样性,接近结束时降低温度以提高连贯性)。

研究表明,最佳温度因模型大小和训练数据而异。例如,较小的模型可能需要较高的温度来避免重复输出,而较大的模型可以在较低温度下保持多样性,不会变得过于确定。

局限性与替代方案

温度缩放存在局限性。它不会改变模型的基础知识或推理能力,只影响采样的随机性。过高的温度可能导致输出无意义或产生幻觉,而过低的温度则可能导致输出重复或乏味。替代方案包括top-k采样、nucleus(top-p)采样和min-p采样,这些方法通过截断概率分布而非重塑分布来实现控制。这些方法通常与温度缩放结合使用。

另一个局限性是温度是一个全局参数,对所有标记统一应用,无法根据上下文进行自适应调整。一些较新的方法,如对比解码或典型采样,提供了更精细的控制,但尚未被广泛采用。

历史背景与采用情况

温度在神经网络中的应用可以追溯到1980年代的玻尔兹曼机,其中温度用于控制神经元激活的随机性。在现代深度学习中,该技术由Hinton等人(2015)的论文《Distilling the Knowledge in a Neural Network》推广,该论文在知识蒸馏中使用了温度。此后,温度缩放成为所有主流AI框架(包括TensorFlow、PyTorch和JAX)中的标准工具。

人工智能行业中,温度缩放已在推理引擎中广泛实现。例如,Amazon Web Services的Bedrock、Microsoft Azure的OpenAI服务和Google Cloud的Vertex AI都将温度作为公开参数。硬件供应商如NVIDIA(尽管未明确列出)和AMD也在优化其芯片以高效处理相关计算,尽管温度缩放本身的计算开销很小。

未来方向

随着生成式AI的发展,温度缩放仍然是一个简单而强大的工具。研究人员正在探索自适应温度方法,根据标记级别的置信度或任务难度动态调整温度。一些模型,如AI21 LabsInflection AI的模型,在其界面中集成了类似温度的控制功能。该技术在基于人类反馈的强化学习(RLHF)中也很重要,其中温度影响探索与利用的权衡。

总之,温度缩放是现代AI中一种多功能且必不可少的技术,能够对生成内容的创造性和确定性进行精细控制。其简单性和有效性确保了它在研究和生产系统中的持续应用。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·deep-learning·generative-ai·sampling
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史