译自英文

推理是使用训练好的AI模型对新输入进行处理以产生输出的过程,与训练不同,其成本、延迟和硬件需求决定了AI产品如何大规模部署。

在人工智能中,推理是指将训练好的模型应用于新输入以产生输出的过程,与训练(即模型参数从数据中学习的早期阶段)相对。一个大型语言模型回答用户的问题、图像分类器标注照片,以及Diffusion model根据文本提示生成图像,都是在执行推理。一旦训练完成且模型的权重固定,该模型的每一次后续使用都是一次推理调用。

成本与硬件

推理的计算需求与训练不同。训练大型模型需要在多次遍历中处理海量数据集,通常需在由GPUTPU组成的大型集群上运行数周或数月。而推理则是持续运行的,常常服务于数百万个独立请求,其成本结构更取决于延迟(生成单个响应所需的时间)和吞吐量(单位硬件上系统能服务的请求数),而非单个任务消耗的总计算量。由于语言模型逐个生成文本标记,每个新标记都依赖于之前的所有标记,自回归模型的推理相对较慢,且受内存限制而非计算限制,这推动了与训练导向研究不同的专门推理工程浪潮。NVIDIA及其他芯片制造商已发布专门针对推理工作负载优化的硬件,云服务提供商也对推理和训练容量采用不同的定价方式。

优化技术

由于推理成本直接随使用量增长,它是优化的主要目标。Quantization降低模型权重的数值精度,减少内存使用量,并往往以略微的精度权衡来加速计算。知识蒸馏训练一个较小的模型来模仿较大的模型,从而产生一个在推理时运行成本更低的模型。Speculative decoding使用一个快速的小型草稿模型一次提出多个标记,再由较大的模型并行验证,从而减少生成长输出所需的慢速顺序步骤数。将多个用户的请求进行批处理、缓存先前计算出的中间结果(如注意力键值缓存),以及将较简单的查询路由到较小的模型,是降低大规模模型服务成本的额外常用技术。

测试时计算

推理传统上被视为相对于训练而言固定且轻量的一步,但推理模型的兴起(这类模型在回答前会生成扩展的内部推理)引入了一个新维度:在推理时投入更多计算量,这种方法被称为Test-time compute,可以显著提高难题输出质量。这模糊了旧有的假设,即只有训练时的计算量才影响能力,因为模型现在可以通过“思考更久”在给定问题上用推理成本换取准确性,这种权衡在早期模型(无论任务难度如何都产生固定数量输出)中并不以同样的方式存在。

经济学

由于广泛使用的AI产品持续提供推理请求服务,推理成本而非训练成本主导着已部署模型运行的长期经济性,且随着使用规模扩大,行业对AI基础设施支出的讨论日益聚焦于推理容量,同时继续投资Pretraining更大规模的模型。

分类:deep-learning·infrastructure·large-language-models
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史