译自英文

上下文窗口是语言模型在生成回复时一次能够处理的最大文本量,以令牌(token)为单位计量,涵盖提示词及其自身输出。

上下文窗口是语言模型一次能够考虑的最大文本量,以词元为单位衡量,涵盖用户提供的提示、任何系统指令、检索到的文档以及模型自身到目前为止的输出。它充当模型的工作记忆:在生成时,上下文窗口之外的信息对模型不可见,除非明确重新提供这些信息。

技术基础

上下文窗口的大小受注意力机制的限制,该机制是Transformer (architecture)架构的核心,用于计算输入中每对词元之间的关系。由于在标准公式中,这种计算随序列长度呈二次方扩展,因此将上下文窗口加倍大约会使处理所需的计算量和内存增加四倍,这历史上使得长上下文窗口的部署成本高昂。后来的工程技术,包括稀疏和窗口化注意力变体、键值缓存压缩以及专门的存储管理,降低了这一成本,使得更大的窗口在商业上变得可行。

随时间的发展

早期的基于transformer的语言模型仅支持几百到几千个词元;GPT-3于2020年由OpenAI发布,支持大约2,048个词元。在接下来的几年中,上下文窗口稳步扩大:GPT-4于2023年推出,其变体支持多达32,000个词元,到2024年,多家实验室提供了数十万个词元的上下文窗口。Gemini来自Google DeepMind,因支持一百万个或更多词元的上下文窗口而闻名,足以在单个提示中处理整部小说、大型代码库或数小时的视频转录。Claude (AI model family)模型来自Anthropic,同样从最初的9,000词元窗口扩展到后续版本中数十万个词元的上下文长度。

权衡与长上下文限制

更大的上下文窗口并不能保证模型能充分利用它。关于长上下文性能的研究反复发现一种“迷失在中间”效应,即模型在检索位于长上下文开头或结尾附近的信息时比检索埋在中间的信息更准确,即使架构中没有正式赋予这些位置任何特权。长上下文“大海捞针”测试,其中将特定事实隐藏在大量无关文本中,成为衡量模型有效上下文是否匹配其宣传最大值的标准方法。服务非常长的上下文在计算上也很昂贵,因此系统通常面临实际选择:要么将大量原始文本塞入上下文窗口,要么使用Retrieval-augmented generation仅选择最相关的段落,以完整性换取成本,并在原则上换取准确性。

与推理的关系

上下文窗口也限制了诸如Chain-of-thought提示和推理模型等技术,这些技术在生成最终答案之前会产生大量中间文本;一个进行长时间推理的模型会消耗自身上下文窗口的一部分用于该推理,这是随着这些技术变得普遍,更长上下文窗口变得更加重要的原因之一。

分类:large-language-models·transformers·deep-learning
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史