Traduzido do inglês

A janela de contexto é a quantidade máxima de texto, medida em tokens, que um modelo de linguagem pode processar de uma só vez ao gerar uma resposta, abrangendo tanto o prompt quanto a sua própria saída.

A janela de contexto é a quantidade máxima de texto, medida em tokens, que um modelo de linguagem pode levar em consideração de uma só vez, abrangendo o prompt fornecido por um usuário, quaisquer instruções do sistema, documentos recuperados e a própria saída do modelo até o momento. Ela funciona como a memória de trabalho do modelo: informações fora da janela de contexto são invisíveis para o modelo no momento da geração, a menos que sejam explicitamente fornecidas novamente.

Base técnica

O tamanho da janela de contexto é limitado pelo mecanismo de atenção no núcleo da arquitetura Transformer (architecture), que calcula relações entre cada par de tokens na entrada. Como esse cálculo escala quadraticamente com o comprimento da sequência na formulação padrão, dobrar a janela de contexto aproximadamente quadruplica o poder computacional e a memória necessários para processá-la, o que historicamente tornou janelas de contexto longas caras de servir. Técnicas de engenharia posteriores, incluindo variantes de atenção esparsa e em janela, compressão de cache de chave-valor e gerenciamento de memória especializado, reduziram esse custo o suficiente para tornar janelas muito maiores comercialmente práticas.

Crescimento ao longo do tempo

Os primeiros modelos de linguagem baseados em transformer suportavam apenas algumas centenas a alguns milhares de tokens; o GPT-3, lançado pela OpenAI em 2020, suportava aproximadamente 2.048 tokens. As janelas de contexto expandiram-se de forma constante nos anos seguintes: o GPT-4 foi lançado em 2023 com variantes que suportavam até 32.000 tokens, e em 2024 vários laboratórios ofereciam janelas de contexto na casa das centenas de milhares de tokens. O Gemini, do Google DeepMind, tornou-se notável por suportar janelas de contexto de um milhão de tokens ou mais, o suficiente para processar um romance inteiro, uma grande base de código ou horas de transcrição de vídeo em um único prompt. Os modelos Claude (AI model family), da Anthropic, também expandiram de uma janela inicial de 9.000 tokens para comprimentos de contexto na casa das centenas de milhares de tokens em lançamentos subsequentes.

Compensações e limitações de contexto longo

Uma janela de contexto maior não garante que um modelo a use bem por completo. Pesquisas sobre desempenho em contexto longo encontraram repetidamente um efeito de "perdido no meio", no qual os modelos são mais precisos ao recuperar informações colocadas perto do início ou do fim de um contexto longo do que informações enterradas no meio, mesmo quando nada na arquitetura privilegia formalmente essas posições. Testes de "agulha no palheiro" em contexto longo, nos quais um fato específico é escondido dentro de um grande volume de texto irrelevante, tornaram-se uma forma padrão de medir se o contexto efetivo de um modelo corresponde ao seu máximo anunciado. Servir contextos muito longos também é computacionalmente caro, então os sistemas frequentemente enfrentam uma escolha prática entre colocar uma grande quantidade de texto bruto na janela de contexto e usar geração aumentada por recuperação para selecionar apenas as passagens mais relevantes, trocando completude por custo e, em princípio, precisão.

Relação com o raciocínio

A janela de contexto também limita técnicas como o prompting de cadeia de pensamento e os modelos de raciocínio, que geram texto intermediário substancial antes de produzir uma resposta final; um modelo que raciocina longamente consome parte de sua própria janela de contexto com esse raciocínio, o que é uma das razões pelas quais janelas de contexto mais longas se tornaram mais importantes à medida que essas técnicas se difundiram.

Categorias:large-language-models·transformers·deep-learning
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico