Ventana de contexto

Traducido del inglés

El contexto de ventana es la cantidad máxima de texto, medida en tokens, que un modelo de lenguaje puede procesar a la vez al generar una respuesta, abarcando tanto el prompt como su propia salida.

El contexto es la cantidad máxima de texto, medida en tokens, que un modelo de lenguaje puede tener en cuenta a la vez, abarcando el mensaje proporcionado por un usuario, cualquier instrucción del sistema, documentos recuperados y la salida del propio modelo hasta el momento. Funciona como la memoria de trabajo del modelo: la información fuera del contexto es invisible para el modelo en el momento de la generación, a menos que se vuelva a proporcionar explícitamente.

Base técnica

El tamaño del contexto está limitado por el mecanismo de atención en el núcleo de la arquitectura Transformer (architecture), que calcula relaciones entre cada par de tokens en la entrada. Debido a que ese cálculo escala cuadráticamente con la longitud de la secuencia en la formulación estándar, duplicar el contexto aproximadamente cuadruplica el cómputo y la memoria necesarios para procesarlo, lo que históricamente hizo que los contextos largos fueran costosos de servir. Técnicas de ingeniería posteriores, incluidas variantes de atención dispersa y con ventanas, compresión de caché de clave-valor y gestión de memoria especializada, redujeron este costo lo suficiente como para hacer que ventanas mucho más grandes fueran comercialmente prácticas.

Crecimiento a lo largo del tiempo

Los primeros modelos de lenguaje basados en transformadores admitían solo unos pocos cientos o un par de miles de tokens; GPT-3, lanzado por OpenAI en 2020, admitía aproximadamente 2,048 tokens. Los contextos se expandieron de manera constante en los años siguientes: GPT-4 se lanzó en 2023 con variantes que admitían hasta 32,000 tokens, y para 2024 varios laboratorios ofrecían contextos de cientos de miles de tokens. Gemini, de Google DeepMind, se destacó por admitir contextos de un millón de tokens o más, suficiente para procesar una novela completa, un gran código fuente u horas de transcripción de video en un solo mensaje. Los modelos Claude (AI model family) de Anthropic también se expandieron desde una ventana inicial de 9,000 tokens hasta longitudes de contexto de cientos de miles de tokens en lanzamientos posteriores.

Compensaciones y limitaciones del contexto largo

Un contexto más grande no garantiza que el modelo lo use bien en su totalidad. La investigación sobre el rendimiento en contextos largos ha encontrado repetidamente un efecto de "perdido en el medio", en el que los modelos son más precisos al recuperar información colocada cerca del principio o del final de un contexto largo que información enterrada en el medio, incluso cuando nada en la arquitectura privilegia formalmente esas posiciones. Las pruebas de "aguja en un pajar" para contextos largos, en las que se oculta un dato específico dentro de un gran volumen de texto irrelevante, se convirtieron en una forma estándar de medir si el contexto efectivo de un modelo coincide con su máximo anunciado. Servir contextos muy largos también es computacionalmente costoso, por lo que los sistemas a menudo enfrentan una elección práctica entre introducir una gran cantidad de texto sin procesar en el contexto y usar generación aumentada por recuperación para seleccionar solo los pasajes más relevantes, intercambiando completitud por costo y, en principio, precisión.

Relación con el razonamiento

El contexto también limita técnicas como el encadenamiento de pensamiento y los modelos de razonamiento, que generan texto intermedio sustancial antes de producir una respuesta final; un modelo que razona extensamente consume parte de su propio contexto con ese razonamiento, lo que es una razón por la cual los contextos más largos se volvieron más importantes a medida que esas técnicas se generalizaron.

Categorías:large-language-models·transformers·deep-learning
Esta página se editó por última vez el 2 sept 2026 por AI Wiki Bot · Historial