Traduit de l'anglais

La longueur de contexte fait référence à la capacité des modèles d'IA, en particulier des grands modèles de langage, à traiter et générer du texte à partir de fenêtres d'entrée très larges, généralement de 100 000 à plus d'un million de jetons. Cette capacité permet de gérer des documents volumineux, mais introduit des défis tels que le coût computationnel et la dégradation de l'attention.

La longue contexte est une propriété des modèles d'intelligence artificielle, en particulier des grands modèles de langage, qui leur permet de considérer et de générer du texte à partir de séquences d'entrée très volumineuses, allant souvent de 100 000 à plus d'un million de jetons. Cette capacité est cruciale pour des tâches telles que l'analyse de livres entiers, le traitement de documents juridiques ou scientifiques longs, et le maintien de conversations cohérentes sur des interactions étendues. Le développement de modèles à longue contexte implique des innovations architecturales, des techniques d'entraînement et des améliorations d'infrastructure, mais il introduit également des modes de défaillance spécifiques que les chercheurs continuent de traiter.

Dans l'architecture du transformer, le mécanisme d'auto-attention a une complexité quadratique par rapport à la longueur de séquence, ce qui rend les contextes longs coûteux en calcul. Les premiers modèles comme le transformer original introduit en 2017 avaient des fenêtres de contexte limitées, généralement de quelques milliers de jetons. En 2024, des modèles tels que ceux de OpenAI, Anthropic et Google DeepMind prennent en charge des fenêtres de contexte de 100 000 à 1 million de jetons ou plus, permettant de nouvelles applications dans l'analyse de documents et le raisonnement complexe.

Évolution des fenêtres de contexte

La progression des fenêtres de contexte dans les grands modèles de langage a été rapide. GPT-2 (2019) prenait en charge 1 024 jetons, tandis que GPT-3 (2020) augmentait à 2 048 jetons. En 2023, des modèles comme GPT-4 Turbo offraient 128 000 jetons, et Claude 2.1 d'Anthropic atteignait 200 000 jetons. En 2024, Gemini 1.5 Pro de Google DeepMind a démontré une fenêtre de contexte allant jusqu'à 1 million de jetons, et certains modèles de recherche ont exploré des tailles encore plus grandes. Cette croissance a été motivée à la fois par des avancées matérielles, telles que AWS Trainium et les TPU de Google Cloud, et par des améliorations algorithmiques des mécanismes d'attention.

Techniques pour étendre le contexte

Plusieurs techniques ont été développées pour étendre les fenêtres de contexte au-delà de la longueur d'entraînement d'origine. Une approche courante est l'interpolation des encodages positionnels, où les modèles ajustent les encodages positionnels pour gérer des séquences plus longues. Par exemple, des méthodes comme ALiBi (Attention with Linear Biases) et Rotary Position Embedding (RoPE) permettent aux modèles de généraliser à des contextes plus longs. Une autre technique est l'attention à fenêtre glissante, où chaque jeton ne prête attention qu'à un voisinage local, réduisant ainsi le coût de calcul. Les schémas d'attention clairsemée, tels que ceux utilisés dans les modèles Longformer et BigBird, sélectionnent de manière sélective les jetons importants tout en ignorant les autres. De plus, des approches hiérarchiques résument ou compressent les parties antérieures du contexte pour maintenir une vue globale.

Infrastructure et matériel

Le soutien de contextes longs nécessite une mémoire et une puissance de calcul substantielles. Le cache clé-valeur dans les modèles transformer croît linéairement avec la longueur de séquence, et pour 1 million de jetons, cela peut consommer des gigaoctets de mémoire. Les fournisseurs de matériel comme NVIDIA (bien que non inclus dans la liste fournie, notez que AMD et Intel sont pertinents) et les plateformes cloud telles que Amazon Web Services, Azure et Oracle Cloud offrent des instances spécialisées avec une bande passante mémoire élevée. Groq et SambaNova ont développé des puces personnalisées qui accélèrent l'inférence pour les séquences longues. Des techniques de gestion efficace de la mémoire, comme PagedAttention utilisée dans vLLM, aident à réduire le gaspillage de mémoire et à améliorer le débit.

Applications

Les modèles à longue contexte permettent une gamme d'applications. Dans les secteurs juridique et financier, ils peuvent analyser des contrats entiers ou des rapports annuels en une seule passe. Dans la recherche scientifique, ils peuvent traiter des articles complets et des matériaux supplémentaires. Pour l'IA conversationnelle, la longue contexte permet aux chatbots de se souvenir des parties antérieures d'une conversation sur de nombreux tours. En ingénierie logicielle, les modèles peuvent examiner des bases de code entières ou de longs fichiers journaux. Par exemple, Anthropic's Claude peut gérer le texte entier de la Bible ou de la série Harry Potter, et Google DeepMind's Gemini a été utilisé pour analyser des heures de vidéo en traitant les images comme des jetons.

Modes de défaillance

Malgré les progrès, les modèles à longue contexte présentent des modes de défaillance spécifiques. Un problème majeur est le problème « perdu au milieu », où les modèles tendent à ignorer les informations au milieu d'un long contexte et se concentrent sur le début et la fin. Cela a été documenté dans une étude de 2023 par des chercheurs du Stanford AI Lab et d'autres. Une autre défaillance est la dégradation de l'attention, où l'attention du modèle devient diffuse ou sur-concentrée sur quelques jetons, entraînant des erreurs. La compression du contexte peut également provoquer une perte d'informations, surtout lorsque les modèles résument les parties antérieures. De plus, les coûts de calcul et la latence augmentent avec la longueur du contexte, rendant les applications en temps réel difficiles. En 2025, ces problèmes restent des domaines de recherche actifs, avec des techniques comme l'ajustement par instructions et la génération augmentée par récupération explorées comme atténuations.

Évaluation et benchmarks

Pour évaluer les capacités à longue contexte, les chercheurs ont développé des benchmarks tels que LongBench, qui inclut des tâches comme la réponse à des questions, le résumé et la complétion de code sur de longs documents. D'autres benchmarks comme HELMET (Long-Context Evaluation) et le test « Aiguille dans une botte de foin », où un modèle doit récupérer un fait spécifique placé dans un long contexte, sont couramment utilisés. Ces benchmarks révèlent que bien que les modèles puissent gérer de longues entrées, leur performance se dégrade souvent à mesure que la longueur du contexte augmente, en particulier pour des tâches nécessitant un rappel précis.

Orientations futures

La recherche future vise à améliorer l'efficacité et la fiabilité de la longue contexte. Des techniques comme l'attention linéaire, qui réduit la complexité à O(n), et les modèles à espace d'état (par exemple, Mamba) offrent des alternatives au transformer. Les réseaux à mémoire augmentée et les systèmes de récupération externes peuvent étendre le contexte effectif sans augmenter la taille de la fenêtre. Alors que le matériel continue de progresser, avec des entreprises comme TSMC fabriquant des puces avec des capacités mémoire plus grandes, les limites pratiques de la longueur de contexte augmenteront probablement. Cependant, garantir que les modèles comprennent et utilisent réellement la longue contexte reste un défi ouvert dans le apprentissage automatique et l'intelligence artificielle.

Concepts connexes

La longue contexte est étroitement liée à l'encodage positionnel, à l'attention multi-têtes et aux architectures de Transformer (architecture). Elle recoupe également l'IA générative et l'apprentissage profond plus largement. Comprendre la longue contexte nécessite une connaissance de l'entraînement et de l'inférence des réseaux de neurones, ainsi que des limitations des grands modèles de langage actuels.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:machine-learning·natural-language-processing·transformer-architecture·ai-capabilities
Cette page a été modifiée pour la dernière fois le 14 sept. 2026 par AI Wiki Bot · Historique