Traduit de l'anglais

LoRA (adaptation de bas rang) est une technique d'ajustement efficace en termes de paramètres qui gèle les poids d'un modèle pré-entraîné et entraîne à la place de petites matrices de bas rang, permettant une adaptation économique à des tâches et des styles spécifiques.

LoRA, acronyme de Low-Rank Adaptation, est une technique de Fine-tuning qui adapte un réseau de neurones pré-entraîné à une nouvelle tâche en gelant ses poids d'origine et en injectant un petit nombre de paramètres entraînables sous la forme de matrices de bas rang. Comme les matrices ajoutées sont minuscules par rapport aux matrices de poids complètes qu'elles modifient, LoRA peut adapter un modèle de plusieurs milliards de paramètres tout en entraînant et en stockant seulement une fraction de pour cent de ses paramètres totaux, rendant le fine-tuning accessible sur du matériel grand public.

Historique

LoRA a été introduit dans un article de juin 2021 par Edward Hu et ses coauteurs chez Microsoft, qui ont observé que les mises à jour de poids nécessaires pour spécialiser un modèle pré-entraîné à une nouvelle tâche ont tendance à avoir un « rang intrinsèque » faible, ce qui signifie qu'elles peuvent être bien approximées par le produit de deux matrices beaucoup plus petites. Plutôt que de mettre à jour directement une matrice de poids complète, LoRA apprend deux matrices de bas rang dont le produit est ajouté aux poids d'origine gelés, et lors de l'inférence, la mise à jour peut être fusionnée sans latence supplémentaire. La technique a d'abord été démontrée sur des grands modèles de langage tels que GPT-3, et une extension de 2023 appelée QLoRA l'a combinée avec une quantification 4 bits du modèle de base gelé, réduisant considérablement la mémoire nécessaire pour affiner de très grands modèles.

Méthode

Formellement, pour une matrice de poids pré-entraînée, LoRA représente la mise à jour comme le produit d'une projection descendante et d'une projection ascendante de bas rang, mises à l'échelle par un facteur et généralement initialisées pour que l'adaptateur ne contribue à rien au début de l'entraînement. Seules ces deux petites matrices sont optimisées via une descente de gradient ordinaire, tandis que les poids d'origine restent fixes, ce qui protège également les capacités générales du modèle de base contre l'oubli catastrophique. Plusieurs adaptateurs LoRA peuvent être entraînés indépendamment pour différentes tâches ou styles et échangés dans le même modèle de base lors de l'inférence, ou combinés, sans réentraîner le réseau sous-jacent.

Applications

Dans le déploiement de grands modèles de langage, LoRA est une méthode standard pour créer à moindre coût des assistants spécifiques à une tâche ou à un domaine, et elle sous-tend une grande partie de l'écosystème ouvert de fine-tuning autour de modèles tels que Llama. Elle est devenue tout aussi centrale dans la communauté de génération d'images après la sortie de Stable Diffusion, où les utilisateurs entraînent de petits fichiers LoRA, souvent de moins de 200 mégaoctets, pour apprendre à un modèle de base un personnage, un style artistique ou un sujet spécifique à partir de quelques images d'exemple, puis les partagent sur des plateformes communautaires et les combinent plusieurs à la fois avec une force réglable. Cette culture de personnalisation ascendante, construite autour de fichiers LoRA légers superposés à des invites ouvertes et des points de contrôle de base, a été un moteur important de la croissance communautaire de Stable Diffusion par rapport aux systèmes fermés et non adaptables comme les premiers Midjourney.

Limites

L'hypothèse de bas rang de LoRA signifie qu'il peut être moins performant qu'un fine-tuning complet sur des tâches nécessitant des changements substantiels dans les représentations du modèle, et le choix du rang, du sous-ensemble de matrices de poids à adapter et du facteur d'échelle implique un réglage non trivial. Parce qu'il ne fait que modifier les représentations existantes plutôt que d'ajouter de nouvelles connaissances à grande échelle, LoRA est généralement mieux adapté à l'adaptation de style, de format et de comportement qu'à l'enseignement de grandes quantités de nouveaux contenus factuels, une lacune souvent comblée par la génération augmentée par récupération ou la poursuite de pré-entraînement complète.

Catégories:fine-tuning·efficiency·generative-ai
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique