OPT (Transformateur Pré-entraîné Ouvert) est une famille de modèles de langage de grande taille de type décodeur uniquement, développée par Meta AI et publiée en mai 2022. La suite couvre des tailles de paramètres allant de 125 millions à 175 milliards, le plus grand modèle, OPT-175B, égalant l’échelle de GPT-3. Contrairement à de nombreux modèles contemporains, OPT a été rendu public avec ses poids, ses codes d’entraînement et ses journaux détaillés, visant à démocratiser l’accès à la recherche sur les modèles de langage à grande échelle.
L’architecture d’OPT suit la conception standard du décodeur transformeur, intégrant des améliorations telles que la normalisation de couche et les connexions résiduelles. Les modèles ont été entraînés sur un corpus diversifié de 180 milliards de tokens, incluant des sources comme Common Crawl, Wikipédia et BooksCorpus. Le processus d’entraînement a mis l’accent sur l’efficacité et la stabilité computationnelles, utilisant des techniques comme la mise à l’échelle dynamique des pertes et le écrêtage des gradients.
Développement et publication
OPT a été présenté dans un article intitulé « OPT : Transformateur Pré-entraîné Ouvert » par Susan Zhang et ses collègues de Meta AI. La publication incluait non seulement les poids des modèles, mais aussi les codes d’entraînement et un journal détaillé du processus, une première pour des modèles de cette envergure. L’objectif était de favoriser la reproductibilité et la collaboration au sein de la communauté de recherche en intelligence artificielle.
Les modèles ont été mis à disposition sous une licence non commerciale, avec un accès accordé via un processus de demande. La publication était accompagnée d’une démonstration et d’une documentation. Le plus grand modèle, OPT-175B, nécessitait des ressources computationnelles importantes, mais des variantes plus petites (par exemple, 125M, 350M, 1,3B, 2,7B, 6,7B, 13B, 30B, 66B) ont également été fournies pour répondre à différents besoins de recherche.
Architecture et entraînement
OPT utilise une architecture de décodeur avec attention causale, similaire à GPT-3. Les choix de conception clés incluent la pré-normalisation (application de la normalisation de couche avant chaque sous-couche), l’activation ReLU au lieu de GELU, et des plongements positionnels appris. Les données d’entraînement ont été filtrées et dédupliquées, et les modèles ont été entraînés en utilisant l’optimiseur Adam avec un calendrier de taux d’apprentissage en cosinus.
L’entraînement d’OPT-175B a pris environ 992 heures de GPU sur des NVIDIA A100, ce qui était notablement plus efficace que des modèles comparables grâce à des techniques d’optimisation. Les journaux d’entraînement ont documenté des défis tels que des pics de perte et les stratégies d’atténuation employées.
Évaluation et performances
Les modèles OPT ont été évalués sur une gamme de benchmarks de traitement du langage naturel, notamment SuperGLUE, SQuAD et OpenBookQA. Bien qu’OPT-175B ait obtenu des performances compétitives par rapport à GPT-3 sur de nombreuses tâches, il présentait quelques différences, comme une performance légèrement inférieure sur les tâches de génération de code. Les modèles ont également démontré des capacités d’apprentissage en quelques exemples, s’améliorant avec le nombre d’exemples fournis.
Dans des contextes zero-shot et few-shot, OPT-175B a obtenu de bons résultats sur des tâches de réponse à des questions et de raisonnement de sens commun. Cependant, comme d’autres grands modèles, il pouvait produire des sorties biaisées ou nuisibles, et l’article a discuté des limites et des considérations éthiques.
Impact et héritage
OPT a constitué une publication marquante dans la communauté de l’IA open source, établissant un précédent en matière de transparence dans le développement de modèles à grande échelle. Il a influencé des modèles ouverts ultérieurs tels que BLOOM et LLaMA. La disponibilité d’OPT a permis aux chercheurs d’étudier le comportement des modèles, le réglage fin et l’interprétabilité sans les barrières des modèles propriétaires.
La publication a également suscité des discussions sur les risques liés à l’ouverture de modèles puissants, notamment en matière d’utilisation abusive. Meta AI a mis en œuvre une stratégie de publication responsable, comprenant une politique d’utilisation et des contrôles d’accès. Malgré ces préoccupations, OPT reste une référence largement utilisée dans la recherche académique et un point de repère pour le développement de modèles ouverts.
Voir aussi
Références
- Zhang, S., et al. (2022). « OPT : Transformateur Pré-entraîné Ouvert. » arXiv:2205.01068.
- Meta AI. (2022). « Présentation d’OPT. »