OPT-175B est un grand modèle de langage développé par Meta AI, publié en mai 2022. Avec 175 milliards de paramètres, il a été conçu pour égaler l'échelle du GPT-3 d'OpenAI tout en étant ouvertement disponible pour les chercheurs. La publication du modèle incluait ses poids, son code et ses journaux d'entraînement, une rupture avec les pratiques fermées de nombreux laboratoires d'IA contemporains. Cette transparence visait à favoriser une recherche reproductible et une compréhension plus approfondie des réseaux neuronaux à grande échelle.
OPT-175B est construit sur l'architecture transformateur, spécifiquement une conception autorégressive décodeur-seul. Il utilise une structure similaire à celle de GPT-3, avec 96 couches, 96 têtes d'attention et une dimension cachée de 12 288. Le modèle a été entraîné sur un corpus diversifié de textes publiquement disponibles, totalisant environ 180 milliards de jetons. Cet ensemble de données incluait des livres, des textes web et d'autres sources, filtrés pour éliminer le contenu de faible qualité ou dupliqué. L'entraînement a utilisé 992 GPU A100 de 80 Go, consommant environ 2,5 millions d'heures GPU, un coût significatif mais réduit par rapport aux modèles antérieurs grâce à des techniques de parallélisme efficaces.
Entraînement et Optimisation
Le processus d'entraînement d'OPT-175B a employé plusieurs techniques avancées pour gérer son échelle. Meta a utilisé une combinaison de parallélisme de données, de modèle et de pipeline à travers le cluster de GPU. Ils ont également implémenté écrêtage de gradient pour stabiliser l'entraînement et utilisé un programme de taux d'apprentissage avec une phase d'échauffement suivie d'un déclin cosinusoïdal. Le modèle a été entraîné avec l'optimiseur Adam, utilisant une taille de lot de 4 millions de jetons. Pour réduire l'utilisation de la mémoire, ils ont utilisé un entraînement en précision mixte, stockant les poids en FP16 et utilisant FP32 pour les états de l'optimiseur. Les journaux d'entraînement, publiés publiquement, documentaient des défis tels que des pics de perte et les réponses de l'équipe, offrant un aperçu rare des dynamiques d'entraînement à grande échelle.
Impact Open Source
La publication d'OPT-175B a été un jalon dans le paysage des grands modèles de langage. Avant cela, des modèles de cette échelle, comme GPT-3, n'étaient disponibles que via des API payantes, limitant l'étude académique. En fournissant des poids ouverts, Meta a permis aux chercheurs d'exécuter, d'affiner et de sonder le modèle directement. Cela a conduit à une vague d'études sur des sujets comme les biais, la toxicité et l'interprétabilité. Le modèle a également servi de référence pour des modèles ouverts ultérieurs, tels que BLOOM et LLaMA, qui ont tiré des leçons de son expérience. Cependant, la publication ouverte a également soulevé des préoccupations concernant un usage abusif, car le modèle pouvait générer de la désinformation ou du spam convaincant. Meta a répondu en exigeant que les chercheurs fassent une demande d'accès, bien que les poids restaient plus accessibles que les modèles propriétaires typiques.
Performance et Évaluation
Sur des références standard, OPT-175B a performé de manière comparable à GPT-3, bien qu'avec des variations légères. Par exemple, sur la suite SuperGLUE, il a obtenu des scores similaires, tandis que sur certaines tâches de raisonnement comme le Winograd Schema, il a montré des différences mineures. Le modèle excellait dans l'apprentissage en quelques exemples, égalant la capacité de GPT-3 à s'adapter à de nouvelles tâches avec seulement quelques exemples. Cependant, il rencontrait des difficultés avec certains types de rappel factuel et produisait parfois des informations hallucinées. L'évaluation de Meta incluait également des tests de préférence humaine, où OPT-175B était jugé compétitif avec GPT-3 dans la génération en texte libre, bien qu'il soit en retard dans certaines tâches structurées. La performance du modèle sur la génération de code était moins robuste, reflétant le contenu limité en code de ses données d'entraînement.
Limitations et Considérations Éthiques
Comme d'autres grands modèles, OPT-175B présentait des biais présents dans ses données d'entraînement. L'analyse de Meta elle-même a constaté qu'il pouvait produire du contenu stéréotypé ou offensant, en particulier concernant le genre, la race et la religion. Le modèle avait également tendance à répéter des phrases et pouvait être facilement incité à générer du texte nuisible. Pour atténuer ces problèmes, Meta a fourni une fiche de modèle détaillée et encouragé une utilisation responsable. Ils ont également publié une version plus petite, OPT-1.3B, pour faciliter l'expérimentation. Le débat éthique autour de l'open source de modèles aussi puissants s'est poursuivi, certains arguant que la transparence l'emportait sur les risques, tandis que d'autres appelaient à un accès plus contrôlé. En 2024, OPT-175B reste un point de référence pour le développement de modèles ouverts, bien que des modèles plus récents aient surpassé ses capacités.
Héritage et Influence
OPT-175B a influencé la direction de la recherche en IA en démontrant que des modèles à grande échelle pouvaient être ouverts sans conséquences catastrophiques. Il a ouvert la voie à la série LLaMA de Meta, qui a encore amélioré l'efficacité et l'accessibilité. Le modèle a également contribué au développement de techniques pour un entraînement et une inférence efficaces, telles que le point de contrôle d'activation et le parallélisme tensoriel. Ses journaux d'entraînement publics sont devenus une ressource précieuse pour comprendre les défis pratiques de la mise à l'échelle. Bien qu'il ne soit pas le modèle le plus puissant aujourd'hui, OPT-175B occupe une place significative dans l'histoire de la IA générative, représentant un changement vers l'ouverture dans un domaine dominé par des systèmes propriétaires. Sa publication a encouragé d'autres laboratoires, comme AI21 Labs et Inflection AI, à envisager des stratégies ouvertes, bien que beaucoup aient encore choisi des approches fermées.