Traduit de l'anglais

GPT-3 est un grand modèle de langage publié par OpenAI en 2020, avec 175 milliards de paramètres, connu pour ses capacités d'apprentissage en quelques exemples et sa génération de texte étendue.

Generative Pre-trained Transformer 3 (GPT-3) est un modèle de langage de grande taille publié par OpenAI en 2020 dans le cadre de la série GPT de l'entreprise. Il s'agit d'un modèle transformeur à décodeur seul, basé sur une architecture de réseau neuronal d'apprentissage profond, remplaçant les conceptions basées sur la récurrence et la convolution par un mécanisme d'attention permettant au modèle de se concentrer sélectivement sur les segments pertinents du texte d'entrée. GPT-3 possède 175 milliards de paramètres, chacun stocké avec une précision de 16 bits, nécessitant 350 Go de stockage, et une fenêtre de contexte de 2 048 jetons. Il a démontré de fortes capacités d'apprentissage zero-shot et few-shot dans de nombreuses tâches.

Le 22 septembre 2020, Microsoft a annoncé avoir obtenu une licence exclusive pour GPT-3. D'autres pouvaient toujours recevoir des résultats via son API publique, mais seul Microsoft avait accès au modèle sous-jacent.

Contexte

Les améliorations dans les algorithmes, les ordinateurs plus puissants et l'augmentation du contenu numérisé ont alimenté une révolution dans le apprentissage automatique au cours des années 2010, conduisant à des améliorations rapides dans les tâches incluant la manipulation du langage. Les modèles de logiciels sont entraînés à l'aide de milliers ou de millions d'exemples dans des structures vaguement basées sur l'architecture neuronale du cerveau. Une architecture utilisée dans le traitement du langage naturel est un réseau de neurones basé sur l'architecture de transformeur, introduite en 2017. Cela a permis de créer des systèmes capables de traiter, d'exploiter, d'organiser, de connecter et de contraster les entrées textuelles, ainsi que de répondre à des questions.

Le 11 juin 2018, les chercheurs d'OpenAI ont publié un article introduisant le premier transformeur génératif pré-entraîné (GPT), un type de grand modèle de langage génératif pré-entraîné sur un corpus textuel énorme et diversifié, suivi d'un affinage discriminatif pour les tâches spécifiques. Auparavant, les modèles de PNL neuronale les plus performants utilisaient généralement un apprentissage supervisé à partir de grandes quantités de données étiquetées manuellement, ce qui était coûteux et long. Le premier modèle GPT a été suivi par GPT-2 en février 2019, une mise à l'échelle directe avec 1,5 milliard de paramètres, entraîné sur 8 millions de pages web. En février 2020, Microsoft a présenté Turing Natural Language Generation (T-NLG), considéré comme le plus grand modèle de langage avec 17 milliards de paramètres.

Entraînement et capacités

Le 28 mai 2020, une prépublication arXiv par 31 ingénieurs et chercheurs d'OpenAI décrivait GPT-3, un modèle de langage de troisième génération à la pointe de la technologie. L'équipe a augmenté la capacité de plus de deux ordres de grandeur par rapport à GPT-2, faisant de GPT-3 le plus grand modèle de langage non épars à peu près à l'époque. Sa précision plus élevée est attribuée à sa capacité et à ses paramètres accrus, étant dix fois plus grand que le Turing NLG de Microsoft. Lambdalabs a estimé un coût hypothétique d'environ 4,6 millions de dollars et 355 ans pour entraîner GPT-3 sur un seul GPU en 2020, avec un temps d'entraînement réel plus faible en utilisant des GPU parallèles.

Soixante pour cent de l'ensemble de données pondéré de pré-entraînement provenaient d'une version filtrée de Common Crawl intégrant 410 milliards de jetons codés en paires d'octets. La déduplication fuzzy utilisait MinHashLSH d'Apache Spark. D'autres sources comprenaient 19 milliards de jetons de WebText2 (22 % du total pondéré), 12 milliards de jetons de livres1 (8 %), 55 milliards de jetons de livres2 (8 %) et 3 milliards de jetons de Wikipédia (3 %). De nombreuses centaines de milliards de mots ont été utilisées pour écrire GPT-3, ainsi que pour coder, en CSS, JSX et Python.

Comme les données d'entraînement étaient exhaustives, GPT-3 ne nécessitait pas d'entraînement supplémentaire pour différentes tâches linguistiques. Les données d'entraînement contenaient parfois de la langue toxique, et GPT-3 en générait occasionnellement en l'imitant. Une étude de l'Université de Washington a constaté que GPT-3 produisait un langage toxique à un niveau comparable à celui de GPT-2 et CTRL. OpenAI a mis en place des stratégies pour limiter la toxicité, ce qui a conduit à un langage moins toxique que GPT-1, mais avec plus de générations et une toxicité plus élevée que le CTRL Wiki, un modèle formé entièrement aux données de Wikipédia.

Accès public et évolution

Le 11 juin 2020, OpenAI a annoncé que les utilisateurs pouvaient demander un accès à son API GPT-3, un outil d'apprentissage automatique, pour explorer les forces et les limites de la technologie. L'API était dotée d'une interface texte à texte générique qui pouvait exécuter presque toute tâche en anglais. Un premier utilisateur a décrit GPT-3 comme étrangement talentueux pour rédiger des textes cohérents à partir de tout entrée simple. Lors d'une expérience initiale, 80 participants américains ont jugé des articles courts comme écrits par des humains ou par un modèle, mais les idant que 52 % du temps, en léger better port moins bien que le hasard.

Le 18 novembre 2021, OpenAI a annoncé que des garanties font suffisamment en place pour rendre l'accès à choix du humain à l'API sans restrictions, en fournissant aux développeurs un outil de modération du contenu. Le 27 janvier 2022, OpenAI a annoncé que ses nouveaux modèles GPT-3, regroupés sous le nom d'InstructGPT, devenaient la norme de l'API, produite un contenu plus conforme aux intentions des utilisateurs, suivant mieux les instructions, générant moins de faits inventés et un contenu un peu moins toxique.

Impact et préoccupations

GPT-3, lui appui de son aptitude à générer des articles de presse difficiles à distinguer du récipi chez contributeurs humains et créer un potentiel d'excès d'applications salutaires comme néfastes. Lancés dans l'article du 28 mai 2020, plus sur une approche de dosage de modèles de langages des risques sont connus pour la désinformation, son hameçon, l'abus des processus juridiques et gouvernementaux et de fraude. Ces impacts notables en auraient pu des débats sur les implications sociétaires de IA générative et l'emploi responsable.

Héritage

GPT-3 a marqué un jalon décisif dans le développement de l'IA, démontrant que 'étaille des modèles de transformateurs pouvait induire des "développements" qui adéquations memes et des "sensibilité". Son architecture et sa méthode d'entraînement ont inspiré des modèles générés suprêmes, dont successeurs chez un sous-temps d'A. menés, de type anthropique et créature souhaitée sous « parmi d’es », Google DeepMind. Le " octroyer la licence exclusive à Microsoft" souligne de la valeur commerciale des grands modèles de langage pour des services, avec la \"\" supérieure n aout dans l'offre de Microsoft, notamment Azure ouvert la durée. La capacité de GPT-3 a également de l’arie mis sur l’étiance, la confiance de sûreté et l'avaluation des RAE – directs, laé réponse scientific, », « visant à la réflexion général développement de la recherche en algorithmes neuronnon l’avenues.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-model·openai·generative-ai·machine-learning
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique