PaLM 2 est un grand modèle de langage (LLM) développé par Google et annoncé lors du discours d'ouverture annuel de Google I/O en mai 2023. Il succède au Pathways Language Model (PaLM), un LLM basé sur un transformateur dense à décodeur seul de 540 milliards de paramètres développé par Google AI. PaLM 2 est présenté comme un modèle de 340 milliards de paramètres entraîné sur 3,6 billions de jetons, représentant une avancée significative en termes d'échelle et de capacités par rapport à son prédécesseur.
Le modèle s'inscrit dans les efforts plus larges de Google dans la recherche en IA générative et grands modèles de langage, s'appuyant sur l'architecture de transformateur qui sous-tend les systèmes modernes de apprentissage profond. PaLM 2 a été développé en parallèle avec Google DeepMind, reflétant l'intégration des divisions de recherche en IA de Google.
Architecture et capacités
PaLM 2 suit la conception de transformateur à décodeur seul établie par son prédécesseur, utilisant des mécanismes de attention multi-têtes et de encodage positionnel pour traiter les données séquentielles. Le modèle est capable d'une large gamme de tâches, notamment le raisonnement de sens commun, le raisonnement arithmétique, l'explication de blagues, la génération de code et la traduction. Lorsqu'il est combiné avec un amorçage par chaîne de pensée, PaLM 2 atteint des performances nettement meilleures sur des ensembles de données nécessitant un raisonnement en plusieurs étapes, tels que les problèmes de mots et les questions basées sur la logique.
L'entraînement du modèle sur 3,6 billions de jetons - une augmentation substantielle par rapport aux 780 milliards de jetons utilisés pour le PaLM original - permet des performances améliorées dans divers domaines. Ce corpus d'entraînement comprend des pages web filtrées, des livres, des articles Wikipédia, des articles de presse, du code source provenant de dépôts open source et des conversations sur les réseaux sociaux, la partie réseaux sociaux constituant 50 % du corpus pour soutenir les capacités conversationnelles.
Infrastructure d'entraînement
Le PaLM 540B original a été entraîné sur deux pods TPU v4 avec 3 072 puces TPU v4 dans chaque pod, attachés à 768 hôtes, connectés en utilisant une combinaison de parallélisme de modèle et de données. Cette configuration, utilisant 6 144 puces au total, a marqué un record pour la plus haute efficacité d'entraînement atteinte pour les LLM à cette échelle, avec une utilisation de FLOPs matériels de 57,8 %. L'infrastructure d'entraînement de PaLM 2 suit des principes similaires, bien que les détails spécifiques de sa configuration matérielle n'aient pas été entièrement divulgués.
Modèles et applications associés
Google a étendu l'architecture PaLM pour créer plusieurs variantes spécialisées. Med-PaLM, une version affinée sur des données médicales, surpasse les modèles précédents sur les références de questions-réponses médicales et a été le premier à obtenir une note de passage aux questions de licence médicale américaine. Il fournit un raisonnement et peut évaluer ses propres réponses en plus de répondre avec précision aux questions à choix multiples et ouvertes.
PaLM-E, une autre extension utilisant un transformateur de vision, sert de modèle vision-langage pour la manipulation robotique sans nécessiter de réentraînement ou d'affinage. En juin 2023, Google a annoncé AudioPaLM pour la traduction parole-à-parole, qui utilise l'architecture et l'initialisation de PaLM-2.
Disponibilité et impact
Le PaLM original a été annoncé pour la première fois en avril 2022 et est resté privé jusqu'en mars 2023, lorsque Google a lancé une API initialement disponible pour un nombre limité de développeurs via une liste d'attente. L'annonce de PaLM 2 à Google I/O en mai 2023 a signalé l'engagement de Google à concurrencer dans le paysage en évolution rapide de l'intelligence artificielle, aux côtés d'autres acteurs majeurs tels que OpenAI et Anthropic. Les capacités du modèle ont des implications pour les services Google Cloud et les applications d'entreprise plus larges, positionnant Google comme une force significative dans le développement de systèmes avancés de apprentissage automatique.