PaLM 2 (Pathways Language Model 2) est un grand modèle de langage développé par Google AI, annoncé lors du discours d'ouverture annuel de Google I/O en mai 2023. Il s'agit d'une version mise à jour du modèle PaLM original, avec environ 340 milliards de paramètres et un entraînement sur 3,6 billions de jetons. PaLM 2 est conçu pour exceller dans une large gamme de tâches, notamment le raisonnement de sens commun, le raisonnement arithmétique, la génération de code et la traduction, avec un accent particulier sur l'amélioration des compétences multilingues.
Le modèle PaLM original, introduit en avril 2022, était un grand modèle de langage dense basé sur un transformateur décodeur seul, avec 540 milliards de paramètres. Les chercheurs ont également entraîné des versions plus petites avec 8 et 62 milliards de paramètres pour étudier les effets de l'échelle du modèle. PaLM 2 s'appuie sur cette base, offrant des performances améliorées et une couverture linguistique plus large.
Architecture et entraînement
PaLM 2 est un modèle de transformateur dense décodeur seul, similaire à son prédécesseur. Il est pré-entraîné sur un corpus de haute qualité de 780 milliards de jetons, comprenant des pages web filtrées, des livres, des articles Wikipédia, des articles de presse, du code source provenant de dépôts open-source sur GitHub et des conversations sur les réseaux sociaux. L'ensemble de données est basé sur celui utilisé pour entraîner le modèle LaMDA de Google, les conversations sur les réseaux sociaux représentant 50 % du corpus pour améliorer les capacités conversationnelles.
Le PaLM 540B original a été entraîné sur deux pods TPU v4, chacun avec 3 072 puces TPU v4 attachées à 768 hôtes, en utilisant une combinaison de parallélisme de modèle et de données. Cette configuration, totalisant 6 144 puces, a atteint une utilisation record de 57,8 % des FLOPs matériels, marquant la plus haute efficacité d'entraînement pour les grands modèles de langage à cette échelle.
Capacités et variantes
PaLM 2 est capable d'une large gamme de tâches, notamment le raisonnement de sens commun, le raisonnement arithmétique, l'explication de blagues, la génération de code et la traduction. Lorsqu'il est combiné avec un amorçage par chaîne de pensée, il obtient des performances nettement meilleures sur des ensembles de données nécessitant un raisonnement en plusieurs étapes, comme les problèmes de mots et les questions basées sur la logique.
Google et DeepMind ont développé Med-PaLM, une version de PaLM 540B affinée sur des données médicales, qui surpasse les modèles précédents sur les références de questions-réponses médicales. Med-PaLM a été le premier à obtenir un score de réussite aux questions de licence médicale américaine, fournissant un raisonnement et une auto-évaluation en plus de réponses précises.
Google a également étendu PaLM en utilisant un transformateur de vision pour créer PaLM-E, un modèle vision-langage pour la manipulation robotique sans nécessiter de réentraînement ou d'affinage. En juin 2023, Google a annoncé AudioPaLM pour la traduction parole-à-parole, qui utilise l'architecture et l'initialisation de PaLM-2.
Publication et accès
Le PaLM original est resté privé jusqu'en mars 2023, lorsque Google a lancé une API pour PaLM et plusieurs autres technologies. L'API était initialement disponible pour un nombre limité de développeurs qui avaient rejoint une liste d'attente avant la publication publique. PaLM 2 a été annoncé en mai 2023 et devrait être intégré dans divers produits et services Google.
Impact et héritage
PaLM 2 représente une avancée significative dans les grands modèles de langage, en particulier dans la compréhension et le raisonnement multilingues. Son développement s'aligne sur les efforts continus dans le domaine de l'intelligence artificielle et de l'apprentissage automatique, contribuant au paysage plus large de l'IA générative. PaLM 2 est considéré comme un successeur de LaMDA et un prédécesseur de Gemini, reflétant l'innovation continue de Google dans ce domaine.