CPM-2 est un modèle de langage pré-entraîné à grande échelle développé par l'Académie de l'intelligence artificielle de Pékin (BAAI). Publié en 2021, il succède à CPM-1 et se distingue par ses 198 milliards de paramètres, ce qui en fait l'un des plus grands modèles en langue chinoise de l'époque. CPM-2 est conçu pour traiter une large gamme de tâches de traitement du langage naturel, notamment la génération de texte, la compréhension et le dialogue, avec un accent sur la langue chinoise.
Contrairement à de nombreux modèles qui reposent uniquement sur une architecture unique, CPM-2 utilise une approche de mélange d'experts (MoE) dans un cadre Transformer (architecture). Cette conception permet au modèle d'activer uniquement un sous-ensemble de ses paramètres pour chaque entrée, améliorant ainsi l'efficacité computationnelle tout en maintenant des performances élevées. Le modèle a été entraîné sur un corpus diversifié de textes chinois, comprenant des pages web, des livres et d'autres sources, et il a démontré des résultats solides sur des références telles que CLUE (Chinese Language Understanding Evaluation).
Architecture et entraînement
CPM-2 est construit sur une architecture Transformer (architecture), utilisant spécifiquement une structure décodeur seul pour les tâches génératives. Ses 198 milliards de paramètres sont organisés en plusieurs couches d'experts, où chaque jeton est routé vers un petit nombre d'experts, réduisant ainsi le coût computationnel effectif par inférence. Le modèle utilise un vocabulaire de sous-unités chinoises et intègre des techniques comme le Positional Encoding et la Layer Normalization pour stabiliser l'entraînement.
Le processus d'entraînement a impliqué une approche en deux étapes : d'abord, une phase de pré-entraînement dense sur un grand corpus, suivie d'une phase de fine-tuning éparse utilisant la structure MoE. Cette méthode a permis à BAAI de faire évoluer le modèle au-delà de ce qui serait réalisable avec une architecture dense seule. Les données d'entraînement comprenaient plus de 200 gigaoctets de texte chinois, et le modèle a été entraîné sur un cluster de GPU, bien que les détails matériels spécifiques ne soient pas divulgués publiquement.
Capacités et applications
CPM-2 excelle dans diverses tâches de Large language model, notamment la complétion de texte, le résumé, la réponse aux questions et la génération de dialogue. Lors des évaluations, il a obtenu des résultats de pointe sur plusieurs références chinoises, telles que le classement CLUE, surpassant des modèles précédents comme GPT-3 dans certaines tâches spécifiques au chinois. La capacité du modèle à gérer de longs contextes et à générer un texte cohérent et contextuellement pertinent l'a rendu adapté à des applications dans la création de contenu, le service client et les outils éducatifs.
Une caractéristique notable est sa capacité bilingue, car CPM-2 peut également traiter du texte anglais, bien que son objectif principal soit le chinois. Cette polyvalence provient de l'inclusion de données anglaises dans son corpus d'entraînement, permettant un transfert interlingue. Le modèle est disponible en deux versions : une version complète de 198 milliards de paramètres et une version plus petite de 11 milliards de paramètres, cette dernière étant plus accessible pour la recherche et le déploiement.
Impact et réception
CPM-2 a été publié en tant que modèle open-source, avec ses poids et son code mis à disposition de la communauté de recherche. Cette ouverture a contribué à son adoption dans les milieux académiques et industriels, en particulier en Chine, où il a servi de base pour un fine-tuning supplémentaire sur des tâches spécifiques à un domaine. La publication du modèle a également suscité des discussions sur les coûts environnementaux et computationnels de l'entraînement de grands modèles, ainsi que sur la nécessité de méthodes d'inférence efficaces.
Comparé à des modèles contemporains comme OpenAI GPT-3, CPM-2 a démontré que des performances compétitives pouvaient être atteintes avec un accent sur une langue spécifique et avec une architecture MoE plus efficace. Son succès a encouragé davantage de recherches sur les modèles épars et a contribué au développement de modèles ultérieurs dans la série CPM, tels que CPM-3.
Limitations et considérations éthiques
Comme d'autres grands modèles de langage, CPM-2 présente des limitations, notamment des biais potentiels dans ses données d'entraînement, qui peuvent conduire à des sorties biaisées. Il peut également produire des réponses incorrectes ou absurdes, en particulier sur des sujets de niche. La grande taille du modèle pose des défis pour le déploiement, nécessitant des ressources computationnelles importantes pour l'inférence, ce qui limite son utilisation dans des environnements à ressources restreintes.
BAAI a reconnu ces problèmes et recommande une évaluation minutieuse avant de déployer le modèle dans des applications sensibles. L'organisation souligne également une utilisation responsable, encourageant les chercheurs à considérer les implications éthiques du contenu généré. En 2024, CPM-2 reste un point de référence dans le développement de l'IA en langue chinoise, bien qu'il ait été surpassé par des modèles plus avancés avec des nombres de paramètres encore plus élevés et des capacités améliorées.
Héritage et orientations futures
La publication de CPM-2 a marqué une étape importante dans le domaine de l'Artificial intelligence, en particulier pour les modèles en langues non anglaises. Il a démontré que le pré-entraînement à grande échelle pouvait être efficacement appliqué à des langues autres que l'anglais, ouvrant la voie à des efforts similaires dans d'autres langues. L'architecture MoE utilisée dans CPM-2 a influencé les conceptions de modèles ultérieurs, y compris celles de Alibaba DAMO Academy et d'autres institutions de recherche chinoises en IA.
Les itérations futures de la série CPM se sont appuyées sur la base de CPM-2, incorporant des techniques plus récentes telles que l'apprentissage par renforcement avec retour humain (Reinforcement Learning from AI Feedback (RLAIF)) et des méthodes d'entraînement plus efficaces. L'héritage de CPM-2 réside dans sa démonstration d'un développement d'IA open-source et évolutif en dehors de l'écosystème technologique occidental, contribuant à un paysage mondial de l'IA plus diversifié.