CPM-3 est un modèle de langage pré-entraîné à grande échelle développé par l'Académie de l'intelligence artificielle de Pékin (BAAI), comportant 175 milliards de paramètres. En tant que membre de la série CPM (Chinese Pretrained Model), il est conçu pour traiter une large gamme de tâches de traitement du langage naturel, notamment la génération de texte, la compréhension et le dialogue. Le modèle fait partie des efforts de la Chine pour faire progresser la recherche et l'infrastructure en intelligence artificielle, le positionnant comme un équivalent des modèles internationaux comme ceux de OpenAI et Google DeepMind.
CPM-3 repose sur l'architecture transformeur, qui est devenue la base de la plupart des systèmes modernes de grand modèle de langage. Son échelle de 175 milliards de paramètres le place parmi les plus grands modèles chinois publiquement connus, lui permettant de capturer des modèles linguistiques et des connaissances complexes. Le modèle est entraîné sur divers corpus chinois, lui permettant d'effectuer des tâches telles que le résumé, la réponse à des questions et l'écriture créative avec une grande fluidité.
Architecture et entraînement
CPM-3 utilise un modèle transformeur dense avec un mécanisme de attention multi-têtes, similaire à d'autres modèles de langage de pointe. Le processus d'entraînement implique des ressources computationnelles massives, utilisant des milliers de GPU sur plusieurs mois. BAAI n'a pas divulgué la taille exacte de l'ensemble de données d'entraînement, mais il comprend un mélange de textes web, de livres et d'autres sources organisées en chinois. Le modèle utilise le encodage positionnel et la normalisation de couche pour stabiliser l'entraînement et améliorer la convergence.
Contrairement à certains modèles qui utilisent des couches de mélange d'experts pour réduire le coût computationnel, CPM-3 est un modèle dense, ce qui signifie que tous les paramètres sont actifs lors de l'inférence. Ce choix de conception privilégie la qualité du modèle à l'efficacité, s'alignant sur la tendance observée dans les premiers grands modèles comme GPT-3. L'entraînement a tiré parti de techniques de écrêtage de gradient et de planification du taux d'apprentissage pour gérer les défis de l'optimisation d'un modèle à cette échelle.
Capacités et applications
CPM-3 excelle dans les tâches en langue chinoise, notamment la complétion de texte, la traduction et l'analyse des sentiments. Il peut générer des réponses cohérentes et contextuellement pertinentes, ce qui le rend adapté aux chatbots et aux assistants virtuels. Le modèle prend également en charge les tâches séquence à séquence, permettant des applications comme le résumé de texte et la paraphrase. BAAI a publié le modèle à des fins de recherche, permettant aux universitaires de l'affiner pour des domaines spécifiques comme la médecine ou le droit.
Dans les déploiements pratiques, CPM-3 a été utilisé sur Alibaba Cloud et d'autres plateformes cloud chinoises pour alimenter des solutions d'entreprise. Sa capacité à comprendre les idiomes chinois nuancés et les références culturelles lui donne un avantage sur les modèles entraînés principalement sur des données anglaises. Cependant, comme d'autres grands modèles, il peut produire des sorties biaisées ou incorrectes, et BAAI a mis en place des filtres de sécurité pour atténuer les contenus nuisibles.
Comparaison avec d'autres modèles
CPM-3 est souvent comparé au GPT-3 de OpenAI, qui possède également 175 milliards de paramètres. Alors que GPT-3 est entraîné sur des données multilingues, CPM-3 se concentre sur le chinois, ce qui entraîne des performances supérieures sur les benchmarks chinois. En revanche, des modèles comme Claude de Anthropic et Chinchilla de Google DeepMind privilégient respectivement la sécurité et l'efficacité. L'architecture dense de CPM-3 diffère de Gopher de Google DeepMind, qui utilise une échelle similaire mais des stratégies d'entraînement différentes.
Au sein de la série CPM, CPM-3 succède à CPM-1 et CPM-2, qui avaient des nombres de paramètres plus petits. Cette progression reflète l'engagement de BAAI à étendre les modèles en langue chinoise. Contrairement aux modèles de l'Académie Damiao d'Alibaba, qui sont intégrés dans des produits commerciaux, CPM-3 reste principalement un artefact de recherche, bien qu'il ait influencé les modèles chinois ultérieurs.
Impact et réception
La publication de CPM-3 en 2021 a suscité un intérêt significatif dans la communauté chinoise de l'IA, soulignant la capacité du pays à produire des modèles à l'échelle frontière. Il a été cité dans de nombreux articles académiques et sert de référence pour la recherche en traitement du langage naturel chinois. Les critiques ont noté le coût computationnel élevé de l'entraînement et de l'inférence, ce qui limite l'accessibilité. BAAI a répondu en fournissant une API pour les chercheurs, bien qu'elle ne soit pas aussi largement disponible que les offres de OpenAI.
CPM-3 a également suscité des discussions sur l'impact environnemental de l'entraînement à grande échelle, une préoccupation partagée dans le domaine du apprentissage automatique. Malgré ces défis, le modèle a contribué à l'avancement de la IA générative en chinois, ouvrant la voie à des modèles ultérieurs comme CPM-4 et à des systèmes commerciaux.
Orientations futures
BAAI continue de développer la série CPM, avec des versions ultérieures intégrant des améliorations en matière d'efficacité et d'alignement. Les itérations futures pourraient adopter des techniques comme le élagage de modèle et la augmentation de données pour réduire les besoins en ressources. L'organisation explore également l'intégration de l'apprentissage par renforcement à partir de retours humains, similaire à RLHF, pour améliorer la sécurité et l'utilité. Alors que la Chine investit massivement dans l'infrastructure de l'IA, des modèles comme CPM-3 devraient jouer un rôle central dans la formation de l'économie numérique du pays.
Les chercheurs étudient également des moyens de rendre CPM-3 plus accessible, notamment par des méthodes de quantification et de distillation. Ces efforts visent à démocratiser l'accès aux grands modèles de langage, permettant à des organisations plus petites de bénéficier de leurs capacités. L'héritage de CPM-3 réside dans sa démonstration que des institutions non occidentales peuvent atteindre des résultats de pointe en IA, favorisant un paysage de recherche mondial plus diversifié.