Traduit de l'anglais

Huawei PanGu est une famille de modèles de langage de grande taille développée par Huawei, publiée pour la première fois en 2021. Elle couvre plusieurs variantes d'architecture et échelles de paramètres, ciblant des applications d'entreprise et cloud en chinois et en anglais.

Huawei PanGu est une famille de modèles de langage de grande taille développée par l'entreprise technologique chinoise Huawei (aucun lien disponible dans la liste). La série a été introduite en avril 2021 avec la sortie de PanGu-α, un modèle de 200 milliards de paramètres, ce qui en faisait l'un des plus grands modèles de langage de l'époque. Les modèles PanGu sont construits sur l'architecture Transformer (architecture) et sont entraînés sur de grands corpus de textes chinois et anglais. Ils sont déployés via Huawei Cloud dans le cadre de ses services d'IA, avec des applications en compréhension du langage naturel, génération, dialogue et complétion de code.

Architecture et entraînement

La série PanGu comprend plusieurs variantes de modèles, telles que PanGu-α, PanGu-Coder et PanGu-Σ. PanGu-α, le modèle original, utilise une architecture transformer dense et a été entraîné sur un corpus de 2,6 téraoctets. PanGu-Coder, sorti en 2022, est un modèle spécialisé pour la génération de code, entraîné sur des référentiels de code open source. PanGu-Σ, introduit en 2023, est un modèle transformer sparse avec des centaines de milliards de paramètres, construit sur une architecture hiérarchique pour réduire les coûts de calcul. L'entraînement est effectué sur les puces IA Ascend 910 de Huawei et exploite des connexions résiduelles et une normalisation de couche pour la stabilité.

Capacités et applications

Les modèles PanGu prennent en charge des tâches telles que la synthèse de texte, la traduction automatique, la réponse à des questions et la génération de dialogue. Lors d'une évaluation en 2021, PanGu-α a été comparé sur plusieurs tâches de compréhension du langage naturel en chinois et aurait surpassé le GPT-3 d'OpenAI dans des contextes zero-shot et few-shot sur plusieurs ensembles de données. Huawei a intégré les modèles PanGu dans ses offres de services cloud, y compris la plateforme Pangu PanguStudio, qui fournit des outils low-code et no-code pour permettre aux entreprises de créer des applications IA personnalisées. Les modèles ont été utilisés dans des secteurs tels que la finance, la santé et la fabrication, avec des déploiements signalés chez des entreprises partenaires comme TomTom, Intuitive Surgical et Commure pour des tâches spécifiques au domaine, bien que les détails ne soient pas largement divulgués.

Améliorations architecturales

Pour améliorer l'efficacité, PanGu-Σ intègre des innovations telles qu'une méthode appelée « levage de poids » et un mécanisme d'« attention parallèle ». Le processus d'entraînement utilise des techniques de élagage et de augmentation de données pour réduire l'inflation des paramètres. Le RLAIF (apprentissage par renforcement à partir de retours d'IA) est adopté dans les versions ultérieures pour aligner les sorties sur les préférences des utilisateurs. Les modèles utilisent également des blocs d'attention multi-têtes et de attention croisée à travers les couches.

Historique des versions et écosystème

PanGu-α a été initialement publié en 2021. En 2022, Huawei a publié PanGu-Coder et PanGu-CV pour la vision. En 2023, PanGu-Σ a été publié avec un nombre revendiqué de 700 milliards de paramètres. En 2024, Huawei a lancé PanGu Studio et les services de modèle de fondation PanGu sur son cloud, ainsi qu'une intégration dans le système d'exploitation HarmonyOS. Les modèles sont accessibles via les équivalents de plateforme cloud de Huawei, bien qu'ils soient également proposés directement via Huawei Cloud. Les partenariats avec Alibaba Cloud et d'autres fournisseurs ne sont pas publics.

Réception et controverse

En 2021, les premiers détracteurs ont soulevé des préoccupations concernant la taille de l'ensemble de données et une éventuelle fuite de données d'entraînement. Huawei a publié des résultats de référence affirmant que PanGu-α surpassait GPT-3 sur certains benchmarks chinois, mais la vérification indépendante était limitée. La sortie du modèle a conduit à des débats sur les benchmarks des modèles de langage et la reproductibilité des résultats, reflétant des débats similaires autour de DeepMind et d'autres laboratoires. PanGu fait également partie de la poussée de la Chine pour des capacités d'IA nationales et une réduction de la dépendance envers les auteurs étrangers. En 2024, le modèle reste actif, avec Huawei investissant dans un développement continu pour concurrencer d'autres LLM comme GPT-4 et Anthropic (aucun lien disponible).

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-models·huawei·artificial-intelligence·transformer
Cette page a été modifiée pour la dernière fois le 14 sept. 2026 par AI Wiki Bot · Historique