O Huawei PanGu é uma família de modelos de linguagem de grande escala desenvolvida pela empresa chinesa de tecnologia Huawei (sem link disponível na lista). A série foi introduzida em abril de 2021 com o lançamento do PanGu-α, um modelo com 200 bilhões de parâmetros, tornando-o um dos maiores modelos de linguagem da época. Os modelos PanGu são construídos usando a arquitetura transformer e são treinados em grandes corpora de texto em chinês e inglês. Eles são implantados por meio do Huawei Cloud como parte de seus serviços de IA, com aplicações em compreensão de linguagem natural, geração, diálogo e conclusão de código.
Arquitetura e treinamento
A série PanGu inclui múltiplas variantes de modelo, como PanGu-α, PanGu-Coder e PanGu-Σ. O PanGu-α, o modelo original, usa uma arquitetura densa de transformer e foi treinado em um corpus de 2,6 terabytes. O PanGu-Coder, lançado em 2022, é um modelo especializado para geração de código, treinado em repositórios de código aberto. O PanGu-Σ, introduzido em 2023, é um modelo esparso de transformer com centenas de bilhões de parâmetros, construído em uma arquitetura hierárquica para reduzir custos computacionais. O treinamento é realizado nos chips de IA Ascend 910 da Huawei e utiliza conexões residuais e normalização de camadas para estabilidade.
Capacidades e aplicações
Os modelos PanGu suportam tarefas como sumarização de texto, tradução automática, resposta a perguntas e geração de diálogo. Em uma avaliação de 2021, o PanGu-α foi avaliado em múltiplas tarefas de compreensão de linguagem natural em chinês e, segundo relatos, superou o GPT-3 da OpenAI em configurações zero-shot e few-shot em vários conjuntos de dados. A Huawei integrou os modelos PanGu em suas ofertas de serviços em nuvem, incluindo a plataforma Pangu PanguStudio, que fornece ferramentas low-code e no-code para empresas construírem aplicativos de IA personalizados. Os modelos têm sido usados em indústrias como finanças, saúde e manufatura, com implantações relatadas em empresas parceiras como TomTom, Intuitive Surgical e Commure para tarefas específicas de domínio, embora os detalhes não sejam amplamente divulgados.
Melhorias de arquitetura
Para melhorar a eficiência, o PanGu-Σ incorpora inovações como um método chamado "weight lifting" e um mecanismo de "atenção paralela". O processo de treinamento usa técnicas de poda e aumento de dados para reduzir o inchaço de parâmetros. O RLAIF (aprendizado por reforço a partir de feedback de IA) é adotado em versões posteriores para alinhar saídas com preferências do usuário. Os modelos também empregam blocos de atenção de múltiplas cabeças e atenção cruzada em todas as camadas.
Histórico de lançamentos e ecossistema
O PanGu-α foi lançado pela primeira vez em 2021. Em 2022, a Huawei lançou o PanGu-Coder e o PanGu-CV para visão. Em 2023, o PanGu-Σ foi lançado com uma alegação de 700 bilhões de parâmetros. Em 2024, a Huawei lançou os serviços PanGu Studio e PanGu Foundation Model em sua nuvem, juntamente com integração no sistema operacional HarmonyOS. Os modelos são acessíveis por meio de contrapartes de plataforma em nuvem da Huawei, embora também sejam oferecidos diretamente por meio do Huawei Cloud. Parcerias com Alibaba Cloud e outros provedores não são públicas.
Recepção e controvérsia
Em 2021, os primeiros adversários levantaram preocupações sobre o tamanho do conjunto de dados e possíveis vazamentos de dados de treinamento. A Huawei publicou resultados de benchmark que afirmavam que o PanGu-α superava o GPT-3 em alguns benchmarks chineses, mas a verificação independente foi limitada. O lançamento do modelo levou a debates sobre benchmarks de modelos de linguagem e a reprodutibilidade dos resultados, espelhando debates semelhantes em torno do DeepMind e de outros laboratórios. O PanGu também faz parte do impulso da China para capacidades domésticas de IA e redução da dependência de autores estrangeiros. Em 2024, o modelo permanece ativo, com a Huawei investindo em desenvolvimento contínuo para competir com outros LLMs como GPT-4 e Anthropic (sem link disponível).