Traduzido do inglês

CPM-2 é um modelo de linguagem pré-treinado chinês com 198 bilhões de parâmetros, desenvolvido pela Academia de Inteligência Artificial de Pequim (BAAI), lançado em 2021 como sucessor do CPM-1, com foco em tarefas generativas e de compreensão em larga escala.

CPM-2 é um modelo de linguagem pré-treinado em larga escala desenvolvido pela Academia de Inteligência Artificial de Pequim (BAAI). Lançado em 2021, é o sucessor do CPM-1 e se destaca por seus 198 bilhões de parâmetros, tornando-se um dos maiores modelos de língua chinesa da época. O CPM-2 é projetado para lidar com uma ampla gama de tarefas de processamento de linguagem natural, incluindo geração de texto, compreensão e diálogo, com foco na língua chinesa.

Ao contrário de muitos modelos que dependem exclusivamente de uma única arquitetura, o CPM-2 emprega uma abordagem de mistura de especialistas (MoE) dentro de um framework transformador. Esse design permite que o modelo ative apenas um subconjunto de seus parâmetros para cada entrada, melhorando a eficiência computacional enquanto mantém alto desempenho. O modelo foi treinado em um corpus diversificado de texto chinês, incluindo páginas da web, livros e outras fontes, e demonstrou resultados fortes em benchmarks como CLUE (Avaliação de Compreensão de Língua Chinesa).

Arquitetura e Treinamento

O CPM-2 é construído sobre uma arquitetura transformador, especificamente usando uma estrutura somente decodificadora para tarefas generativas. Seus 198 bilhões de parâmetros são organizados em múltiplas camadas de especialistas, onde cada token é roteado para um pequeno número de especialistas, reduzindo o custo computacional efetivo por inferência. O modelo usa um vocabulário de unidades subpalavras chinesas e incorpora técnicas como codificação posicional e normalização de camadas para estabilizar o treinamento.

O processo de treinamento envolveu uma abordagem em duas etapas: primeiro, uma fase de pré-treinamento denso em um grande corpus, seguida por uma fase de ajuste fino esparso usando a estrutura MoE. Esse método permitiu que a BAAI escalasse o modelo além do que seria viável com uma arquitetura densa sozinha. Os dados de treinamento compreenderam mais de 200 gigabytes de texto chinês, e o modelo foi treinado em um cluster de GPUs, embora detalhes específicos de hardware não sejam divulgados publicamente.

Capacidades e Aplicações

O CPM-2 se destaca em várias tarefas de modelo de linguagem de grande escala, incluindo conclusão de texto, sumarização, resposta a perguntas e geração de diálogo. Em avaliações, alcançou resultados de ponta em vários benchmarks chineses, como o ranking CLUE, superando modelos anteriores como o GPT-3 em certas tarefas específicas de chinês. A capacidade do modelo de lidar com contextos longos e gerar texto coerente e contextualmente relevante o tornou adequado para aplicações em criação de conteúdo, atendimento ao cliente e ferramentas educacionais.

Uma característica notável é sua capacidade bilíngue, pois o CPM-2 também pode processar texto em inglês, embora seu foco principal seja o chinês. Essa versatilidade decorre da inclusão de dados em inglês em seu corpus de treinamento, permitindo transferência entre línguas. O modelo está disponível em duas versões: uma versão completa de 198B parâmetros e uma versão menor de 11B parâmetros, sendo esta última mais acessível para pesquisa e implantação.

Impacto e Recepção

O CPM-2 foi lançado como um modelo de código aberto, com seus pesos e código disponibilizados para a comunidade de pesquisa. Essa abertura contribuiu para sua adoção em ambientes acadêmicos e industriais, particularmente na China, onde serviu como base para ajuste fino adicional em tarefas específicas de domínio. O lançamento do modelo também gerou discussões sobre os custos ambientais e computacionais do treinamento de modelos grandes, bem como a necessidade de métodos de inferência eficientes.

Em comparação com modelos contemporâneos como o GPT-3 da OpenAI, o CPM-2 demonstrou que desempenho competitivo poderia ser alcançado com foco em uma língua específica e com uma arquitetura MoE mais eficiente. Seu sucesso incentivou mais pesquisas em modelos esparsos e contribuiu para o desenvolvimento de modelos subsequentes na série CPM, como o CPM-3.

Limitações e Considerações Éticas

Como outros modelos de linguagem grandes, o CPM-2 tem limitações, incluindo possíveis vieses em seus dados de treinamento, que podem levar a saídas tendenciosas. Ele também pode produzir respostas incorretas ou sem sentido, especialmente em tópicos de nicho. O grande tamanho do modelo apresenta desafios para implantação, exigindo recursos computacionais significativos para inferência, o que limita seu uso em ambientes com restrição de recursos.

A BAAI reconheceu esses problemas e recomenda avaliação cuidadosa antes de implantar o modelo em aplicações sensíveis. A organização também enfatiza o uso responsável, incentivando pesquisadores a considerar as implicações éticas do conteúdo gerado. Em 2024, o CPM-2 permanece um ponto de referência no desenvolvimento de IA em língua chinesa, embora tenha sido superado por modelos mais avançados com contagens de parâmetros ainda maiores e capacidades aprimoradas.

Legado e Direções Futuras

O lançamento do CPM-2 marcou um marco no campo da inteligência artificial, particularmente para modelos de línguas não inglesas. Demonstrou que o pré-treinamento em larga escala poderia ser efetivamente aplicado a línguas além do inglês, abrindo caminho para esforços semelhantes em outras línguas. A arquitetura MoE usada no CPM-2 influenciou designs de modelos subsequentes, incluindo os da Academia Damiao da Alibaba e outras instituições de pesquisa em IA chinesas.

Iterações futuras da série CPM construíram sobre a base do CPM-2, incorporando técnicas mais recentes, como aprendizado por reforço com feedback humano (RLHF) e métodos de treinamento mais eficientes. O legado do CPM-2 reside em sua demonstração de desenvolvimento de IA escalável e de código aberto fora do ecossistema tecnológico ocidental, contribuindo para um cenário global de IA mais diversificado.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:large-language-model·chinese-ai·transformer·open-source
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico