Traduzido do inglês

XLNet é um modelo Transformer autoregressivo para processamento de linguagem natural, lançado em junho de 2019 como uma melhoria em relação ao BERT. Ele utiliza modelagem de linguagem por permutação para capturar contexto bidirecional, alcançando resultados de ponta em várias tarefas.

XLNet é um modelo de inteligência artificial para processamento de linguagem natural, introduzido em 19 de junho de 2019 como uma arquitetura Transformer (architecture) autorregressiva. Foi projetado como uma melhoria em relação ao BERT, abordando as limitações da modelagem de linguagem mascarada ao usar modelagem de linguagem por permutação para capturar contexto bidirecional. O modelo tem 340 milhões de parâmetros e foi treinado em um corpus de 33 bilhões de palavras, alcançando resultados de ponta em tarefas como modelagem de linguagem, resposta a perguntas, e inferência de linguagem natural. Foi lançado sob a licença Apache 2.0, tornando-o livremente disponível tanto para uso em pesquisa quanto comercial

XLNet pertence à família mais ampla de grandes modelos de linguagem, que são sistemas de redes neurais treinados em vastos corpora de texto para compreender e gerar linguagem humana. Seu desenvolvimento baseou-se em avanços em aprendizado profundo e na arquitetura Transformer (architecture), que revolucionou o campo desde sua introdução em 2017. Diferentemente de modelos anteriores que processavam texto em uma ordem fixa da esquerda para a direita ou da direita para a esquerda, XLNet introduziu um novo objetivo de treinamento que considera todas as permutações possíveis de uma frase, permitindo-lhe aprender com o contexto tanto à esquerda quanto à direita simultaneamente

Arquitetura

A inovação central do XLNet é a modelagem de linguagem por permutação. Na modelagem autorregressiva padrão, uma frase como "Meu cachorro é fofo" é fatorada como o produto de probabilidades condicionais, onde cada palavra é prevista dados todas as palavras anteriores: Pr(Meu) × Pr(cachorro|Meu) × Pr(é|Meu, cachorro) × Pr(fofo|Meu, cachorro, é). Esta ordem da esquerda para a direita limita a capacidade do modelo de usar contexto futuro. XLNet, no entanto, permuta aleatoriamente a ordem das palavras durante o treinamento. Por exemplo, com uma ordem de permutação de 3-2-4-1, o modelo prevê "é" primeiro, depois "cachorro", depois "fofo", e finalmente "Meu", cada vez condicionando nas palavras já geradas naquela permutação. Ao treinar em todas as permutações possíveis, o modelo aprende a usar contexto bidirecional, semelhante ao BERT, mas sem os tokens artificiais [MASK] nos quais o BERT depende

Atenção Auto-Atenta de Dois Fluxos

Para implementar a modelagem de linguagem por permutação, XLNet usa um mecanismo de atenção auto-atenta de dois fluxos. O primeiro fluxo, chamado de fluxo de conteúdo, codifica o conteúdo real de cada palavra usando atenção auto-atenta com mascaramento causal padrão, semelhante a um decodificador Transformer (architecture) típico. O segundo fluxo, chamado de fluxo de consulta, codifica o conteúdo de cada palavra no contexto do que foi gerado até agora na permutação. Ele usa um mecanismo de atenção cruzada mascarada onde as consultas vêm do fluxo de consulta e os pares chave-valor vêm do fluxo de conteúdo. Essa separação permite que o modelo preveja uma palavra sem ver seu próprio conteúdo, o que é essencial para o objetivo de permutação. Os dois fluxos são combinados durante o treinamento, e apenas o fluxo de conteúdo é usado durante a inferência

Treinamento e Desempenho

XLNet foi treinado em um grande corpus de 33 bilhões de palavras, que incluía texto de livros, páginas da web, e outras fontes. O processo de treinamento usou o objetivo de modelagem de linguagem por permutação, com o modelo amostrando aleatoriamente uma ordem de permutação para cada exemplo de treinamento. Os 340 milhões de parâmetros do modelo o tornaram comparável em tamanho ao BERT-large, mas seu objetivo de treinamento permitiu-lhe alcançar melhor desempenho em vários benchmarks. Por exemplo, no benchmark GLUE, que testa a compreensão de linguagem natural em múltiplas tarefas, XLNet superou o BERT na maioria das tarefas, incluindo análise de sentimentos, resposta a perguntas, e implicação textual. Também alcançou resultados de ponta no conjunto de dados de resposta a perguntas SQuAD e em tarefas de perplexidade de modelagem de linguagem

Uma vantagem notável do XLNet é sua capacidade de capturar dependências de longo alcance. Porque considera todas as permutações, o modelo pode aprender relações entre palavras que estão distantes na frase original, mesmo que sejam adjacentes em uma permutação particular. Isso é particularmente útil para tarefas que exigem compreensão do contexto global, como classificação de documentos ou resolução de coreferência

Comparação com BERT

BERT, introduzido em 2018, usava um objetivo de modelagem de linguagem mascarada onde uma porcentagem de tokens de entrada são substituídos por [MASK], e o modelo é treinado para prever os tokens originais. Embora eficaz, essa abordagem tem limitações: os tokens [MASK] não estão presentes durante o ajuste fino ou inferência, criando uma incompatibilidade entre treinamento e implantação. Além disso, BERT assume que os tokens mascarados são independentes entre si, o que nem sempre é verdadeiro. XLNet aborda essas questões usando modelagem de linguagem por permutação, que não depende de tokens [MASK] e permite que o modelo capture dependências entre todos os tokens. Isso torna o XLNet mais consistente entre treinamento e inferência, e ele pode modelar distribuições de probabilidade conjuntas com mais precisão

No entanto, a abordagem de permutação também tem custos computacionais. XLNet requer mais tempo de treinamento do que BERT porque deve processar múltiplas permutações para cada exemplo de treinamento. O mecanismo de atenção auto-atenta de dois fluxos também adiciona complexidade à arquitetura. Apesar desses custos, os ganhos de desempenho tornaram o XLNet uma escolha popular para muitas aplicações de PLN na época de seu lançamento

Impacto e Legado

XLNet teve um impacto significativo no campo de aprendizado de máquina e processamento de linguagem natural. Demonstrou que modelos autorregressivos poderiam igualar ou exceder o desempenho de modelos de linguagem mascarada enquanto forneciam um objetivo de treinamento mais fundamentado. Seu sucesso inspirou mais pesquisas em modelos baseados em permutação e equivariantes a permutação. Muitos modelos subsequentes, como ELECTRA e T5, construíram sobre ideias do XLNet, e o conceito de modelagem de linguagem por permutação influenciou o design de grandes modelos de linguagem posteriores. Embora o XLNet tenha sido superado por modelos mais poderosos como GPT-3 e T5, ele permanece um marco importante no desenvolvimento de IA generativa e arquiteturas baseadas em Transformer (architecture). Seu lançamento de código aberto sob a licença Apache 2.0 também contribuiu para a democratização da pesquisa em IA, permitindo que pesquisadores e desenvolvedores em todo o mundo usassem e modificassem o modelo

Referências

  • Yang, Z., Dai, Z., Yang, Y., Carbonell, J., Salakhutdinov, R., & Le, Q. V. (2019). XLNet: Generalized Autoregressive Pretraining for Language Understanding. arXiv preprint arXiv:1906.08237.
  • Devlin, J., Chang, M. W., Lee, K., & Toutanova, K. (2018). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv preprint arXiv:1810.04805.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:natural-language-processing·transformer-models·deep-learning·language-models
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico