Traduzido do inglês

XLM-RoBERTa é um modelo de linguagem multilíngue baseado em transformer, desenvolvido pela Facebook AI, pré-treinado em 100 idiomas usando modelagem de linguagem mascarada para permitir transferência zero-shot entre idiomas.

XLM-RoBERTa é um modelo de linguagem multilíngue desenvolvido pela Facebook AI (agora Meta AI) que estende o paradigma de aprendizado de máquina de modelagem de linguagem mascarada para 100 idiomas. Ele se baseia na arquitetura de transformadores e na abordagem de treinamento do RoBERTa, uma variante otimizada de forma robusta do BERT. O modelo é projetado para aprender um espaço de representação compartilhado entre idiomas, permitindo que ele execute tarefas como classificação de texto, reconhecimento de entidades nomeadas e resposta a perguntas nos idiomas em que foi pré-treinado, sem exigir dados de treinamento específicos de cada tarefa em cada idioma.

O modelo foi introduzido em um artigo de pesquisa de 2019 intitulado "Unsupervised Cross-lingual Representation Learning at Scale" por Alexis Conneau, Kartikay Khandelwal, Naman Goyal, Vishrav Chaudhary, Guillaume Wenzek, Francisco Guzmán, Edouard Grave, Myle Ott, Luke Zettlemoyer e Veselin Stoyanov. Ele foi lançado como um modelo de código aberto, com checkpoints disponíveis em dois tamanhos: XLM-R base (com 12 camadas, 768 dimensões ocultas e 270 milhões de parâmetros) e XLM-R large (com 24 camadas, 1024 dimensões ocultas e 550 milhões de parâmetros). Os dados de pré-treinamento do modelo consistiam em um corpus CommonCrawl filtrado contendo mais de 2 terabytes de texto, balanceado entre os 100 idiomas.

Abordagem de Pré-treinamento

XLM-RoBERTa usa um objetivo de modelagem de linguagem mascarada, onde uma porcentagem dos tokens de entrada é mascarada aleatoriamente, e o modelo aprende a prever os tokens originais com base no contexto circundante. Diferente de modelos multilíngues anteriores, como o XLM, que exigiam sentenças paralelas ou objetivos de modelagem de linguagem por tradução, o XLM-RoBERTa depende apenas de dados monolíngues de cada idioma. Isso simplifica o pipeline de pré-treinamento e permite a escalabilidade para um número maior de idiomas. O modelo usa um vocabulário compartilhado de 250.000 unidades subpalavra, construído com um tokenizador SentencePiece, o que permite uma representação eficiente de múltiplos sistemas de escrita e idiomas.

Durante o pré-treinamento, o modelo foi treinado com um esquema de mascaramento dinâmico, semelhante ao RoBERTa, onde o padrão de mascaramento muda a cada época. O treinamento usou o otimizador Adam com uma taxa de aprendizado máxima de 1e-4 e um tamanho de lote de 8.192 sequências. O modelo grande foi treinado em 512 TPUs (Unidades de Processamento Tensor) por aproximadamente 1,5 milhão de passos, consumindo recursos computacionais significativos. Os autores relataram que o desempenho do modelo melhorou com mais dados e maior tamanho do modelo, demonstrando os benefícios de escalar o pré-treinamento multilíngue.

Capacidades de Transferência Multilíngue

Uma característica chave do XLM-RoBERTa é sua capacidade de realizar transferência multilíngue zero-shot. Quando ajustado em uma tarefa em um idioma (por exemplo, inglês), o modelo pode aplicar esse conhecimento a outros idiomas sem ajuste adicional. Isso é alcançado porque o espaço de representação compartilhado alinha conceitos semelhantes entre idiomas. No artigo original, os autores avaliaram o XLM-RoBERTa em vários benchmarks, incluindo XNLI (inferência de linguagem natural multilíngue), MLQA (resposta a perguntas multilíngue) e NER (reconhecimento de entidades nomeadas). O modelo alcançou resultados de última geração nesses benchmarks na época, superando modelos multilíngues anteriores, como mBERT e XLM.

Por exemplo, no XNLI, o modelo grande alcançou uma precisão média de 79,2% em 15 idiomas, em comparação com 72,6% para o mBERT e 76,2% para o XLM. O modelo também mostrou forte desempenho em idiomas com poucos recursos, como suaíli e urdu, indicando que o pré-treinamento em idiomas diversos ajuda a mitigar a escassez de dados rotulados. No entanto, os autores notaram que o desempenho varia entre idiomas, com idiomas que têm mais dados de treinamento geralmente alcançando melhores resultados.

Arquitetura e Implementação

XLM-RoBERTa segue a arquitetura padrão de codificador transformer, sem componente decodificador. Ele usa mecanismos de autoatenção multi-cabeça, camadas feed-forward e normalização de camada, conforme descrito no artigo original sobre transformers. O modelo incorpora uma codificação posicional aprendida e usa um token especial [CLS] no início de cada sequência, cujo estado oculto final é usado para tarefas de classificação. O modelo suporta sequências de até 512 tokens, que é uma restrição comum para modelos do estilo BERT.

A implementação está disponível na biblioteca Hugging Face Transformers, facilitando o carregamento e o ajuste do modelo para tarefas personalizadas. O modelo também é integrado a outros frameworks, como o Fairseq, que foi usado para o treinamento original. O lançamento de código aberto inclui os pesos pré-treinados, o tokenizador e arquivos de configuração, permitindo que pesquisadores e profissionais reproduzam resultados e construam sobre o modelo. O modelo é licenciado sob a licença MIT, permitindo uso comercial e de pesquisa.

Impacto e Aplicações

XLM-RoBERTa teve um impacto significativo no campo de processamento de linguagem natural (PLN), particularmente para aplicações multilíngues. Ele tem sido amplamente adotado como uma linha de base para benchmarks multilíngues e é usado em sistemas de produção para tarefas como suporte ao cliente multilíngue, moderação de conteúdo e extração de informações. A capacidade do modelo de lidar com 100 idiomas com um único conjunto de pesos reduz a necessidade de modelos separados por idioma, simplificando a implantação e a manutenção.

O modelo também influenciou pesquisas subsequentes, incluindo o desenvolvimento de modelos multilíngues maiores, como mT5 e XLM-E, e tem sido usado como um componente em sistemas mais complexos, como pipelines de geração aumentada por recuperação. Seu sucesso demonstrou que escalar dados de pré-treinamento e tamanho do modelo pode gerar ganhos substanciais na compreensão multilíngue, abrindo caminho para avanços adicionais em modelos de linguagem de grande porte multilíngues.

Limitações e Considerações

Apesar de seus pontos fortes, o XLM-RoBERTa tem limitações. O vocabulário e os dados de pré-treinamento do modelo são tendenciosos em relação a idiomas com muitos recursos, e o desempenho em idiomas com muito poucos recursos pode ser subótimo. O limite de comprimento de sequência de 512 tokens restringe seu uso para documentos longos. Além disso, o modelo não gera texto, pois é um modelo apenas de codificador, portanto não é adequado para tarefas generativas sem adaptação. O custo computacional do pré-treinamento foi substancial, mas os checkpoints lançados permitem que os usuários evitem essa despesa. Como com outros modelos de linguagem, o XLM-RoBERTa pode codificar vieses sociais presentes nos dados de treinamento, o que requer consideração cuidadosa em aplicações downstream.

Ver Também

  • BERT (não na lista, mas relacionado - omitido)
  • modelo-multilingue (não na lista - omitido)
  • RoBERTa (não na lista - omitido)
  • transferencia-multilingue (não na lista - omitido)

(Nota: Como os slugs de links fornecidos não incluem esses termos específicos, o artigo usa apenas os slugs permitidos. Os links internos usados são Machine learning, Transformer (architecture) e Large language model.)

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:cross-lingual-model·transformer·language-model·multilingual-nlp
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico