Modelagem de Linguagem Mascarada

Traduzido do inglês

O modelamento de linguagem mascarado é um objetivo de pré-treinamento autossupervisionado no qual um modelo prevê tokens mascarados em uma sequência, permitindo a compreensão bidirecional do contexto, como popularizado pelo [[bert|BERT]].

Modelagem de linguagem mascarada (MLM, do inglês masked language modeling) é um objetivo de aprendizado autossupervisionado usado em processamento de linguagem natural, no qual um modelo é treinado para prever tokens mascarados aleatoriamente em uma sequência com base no contexto circundante. Diferentemente dos modelos de linguagem tradicionais que preveem o próximo token de forma da esquerda para a direita, a MLM permite que o modelo use tanto o contexto à esquerda quanto à direita, possibilitando uma compreensão bidirecional mais profunda da linguagem. Essa abordagem foi popularizada pelo modelo baseado em Transformer BERT (Bidirectional Encoder Representations from Transformers, ou Representações de Codificador Bidirecional de Transformers), introduzido por Google em 2018, e desde então se tornou uma pedra angular de muitos grandes modelos de linguagem e sistemas de aprendizado profundo.

A ideia central da MLM é corromper uma parte do texto de entrada substituindo alguns tokens por um token especial [MASK] (máscara) e, em seguida, treinar o modelo para reconstruir os tokens originais. Isso força o modelo a aprender representações contextuais que capturam relações sintáticas e semânticas. A MLM é uma forma de treinamento de inteligência artificial que não requer dados rotulados por humanos, tornando-a altamente escalável para pré-treinamento em vastos corpus de texto.

Histórico

O conceito de prever palavras ausentes em texto tem raízes em modelos estatísticos e neurais anteriores, mas a formulação moderna da MLM surgiu com o advento do aprendizado profundo. Em 2018, Jacob Devlin e colegas da Google AI introduziram o BERT, que usava MLM como seu principal objetivo de pré-treinamento. O sucesso do BERT demonstrou que o pré-treinamento bidirecional poderia melhorar significativamente o desempenho em uma ampla gama de tarefas de processamento de linguagem natural, incluindo resposta a perguntas e análise de sentimentos.

Antes do BERT, modelos como o ELMo usavam LSTMs bidirecionais, mas não condicionavam conjuntamente em ambas as direções de maneira profunda. A arquitetura Transformer, introduzida em 2017 por Vaswani et al., forneceu a base para o mecanismo de atenção bidirecional do BERT. A MLM tornou-se uma inovação fundamental que distinguiu o BERT de modelos unidirecionais anteriores, como o GPT.

Como Funciona a Modelagem de Linguagem Mascarada

Em uma configuração típica de MLM, uma sequência de treinamento é processada da seguinte forma:

  1. Tokenização: O texto de entrada é dividido em tokens usando um tokenizador (por exemplo, WordPiece).
  2. Mascaramento: Um subconjunto aleatório de tokens (tipicamente 15%) é selecionado. Para cada token selecionado, há 80% de chance de substituí-lo por [MASK], 10% de chance de substituí-lo por um token aleatório e 10% de chance de mantê-lo inalterado.
  3. Predição: O modelo processa a sequência mascarada e produz uma distribuição de probabilidade sobre o vocabulário para cada posição mascarada.
  4. Perda: A perda é calculada como a entropia cruzada entre a distribuição prevista e o token verdadeiro, e os gradientes são retropropagados para atualizar os pesos do modelo.

Essa estratégia de mascaramento, conhecida como "mascaramento com substituição aleatória", foi introduzida no BERT para mitigar a incompatibilidade entre o pré-treinamento (onde [MASK] aparece) e o ajuste fino (onde [MASK] está ausente).

Vantagens e Limitações

A MLM oferece várias vantagens:

  • Contexto bidirecional: Os modelos podem aproveitar informações de ambos os lados de um token, levando a representações mais ricas.
  • Escalabilidade: O pré-treinamento pode ser feito em texto não rotulado, permitindo que os modelos aprendam a partir de corpora massivos.
  • Aprendizado por transferência: O ajuste fino de um modelo MLM pré-treinado em tarefas downstream frequentemente produz resultados de última geração com dados rotulados limitados.

No entanto, a MLM também tem limitações:

  • Custo computacional: O treinamento exige recursos computacionais significativos, muitas vezes usando hardware especializado como sistemas AWS Trainium ou Cerebras.
  • Ineficiência de amostragem: Apenas uma pequena fração dos tokens é usada para previsão em cada etapa de treinamento, tornando o treinamento menos eficiente em termos de amostras do que métodos autorregressivos.
  • Incompatibilidade entre pré-treinamento e ajuste fino: O token [MASK] não está presente durante o ajuste fino, o que pode causar uma mudança de distribuição.

Variantes e Melhorias

Várias variantes da MLM foram propostas para lidar com suas limitações:

  • RoBERTa: Desenvolvido pela Meta AI (anteriormente Facebook AI), o RoBERTa remove o objetivo de previsão de sentença e usa mascaramento dinâmico, onde o padrão de mascaramento muda a cada época. Também treina com lotes maiores e mais dados.
  • ALBERT: Introduz compartilhamento de parâmetros e previsão de ordem de sentenças para reduzir o uso de memória, mantendo o desempenho.
  • ELECTRA: Usa uma tarefa de detecção de tokens substituídos, em que o modelo aprende a distinguir tokens reais de substituições geradas, tornando o treinamento mais eficiente.
  • SpanBERT: Máscara trechos contíguos de tokens em vez de tokens individuais, melhorando o desempenho em tarefas relacionadas a trechos.

Essas variantes foram propostas para abordar as limitações da MLM original e têm sido adotadas em vários grandes modelos de linguagem.

Aplicações na IA Moderna

A MLM é usada não apenas para pré-treinar modelos de propósito geral, mas também em domínios específicos. Por exemplo, o BioBERT aplica MLM a textos biomédicos, e o ClinicalBERT é treinado em notas clínicas. Além disso, a MLM foi estendida a outras modalidades, como visão computacional, por meio de autoencoders mascarados (ex.: MAE) e áudio (ex.: wav2vec 2.0).

No contexto de IA generativa, a MLM é frequentemente usada como componente em modelos híbridos que combinam objetivos bidirecionais e autorregressivos, como T5 e BART, que utilizam um objetivo de denoising semelhante à MLM, mas com arquitetura de sequência a sequência.

Relação com Outros Objetivos de Pré-treinamento

A MLM é um dos vários objetivos de pré-treinamento em aprendizado de máquina. Outros incluem:

  • Modelagem autorregressiva: Prediz o próximo token com base nos tokens anteriores (ex.: GPT). É unidirecional e serve de base para muitos grandes modelos de linguagem, como os da OpenAI.
  • Denoising de sequência a sequência: Modelos como T5 e BART corrompem a entrada e treinam o modelo para reconstruir a sequência original, o que pode ser visto como uma forma generalizada de MLM.
  • Aprendizado contrastivo: Usado em modelos como SimCSE para aprender embeddings de frases, aproximando frases semelhantes e afastando as dissimilares.

A natureza bidirecional da MLM a torna particularmente adequada para tarefas que exigem compreensão do contexto completo, como reconhecimento de entidades nomeadas e extração de relações.

Impacto no Campo

A introdução da MLM com o BERT marcou uma mudança de paradigma no processamento de linguagem natural. Ela demonstrou que o pré-treinamento em grandes corpora com um objetivo simples poderia melhorar significativamente o desempenho em uma ampla gama de tarefas. Isso levou ao desenvolvimento de modelos derivados, como DistilBERT, ALBERT e RoBERTa, que exploram variações na arquitetura e no treinamento.

A MLM também influenciou o design de arquiteturas baseadas em Transformer em outras áreas, como visão computacional (ex.: BEiT, MAE) e processamento de fala (ex.: wav2vec 2.0). O princípio de mascaramento e reconstrução tornou-se um conceito geral no aprendizado autossupervisionado.

Impacto no Campo

A introdução da MLM com o BERT marcou uma mudança de paradigma no processamento de linguagem natural. Ela demonstrou que o pré-treinamento em texto não rotulado pode produzir representações que transferem bem para uma ampla gama de tarefas. Isso levou ao desenvolvimento de numerosos modelos baseados em BERT, como DistilBERT, TinyBERT e MobileBERT, que visam preservar o desempenho com menor custo computacional.

A MLM também influenciou o design de arquiteturas Transformer em outros domínios, como visão computacional (ex.: BEiT) e processamento de fala (ex.: wav2vec 2.0). O conceito de mascaramento e reconstrução tornou-se um princípio fundamental em aprendizado autossupervisionado.

Impacto no Campo

A introdução da MLM com o BERT marcou uma mudança de paradigma no processamento de linguagem natural. Ela demonstrou que um objetivo simples de pré-treinamento poderia produzir representações que transferem bem para uma ampla gama de tarefas. Isso levou ao desenvolvimento de modelos menores e mais eficientes, como DistilBERT e TinyBERT, que mantêm o desempenho com menos parâmetros.

Além disso, a MLM influenciou o projeto de sistemas em outras áreas, como visão computacional e fala, e inspirou abordagens híbridas que combinam bidirecionalidade com geração autorregressiva.

Direções Futuras

A pesquisa continua explorando objetivos de pré-treinamento mais eficientes e eficazes. Algumas direções incluem:

  • Modelos unificados: Combinar MLM com modelagem autorregressiva em um único modelo, como no XLNet, que usa modelagem de linguagem por permutação.
  • Atenção eficiente: Reduzir o custo computacional da atenção bidirecional para permitir MLM em sequências mais longas.
  • MLM multimodal: Estender a MLM para modelar conjuntamente texto, imagem e áudio, como em modelos como Flamingo.

Empresas como Google DeepMind, OpenAI e Anthropic continuam investindo em pesquisa de pré-treinamento, e a MLM permanece uma técnica fundamental em seus conjuntos de ferramentas.

Conclusão

A modelagem de linguagem mascarada tornou-se uma técnica fundamental na IA moderna, permitindo que modelos aprendam representações bidirecionais ricas a partir de texto não rotulado. Sua introdução com o BERT em 2018 revolucionou o campo de processamento de linguagem natural e, desde então, foi adaptada a diversas modalidades e arquiteturas. Embora novos objetivos e modelos tenham surgido, os princípios de mascaramento e reconstrução da MLM continuam a influenciar o design de sistemas de última geração. À medida que a pesquisa avança, a MLM provavelmente permanecerá como um componente essencial no desenvolvimento de modelos de IA mais capazes e eficientes.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:natural-language-processing·self-supervised-learning·pretraining·transformer
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico