Traduzido do inglês

DeBERTa (Decoding-enhanced BERT with disentangled attention) é um modelo de linguagem baseado em transformer desenvolvido pela Microsoft que melhora o BERT ao usar atenção desentrelaçada e um decodificador de máscara aprimorado. Ele alcançou resultados de ponta no benchmark SuperGLUE em 2021.

DeBERTa (Decoding-enhanced BERT with disentangled attention) é uma família de arquiteturas de redes neurais baseadas em transformers para processamento de linguagem natural (PLN), introduzida por pesquisadores da Microsoft em 2021. Ela se baseia no modelo BERT anterior, incorporando duas inovações principais: um mecanismo de atenção desembaraçada que modela separadamente informações de conteúdo e posição relativa, e um decodificador de máscara aprimorado que melhora a predição de tokens mascarados durante o pré-treinamento. Essas mudanças permitem que a DeBERTa alcance desempenho superior em uma variedade de benchmarks de PLN, incluindo o ranking SuperGLUE, onde superou as pontuações de referência humanas pela primeira vez em janeiro de 2021.

Histórico e Motivação

A DeBERTa faz parte da evolução mais ampla dos grandes modelos de linguagem que começou com a introdução da arquitetura transformer em 2017. O BERT, lançado pelo Google em 2018, demonstrou que o pré-treinamento de um codificador transformer bidirecional em grandes corpora de texto poderia produzir representações transferíveis para muitas tarefas downstream. No entanto, o mecanismo de atenção do BERT codifica as posições dos tokens como embeddings absolutos adicionados à entrada, o que pode limitar sua capacidade de generalizar para sequências mais longas ou combinações de posições não vistas. A DeBERTa aborda isso desacoplando informações de conteúdo e posição, permitindo que o modelo aprenda relações mais flexíveis entre tokens.

Arquitetura

A DeBERTa mantém a estrutura geral apenas de codificador do BERT, consistindo em uma camada de embeddings, múltiplas camadas de codificador transformer e uma cabeça de saída específica para a tarefa. As principais diferenças arquiteturais residem no cálculo da atenção e no processo de decodificação de máscaras.

Atenção Desembaraçada

Na atenção padrão do transformer, cada token é representado por um único vetor que combina seu conteúdo e posição absoluta. A DeBERTa, em vez disso, representa cada token com dois vetores separados: um para conteúdo e outro para posição relativa. A pontuação de atenção entre dois tokens é então calculada como a soma de quatro termos distintos: conteúdo-para-conteúdo, conteúdo-para-posição, posição-para-conteúdo e posição-para-posição. Esse desembaraçamento permite que o modelo capture relações semânticas e posicionais de forma independente, o que é particularmente benéfico para tarefas que exigem compreensão refinada da ordem das palavras e da distância.

Decodificador de Máscara Aprimorado

O objetivo de pré-treinamento da DeBERTa é a modelagem de linguagem mascarada, semelhante ao BERT. No entanto, a DeBERTa introduz um decodificador de máscara aprimorado que usa tanto as informações de conteúdo quanto de posição do token mascarado para prever a palavra original. Isso é alcançado incorporando a posição absoluta do token mascarado na camada de decodificação, o que ajuda o modelo a resolver ambiguidades que surgem quando múltiplos tokens compartilham posições relativas semelhantes. O decodificador aprimorado melhora a eficiência do pré-treinamento e leva a um melhor desempenho downstream.

Treinamento e Variantes

A DeBERTa foi pré-treinada no mesmo corpus que o BERT, que inclui a Wikipédia em inglês e o BookCorpus, totalizando aproximadamente 16GB de texto. O modelo base, DeBERTa-base, tem 12 camadas, 768 unidades ocultas e 12 cabeças de atenção, totalizando cerca de 140 milhões de parâmetros. Uma variante maior, DeBERTa-large, tem 24 camadas, 1024 unidades ocultas e 16 cabeças de atenção, com aproximadamente 400 milhões de parâmetros. Em 2021, a Microsoft também lançou a DeBERTa-v3, que introduziu um novo método de pré-treinamento chamado detecção de token substituído, melhorando ainda mais a eficiência e o desempenho.

Desempenho e Impacto

A DeBERTa alcançou resultados de última geração em vários benchmarks importantes de PLN. Em janeiro de 2021, a DeBERTa com tamanho de modelo grande e dados de treinamento adicionais superou a linha de base humana no benchmark SuperGLUE, um marco que destacou o rápido progresso dos grandes modelos de linguagem. A DeBERTa também teve um desempenho forte no benchmark GLUE e no conjunto de dados de perguntas e respostas SQuAD. Suas inovações influenciaram modelos subsequentes, incluindo aqueles nas famílias GPT e T5, e contribuíram para o desenvolvimento de mecanismos de atenção mais eficientes em arquiteturas posteriores.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:natural-language-processing·deep-learning·transformer-architectures·language-models
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico