Traducido del inglés

DeBERTa (Decoding-enhanced BERT with disentangled attention) es un modelo de lenguaje basado en transformadores desarrollado por Microsoft que mejora BERT mediante el uso de atención desentrelazada y un decodificador de máscara mejorado. Alcanzó resultados de última generación en el punto de referencia SuperGLUE en 2021.

DeBERTa (Decoding-enhanced BERT with disentangled attention) es una familia de arquitecturas de redes neuronales basadas en transformadores para el procesamiento del lenguaje natural (PLN), presentada por investigadores de Microsoft en 2021. Se basa en el modelo BERT anterior incorporando dos innovaciones clave: un mecanismo de atención desentrelazada que modela por separado la información de contenido y la de posición relativa, y un decodificador de máscara mejorado que optimiza la predicción de tokens enmascarados durante el preentrenamiento. Estos cambios permiten que DeBERTa alcance un rendimiento superior en una variedad de referencias de PLN, incluida la tabla de clasificación de SuperGLUE, donde superó las puntuaciones de referencia humanas por primera vez en enero de 2021.

Antecedentes y Motivación

DeBERTa forma parte de la evolución más amplia de los grandes modelos de lenguaje que comenzó con la introducción de la arquitectura de transformador en 2017. BERT, publicado por Google en 2018, demostró que el preentrenamiento de un codificador de transformador bidireccional en grandes corpus de texto podía producir representaciones transferibles para muchas tareas posteriores. Sin embargo, el mecanismo de atención de BERT codifica las posiciones de los tokens como incrustaciones absolutas añadidas a la entrada, lo que puede limitar su capacidad para generalizar a secuencias más largas o a combinaciones de posiciones no vistas. DeBERTa aborda esto desacoplando la información de contenido y posición, lo que permite al modelo aprender relaciones más flexibles entre tokens.

Arquitectura

DeBERTa conserva la estructura general de solo codificador de BERT, que consiste en una capa de incrustación, múltiples capas de codificador de transformador y una cabeza de salida específica para la tarea. Las principales diferencias arquitectónicas residen en el cálculo de la atención y en el proceso de decodificación de máscaras.

Atención Desentrelazada

En la atención estándar de los transformadores, cada token se representa mediante un único vector que combina su contenido y su posición absoluta. DeBERTa, en cambio, representa cada token con dos vectores separados: uno para el contenido y otro para la posición relativa. La puntuación de atención entre dos tokens se calcula entonces como la suma de cuatro términos distintos: contenido a contenido, contenido a posición, posición a contenido y posición a posición. Este desentrelazado permite al modelo capturar relaciones semánticas y posicionales de forma independiente, lo que resulta especialmente beneficioso para tareas que requieren una comprensión precisa del orden de las palabras y de la distancia.

Decodificador de Máscara Mejorado

El objetivo de preentrenamiento de DeBERTa es el modelado de lenguaje enmascarado, similar al de BERT. Sin embargo, DeBERTa introduce un decodificador de máscara mejorado que utiliza tanto la información de contenido como la de posición del token enmascarado para predecir la palabra original. Esto se logra incorporando la posición absoluta del token enmascarado en la capa de decodificación, lo que ayuda al modelo a resolver ambigüedades que surgen cuando varios tokens comparten posiciones relativas similares. El decodificador mejorado optimiza la eficiencia del preentrenamiento y conduce a un mejor rendimiento en las tareas posteriores.

Entrenamiento y Variantes

DeBERTa se preentrenó con el mismo corpus que BERT, que incluye la Wikipedia en inglés y BookCorpus, con un total de aproximadamente 16GB de texto. El modelo base, DeBERTa-base, tiene 12 capas, 768 unidades ocultas y 12 cabezas de atención, con alrededor de 140 millones de parámetros. Una variante más grande, DeBERTa-large, tiene 24 capas, 1024 unidades ocultas y 16 cabezas de atención, con aproximadamente 400 millones de parámetros. En 2021, Microsoft también publicó DeBERTa-v3, que introdujo un nuevo método de preentrenamiento llamado detección de tokens reemplazados, mejorando aún más la eficiencia y el rendimiento.

Rendimiento e Impacto

DeBERTa logró resultados de vanguardia en varias referencias importantes de PLN. En enero de 2021, DeBERTa, con un tamaño de modelo grande y datos de entrenamiento adicionales, superó la línea base humana en la referencia SuperGLUE, un hito que destacó el rápido progreso de los grandes modelos de lenguaje. DeBERTa también obtuvo un buen rendimiento en la referencia GLUE y en el conjunto de datos de preguntas y respuestas SQuAD. Sus innovaciones influyeron en modelos posteriores, incluidos los de las familias GPT y T5, y contribuyeron al desarrollo de mecanismos de atención más eficientes en arquitecturas posteriores.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:natural-language-processing·deep-learning·transformer-architectures·language-models
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial