Traducido del inglés

SpanBERT es una variante de BERT que mejora la representación de segmentos al enmascarar segmentos contiguos de tokens y entrenar en la predicción de límites de segmentos, mejorando tareas como la respuesta a preguntas y la resolución de correferencias.

SpanBERT es una variante de la arquitectura de transformador basada en red neuronal, introducida en 2020 por investigadores de la Universidad Carnegie Mellon y el Laboratorio de IA de Stanford. Extiende el modelo original BERT al centrarse en predecir tramos completos de tokens contiguos en lugar de tokens individuales enmascarados. La innovación principal radica en dos objetivos de entrenamiento: el enmascaramiento de tramos y la predicción de límites de tramo (SBP, por sus siglas en inglés). El enmascaramiento de tramos reemplaza una secuencia contigua aleatoria de tokens con un único token [MASK], lo que obliga al modelo a inferir todo el tramo a partir de su contexto circundante. Luego, SBP utiliza las representaciones de los tokens al inicio y al final del tramo enmascarado para predecir los tokens internos, aprovechando la información de los límites. Este diseño hace que SpanBERT sea particularmente eficaz para tareas que requieren comprensión de entidades y relaciones de múltiples tokens, como la respuesta a preguntas y la resolución de correferencias.

Arquitectura y entrenamiento

SpanBERT conserva la arquitectura estándar de codificador transformador de BERT, con un codificador bidireccional de múltiples capas. La diferencia clave está en la estrategia de enmascaramiento de datos durante el preentrenamiento. En lugar de enmascarar el 15% de los tokens individuales de manera aleatoria, SpanBERT muestrea una longitud de tramo a partir de una distribución geométrica (con una media de 3.8 tokens) y enmascara ese bloque contiguo completo. La longitud del tramo está limitada a 10 tokens. Este enfoque anima al modelo a capturar dependencias dentro de secuencias más largas. El modelo se entrena con los mismos conjuntos de datos de Wikipedia en inglés y BooksCorpus que BERT, utilizando el mismo objetivo de modelado de lenguaje enmascarado para el tramo enmascarado, pero con la pérdida adicional de SBP. El objetivo de SBP utiliza los estados ocultos del primer y último token del tramo (después del enmascaramiento) para predecir los tokens internos, enseñando efectivamente al modelo a usar la información de los límites para reconstruir el contenido.

Predicción de límites de tramo

La predicción de límites de tramo es una tarea auxiliar novedosa introducida en SpanBERT. Para cada tramo enmascarado, el modelo toma las representaciones de salida del token inmediatamente anterior al tramo y del token inmediatamente posterior al tramo. Estos dos vectores se concatenan y se pasan a través de una capa lineal para predecir cada uno de los tokens internos enmascarados. Esto obliga al modelo a codificar los límites del tramo de manera que capture el contenido semántico dentro. A diferencia del modelado de lenguaje enmascarado de BERT, que trata cada token de manera independiente, SBP anima al modelo a razonar sobre el tramo como una unidad. Esto es particularmente beneficioso para tareas como la respuesta a preguntas, donde la respuesta suele ser un tramo contiguo de texto, y para la resolución de correferencias, donde las menciones suelen ser frases de múltiples tokens.

Rendimiento e impacto

SpanBERT logró resultados de vanguardia en varios puntos de referencia en el momento de su lanzamiento. En los conjuntos de datos de respuesta a preguntas SQuAD 1.1 y SQuAD 2.0, superó a BERT y a otros modelos contemporáneos como RoBERTa. También estableció nuevos récords en la tarea de resolución de correferencias de OntoNotes y en el conjunto de datos de extracción de relaciones TACRED. Las mejoras fueron más pronunciadas en tareas que requieren razonamiento a nivel de tramo, lo que confirma la efectividad del preentrenamiento centrado en tramos. El enfoque de SpanBERT influyó en investigaciones posteriores sobre aprendizaje de representaciones basado en tramos. Demostró que enmascarar tramos contiguos y usar la predicción de límites puede ser más efectivo que el enmascaramiento a nivel de token para ciertas tareas posteriores. El código del modelo y sus pesos preentrenados se publicaron públicamente, facilitando su adopción en la comunidad de investigación.

Comparación con BERT y RoBERTa

SpanBERT difiere de BERT principalmente en su estrategia de enmascaramiento y en la adición de SBP. BERT enmascara tokens individuales de manera aleatoria, mientras que SpanBERT enmascara tramos. RoBERTa, otra variante popular, utiliza enmascaramiento dinámico y elimina el objetivo de predicción de la siguiente oración, pero aún enmascara tokens individuales. El enmascaramiento de tramos de SpanBERT proporciona una señal de entrenamiento más fuerte para capturar dependencias de largo alcance. En comparaciones directas, SpanBERT superó consistentemente a BERT en tareas relacionadas con tramos, y a menudo igualó o superó a RoBERTa en respuesta a preguntas y correferencias, a pesar de usar un tamaño de datos de entrenamiento similar. La conclusión clave es que la elección de la granularidad del enmascaramiento importa significativamente para el aprendizaje de representaciones en procesamiento de lenguaje natural.

Aplicaciones y legado

La arquitectura de SpanBERT se ha aplicado a diversas tareas de aprendizaje automático más allá de la respuesta a preguntas y la correferencia. Se ha utilizado en la extracción de información, donde identificar menciones de entidades y relaciones a menudo requiere predicciones a nivel de tramo. También se ha adaptado para la minería de textos biomédicos, como extraer interacciones entre fármacos o asociaciones entre genes y enfermedades. Los principios del enmascaramiento de tramos y la predicción de límites se han incorporado en otros modelos, incluidos algunos pipelines de preentrenamiento de modelos de lenguaje grandes. Aunque SpanBERT en sí no se usa tan ampliamente como modelos más grandes como los sistemas de IA generativa, sigue siendo un hito significativo en la evolución de los codificadores basados en transformadores. Su enfoque en la comprensión a nivel de tramo ha informado el diseño de modelos más recientes que buscan mejorar tareas de predicción estructurada. A mediados de la década de 2020, SpanBERT todavía se referencia en la literatura de investigación como un punto de referencia sólido para métricas relacionadas con tramos.

Limitaciones

SpanBERT tiene algunas limitaciones. La estrategia de enmascaramiento de tramos requiere un ajuste cuidadoso de la distribución de la longitud del tramo, y el objetivo de SBP añade una sobrecarga computacional. El modelo también está limitado por la ventana de contexto fija del transformador, típicamente de 512 tokens, lo que puede restringir su capacidad para procesar documentos muy largos. Además, SpanBERT es un modelo solo de codificador, por lo que no está diseñado para la generación de texto. Su rendimiento en tareas generativas no es comparable al de los modelos basados en decodificadores. A pesar de estas restricciones, las contribuciones de SpanBERT al aprendizaje de representaciones de tramos han sido duraderas, y sirve como un punto de referencia valioso para comprender las compensaciones en los objetivos de preentrenamiento.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:natural-language-processing·transformer-models·pre-training·span-representation
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial