Traduzido do inglês

SpanBERT é uma variante do BERT que melhora a representação de spans ao mascarar spans contiguos de tokens e treinar na predição de limites de spans, aprimorando tarefas como [[question-answering|resposta a perguntas]] e [[coreference-resolution|resolução de coreferência]].

SpanBERT é uma variante da arquitetura transformers baseada em redes neurais, introducida em 2020 por pesquisadores da Universidade Carnegie Mellon e do Laboratorio de IA de Stanford. Ele estende o modelo BERT original ao focar na predição de spans completos de tokens contiguos, em vez de tokens mascarados individualmente. A inovação central reside em dois objetivos de treinamento: mascaramento de spans e predição de limites de span (SBP). O mascaramento de spans substituye uma sequência contigua aleatoria de tokens por um único token [MASK], forzando o modelo a inferir todo o span a partir de seu contexto circundante. O SBP, por sua vez, usa as representações dos tokens no início e no final do span mascarado para predir os tokens internos, aproveitando a informação dos limites. Este design torna SpanBERT particularmente eficaz para tarefas que requerem compreensão de entidades e relações de múltiples tokens, como resposta a perguntas e resolução de coreferência.

Arquitectura e Treinamento

SpanBERT mantiene a arquitetura padrão de codificador transformers de BERT, com um codificador bidireccional de múltiples capas. A diferença clave está na estratégia de mascaramento de datos durante o pré-treino. Em lugar de mascarar 15% dos tokens individualmente de forma aleatoria, SpanBERT muestrea uma longitud de span a partir de uma distribución geométrica (com média de 3,8 tokens) e mascara ese bloque contiguo completo. A longitud do span está limitada a 10 tokens. Esta abordagem incentiva o modelo a capturar dependências dentro de secuencias más largas. O modelo é treinado nos mesmos conjuntos de datos de Wikipedia em inglês e BooksCorpus que BERT, usando o mesmo objetivo de modelagem de linguagem mascarada para o span mascarado, pero com a adição da pérdida SBP. O objetivo SBP usa os estados ocultos do primeiro e último token do span (após o mascaramento) para predir os tokens internos, ensinando efectivamente ao modelo a usar informação de límites para reconstruir conteúdo.

Predição de Limites de Span

A predição de limites de span é uma tarefa auxiliar novedosa introducida em SpanBERT. Para cada span mascarado, o modelo toma as representações de saída do token imediatamente antes do span e do token imediatamente depois do span. Estes dois vectores são concatenados e passados através de uma capa linear para predir cada um dos tokens internos mascarados. Isto força o modelo a codificar os límites do span de uma forma que captura o conteúdo semántico dentro. A diferencia da modelagem de linguagem mascarada de BERT, que trata cada token de forma independente, o SBP incentiva o modelo a razoar sobre o span como uma unidade. Isto é particularmente beneficioso para tarefas como resposta a preguntas, onde a resposta é frecuentemente um span contiguo de texto, e para resolución de coreferencia, onde as menções son tipicamente frases de múltiples tokens.

Desempeño e Impacto

SpanBERT alcanzó resultados de última generación en varios benchmarks no momento de sua liberación. Nos conjuntos de datos de resposta a preguntas SQuAD 1.1 e SQuAD 2.0, superó a BERT e outros modelos contemporáneos como RoBERTa. Também estabeleceu novos récords na tarefa de resolución de coreferencia OntoNotes e no conjunto de datos de extracción de relaciones TACRED. As melhoras foram mais pronunciadas em tarefas que requerem razoamento a nível de span, confirmando a efectividade do pré-treino focado en spans. A abordagem de SpanBERT influenciou investigações posteriores em aprendizaxe de representación baseada en spans. Demostró que mascarar spans contiguos e usar predición de límites pode ser más efectivo que o mascaramento a nível de token para certas tarefas posteriores. O código do modelo e os pesos pré-treinados foram liberados públicamente, facilitando sua adopción na comunidade de investigación.

Comparación con BERT e RoBERTa

SpanBERT difiere de BERT principalmente en sua estrategia de mascaramento e na adición do SBP. BERT mascara tokens individuales de forma aleatoria, enquanto SpanBERT mascara spans. RoBERTa, outra variante popular, usa mascaramento dinámico e elimina o obxectivo de predición de seguinte oración, pero ainda mascara tokens individuales. O mascaramento de spans de SpanBERT proporciona un sinal de treinamento más forte para capturar dependencias de longo alcance. En comparacións directas, SpanBERT superó consistentemente a BERT en tarefas relacionadas con spans, e frecuentemente igualou ou superó a RoBERTa en resposta a preguntas e coreferencia, a pesar de usar un tamaño de datos de treinamento similar. A conclusión clave é que a elección da granularidade do mascaramento importa significativamente para a aprendizaxe de representación en procesamiento de linguaxe natural.

Aplicacións e Legado

A arquitectura de SpanBERT foi aplicada a diversas tarefas de aprendizaxe automática máis alá da resposta a preguntas e a coreferencia. Foi usado en extracción de información, onde identificar mencións de entidades e relacións frecuentemente require predicións a nivel de span. Também foi adaptado para minería de textos biomédicos, como extraer interaccións fármaco-fármaco ou asociacións xene-enfermedade. Os principios de mascaramento de spans e predición de límites foron incorporados en outros modelos, incluindo algúns pipelines de pré-treino de modelos de linguaxe grande. Aínda que SpanBERT en sí non é tan amplamente usado como modelos máis grandes como sistemas de IA xenerativa, segue sendo un fito significativo na evolución dos codificadores baseados en transformers. O seu foco na comprensión a nivel de span informou o diseño de modelos máis recentes que buscan mellorar tarefas de predición estruturada. A partir da metade da década de 2020, SpanBERT aínda é referenciado na literatura de investigación como un baseline forte para benchmarks relacionados con spans.

Limitacións

SpanBERT ten algunhas limitacións. A estratexia de mascaramento de spans require un axuste coidadoso da distribución da lonxitude do span, e o obxectivo SBP engade sobrecarga computacional. O modelo tamén está limitado pola xanela de contexto fixa do transformer, tipicamente 512 tokens, o que pode restrinxir a súa capacidade para procesar documentos moi longos. Ademais, SpanBERT é un modelo só de codificador, polo que non está deseñado para xeración de texto. O seu desempeño en tarefas xenerativas non é comparable ao dos modelos baseados en decodificador. A pesar destas restriccións, as contribucións de SpanBERT á aprendizaxe de representación de spans foron duradeiras, e serve como un punto de referencia valioso para comprender os trade-offs nos obxectivos de pré-treino.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:natural-language-processing·transformer-models·pre-training·span-representation
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico