Modelado de Lenguaje Enmascarado

Traducido del inglés

El modelado de lenguaje enmascarado es un objetivo de preentrenamiento autosupervisado en el que un modelo predice tokens enmascarados en una secuencia, lo que permite una comprensión del contexto bidireccional, como popularizó BERT.

El modelado de lenguaje enmascarado (MLM) es un objetivo de aprendizaje autosupervisado utilizado en el procesamiento del lenguaje natural, donde un modelo se entrena para predecir tokens enmascarados aleatoriamente en una secuencia basándose en el contexto circundante. A diferencia de los modelos de lenguaje tradicionales que predicen el siguiente token de izquierda a derecha, el MLM permite que el modelo utilice tanto el contexto izquierdo como el derecho, lo que posibilita una comprensión bidireccional más profunda del lenguaje. Este enfoque fue popularizado por el modelo BERT (Representaciones de Codificador Bidireccional de Transformadores), basado en la arquitectura Transformer, introducido por Google en 2018, y desde entonces se ha convertido en una piedra angular de muchos modelos de lenguaje grandes y sistemas de aprendizaje profundo.

La idea central del MLM es corromper una parte del texto de entrada reemplazando algunos tokens con un token especial [MASK], y luego entrenar al modelo para reconstruir los tokens originales. Esto obliga al modelo a aprender representaciones contextuales que capturan relaciones sintácticas y semánticas. El MLM es una forma de entrenamiento de inteligencia artificial que no requiere datos etiquetados por humanos, lo que lo hace altamente escalable para el preentrenamiento en grandes corpus de texto.

Antecedentes históricos

El concepto de predecir palabras faltantes en un texto tiene raíces en modelos estadísticos y neuronales anteriores, pero la formulación moderna del MLM surgió con la llegada del aprendizaje profundo. En 2018, Jacob Devlin y sus colegas de Google AI presentaron BERT, que utilizó el MLM como su objetivo de preentrenamiento principal. El éxito de BERT demostró que el preentrenamiento bidireccional podía mejorar significativamente el rendimiento en una amplia gama de tareas de procesamiento del lenguaje natural, como la respuesta a preguntas y el análisis de sentimientos.

Antes de BERT, modelos como ELMo utilizaban LSTM bidireccionales, pero no condicionaban conjuntamente ambas direcciones de manera profunda. La arquitectura Transformer, introducida en 2017 por Vaswani y sus colegas, proporcionó la base para el mecanismo de atención bidireccional de BERT. El MLM se convirtió en una innovación clave que distinguía a BERT de modelos unidireccionales anteriores como GPT.

Cómo funciona el modelado de lenguaje enmascarado

En una configuración típica de MLM, una secuencia de entrenamiento se procesa de la siguiente manera:

  1. Tokenización: El texto de entrada se divide en tokens utilizando un tokenizador (por ejemplo, WordPiece).
  2. Enmascaramiento: Se selecciona un subconjunto aleatorio de tokens (generalmente el 15%). Para cada token seleccionado, hay un 80% de probabilidad de reemplazarlo con [MASK], un 10% de probabilidad de reemplazarlo con un token aleatorio y un 10% de probabilidad de mantenerlo sin cambios.
  3. Predicción: El modelo procesa la secuencia enmascarada y genera una distribución de probabilidad sobre el vocabulario para cada posición enmascarada.
  4. Pérdida: La pérdida se calcula como la entropía cruzada entre la distribución predicha y el token verdadero, y los gradientes se retropropagan para actualizar los pesos del modelo.

Esta estrategia de enmascaramiento, conocida como "MLM con reemplazo aleatorio", fue introducida en BERT para mitigar la discrepancia entre el preentrenamiento (donde aparece [MASK]) y el ajuste fino (donde [MASK] está ausente).

Ventajas y limitaciones

El MLM ofrece varias ventajas:

  • Contexto bidireccional: Los modelos pueden aprovechar información de ambos lados de un token, lo que lleva a representaciones más ricas.
  • Escalabilidad: El preentrenamiento se puede realizar en texto no etiquetado, lo que permite aprender de corpus masivos.
  • Transferencia de aprendizaje: El ajuste fino de un modelo MLM preentrenado en tareas posteriores a menudo produce resultados de vanguardia con datos etiquetados limitados.

Sin embargo, el MLM también tiene limitaciones:

  • Costo computacional: El entrenamiento requiere recursos computacionales significativos, a menudo utilizando hardware especializado como AWS Trainium o sistemas Cerebras.
  • Ineficiencia del enmascaramiento: Solo una pequeña fracción de tokens se utiliza para la predicción en cada paso de entrenamiento, lo que hace que el entrenamiento sea menos eficiente en términos de muestras que los métodos autorregresivos.
  • Discrepancia entre preentrenamiento y ajuste fino: El token [MASK] no está presente durante el ajuste fino, lo que puede causar una distribución de datos diferente.

Variantes y mejoras

Se han propuesto varias variantes del MLM para abordar sus limitaciones:

  • RoBERTa: Desarrollado por Facebook AI (ahora Meta AI), elimina el objetivo de predicción de la siguiente oración y utiliza enmascaramiento dinámico, donde el patrón de enmascaramiento cambia en cada época. También entrena con lotes más grandes y más datos.
  • ALBERT: Introduce el intercambio de parámetros y el orden de predicción de oraciones para reducir el uso de memoria mientras mantiene el rendimiento.
  • ELECTRA: Utiliza una tarea de detección de tokens reemplazados, donde el modelo aprende a distinguir tokens reales de reemplazos generados, lo que hace que el entrenamiento sea más eficiente.
  • Enmascaramiento por tramos: Modelos como SpanBERT enmascaran tramos contiguos de tokens en lugar de tokens individuales, mejorando el rendimiento en tareas que requieren comprensión de tramos.

Estas variantes han sido adoptadas en diversos modelos de lenguaje grandes y han influido en el diseño de arquitecturas más nuevas.

Aplicaciones en la IA moderna

El MLM no solo se utiliza para preentrenar modelos de lenguaje de propósito general, sino también en dominios específicos. Por ejemplo, BioBERT aplica el MLM a textos biomédicos, y ClinicalBERT se entrena en notas clínicas. Además, el MLM se ha extendido a otras modalidades, como imágenes y audio, a través de autoencoders enmascarados (por ejemplo, MAE para imágenes).

En el contexto de la IA generativa, el MLM se utiliza a menudo como un componente en modelos híbridos que combinan objetivos bidireccionales y autorregresivos, como T5 y BART, que utilizan un objetivo de denoising similar al MLM pero con una arquitectura de secuencia a secuencia.

Relación con otros objetivos de preentrenamiento

El MLM es uno de los varios objetivos de preentrenamiento en el campo del aprendizaje automático. Otros incluyen:

  • Modelado autorregresivo: Predice el siguiente token dado los tokens anteriores (por ejemplo, GPT). Este enfoque es unidireccional y es la base de muchos modelos de lenguaje grandes como los de OpenAI.
  • Denoising de secuencia a secuencia: Modelos como T5 y BART corrompen la entrada y entrenan al modelo para reconstruir la secuencia original, lo que puede verse como una forma generalizada de MLM.
  • Aprendizaje contrastivo: Se utiliza en modelos como SimCSE para aprender representaciones de oraciones atrayendo oraciones similares y separando las diferentes.

La naturaleza bidireccional del MLM lo hace particularmente adecuado para tareas que requieren comprender el contexto completo, como el reconocimiento de entidades nombradas y la extracción de relaciones.

Impacto en el campo

La introducción del MLM con BERT marcó un cambio de paradigma en el procesamiento del lenguaje natural. Demostró que el preentrenamiento en grandes corpus con un objetivo simple podía producir representaciones que se transfieren bien a una amplia gama de tareas. Esto llevó al desarrollo de numerosos modelos similares a BERT, como DistilBERT, TinyBERT y MobileBERT, que buscan reducir el tamaño del modelo mientras preservan el rendimiento.

El MLM también ha influido en el diseño de modelos basados en Transformers en otros dominios, como la visión por computadora (por ejemplo, BEiT, MAE) y el procesamiento de voz (por ejemplo, wav2vec 2.0). El concepto de enmascaramiento y reconstrucción se ha convertido en un principio general en el aprendizaje autosupervisado.

Direcciones futuras

A partir de 2025, la investigación continúa explorando objetivos de preentrenamiento más eficientes y efectivos. Algunas direcciones incluyen:

  • Modelos unificados: Combinar el MLM con objetivos autorregresivos en un solo modelo, como se ve en modelos como UniLM y XLNet (que utiliza modelado de lenguaje por permutación).
  • Atención eficiente: Reducir el costo computacional de la atención bidireccional, lo que permite aplicar el MLM a secuencias más largas.
  • MLM multimodal: Extender el MLM para modelar conjuntamente texto, imágenes y audio, como en modelos como CLIP y Flamingo.

Empresas como Google DeepMind, OpenAI y Anthropic continúan invirtiendo en la investigación de preentrenamiento, y el MLM sigue siendo una técnica fundamental en sus herramientas.

Conclusión

El modelado de lenguaje enmascarado se ha convertido en una técnica fundamental en la IA moderna, ya que permite a los modelos aprender representaciones ricas y bidireccionales a partir de texto no etiquetado. Su introducción con BERT en 2018 revolucionó el campo del procesamiento del lenguaje natural y desde entonces se ha adaptado a diversas modalidades y arquitecturas. Aunque han surgido objetivos y modelos más nuevos, los principios del enmascaramiento y la reconstrucción continúan influyendo en el diseño de sistemas de vanguardia. A medida que el campo avanza, es probable que el MLM siga siendo un componente clave en el desarrollo de modelos de IA más capaces y eficientes.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:natural-language-processing·self-supervised-learning·pretraining·transformer
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial