BERT (Bidirectional Encoder Representations from Transformers) es un modelo de lenguaje presentado en octubre de 2018 por investigadores de Google. Aprende a representar texto como una secuencia de vectores mediante aprendizaje autosupervisado, empleando una arquitectura de transformador solo con codificador. BERT mejoró drásticamente el estado del arte para modelos de lenguaje grandes y, a partir de 2026, sigue siendo un componente metodológico común en la investigación del procesamiento del lenguaje natural (PLN).
BERT se entrena utilizando predicción de tokens enmascarados y predicción de la siguiente oración, lo que le permite aprender representaciones latentes y contextuales de los tokens en su contexto, similar a ELMo y GPT-2. Encontró aplicaciones en muchas tareas de PLN, como la resolución de correferencias y la resolución de polisemia. BERT mejoró a ELMo y dio lugar al estudio de la "BERTología", que intenta interpretar lo que aprende BERT.
Arquitectura
BERT es una arquitectura de transformador "solo con codificador". A alto nivel, BERT consta de cuatro módulos: un tokenizador, un módulo de incrustaciones, una pila de codificadores y una cabeza de tarea. El tokenizador convierte texto en inglés en una secuencia de enteros (tokens). El módulo de incrustaciones convierte los tokens en vectores de valores reales. La pila de codificadores consiste en bloques de transformador con autoatención pero sin enmascaramiento causal. La cabeza de tarea convierte los vectores de representación final en una distribución de probabilidad sobre los tipos de tokens, actuando como una capa de desincrustación.
La cabeza de tarea es necesaria para el preentrenamiento, pero a menudo innecesaria para tareas posteriores como la respuesta a preguntas o la clasificación de sentimientos. Para tales tareas, la cabeza de tarea se elimina y se reemplaza con un módulo recién inicializado adecuado para la tarea, seguido de un ajuste fino. El vector de representación latente se alimenta directamente a este nuevo módulo, lo que permite un aprendizaje por transferencia eficiente en muestras.
Incrustación
El tokenizador de BERT es WordPiece, una estrategia de subpalabras similar a la codificación por pares de bytes. Su tamaño de vocabulario es de 30,000, y cualquier token que no aparezca en el vocabulario se reemplaza por [UNK]. La capa de incrustación contiene tres componentes: incrustaciones de tipo de token, incrustaciones de posición e incrustaciones de tipo de segmento. Las incrustaciones de tipo de token traducen un vector one-hot en un vector denso según el tipo de token. Las incrustaciones de posición usan posiciones absolutas, con cada dimensión consistiendo en una función sinusoidal de la posición. Las incrustaciones de tipo de segmento usan un vocabulario de 0 o 1, indicando si un token pertenece al primer o segundo segmento de texto (los tokens después del token especial [SEP] son de tipo 1). Los tres vectores de incrustación se suman y luego se normalizan usando LayerNorm, produciendo un vector de 768 dimensiones para cada token. Estos vectores pasan a través de 12 bloques de codificador de transformador y se decodifican de vuelta al espacio de vocabulario de 30,000 dimensiones mediante una transformación afín.
Familia arquitectónica
La pila de codificadores tiene dos parámetros libres: L (número de capas) y H (tamaño oculto). Siempre hay H/64 cabezas de autoatención, y el tamaño de avance/filtro es siempre 4H. Variar estos parámetros produce una familia de modelos BERT. La notación es L/H: BERTBASE es 12L/768H, BERTLARGE es 24L/1024H y BERTTINY es 2L/128H.
Entrenamiento
Preentrenamiento
BERT se preentrenó simultáneamente en dos tareas: modelado de lenguaje enmascarado (MLM) y predicción de la siguiente oración (NSP). En MLM, BERT ingiere una secuencia de palabras donde una palabra puede estar enmascarada aleatoriamente, y predice la palabra original. Esto ayuda a BERT a aprender contexto bidireccional, comprendiendo relaciones entre palabras desde ambas direcciones simultáneamente. En NSP, BERT se entrena para predecir si una oración sigue lógicamente a otra, lo cual es importante para tareas como la respuesta a preguntas o la clasificación de documentos.
#### Modelado de lenguaje enmascarado
En el modelado de lenguaje enmascarado, el 15% de los tokens se seleccionan aleatoriamente para la tarea de predicción enmascarada. El token seleccionado se reemplaza con un token [MASK] con probabilidad del 80%, se reemplaza con un token de palabra aleatorio con probabilidad del 10% y se deja sin cambios con probabilidad del 10%. Esta estrategia evita el problema de cambio de distribución de datos, donde la distribución de entradas durante el entrenamiento difiere de la de la inferencia.
Lanzamiento e impacto
BERT se implementó originalmente en inglés en dos tamaños de modelo: BERTBASE (110 millones de parámetros) y BERTLARGE (340 millones de parámetros). Ambos se entrenaron en Toronto BookCorpus (800 millones de palabras) y Wikipedia en inglés (2,500 millones de palabras). Los pesos se publicaron en GitHub, haciendo el modelo ampliamente accesible. El 11 de marzo de 2020, se lanzaron 24 modelos más pequeños, siendo el más pequeño BERTTINY con solo 4 millones de parámetros.
El lanzamiento de BERT tuvo un impacto profundo en el campo del procesamiento del lenguaje natural. Estableció nuevos puntos de referencia en una amplia gama de tareas, incluyendo respuesta a preguntas, análisis de sentimientos y reconocimiento de entidades nombradas. Su éxito popularizó el paradigma de preentrenamiento y ajuste fino, influyendo en modelos posteriores como GPT-2 y RoBERTa. BERT también inspiró investigación en interpretabilidad, con la "BERTología" emergiendo como un campo para comprender las representaciones internas aprendidas por el modelo.
Aplicaciones y legado
Las incrustaciones contextuales de BERT se han aplicado a numerosas tareas, incluyendo resolución de correferencias, resolución de polisemia y traducción automática. Su arquitectura se ha adaptado para varios idiomas y dominios, y sigue siendo un punto de referencia para muchos sistemas de PLN. A partir de 2026, BERT continúa siendo una herramienta fundamental en la investigación de PLN y aplicaciones industriales, a pesar del auge de modelos más grandes como GPT-3 y T5. Su influencia es evidente en la adopción generalizada de modelos basados en transformadores y el desarrollo de modelos de lenguaje grandes.
El lanzamiento de BERT también impulsó avances en variantes de modelos eficientes, como DistilBERT y ALBERT, que buscan reducir costos computacionales mientras mantienen el rendimiento. Los principios de diseño del modelo, incluyendo el modelado de lenguaje enmascarado y la predicción de la siguiente oración, se han incorporado en muchas arquitecturas posteriores, consolidando el legado de BERT como una piedra angular del PLN moderno.