Artículo de BERT

Traducido del inglés

BERT (Bidirectional Encoder Representations from Transformers) es un modelo de lenguaje presentado por investigadores de Google en octubre de 2018. Utiliza una arquitectura de transformador solo con codificador y aprendizaje autosupervisado para crear representaciones textuales contextuales, lo que supone un avance significativo en el procesamiento del lenguaje natural.

BERT (Bidirectional Encoder Representations from Transformers) es un modelo de lenguaje presentado en octubre de 2018 por investigadores de Google. Aprende a representar texto como una secuencia de vectores mediante aprendizaje autosupervisado, empleando una arquitectura de solo codificador transformador. BERT mejoró drásticamente el estado del arte de los grandes modelos de lenguaje y, a partir de 2026, sigue siendo un componente metodológico común en la investigación del procesamiento del lenguaje natural (NLP).

BERT se entrena mediante la predicción de tokens enmascarados y la predicción de la siguiente oración, aprendiendo representaciones latentes y contextuales de los tokens en su contexto, similar a modelos anteriores como ELMo y, posteriormente, GPT-2. Encontró aplicaciones en muchas tareas de NLP, incluida la resolución de correferencias y la resolución de polisemia. Su éxito sobre ELMo impulsó el estudio de la "BERTología", que intenta interpretar lo que aprende el modelo.

Arquitectura

BERT es una arquitectura de transformador de solo codificador, que consta de cuatro módulos principales: un tokenizador, una capa de incrustación, una pila de codificadores y una cabeza de tarea. El tokenizador convierte texto en inglés en una secuencia de enteros (tokens). La capa de incrustación convierte estos tokens en vectores de valores reales. La pila de codificadores, compuesta por bloques de transformador con autoatención pero sin enmascaramiento causal, procesa estos vectores. La cabeza de tarea convierte los vectores de representación finales de nuevo en una distribución de probabilidad sobre los tipos de tokens, funcionando como una capa de desincrustación.

La cabeza de tarea es esencial para el preentrenamiento, pero a menudo innecesaria para tareas posteriores como la respuesta a preguntas o la clasificación de sentimientos. En tales casos, se elimina y se reemplaza con un módulo recién inicializado adecuado para la tarea, y luego se ajusta finamente. Los vectores de representación latente se alimentan directamente a este nuevo módulo, lo que permite un aprendizaje por transferencia eficiente en muestras.

Incrustación

El tokenizador de BERT usa WordPiece, una estrategia de subpalabras similar a la codificación por pares de bytes, con un tamaño de vocabulario de 30,000. Cualquier token que no esté en el vocabulario se reemplaza por [UNK]. La capa de incrustación tiene tres componentes: incrustaciones de tipo de token, incrustaciones de posición e incrustaciones de tipo de segmento. Las incrustaciones de tipo de token traducen vectores one-hot en vectores densos. Las incrustaciones de posición usan posiciones absolutas, con cada dimensión siendo una función sinusoidal de la posición. Las incrustaciones de tipo de segmento usan un vocabulario de 0 o 1, indicando si un token pertenece al primer o segundo segmento de texto, separados por el token [SEP].

Estos tres vectores de incrustación se suman y luego se normalizan usando LayerNorm, produciendo un vector de 768 dimensiones para cada token en BERTBASE. Los vectores pasan a través de 12 bloques de codificador de transformador y se decodifican de nuevo al espacio de vocabulario de 30,000 dimensiones mediante una transformación afín básica.

Familia arquitectónica

La pila de codificadores tiene dos parámetros libres: L (número de capas) y H (tamaño oculto). Siempre hay H/64 cabezas de autoatención, y el tamaño de avance o filtro es siempre 4H. Variar L y H produce una familia de modelos. La notación es L/H, por lo que BERTBASE es 12L/768H, BERTLARGE es 24L/1024H y BERTTINY es 2L/128H.

Entrenamiento

BERT se preentrenó simultáneamente en dos tareas: modelado de lenguaje enmascarado (MLM) y predicción de la siguiente oración (NSP). En MLM, BERT ingiere una secuencia de palabras donde una palabra puede estar enmascarada aleatoriamente, y predice la palabra original. Esto enseña contexto bidireccional, comprendiendo relaciones entre palabras desde ambas direcciones a la vez. En NSP, BERT predice si una oración sigue lógicamente a otra, lo que ayuda con tareas como la respuesta a preguntas y la clasificación de documentos.

Modelado de lenguaje enmascarado

En MLM, el 15% de los tokens se seleccionan aleatoriamente para la tarea de predicción enmascarada. El token seleccionado se reemplaza con un token [MASK] con una probabilidad del 80%, con un token de palabra aleatorio con una probabilidad del 10%, o se deja sin cambios con una probabilidad del 10%. Este enmascaramiento parcial evita el cambio de distribución del conjunto de datos, donde la distribución de entradas durante el entrenamiento difiere de la inferencia. Si todos los tokens seleccionados estuvieran enmascarados, el modelo podría no manejar bien las entradas no enmascaradas durante la inferencia.

Tamaños de modelo y lanzamiento

BERT se implementó originalmente en inglés en dos tamaños: BERTBASE con 110 millones de parámetros y BERTLARGE con 340 millones de parámetros. Ambos se entrenaron en Toronto BookCorpus (800 millones de palabras) y Wikipedia en inglés (2,500 millones de palabras). Los pesos se publicaron en GitHub. El 11 de marzo de 2020, se lanzaron 24 modelos más pequeños, siendo el más pequeño BERTTINY con solo 4 millones de parámetros. Estos modelos más pequeños permitieron una experimentación más amplia y un despliegue en entornos con recursos limitados.

Impacto y legado

La introducción de BERT marcó un cambio significativo en el NLP, pasando de modelos unidireccionales a la comprensión del contexto bidireccional. Su paradigma de preentrenamiento y ajuste fino se convirtió en un enfoque estándar, influyendo en modelos posteriores como GPT-2 y el desarrollo más amplio de los grandes modelos de lenguaje. La arquitectura y los métodos de entrenamiento de BERT han sido ampliamente adoptados y adaptados en todo el campo, consolidando su lugar como una técnica fundamental en el aprendizaje automático y la inteligencia artificial modernos.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:natural-language-processing·transformer·google·machine-learning
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial