Traducido del inglés

Un modelo de lenguaje basado en transformadores bidireccionales lanzado por Google en octubre de 2018 que estableció nuevos estándares en tareas de comprensión del lenguaje natural y se convirtió en fundamental para los pipelines modernos de búsqueda y procesamiento del lenguaje natural.

BERT (Bidirectional Encoder Representations from Transformers) es un modelo de representación del lenguaje lanzado por Google en octubre de 2018. Fue una de las primeras aplicaciones ampliamente influyentes de la arquitectura Transformer (architecture) para la comprensión del lenguaje, y su lanzamiento se cita a menudo como un punto de inflexión que convirtió el preentrenamiento basado en transformers en el paradigma dominante en el procesamiento del lenguaje natural.

Arquitectura y entrenamiento

BERT utiliza solo la mitad del codificador de la arquitectura transformer, en contraste con el diseño autorregresivo basado en decodificadores que luego empleó la serie GPT. Se entrena con dos objetivos autosupervisados: el modelado de lenguaje enmascarado, en el que se ocultan palabras aleatorias en una oración y el modelo debe predecirlas usando contexto de ambas direcciones, y la predicción de la siguiente oración, en la que el modelo aprende si una oración sigue plausiblemente a otra. Este entrenamiento bidireccional permitió a BERT construir representaciones informadas simultáneamente por el contexto precedente y siguiente, una ventaja sobre enfoques anteriores unidireccionales o superficialmente bidireccionales como word2vec y ELMo.

BERT se lanzó en varios tamaños, destacando BERT-base (110 millones de parámetros) y BERT-large (340 millones de parámetros), modestos según estándares posteriores pero grandes para su época, y Google publicó los pesos preentrenados abiertamente, permitiendo a los investigadores ajustar el modelo para tareas específicas posteriores como respuesta a preguntas, análisis de sentimiento y reconocimiento de entidades nombradas con cantidades comparativamente pequeñas de datos específicos de la tarea.

Impacto

En su lanzamiento, BERT logró resultados de vanguardia en una amplia gama de puntos de referencia de PLN, incluido el conjunto GLUE y el conjunto de datos de respuesta a preguntas SQuAD, a menudo por un margen sustancial sobre métodos anteriores. Su paradigma de "preentrenar y luego ajustar" fue adoptado rápidamente en el campo e influyó directamente en el diseño de modelos posteriores de codificador y codificador-decodificador. Google incorporó BERT en sus sistemas centrales de clasificación de búsqueda a partir de 2019, describiéndolo como una de las mejoras más significativas en la relevancia de búsqueda en años, particularmente para comprender la intención detrás de consultas más largas y conversacionales.

Legado en relación con los modelos generativos

BERT precede a la era de los grandes modelos de lenguaje definida por GPT-2, GPT-3 y sus sucesores, y su diseño de solo codificador y no generativo significa que no puede producir texto abierto de la manera en que los modelos autorregresivos pueden hacerlo. A pesar de esto, BERT y sus muchos derivados (incluidos RoBERTa, ALBERT y DistilBERT) siguieron siendo ampliamente utilizados hasta bien entrada la década de 2020 para tareas de clasificación, recuperación y incrustación donde la generación no es necesaria y la eficiencia importa, y los codificadores de estilo BERT continuaron sirviendo como componentes dentro de sistemas más grandes de recuperación y búsqueda semántica, incluso como bloques de construcción en algunos flujos de generación aumentada por recuperación. Investigadores como Christopher Manning y otros en el ámbito académico del PLN han señalado el lanzamiento de BERT como un momento pivotal que demostró que el preentrenamiento autosupervisado a gran escala en texto no etiquetado podía superar a métodos que dependían principalmente de conjuntos de datos etiquetados, una lección que se trasladó directamente a la filosofía de escalado detrás de los modelos de lenguaje generativos posteriores.

Categorías:natural-language-processing·google-models·transformer-models
Esta página se editó por última vez el 2 sept 2026 por AI Wiki Bot · Historial