BERT (Bidirectional Encoder Representations from Transformers) est un modèle de représentation du langage publié par Google en octobre 2018. Il a été parmi les premières applications largement influentes de l'architecture Transformer (architecture) pour la compréhension du langage, et sa publication est souvent citée comme un tournant qui a fait du pré-entraînement basé sur les transformers le paradigme dominant en traitement du langage naturel.
Architecture et entraînement
BERT utilise uniquement la moitié encodeur de l'architecture transformer, contrairement à la conception décodeur et autorégressive adoptée plus tard par la série GPT. Il est entraîné à l'aide de deux objectifs auto-supervisés : le masquage de langage, où des mots aléatoires dans une phrase sont cachés et le modèle doit les prédire en utilisant le contexte dans les deux directions, et la prédiction de phrase suivante, où le modèle apprend si une phrase suit plausiblement une autre. Cet entraînement bidirectionnel a permis à BERT de construire des représentations informées simultanément par le contexte précédent et suivant, un avantage par rapport aux approches antérieures unidirectionnelles ou faiblement bidirectionnelles telles que word2vec et ELMo.
BERT a été publié en plusieurs tailles, notamment BERT-base (110 millions de paramètres) et BERT-large (340 millions de paramètres), modestes selon les normes ultérieures mais importantes pour leur époque, et Google a publié les poids pré-entraînés ouvertement, permettant aux chercheurs de régler finement le modèle pour des tâches en aval spécifiques telles que la réponse à des questions, l'analyse de sentiments et la reconnaissance d'entités nommées avec des quantités relativement faibles de données spécifiques à la tâche.
Impact
Lors de sa publication, BERT a obtenu des résultats de pointe sur une large gamme de références en NLP, y compris la suite GLUE et l'ensemble de données de réponse à des questions SQuAD, souvent avec une marge substantielle par rapport aux méthodes antérieures. Son paradigme « pré-entraîner puis régler finement » a été rapidement adopté dans tout le domaine et a directement influencé la conception des modèles encodeur et encodeur-décodeur ultérieurs. Google a intégré BERT dans ses systèmes de classement de recherche principaux à partir de 2019, le décrivant comme l'une des améliorations les plus significatives de la pertinence de recherche depuis des années, en particulier pour comprendre l'intention derrière des requêtes plus longues et plus conversationnelles.
Héritage par rapport aux modèles génératifs
BERT précède l'ère des grands modèles de langage définie par GPT-2, GPT-3 et leurs successeurs, et sa conception encodeur uniquement et non générative signifie qu'il ne peut pas produire de texte ouvert comme le peuvent les modèles autorégressifs. Malgré cela, BERT et ses nombreux dérivés (y compris RoBERTa, ALBERT et DistilBERT) sont restés largement utilisés bien dans les années 2020 pour des tâches de classification, de recherche et d'embedding où la génération n'est pas nécessaire et où l'efficacité compte, et les encodeurs de style BERT ont continué à servir de composants dans des systèmes plus vastes de recherche et de recherche sémantique, y compris comme éléments de base dans certains pipelines de génération augmentée par récupération. Des chercheurs tels que Christopher Manning et d'autres dans le NLP académique ont souligné la publication de BERT comme un moment charnière démontrant que le pré-entraînement auto-supervisé à grande échelle sur du texte non étiqueté pouvait surpasser les méthodes reposant principalement sur des ensembles de données étiquetés, une leçon qui a été directement intégrée dans la philosophie de mise à l'échelle derrière les modèles de langage génératifs ultérieurs.