Traduzido do inglês

Um modelo de linguagem baseado em transformer bidirecional lançado pelo Google em outubro de 2018, que estabeleceu novos padrões de referência em tarefas de compreensão de linguagem natural e se tornou fundamental para os pipelines modernos de busca e PLN.

BERT (Bidirectional Encoder Representations from Transformers) é um modelo de representação de linguagem lançado pelo Google em outubro de 2018. Foi uma das primeiras aplicações amplamente influentes da arquitetura Transformer (architecture) para compreensão de linguagem, e seu lançamento é frequentemente citado como um marco que tornou o pré-treinamento baseado em transformers o paradigma dominante em processamento de linguagem natural.

Arquitetura e treinamento

O BERT utiliza apenas a metade do codificador da arquitetura transformer, em contraste com o design autorregressivo baseado no decodificador, adotado posteriormente pela série GPT. Ele é treinado com dois objetivos de aprendizado autossupervisionado: modelagem de linguagem mascarada, na qual palavras aleatórias em uma frase são ocultadas e o modelo deve prevê-las usando o contexto de ambas as direções, e predição de próxima frase, na qual o modelo aprende se uma frase segue plausivelmente outra. Esse treinamento bidirecional permitiu que o BERT construísse representações informadas tanto pelo contexto anterior quanto pelo posterior simultaneamente, uma vantagem sobre abordagens anteriores unidirecionais ou superficialmente bidirecionais, como word2vec e ELMo.

O BERT foi lançado em vários tamanhos, sendo os mais notáveis o BERT-base (110 milhões de parâmetros) e o BERT-large (340 milhões de parâmetros), que eram modestos para os padrões posteriores, mas grandes para a época. O Google publicou os pesos pré-treinados abertamente, permitindo que pesquisadores realizassem ajuste fino do modelo para tarefas específicas downstream, como resposta a perguntas, análise de sentimento e reconhecimento de entidades nomeadas, com quantidades comparativamente pequenas de dados específicos da tarefa.

Impacto

No lançamento, o BERT alcançou resultados de última geração em uma ampla gama de benchmarks de PLN, incluindo o conjunto GLUE e o conjunto de dados SQuAD de resposta a perguntas, frequentemente com margens substanciais sobre métodos anteriores. Seu paradigma de "pré-treinar e ajustar fino" foi rapidamente adotado em todo o campo e influenciou diretamente o design de modelos subsequentes de codificador e codificador-decodificador. O Google incorporou o BERT em seus sistemas centrais de classificação de busca a partir de 2019, descrevendo-o como uma das melhorias mais significativas em relevância de busca em anos, especialmente para compreender a intenção por trás de consultas mais longas e conversacionais.

Legado em relação aos modelos generativos

O BERT precede a era dos grandes modelos de linguagem definida por GPT-2, GPT-3 e seus sucessores, e seu design exclusivamente baseado em codificador e não generativo significa que ele não pode produzir texto aberto da mesma forma que os modelos autorregressivos. Apesar disso, o BERT e seus muitos derivados (incluindo RoBERTa, ALBERT e DistilBERT) permaneceram amplamente utilizados durante os anos 2020 para tarefas de classificação, recuperação e incorporação, onde a geração é desnecessária e a eficiência é importante. Os codificadores estilo BERT continuaram a servir como componentes dentro de sistemas maiores de recuperação e busca semântica, inclusive como blocos de construção em alguns pipelines de geração aumentada por recuperação. Pesquisadores como Christopher Manning e outros na área acadêmica de PLN apontaram o lançamento do BERT como um momento crucial que demonstrou que o pré-treinamento autossupervisionado em larga escala em texto não rotulado poderia superar métodos que dependiam principalmente de conjuntos de dados rotulados, uma lição que foi levada diretamente para a filosofia de escalonamento por trás dos modelos generativos de linguagem posteriores.

Categorias:natural-language-processing·google-models·transformer-models
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico