Transformador (arquitetura)

Traduzido do inglês

O transformer é uma arquitetura de rede neural de 2017 que utiliza autoatenção para processar sequências em paralelo, em vez de passo a passo, tornando-se a base de quase todos os [[large language model|modelos de linguagem modernos de grande escala]].

O transformer é uma arquitetura de rede neural, introduzida em 2017, que processa dados sequenciais, como texto, usando mecanismos de atenção em vez da recorrência passo a passo usada por modelos anteriores, permitindo que uma sequência inteira seja processada em paralelo. Tornou-se a base de quase todos os modelos de linguagem de grande porte modernos e foi adaptado também para imagens, áudio e outros tipos de dados.

História

Antes do transformer, a modelagem de sequências para tarefas como tradução automática dependia principalmente de redes neurais recorrentes, incluindo modelos codificador-decodificador Seq2seq, que processam tokens de entrada um a um e, portanto, têm dificuldade em paralelizar e em reter informações ao longo de sequências longas. O transformer foi introduzido no artigo de 2017 "Attention Is All You Need" por uma equipe de pesquisadores, incluindo Ashish Vaswani e Noam Shazeer, que propuseram dispensar completamente a recorrência em favor da autoatenção. Todos os oito autores do artigo posteriormente deixaram a empresa onde o trabalho foi realizado para fundar ou se juntar a outras empresas de IA, um resultado incomum para um único artigo de pesquisa.

Arquitetura

Um transformer processa uma sequência de entrada, primeiro convertida em representações vetoriais por meio de tokenização e incorporação (embedding), aplicando repetidamente camadas de autoatenção, que permitem que cada posição na sequência pese a relevância de todas as outras posições, juntamente com camadas simples de alimentação direta (feed-forward). Como a autoatenção não tem noção inerente de ordem sequencial, os transformers adicionam informações posicionais às suas representações de entrada. Múltiplas "cabeças" de atenção executadas em paralelo permitem que o modelo capture diferentes tipos de relações simultaneamente. A arquitetura original usava um codificador e um decodificador separados; a maioria dos modelos de linguagem de grande porte modernos usa uma variante apenas com decodificador, que gera texto um token por vez com base em todos os tokens gerados anteriormente.

Impacto

A paralelizabilidade do transformer permitiu que modelos fossem treinados em conjuntos de dados muito maiores e com muito mais parâmetros do que as arquiteturas recorrentes permitiam, possibilitando diretamente o progresso impulsionado pela escala de modelos desde o BERT em 2018 até o GPT-3 e além. Seu mecanismo de autoatenção, aplicável em princípio a qualquer dado que possa ser representado como uma sequência, também foi adaptado para imagens, dando origem aos transformers de visão, e para sistemas combinados de texto e imagem usados em modelos de visão e linguagem modernos.

Variantes e alternativas

O custo computacional da autoatenção cresce quadraticamente com o comprimento da sequência, motivando tanto variantes focadas em eficiência quanto arquiteturas totalmente diferentes. Modelos de mistura de especialistas ativam apenas um subconjunto dos parâmetros de um transformer para qualquer entrada dada, reduzindo o custo computacional em relação ao tamanho do modelo. Modelos de espaço de estado, como a arquitetura Mamba introduzida em 2023, oferecem uma alternativa que escala linearmente com o comprimento da sequência, em vez de quadraticamente, embora em meados da década de 2020 não tenham deslocado o transformer como a arquitetura dominante para modelos de linguagem de fronteira.

Categorias:deep-learning·large-language-models
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico