Uma incorporação (embedding) é uma forma de representar um objeto, na maioria das vezes uma palavra, frase, imagem ou usuário, como um vetor de comprimento fixo de números reais em um espaço contínuo. A propriedade definidora de uma boa incorporação é que a proximidade geométrica nesse espaço corresponde à similaridade semântica: vetores para "cachorro" e "filhote" ficam próximos entre si, enquanto "cachorro" e "mercado de ações" ficam distantes. As incorporações transformam o problema difuso e simbólico do significado em aritmética que uma rede neural pode aprender e um computador pode pesquisar com eficiência.
A ideia antecede o aprendizado profundo. Pesquisadores de semântica distribucional nos anos 1990 argumentavam que "uma palavra é caracterizada pela companhia que mantém", e métodos iniciais baseados em contagem, como a análise semântica latente, construíam representações de baixa dimensão a partir de estatísticas de co-ocorrência de palavras. A era moderna começou com o Word2vec em 2013, que treinou uma rede neural rasa para prever palavras vizinhas e produziu incorporações com a agora famosa propriedade de que a aritmética vetorial podia capturar analogias, como "rei" menos "homem" mais "mulher" chegando perto de "rainha". O GloVe, lançado no mesmo período, oferecia uma abordagem concorrente baseada em contagem com resultados semelhantes.
Como as incorporações são produzidas
Incorporações estáticas de palavras, como word2vec e GloVe, atribuem um vetor fixo por palavra, independentemente do contexto. Isso falha com palavras polissêmicas: "banco" recebe um único vetor que mistura seus significados de margem de rio e instituição financeira. A arquitetura Transformer (architecture) e seu mecanismo de atenção resolveram isso produzindo incorporações contextuais, onde a mesma palavra recebe um vetor diferente dependendo da frase ao redor. Modelos como o BERT popularizaram incorporações contextuais para tarefas downstream, e todo modelo de linguagem de grande porte moderno representa internamente tokens como incorporações que são refinadas camada por camada.
Além do texto, as incorporações generalizam para qualquer modalidade. O CLIP treina codificadores de imagem e texto em conjunto, de modo que uma foto de um gato e a legenda "um gato" fiquem próximas em um espaço compartilhado, o que sustenta grande parte da geração moderna de texto para imagem e da recuperação multimodal. Sistemas de recomendação incorporam usuários e itens em um espaço compartilhado, de modo que a proximidade prediz preferência, e a biologia adotou o mesmo truque para incorporar sequências de proteínas.
Aplicações
As incorporações são o substrato da busca semântica, onde uma consulta é incorporada e comparada contra um corpus de documentos incorporados usando similaridade de cosseno ou produto escalar, em vez de correspondência exata de palavras-chave. Essa capacidade sustenta sistemas de geração aumentada por recuperação, que incorporam uma base de conhecimento uma vez e recuperam as passagens mais relevantes no momento da consulta para fundamentar a resposta de um LLM e reduzir alucinações. Armazenar e pesquisar milhões ou bilhões de incorporações com eficiência é a função de um banco de dados vetorial, que usa indexação de vizinhos mais próximos aproximada para tornar a busca por similaridade rápida em escala.
As incorporações também alimentam agrupamento, deduplicação, detecção de anomalias e classificação, já que um classificador linear simples treinado sobre boas incorporações frequentemente tem desempenho competitivo com modelos muito mais complexos treinados do zero. Em sistemas de recomendação e ranqueamento de busca, as incorporações de usuários e itens são frequentemente aprendidas em conjunto e atualizadas continuamente à medida que dados de comportamento se acumulam.
Propriedades e limitações
A dimensionalidade de uma incorporação, tipicamente variando de algumas centenas a alguns milhares para texto, é uma escolha de design que equilibra expressividade contra custo de armazenamento e computação. A estrutura geométrica resultante é às vezes chamada de espaço latente, e interpolar entre dois pontos nesse espaço pode produzir exemplos intermediários plausíveis, uma propriedade amplamente explorada em modelos generativos de imagem e áudio.
As incorporações herdam vieses presentes em seus dados de treinamento: incorporações de palavras treinadas em texto da web demonstraram codificar estereótipos de gênero e raça em suas relações geométricas, uma descoberta amplamente citada na pesquisa sobre viés algorítmico. Elas também podem ser frágeis a mudanças de distribuição, o que significa que um modelo de incorporação treinado em um domínio, como texto geral da web, pode ter desempenho ruim quando aplicado a um domínio especializado, como documentos jurídicos ou médicos, sem ajuste fino adicional. Apesar dessas ressalvas, as incorporações permanecem um dos blocos de construção mais duráveis e amplamente reutilizados em sistemas modernos de IA, em grande parte inalteradas em conceito desde o avanço do word2vec em 2013, mesmo enquanto os modelos que as produzem se tornaram muito mais capazes.