Traduzido do inglês

Uma incorporação é uma representação vetorial numérica de um dado, como uma palavra, frase, imagem ou usuário, posicionada em um espaço contínuo de modo que itens com significado ou conteúdo semelhante fiquem próximos uns dos outros.

Uma incorporação (embedding) é uma forma de representar um objeto, na maioria das vezes uma palavra, frase, imagem ou usuário, como um vetor de comprimento fixo de números reais em um espaço contínuo. A propriedade definidora de uma boa incorporação é que a proximidade geométrica nesse espaço corresponde à similaridade semântica: vetores para "cachorro" e "filhote" ficam próximos entre si, enquanto "cachorro" e "mercado de ações" ficam distantes. As incorporações transformam o problema difuso e simbólico do significado em aritmética que uma rede neural pode aprender e um computador pode pesquisar com eficiência.

A ideia antecede o aprendizado profundo. Pesquisadores de semântica distribucional nos anos 1990 argumentavam que "uma palavra é caracterizada pela companhia que mantém", e métodos iniciais baseados em contagem, como a análise semântica latente, construíam representações de baixa dimensão a partir de estatísticas de co-ocorrência de palavras. A era moderna começou com o Word2vec em 2013, que treinou uma rede neural rasa para prever palavras vizinhas e produziu incorporações com a agora famosa propriedade de que a aritmética vetorial podia capturar analogias, como "rei" menos "homem" mais "mulher" chegando perto de "rainha". O GloVe, lançado no mesmo período, oferecia uma abordagem concorrente baseada em contagem com resultados semelhantes.

Como as incorporações são produzidas

Incorporações estáticas de palavras, como word2vec e GloVe, atribuem um vetor fixo por palavra, independentemente do contexto. Isso falha com palavras polissêmicas: "banco" recebe um único vetor que mistura seus significados de margem de rio e instituição financeira. A arquitetura Transformer (architecture) e seu mecanismo de atenção resolveram isso produzindo incorporações contextuais, onde a mesma palavra recebe um vetor diferente dependendo da frase ao redor. Modelos como o BERT popularizaram incorporações contextuais para tarefas downstream, e todo modelo de linguagem de grande porte moderno representa internamente tokens como incorporações que são refinadas camada por camada.

Além do texto, as incorporações generalizam para qualquer modalidade. O CLIP treina codificadores de imagem e texto em conjunto, de modo que uma foto de um gato e a legenda "um gato" fiquem próximas em um espaço compartilhado, o que sustenta grande parte da geração moderna de texto para imagem e da recuperação multimodal. Sistemas de recomendação incorporam usuários e itens em um espaço compartilhado, de modo que a proximidade prediz preferência, e a biologia adotou o mesmo truque para incorporar sequências de proteínas.

Aplicações

As incorporações são o substrato da busca semântica, onde uma consulta é incorporada e comparada contra um corpus de documentos incorporados usando similaridade de cosseno ou produto escalar, em vez de correspondência exata de palavras-chave. Essa capacidade sustenta sistemas de geração aumentada por recuperação, que incorporam uma base de conhecimento uma vez e recuperam as passagens mais relevantes no momento da consulta para fundamentar a resposta de um LLM e reduzir alucinações. Armazenar e pesquisar milhões ou bilhões de incorporações com eficiência é a função de um banco de dados vetorial, que usa indexação de vizinhos mais próximos aproximada para tornar a busca por similaridade rápida em escala.

As incorporações também alimentam agrupamento, deduplicação, detecção de anomalias e classificação, já que um classificador linear simples treinado sobre boas incorporações frequentemente tem desempenho competitivo com modelos muito mais complexos treinados do zero. Em sistemas de recomendação e ranqueamento de busca, as incorporações de usuários e itens são frequentemente aprendidas em conjunto e atualizadas continuamente à medida que dados de comportamento se acumulam.

Propriedades e limitações

A dimensionalidade de uma incorporação, tipicamente variando de algumas centenas a alguns milhares para texto, é uma escolha de design que equilibra expressividade contra custo de armazenamento e computação. A estrutura geométrica resultante é às vezes chamada de espaço latente, e interpolar entre dois pontos nesse espaço pode produzir exemplos intermediários plausíveis, uma propriedade amplamente explorada em modelos generativos de imagem e áudio.

As incorporações herdam vieses presentes em seus dados de treinamento: incorporações de palavras treinadas em texto da web demonstraram codificar estereótipos de gênero e raça em suas relações geométricas, uma descoberta amplamente citada na pesquisa sobre viés algorítmico. Elas também podem ser frágeis a mudanças de distribuição, o que significa que um modelo de incorporação treinado em um domínio, como texto geral da web, pode ter desempenho ruim quando aplicado a um domínio especializado, como documentos jurídicos ou médicos, sem ajuste fino adicional. Apesar dessas ressalvas, as incorporações permanecem um dos blocos de construção mais duráveis e amplamente reutilizados em sistemas modernos de IA, em grande parte inalteradas em conceito desde o avanço do word2vec em 2013, mesmo enquanto os modelos que as produzem se tornaram muito mais capazes.

Categorias:machine-learning·natural-language-processing·representation-learning
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico