Um espaço latente é um espaço comprimido e de menor dimensionalidade que uma rede neural aprende internamente para representar a estrutura dos seus dados de treinamento. Em vez de armazenar pixels brutos, palavras ou amostras de áudio, os modelos que usam um espaço latente mapeiam as entradas para um conjunto de coordenadas numéricas abstratas, ou vetores, escolhidos de modo que entradas com significado ou aparência semelhantes acabem posicionadas próximas umas das outras. A ideia é usada em todo o aprendizado profundo, desde autoencoders e redes adversárias generativas até modelos de difusão modernos e sistemas de busca baseados em embeddings.
Origens
A ideia remonta a métodos anteriores de redução de dimensionalidade em estatística, mas entrou na corrente principal do aprendizado de máquina através do autoencoder, uma rede neural treinada para comprimir uma entrada em uma camada de gargalo e depois reconstruí-la. Os valores da camada de gargalo são a representação latente. Os autoencoders variacionais, introduzidos em 2013, estenderam isso ao forçar o espaço latente a seguir uma distribuição de probabilidade suave, o que tornou possível amostrar novas saídas plausíveis escolhendo pontos aleatórios nesse espaço. Uma linha de trabalho paralela, o Word2vec (2013), mostrou que um espaço latente treinado em texto poderia capturar relações analógicas entre palavras, popularizando a ideia de que direção e distância em um espaço latente carregam significado.
Papel nos modelos generativos
O espaço latente tornou-se central para a geração de imagens com redes adversárias generativas, cujo gerador aprende a mapear vetores latentes aleatórios em imagens realistas. Tornou-se ainda mais importante com a difusão latente, a técnica por trás do Stable Diffusion e sistemas relacionados: em vez de executar o lento processo de remoção de ruído diretamente nos pixels, o modelo comprime uma imagem em uma grade latente pequena com um autoencoder, executa as etapas do modelo de difusão ali e decodifica de volta para pixels apenas no final. Isso tornou a geração de texto para imagem de alta resolução drasticamente mais barata de executar. Sistemas multimodais como o CLIP aprendem um espaço latente compartilhado para imagens e textos, de modo que uma legenda e sua imagem correspondente fiquem próximas, o que é o que permite que um modelo de difusão seja guiado por um prompt de texto em primeiro lugar.
Interpolação, aritmética e busca
Como pontos próximos em um espaço latente bem formado tendem a ser semanticamente semelhantes, os profissionais podem interpolar suavemente entre dois pontos para transformar uma saída em outra, ou realizar aritmética vetorial, um exemplo inicial famoso sendo "rei menos homem mais mulher é igual a rainha" em embeddings de palavras. Essa mesma propriedade está na base da busca semântica: documentos e consultas são incorporados em um espaço latente compartilhado, e um banco de dados vetorial encontra vetores próximos em vez de corresponder a palavras-chave exatas. Em modelos de imagem, editar um vetor latente ao longo de uma direção descoberta pode alterar um atributo da saída, como iluminação ou pose, sem retreinar o modelo.
Limitações
Os espaços latentes são aprendidos, não projetados, portanto sua estrutura não é garantida como interpretável ou uniformemente organizada; as regiões podem ser emaranhadas, o que significa que uma única dimensão afeta vários atributos visíveis ao mesmo tempo. O trabalho em interpretabilidade tem tentado tornar as representações latentes mais transparentes, com sucesso misto, e a geometria de um espaço latente pode mudar substancialmente entre versões do modelo, complicando as tentativas de reutilizar direções aprendidas entre modelos.