Análise semântica explícita (ESA) é uma representação vetorial de texto usada em processamento de linguagem natural e recuperação de informação. Ela representa palavras individuais ou documentos inteiros como vetores em um espaço de alta dimensão, onde cada dimensão corresponde a um conceito explicitamente definido por humanos, como um artigo da Wikipédia. A técnica foi projetada por Evgeniy Gabrilovich e Shaul Markovitch para melhorar a categorização de texto e calcular a relacionamento semântico entre textos usando similaridade por cosseno. O nome contrasta com a análise semântica latente (LSA), porque o uso de uma base de conhecimento pela ESA permite que rótulos legíveis por humanos sejam atribuídos aos conceitos que formam o espaço vetorial.
A ESA opera aproveitando um corpus de documentos como base de conhecimento. Em sua forma básica, uma palavra é representada como um vetor coluna na matriz de frequência de termo-frequência inversa de documento (tf-idf) do corpus, e um documento é representado como o centróide dos vetores de suas palavras constituintes. Embora a Wikipédia em inglês seja o corpus típico, outras coleções, como o Open Directory Project, também foram usadas.
Modelo
A variante básica da ESA começa com uma coleção de textos, como todos os artigos da Wikipédia, totalizando N documentos. Cada documento é convertido em um "saco de palavras" - um histograma de frequência de termos - e armazenado em um índice invertido. Para qualquer palavra dada, o índice invertido retorna o conjunto de documentos que contêm essa palavra, com cada documento pontuado com base na frequência com que a palavra aparece, ponderada pelo número total de palavras no documento. Matematicamente, essa saída é um vetor N-dimensional de pontuações palavra-documento, onde documentos que não contêm a palavra recebem uma pontuação de zero.
Para calcular a relação entre duas palavras, seus vetores u e v são comparados usando similaridade por cosseno: sim(u, v) = (u · v) / (||u|| ||v||). Isso produz uma estimativa numérica do relacionamento semântico. O esquema se estende de palavras individuais para textos com múltiplas palavras somando os vetores de todas as palavras no texto, produzindo uma representação em nível de documento.
Análise
A ESA foi originalmente proposta sob a suposição de que a base de conhecimento contém conceitos topicamente ortogonais. No entanto, Maik Anderka e Benno Stein demonstraram posteriormente que a ESA também melhora o desempenho da recuperação de informação quando baseada no corpus Reuters de artigos de agências de notícias, que não satisfaz a propriedade de ortogonalidade. Em seus experimentos, histórias de agências de notícias serviram como "conceitos". Essa observação foi explicada por meio de ligações entre a ESA e o modelo de espaço vetorial generalizado. Gabrilovich e Markovitch responderam notando que o resultado de Anderka e Stein foi alcançado usando uma única aplicação da ESA para similaridade de texto e uma pequena coleção de teste homogênea de apenas 50 documentos de notícias.
Aplicações
Relacionamento entre palavras
A ESA é considerada por seus autores uma medida de relacionamento semântico, em oposição à similaridade semântica. Em conjuntos de dados de referência para relacionamento entre palavras, a ESA supera outros algoritmos, incluindo medidas de similaridade semântica baseadas em WordNet e modelos de linguagem de rede neural skip-gram, como Word2vec. A abordagem foi aplicada em tarefas de categorização de texto, onde a representação baseada em conceitos melhora a precisão da classificação.
Relacionamento entre documentos
A ESA é usada em pacotes de software comercial para calcular o relacionamento entre documentos. Restrições específicas de domínio no modelo ESA são às vezes aplicadas para fornecer correspondência de documentos mais robusta em campos especializados. A capacidade da técnica de produzir vetores de conceito interpretáveis a torna valiosa para aplicações que exigem representações transparentes de conteúdo textual.
Extensões
Análise semântica explícita multilíngue (CL-ESA) é uma generalização multilíngue da ESA. A CL-ESA explora uma coleção de referência multilíngue alinhada por documentos, novamente tipicamente a Wikipédia, para representar um documento como um vetor de conceito independente de idioma. O relacionamento entre dois documentos em idiomas diferentes é avaliado pela similaridade por cosseno entre suas representações vetoriais correspondentes. Essa extensão permite recuperação de informação entre idiomas e comparação de textos através de fronteiras linguísticas.
A ESA também foi conectada a desenvolvimentos mais amplos em aprendizado de máquina e inteligência artificial, particularmente no contexto de tarefas de processamento de linguagem natural. Seu espaço de conceito explícito e interpretável a distingue de abordagens posteriores de aprendizado profundo, como redes neurais embeddings, embora ambas visem capturar relações semânticas em texto. O método permanece relevante como uma técnica fundamental para representação semântica, complementando modelos mais recentes como modelos de linguagem de grande escala e arquiteturas transformers.