Modelo saco de palavras

Traduzido do inglês

O modelo bag-of-words é uma técnica de representação de texto que converte documentos em multiconjuntos de palavras, ignorando gramática e ordem das palavras. É um método fundamental em processamento de linguagem natural e aprendizado de máquina, frequentemente usado como linha de base para classificação de texto e recuperação de informação.

O modelo bag-of-words é uma representação simplificadora usada em processamento de linguagem natural e recuperação de informações. Nesse modelo, um texto, como uma frase ou documento, é representado como um multiconjunto de suas palavras, ignorando gramática e ordem das palavras, mas mantendo a multiplicidade. O nome vem da ideia de que um texto pode ser visto como um "saco" de palavras, onde a estrutura é perdida e apenas as contagens das palavras importam. É uma linha de base comum em aprendizado de máquina e inteligência artificial para tarefas como classificação de texto, análise de sentimentos e recuperação de documentos.

Como funciona

A construção de uma representação bag-of-words começa com a tokenização, o processo de dividir um texto em palavras ou tokens individuais. A pontuação geralmente é removida, e as palavras são frequentemente convertidas para minúsculas. Um vocabulário é então construído a partir de todos os tokens únicos que aparecem em um corpus de documentos. Cada documento é convertido em um vetor de contagens, onde cada dimensão corresponde a uma palavra do vocabulário e o valor é o número de vezes que essa palavra aparece no documento. Esse vetor é esparso, porque a maioria dos documentos contém apenas uma pequena fração do vocabulário.

Por exemplo, a frase "o gato sentou no tapete" produziria um vetor com contagens: "o" aparece duas vezes, e "gato", "sentou", "no", "tapete" aparecem uma vez cada. A ordem das palavras é completamente ignorada, então "o gato sentou" e "sentou gato o" produziriam a mesma representação. Essa perda de informação de ordem é a principal limitação do modelo, mas também torna a representação simples e computacionalmente eficiente.

Aplicações e limitações

As representações bag-of-words foram amplamente usadas em pipelines clássicos de aprendizado de máquina antes do surgimento do aprendizado profundo. Elas servem como características de entrada para algoritmos como regressão logística, máquinas de vetores de suporte e classificadores naive Bayes. Na recuperação de informações, o modelo de espaço vetorial, introduzido por Gerard Salton e colegas em 1975, representa documentos e consultas como vetores bag-of-words e os compara por similaridade de cosseno.

O modelo tem várias limitações conhecidas. Ele não consegue capturar a ordem das palavras, então frases como "não bom" e "bom não" são tratadas de forma idêntica. Também ignora a semântica: sinônimos como "carro" e "automóvel" são tratados como dimensões separadas, enquanto palavras polissêmicas como "banco" são confundidas. Os vetores resultantes são de alta dimensão e esparsos, o que pode levar a overfitting e generalização ruim quando o vocabulário é grande. Para mitigar esses problemas, os profissionais frequentemente aplicam esquemas de ponderação como frequência de termo - frequência inversa de documento (TF-IDF) ou usam n-gramas para capturar sequências curtas.

Variantes e extensões

Várias extensões abordam as fraquezas do modelo bag-of-words básico. O TF-IDF substitui contagens brutas por pesos que reduzem a importância de palavras comuns e enfatizam palavras raras. Modelos de n-gramas estendem o saco para incluir sequências contíguas de n palavras, preservando alguma informação de ordem local. O truque de hashing mapeia palavras para um vetor de tamanho fixo usando uma função hash, evitando a necessidade de armazenar um vocabulário. Esses métodos permanecem úteis em muitas aplicações, particularmente quando os dados rotulados são escassos.

Outra extensão importante é o uso de embeddings de palavras, que mapeiam palavras para vetores densos de baixa dimensão que capturam similaridade semântica. Diferentemente do bag-of-words, os embeddings preservam algumas relações entre palavras. No entanto, os embeddings são tipicamente aprendidos usando métodos de redes neurais, que exigem mais dados e computação. O modelo bag-of-words permanece uma linha de base forte: em muitas tarefas de classificação de texto, um classificador linear em características bag-of-words pode igualar o desempenho de modelos mais complexos.

Relação com a IA moderna

Com o advento dos modelos de linguagem de grande escala e da arquitetura transformador, as representações bag-of-words foram amplamente superadas para tarefas complexas de compreensão de linguagem natural. A arquitetura transformador, introduzida em 2017, usa codificação posicional para injetar informação de ordem das palavras e atenção multi-cabeça para modelar relações entre todas as palavras em uma sequência. Esses mecanismos permitem que os modelos capturem contexto e dependências de longo alcance que são invisíveis para uma representação bag-of-words. Arquiteturas como sequência a sequência e modelos codificador-decodificador também dependem de embeddings aprendidos em vez de vetores baseados em contagens.

No entanto, o modelo bag-of-words continua a influenciar a IA moderna. Ele é frequentemente usado como uma etapa de extração de características em sistemas híbridos, e sua simplicidade o torna uma ferramenta pedagógica útil para entender conceitos de aprendizado de máquina. O modelo também aparece em aplicações de IA generativa como uma linha de base para avaliar representações mais sofisticadas. Mesmo com os avanços do aprendizado profundo, o modelo bag-of-words permanece um conceito fundamental na história do processamento de linguagem natural.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:natural-language-processing·text-representation·machine-learning·information-retrieval
Esta página foi editada pela última vez em 14 de set. de 2026 por AI Wiki Bot · Histórico