Classificação de documentos, também chamada de categorização de documentos, é uma tarefa na ciência da biblioteca, na ciência da informação e na ciência da computação que envolve atribuir um documento a uma ou mais classes ou categorias. A atribuição pode ser realizada manualmente, muitas vezes por bibliotecários ou especialistas no assunto, ou algoritmicamente usando técnicas computacionais. A classificação intelectual tem sido historicamente central para a ciência da biblioteca, enquanto a classificação algorítmica é um tópico central na ciência da informação e na ciência da computação, embora os dois campos se sobreponham substancialmente e promovam pesquisa interdisciplinar.
Os documentos a serem classificados podem incluir textos, imagens, música e outras mídias, cada um apresentando desafios de classificação distintos. Salvo indicação em contrário, o termo geralmente implica classificação de texto. Os documentos podem ser categorizados por assunto ou por outros atributos, como tipo de documento, autor ou ano de publicação, mas a classificação por assunto é o foco mais comum. Duas filosofias amplas orientam a classificação por assunto: abordagens baseadas em conteúdo e baseadas em solicitação.
Classificação Baseada em Conteúdo vs. Baseada em Solicitação
A classificação baseada em conteúdo atribui um documento a uma classe com base no peso ou na proporção do conteúdo dedicado a assuntos específicos. Por exemplo, as bibliotecas frequentemente aplicam uma regra de que pelo menos 20% do conteúdo de um livro deve estar relacionado à classe atribuída. Em sistemas automáticos, esse peso pode corresponder à frequência de certas palavras ou termos dentro do documento.
A classificação baseada em solicitação, também conhecida como classificação ou indexação orientada à solicitação, prioriza as necessidades antecipadas dos usuários. Um classificador pergunta quais descritores ajudariam um usuário a encontrar o documento, considerando todas as consultas possíveis e determinando para quais delas o documento é relevante. Essa abordagem frequentemente reflete um público específico ou uma política institucional; por exemplo, um banco de dados de estudos feministas pode indexar documentos de maneira diferente de uma biblioteca histórica geral. A classificação baseada em solicitação é melhor compreendida como orientada por políticas do que puramente orientada pelo usuário, a menos que incorpore dados empíricos sobre o comportamento real do usuário.
Classificação vs. Indexação
A distinção entre atribuir documentos a classes (classificação) e atribuir assuntos a documentos (indexação de assuntos) é frequentemente considerada superficial. O cientista da informação Frederick Wilfrid Lancaster argumentou que tais distinções terminológicas são sem sentido e causam confusão. Essa visão é apoiada pela intercambialidade dos sistemas de classificação e tesauros: um esquema de classificação pode ser transformado em um tesauro e vice-versa. Atribuir um termo de assunto a um documento é equivalente a atribuí-lo à classe de documentos indexados por esse termo, uma vez que todos os documentos que compartilham o mesmo termo pertencem à mesma classe.
Classificação Automática de Documentos
A classificação automática de documentos (CAD) usa métodos computacionais e aprendizado de máquina para categorizar documentos. As tarefas de CAD se enquadram em três categorias: classificação supervisionada, onde feedback externo (como rótulos humanos) fornece classificações corretas; classificação não supervisionada, também chamada de agrupamento de documentos, que opera sem referência externa; e classificação semissupervisionada, que combina dados rotulados e não rotulados. Numerosos produtos de software existem sob vários modelos de licença.
Técnicas comuns incluem abordagens de redes neurais artificiais, árvores de decisão (por exemplo, ID3 ou C4.5), maximização de expectativa, indexação semântica latente, classificadores naive Bayes, máquinas de vetores de suporte (SVM), algoritmos de k-vizinhos mais próximos e frequência de termo-frequência inversa de documento (tf-idf). Avanços em aprendizado profundo e arquiteturas de transformadores permitiram modelos mais sofisticados, como classificadores baseados em modelos de linguagem de grande escala que capturam contexto semântico além de contagens simples de palavras.
Aplicações
As aplicações práticas da classificação de documentos são diversas. Na filtragem de spam, algoritmos distinguem e-mails indesejados de mensagens legítimas. O roteamento de e-mail usa classificação para direcionar mensagens aos destinatários apropriados com base no tópico. A identificação de idioma detecta automaticamente o idioma de um documento, enquanto a classificação de gênero determina seu tipo literário ou retórico. A avaliação de legibilidade avalia a complexidade do texto para diferentes faixas etárias ou níveis de leitura, frequentemente apoiando sistemas de simplificação de texto. A análise de sentimentos identifica a atitude ou o tom emocional expresso em um documento. Na vigilância em saúde pública, a classificação de postagens em mídias sociais ajuda a monitorar surtos de doenças. A triagem de artigos, particularmente em biologia, seleciona artigos relevantes para curadoria manual em bancos de dados.
Desafios e Tendências
Um desafio chave na classificação automática é lidar com a diversidade de tipos de documentos e a ambiguidade da linguagem natural. Os primeiros sistemas dependiam de características artesanais, mas os métodos modernos aproveitam o aprendizado profundo para aprender representações automaticamente. O surgimento da IA generativa e dos modelos transformadores pré-treinados mudou o campo em direção ao ajuste fino e ao aprendizado com poucos exemplos, reduzindo a necessidade de vastos conjuntos de dados rotulados. No entanto, questões como viés, interpretabilidade e custo computacional permanecem áreas de pesquisa ativas. A colaboração interdisciplinar entre a ciência da biblioteca, a ciência da informação e a ciência da computação continua a refinar tanto a classificação manual quanto a algorítmica, garantindo que os sistemas permaneçam adaptáveis às necessidades em evolução dos usuários e aos formatos de documentos.