Traduzido do inglês

Reuters-21578 é um conjunto de dados clássico de referência para categorização de texto, composto por 21.578 artículos de agência de notícias Reuters de 1987, amplamente utilizado para avaliar sistemas de [[machine-learning|aprendizado automático]] e de recuperação de informações. Incluye documentos rotulados organizados em múltiples categorias, servindo como padrão para a pesquisa em [[natural-language-processing|processamento de linguagem natural]].

Reuters-21578 é um conjunto de dados clássico de referência para categorização de texto, consistindo em 21.578 artigos de notícias do serviço de fios de notícias Reuters, publicados em 1987. Tem sido uma pedra angular para avaliar algoritmos de aprendizado de máquina e recuperação de informação por décadas. O conjunto de dados é distribuído com uma divisão padrão de treino e teste, tipicamente usando a divisão "ModApte", que reserva 9.603 documentos para treinamento e 3.299 para teste, descartando uma porção de documentos que têm múltiplos tópicos ou nenhum tópico. Cada artigo é atribuído a um ou mais rótulos de tópico de um conjunto de 135 categorias, incluindo indicadores econômicos, aquisições corporativas e commodities agrícolas.

O conjunto de dados originou-se do corpus Reuters-22173, que foi compilado durante os anos 1990 para fins de pesquisa. A versão -21578 foi criada para abordar inconsistências e fornecer um padrão de referência mais limpo e amplamente adotado. Tem sido hospedado em múltiplas plataformas, incluindo o Repositório de Aprendizado de Máquina da UCI e vários sites de cursos acadêmicos, tornando-se um padrão de facto para experimentos de classificação de texto.

Contexto Histórico e Criação

Reuters-21578 foi derivado de uma coleção maior de histórias de fios de notícias da Reuters, principalmente de 1987. A compilação inicial fez parte de projetos na Universidade de Massachusetts e outras instituições, visando fornecer um corpus realista para avaliar sistemas de recuperação de informação. O conjunto de dados completo originalmente continha mais de 21.000 documentos, mas etapas de pré-processamento removeram aqueles com rótulos ausentes ou ambíguos, resultando nos 21.578 artigos usados hoje. A divisão ModApte, nomeada após os pesquisadores David D. Lewis e Marc Ringuette, que usaram o acrônimo dos autores do relatório técnico (ModApte), tornou-se o protocolo de avaliação padrão, garantindo comparabilidade entre estudos.

A estrutura do conjunto de dados segue a formatação típica de fios de notícias, incluindo um título, texto do corpo e metadados como data e autor, embora a maioria das avaliações se concentre no corpo rotulado topicamente. Os rótulos de tópico foram atribuídos manualmente por editores da Reuters, fornecendo verdade fundamental de alta qualidade para tarefas de classificação.

Papel de Referência em Aprendizado de Máquina

Reuters-21578 tem sido instrumental no avanço do aprendizado de máquina para classificação de texto. Trabalhos iniciais no final dos anos 1990 e 2000 usaram este conjunto de dados para comparar algoritmos como naive Bayes, máquinas de vetores de suporte e árvores de decisão. Por exemplo, um estudo marcante de Joachims em 1998 demonstrou que máquinas de vetores de suporte alcançaram desempenho superior neste padrão de referência, com pontuações F1 micro-médias em torno de 0,86 para as 10 principais categorias, comparado a cerca de 0,82 para k-vizinhos mais próximos e 0,72 para naive Bayes. Esses resultados ajudaram a estabelecer SVMs como uma ferramenta poderosa para dados de texto de alta dimensão.

Pesquisadores também usaram o conjunto de dados para explorar técnicas de seleção de características, como estatísticas qui-quadrado e ganho de informação, que melhoraram significativamente a precisão da classificação ao reduzir ruído. O tamanho moderado do conjunto de dados e a estrutura clara de rótulos o tornaram ideal para prototipar métodos antes de escalar para corpora maiores.

Influência no Processamento de Linguagem Natural

No campo mais amplo do processamento de linguagem natural, Reuters-21578 forneceu uma avaliação padrão para modelos iniciais de rede neural. Arquiteturas pré-transformador, como redes neurais convolucionais para texto (por exemplo, o modelo de 2014 de Kim Yoon) e redes recorrentes, foram testadas neste conjunto de dados para demonstrar sua eficácia. Por exemplo, o artigo de 2014 de Kim sobre CNN para classificação de sentenças relatou um micro-F1 de 0,872 em Reuters-21578, superando ligeiramente SVMs tradicionais com kernel linear (0,855). Isso ajudou a estimular o interesse em aprendizado profundo para classificação de texto estruturado.

Mais tarde, com o advento de grandes modelos de linguagem e abordagens de ajuste fino, Reuters-21578 permaneceu como uma verificação rápida de sanidade para novas arquiteturas, embora seu tamanho pequeno o limitasse a experimentos em estágio inicial. O conjunto de dados é frequentemente usado para avaliar técnicas de incorporação e aprendizado por transferência, onde modelos pré-treinados são ajustados na divisão ModApte.

Características dos Dados e Pré-processamento

O conjunto de dados inclui 21.578 artigos, mas nem todos têm texto completo. O comprimento médio do documento é de cerca de 200 palavras. Os rótulos não são mutuamente exclusivos; um documento pode pertencer a múltiplas categorias, como "earn" e "acq". Na prática, muitos estudos transformam o problema em classificação binária para cada categoria ou focam nas 10 categorias mais frequentes, que cobrem a maioria dos documentos. A distribuição é assimétrica, com a categoria "earn" tendo cerca de 3.776 documentos de treinamento, enquanto muitas categorias têm menos de 10 exemplos, apresentando desafios para classificação de classes raras.

O pré-processamento tipicamente envolve tokenização, conversão para minúsculas, remoção de palavras de parada e stemming. O conjunto de dados é frequentemente usado como uma tarefa de classificação binária ou multi-rótulo, com métricas como precisão, recall e pontuação F1 (média micro e macro).

Legado e Uso Contínuo

Embora conjuntos de dados mais novos como 20 Newsgroups e AG News tenham surgido, Reuters-21578 permanece como uma referência para entender questões fundamentais de classificação de texto. É frequentemente usado em cursos acadêmicos sobre inteligência artificial e recuperação de informação para ensinar estudantes a construir e avaliar classificadores. Sua importância histórica é reconhecida na literatura, frequentemente citada em pesquisas de categorização de texto.

A partir do início dos anos 2020, o conjunto de dados está disponível gratuitamente para fins de pesquisa, com citação adequada às fontes originais. Também inspirou versões derivadas, como Reuters-21578 com pré-processamento adicionado ou divisões diferentes, mas a divisão ModApte original permanece como a linha de base mais comum. A longevidade do padrão de referência sublinha sua qualidade e a clareza de sua rotulagem, tornando-o uma ferramenta durável para pesquisa reproduzível.

Referências e Leitura Adicional

Pesquisadores tipicamente citam o relatório técnico de David D. Lewis, "Reuters-21578 Text Categorization Test Collection, Distribution 1.0" (1997), que descreve a construção do conjunto de dados e seu uso pretendido. Para uma perspectiva histórica, o artigo de 1992 de Lewis e Ringuette introduziu a divisão ModApte no contexto de classificadores probabilísticos. Esses documentos fornecem a base primária para a proveniência do conjunto de dados.

Veja Também

Em resumo, Reuters-21578 é um conjunto de dados fundamental que moldou o campo da categorização de texto, oferecendo um ambiente de teste estável e bem documentado que continua a informar a pesquisa moderna em PLN.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:text-categorization·dataset·machine-learning·nlp
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico