Traduzido do inglês

AG News é um conjunto de dados de classificação de artigos de notícias em larga escala, contendo mais de 120.000 manchetes e descrições de notícias em inglês, utilizado para avaliar algoritmos de classificação de texto em aprendizado de máquina.

AG News é um conjunto de dados de referência amplamente utilizado para classificação de artigos de notícias. Ele contém mais de 120.000 manchetes e descrições curtas de notícias em inglês, cada uma atribuída a uma de quatro classes: Mundo, Esportes, Negócios e Ciência/Tecnologia. O conjunto de dados foi derivado de um corpus maior de artigos de notícias coletados pelo mecanismo de busca acadêmica AG's Corpus, e tornou-se um ambiente de teste padrão para avaliar modelos de classificação de texto em aprendizado de máquina e processamento de linguagem natural.

O conjunto de dados é notável por sua simplicidade e escala, tornando-o um ponto de partida comum para pesquisadores e profissionais que exploram abordagens de aprendizado profundo para categorização de texto. Cada amostra consiste em um título e uma descrição, com o rótulo da classe indicando o tópico. As quatro classes são balanceadas, com aproximadamente 30.000 exemplos de treinamento por classe e 1.900 exemplos de teste por classe, fornecendo uma medida confiável do desempenho do modelo.

História e Origem

O conjunto de dados AG News foi introduzido em 2015 como parte de um projeto de pesquisa de Xiang Zhang e colegas da Universidade de Nova York. Os pesquisadores extraíram artigos de notícias do AG's Corpus, uma coleção de mais de 1 milhão de artigos de notícias reunidos de mais de 2.000 fontes de notícias. Eles selecionaram artigos que se enquadravam em uma das quatro categorias e construíram um subconjunto balanceado para tarefas de classificação. O conjunto de dados foi lançado juntamente com benchmarks semelhantes, como DBpedia e Yahoo! Answers, com o objetivo de fornecer desafios diversos para algoritmos de classificação de texto.

A criação do AG News foi motivada pela necessidade de conjuntos de dados grandes, limpos e publicamente disponíveis para treinar e avaliar modelos de redes neurais. Na época, muitos conjuntos de dados existentes eram pequenos ou exigiam pré-processamento significativo. O AG News ofereceu uma tarefa de classificação direta com rótulos claros, permitindo que os pesquisadores se concentrassem na arquitetura do modelo e nas técnicas de treinamento, em vez da limpeza de dados.

Estrutura do Conjunto de Dados

O AG News contém dois arquivos: um para treinamento e outro para teste. O conjunto de treinamento inclui 120.000 amostras, enquanto o conjunto de teste contém 7.600 amostras. Cada amostra é uma linha CSV com três campos: índice da classe (1 a 4), título e descrição. Os índices das classes correspondem a Mundo, Esportes, Negócios e Ciência/Tecnologia, respectivamente. Os títulos são tipicamente curtos, muitas vezes com menos de 10 palavras, enquanto as descrições têm uma ou duas frases, fornecendo contexto para a manchete.

O conjunto de dados é pré-processado para remover pontuação e converter todo o texto para minúsculas, embora a capitalização e a pontuação originais estejam disponíveis na versão bruta. Esse pré-processamento simplifica a tokenização e permite que os modelos se concentrem em padrões de palavras em vez de formatação. A distribuição balanceada das classes garante que a acurácia seja uma métrica significativa, pois adivinhação aleatória resultaria em 25% de acurácia.

Aplicações em Aprendizado de Máquina

O AG News é frequentemente usado para avaliar modelos de classificação de texto, desde métodos tradicionais como máquinas de vetores de suporte e regressão logística até arquiteturas modernas baseadas em transformers. Ele serve como um teste de sanidade para novos designs de modelos, pois alcançar alta acurácia no AG News indica que um modelo pode capturar padrões semânticos e sintáticos básicos no texto.

Na era dos modelos de linguagem de grande escala, o AG News é frequentemente usado para ajuste fino e avaliação. Modelos como BERT e GPT podem alcançar acurácia quase perfeita no conjunto de teste, demonstrando a maturidade da classificação de texto. No entanto, o conjunto de dados permanece valioso para fins educacionais e para comparar a eficiência de diferentes arquiteturas, especialmente em ambientes com recursos limitados.

Pesquisadores também usam o AG News para estudar aprendizado por transferência, adaptação de domínio e técnicas de aumento de dados. Sua simplicidade permite experimentos controlados, e seu tamanho suporta treinamento sem custo computacional excessivo. Como resultado, o AG News aparece em centenas de artigos acadêmicos e é um item essencial em cursos de aprendizado de máquina.

Limitações e Críticas

Apesar de sua popularidade, o AG News tem limitações. As quatro categorias são amplas, e alguns artigos podem ser rotulados incorretamente ou ser ambíguos, levando a ruído nos rótulos. O conjunto de dados também é relativamente antigo, com artigos do início dos anos 2000, portanto pode não refletir as tendências atuais de notícias ou o vocabulário. Além disso, o pré-processamento remove pontuação e converte o texto para minúsculas, o que pode obscurecer diferenças estilísticas que poderiam ser relevantes em aplicações do mundo real.

Outra crítica é que o AG News é fácil demais para modelos modernos, com muitos alcançando mais de 90% de acurácia. Isso levou alguns pesquisadores a buscar benchmarks mais desafiadores, como aqueles com categorias mais granulares ou distribuições de classes desbalanceadas. No entanto, o AG News permanece uma linha de base útil e um ponto de partida para entender a classificação de texto.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:dataset·text-classification·machine-learning·natural-language-processing
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico