Traduzido do inglês

Amazon Polarity é um conjunto de dados de classificação de sentimentos derivado de avaliações de produtos da Amazon, contendo 3,6 milhões de amostras de treinamento e 400.000 de teste, rotuladas como positivas ou negativas, amplamente utilizado para avaliar modelos de aprendizado de máquina.

Amazon Polarity é um conjunto de dados de classificação de sentimentos em larga escala, construído a partir de avaliações de produtos da Amazon. É comumente utilizado como referência para avaliar modelos de aprendizado de máquina e aprendizado profundo em tarefas de classificação binária de texto. O conjunto de dados associa cada avaliação a um rótulo que indica se o sentimento expresso é positivo ou negativo, derivado da classificação por estrelas da avaliação.

O conjunto de dados foi introduzido como parte de um esforço mais amplo para criar referências padronizadas para classificação de frases, juntamente com conjuntos de dados semelhantes, como IMDB e Yelp Polarity. Foi apresentado pela primeira vez em um artigo de 2015 de Xiang Zhang, Junbo Zhao e Yann LeCun, que também introduziu o conjunto de dados relacionado Amazon Full. A versão de polaridade simplifica o problema original de classificação de cinco classes baseado em avaliações em duas classes: avaliações com 1 ou 2 estrelas são rotuladas como negativas, enquanto aquelas com 4 ou 5 estrelas são rotuladas como positivas. Avaliações com 3 estrelas são excluídas do conjunto de dados.

Construção e Estatísticas

O conjunto de dados é derivado de uma coleção maior de avaliações da Amazon que abrange mais de 18 anos de feedback de produtos. O corpus original contém mais de 35 milhões de avaliações cobrindo uma ampla gama de categorias de produtos, incluindo livros, eletrônicos, roupas e artigos para o lar. Para a versão de polaridade, os criadores amostraram um subconjunto para garantir equilíbrio entre as duas classes.

O conjunto de dados final contém 3.600.000 exemplos de treinamento e 400.000 exemplos de teste. Cada exemplo consiste no texto da avaliação e em um rótulo binário. As avaliações são apresentadas como texto bruto, sem pré-processamento, preservando a capitalização original, pontuação e erros de digitação ocasionais. Isso torna o conjunto de dados um teste realista para modelos que devem lidar com linguagem ruidosa e informal.

Uso em Pesquisa

Amazon Polarity tornou-se uma referência padrão na pesquisa em processamento de linguagem natural. É frequentemente usado para comparar o desempenho de vários classificadores, desde métodos tradicionais, como máquinas de vetores de suporte e regressão logística, até arquiteturas modernas de aprendizado profundo. O grande tamanho do conjunto de dados o torna particularmente adequado para treinar modelos de redes neurais, incluindo arquiteturas baseadas em transformadores.

Pesquisadores frequentemente relatam a acurácia no conjunto de teste como métrica principal. Modelos de última geração, particularmente aqueles baseados em modelos de linguagem de grande escala como BERT e seus sucessores, alcançam acurácia acima de 95%. O conjunto de dados também é usado em estudos sobre adaptação de domínio, aprendizado por transferência e robustez a exemplos adversariais. Como as avaliações vêm de categorias de produtos diversas, espera-se que modelos treinados em Amazon Polarity generalizem em diferentes domínios da linguagem do consumidor.

Relação com Outros Conjuntos de Dados

Amazon Polarity faz parte de uma família de conjuntos de dados criados pelos mesmos autores, incluindo Amazon Full, IMDB e Yelp Polarity. Esses conjuntos de dados compartilham um formato comum e são frequentemente usados juntos em estudos comparativos. O conjunto de dados IMDB, por exemplo, foca especificamente em avaliações de filmes, enquanto Yelp Polarity é derivado de avaliações de restaurantes e negócios. Juntos, eles fornecem uma variedade de estilos de texto e vocabulário, permitindo que pesquisadores testem a generalização de modelos entre domínios.

O conjunto de dados também está relacionado ao corpus original de avaliações da Amazon compilado por Julian McAuley e colegas, que é amplamente utilizado em pesquisa de sistemas de recomendação. Esse corpus inclui metadados adicionais, como IDs de produtos, IDs de usuários e carimbos de data/hora, que não estão incluídos na versão de polaridade.

Limitações e Considerações

Uma limitação do Amazon Polarity é que ele reduz um sistema de classificação por estrelas de cinco níveis a uma classificação binária. Essa simplificação perde informações sobre a intensidade do sentimento, pois uma avaliação de 1 estrela e uma de 2 estrelas são tratadas de forma idêntica. Além disso, a exclusão de avaliações de 3 estrelas cria uma lacuna no meio do espectro de sentimentos, o que pode não refletir distribuições do mundo

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:sentiment-analysis·dataset·natural-language-processing·benchmark
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico