Traduzido do inglês

Amazon Reviews é um conjunto de dados em grande escala de avaliações de produtos do Amazon.com, amplamente utilizado para análise de sentimentos, classificação de texto e pesquisa em sistemas de recomendação, contendo mais de 130 milhões de avaliações a partir de 2014.

Amazon Reviews é um conjunto de dados publicamente disponível que compreende avaliações de produtos e metadados da Amazon.com, uma das maiores plataformas de comércio eletrônico do mundo. O conjunto de dados tornou-se um padrão de referência em processamento de linguagem natural (NLP) e aprendizado de máquina, particularmente para tarefas como análise de sentimentos, mineração de opinião baseada em aspectos e sistemas de recomendação. Foi introduzido pela primeira vez em um artigo de 2011 de J. McAuley e J. Leskovec, e posteriormente expandido em 2014 para incluir mais de 130 milhões de avaliações em mais de 20 categorias de produtos, como livros, eletrônicos, roupas e artigos para o lar.

Histórico e Versões

O conjunto de dados original do Amazon Reviews, frequentemente referido como a coleção "Amazon product data", foi lançado por Julian McAuley e colegas da Universidade da Califórnia, em San Diego. A versão de 2011 continha aproximadamente 35 milhões de avaliações, enquanto a expansão de 2014 adicionou mais categorias e metadados, incluindo descrições de produtos, preço e informações de compra conjunta. Uma versão posterior, conhecida como conjunto de dados "Amazon Reviews 2018", foi lançada pelo grupo de McAuley, contendo mais de 233 milhões de avaliações até meados de 2018, com metadados mais ricos, como imagens e sinalizadores de compra verificada. Esses conjuntos de dados são comumente usados em pesquisa acadêmica e competições da indústria, e estão disponíveis para download no site da Universidade da Califórnia, em San Diego.

Estrutura e Características dos Dados

Cada avaliação no conjunto de dados normalmente inclui um identificador único, o ID do avaliador, o ID do produto (ASIN), a classificação geral (em uma escala de 1 a 5), o texto da avaliação, o título da avaliação, o carimbo de data e hora da avaliação e, às vezes, votos de utilidade de outros usuários. Os arquivos de metadados incluem informações do produto, como título, descrição, preço, categoria e classificação de vendas. O conjunto de dados é fornecido em formato JSON, com cada linha representando uma única avaliação ou produto. Essa estrutura permite que pesquisadores analisem e processem facilmente os dados usando linguagens de programação como Python ou R. A grande escala e a diversidade do conjunto de dados o tornam adequado para treinar modelos de aprendizado profundo, incluindo arquiteturas baseadas em transformadores.

Aplicações em Pesquisa e Indústria

O Amazon Reviews tem sido extensivamente usado em pesquisa acadêmica para análise de sentimentos, onde modelos preveem a polaridade (positiva, negativa, neutra) de uma avaliação com base em seu texto. Ele também serve como referência para classificação de texto, modelagem de tópicos e sistemas de recomendação, onde o objetivo é prever preferências do usuário com base em avaliações históricas. Na indústria, empresas usam dados de avaliações semelhantes para monitorar a qualidade do produto, entender o feedback do cliente e melhorar seus algoritmos de recomendação. O conjunto de dados também tem sido usado para estudar o impacto de avaliações falsas, a utilidade das avaliações e a dinâmica do boca a boca online. Muitos artigos de aprendizado de máquina e aprendizado profundo relatam resultados neste conjunto de dados, tornando-o um padrão de fato para avaliar novos modelos de NLP.

Desafios e Limitações

Apesar de sua popularidade, o conjunto de dados Amazon Reviews tem várias limitações. Primeiro, ele é altamente desbalanceado, com a maioria das avaliações sendo positivas (classificações 4 e 5), o que pode enviesar modelos para previsões positivas. Segundo, o conjunto de dados contém texto ruidoso, incluindo erros de digitação, gírias e gramática não padronizada, o que pode ser desafiador para pipelines tradicionais de NLP. Terceiro, as avaliações não são necessariamente representativas de toda a população de usuários da Amazon, pois são autosselecionadas. Quarto, o conjunto de dados é estático, o que significa que não reflete mudanças recentes em linhas de produtos ou comportamento do usuário. Finalmente, surgem preocupações com privacidade porque os dados incluem IDs de avaliadores, embora sejam anonimizados até certo ponto. Pesquisadores frequentemente abordam essas questões usando técnicas de amostragem, aumento de dados ou métodos de adaptação de domínio.

Conjuntos de Dados Relacionados e Extensões

Várias extensões e conjuntos de dados relacionados foram desenvolvidos a partir do Amazon Reviews. Por exemplo, o Amazon Review Data (2018) inclui campos adicionais como imagens e status de compra verificada. O conjunto de dados Amazon Multilingual Review fornece avaliações em vários idiomas, permitindo pesquisa multilíngue. Outra variante, o conjunto de dados Amazon Counterfactual, foi criado para raciocínio contrafactual em NLP. Além disso, o conjunto de dados tem sido usado para criar referências para análise de sentimentos baseada em aspectos, como as tarefas SemEval. Essas extensões permitem que pesquisadores explorem problemas mais complexos, como aprendizado multimodal (texto e imagens) e justiça em sistemas de recomendação. O conjunto de dados também é frequentemente combinado com outras fontes, como serviços Google Cloud ou Azure, para processamento em larga escala em ambientes de nuvem.

Impacto no Desenvolvimento de NLP e IA

O conjunto de dados Amazon Reviews desempenhou um papel significativo no avanço da pesquisa em NLP e inteligência artificial. Ele tem sido usado para treinar e avaliar modelos como BERT, GPT e outras arquiteturas de grandes modelos de linguagem. Por exemplo, pesquisadores ajustaram o BERT no Amazon Reviews para alcançar resultados de ponta em classificação de sentimentos. O conjunto de dados também contribuiu para o desenvolvimento de técnicas de aprendizado por transferência, onde modelos pré-treinados em texto geral são adaptados a domínios específicos. Além disso, foi fundamental para estudar a eficácia de arquiteturas de redes neurais, incluindo redes neurais convolucionais e redes neurais recorrentes. A disponibilidade de um conjunto de dados tão grande e real acelerou o ritmo de inovação em NLP, permitindo que pesquisadores testem hipóteses e desenvolvam novos algoritmos que são posteriormente implantados em sistemas comerciais.

Acesso e Diretrizes de Uso

O conjunto de dados Amazon Reviews está disponível gratuitamente para fins de pesquisa, mas os usuários devem aderir aos termos de uso especificados pelos provedores. Normalmente, o conjunto de dados é distribuído sob uma licença não comercial, e os pesquisadores são obrigados a citar os artigos originais ao usar os dados em publicações. O conjunto de dados pode ser baixado em formatos compactados, e várias ferramentas e bibliotecas foram desenvolvidas para facilitar o carregamento e o pré-processamento. Por exemplo, a biblioteca Hugging Face Datasets fornece uma interface conveniente para acessar o Amazon Reviews. Ao usar o conjunto de dados, é importante considerar implicações éticas, como proteger a privacidade do usuário e evitar a propagação de vieses. Os pesquisadores são incentivados a seguir as melhores práticas para o manuseio de dados e a documentar quaisquer etapas de pré-processamento para reprodutibilidade.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:datasets·natural-language-processing·sentiment-analysis·recommender-systems
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico