Traduzido do inglês

Yelp Polarity é um conjunto de dados de classificação de sentimentos derivado de avaliações do Yelp, utilizado para treinar e avaliar modelos de aprendizado de máquina para análise binária de sentimentos positivos/negativos.

Yelp Polarity é um conjunto de dados de referência amplamente utilizado para classificação de sentimentos, construído a partir de avaliações de negócios na plataforma Yelp. Foi introduzido em 2015 por Xiang Zhang, Junbo Zhao e Yann LeCun em seu artigo "Character-level Convolutional Networks for Text Classification". O conjunto de dados consiste em 598.000 amostras de treinamento e 65.000 amostras de teste, cada uma rotulada como sentimento positivo (1) ou negativo (0). Avaliações com classificações de 1 ou 2 estrelas são consideradas negativas, enquanto aquelas com 4 ou 5 estrelas são positivas; avaliações de 3 estrelas são excluídas para criar uma distinção binária clara.

O conjunto de dados é derivado do Yelp Dataset Challenge, que inclui milhões de avaliações em diversas categorias de negócios. Cada amostra é um único texto de avaliação, tipicamente truncado para um comprimento máximo de 1.014 caracteres no pré-processamento padrão. Os rótulos de polaridade são balanceados, com um número igual de exemplos positivos e negativos tanto nos conjuntos de treinamento quanto nos de teste, tornando-o um problema de classificação binária direto. Yelp Polarity é frequentemente pareado com seu conjunto de dados irmão, Yelp Full (que usa rótulos de granularidade fina com 5 classes), e é comumente usado ao lado de outros benchmarks de classificação de texto, como AG News e DBPedia.

Construção e Pré-processamento

As avaliações originais do Yelp foram coletadas ao longo de um período de 2004 a 2015, com o conjunto de dados lançado em 2015. Os criadores aplicaram um processo de filtragem simples: removeram avaliações com classificações de 3 estrelas e, em seguida, amostraram aleatoriamente um número igual de avaliações de 1-2 estrelas e 4-5 estrelas para garantir o equilíbrio. O texto foi convertido para minúsculas, e pontuação e números foram preservados, pois o foco estava na análise em nível de caractere. Para a versão padrão, avaliações mais longas que 1.014 caracteres foram truncadas, e as mais curtas foram preenchidas até esse comprimento. Essa representação de comprimento fixo permite um agrupamento eficiente no treinamento de redes neurais.

Papel na Pesquisa em Aprendizado de Máquina

Yelp Polarity tornou-se um benchmark padrão para avaliar modelos de classificação de texto, particularmente aqueles baseados em redes neurais convolucionais (CNNs) e redes neurais recorrentes (RNNs). O artigo original demonstrou que CNNs em nível de caractere poderiam alcançar alta precisão (cerca de 95%) nessa tarefa sem qualquer pré-processamento em nível de palavra, como tokenização ou embeddings de palavras. Essa descoberta influenciou pesquisas subsequentes em aprendizado profundo para processamento de linguagem natural, incentivando a exploração de modelos baseados em caracteres como uma alternativa às abordagens baseadas em palavras.

Em anos posteriores, o conjunto de dados tem sido usado para testar modelos baseados em transformers, incluindo BERT e suas variantes, que tipicamente alcançam precisão acima de 97%. Também é uma escolha comum para avaliar técnicas de aumento de dados, métodos de poda de modelos e estratégias de aprendizado por transferência. Como o conjunto de dados é relativamente pequeno em comparação com corpora modernos de treinamento de modelos de linguagem de grande escala, ele serve como um ambiente de teste rápido e reproduzível para novas arquiteturas e ajuste de hiperparâmetros.

Comparação com Outros Conjuntos de Dados de Sentimentos

Yelp Polarity é frequentemente comparado com o conjunto de dados IMDb Reviews, que também usa rótulos binários de sentimento, mas a partir de avaliações de filmes. A principal diferença é que as avaliações do Yelp são tipicamente mais curtas, mais coloquiais e específicas de domínio, relacionadas a restaurantes e serviços locais, enquanto as avaliações do IMDb são mais longas e mais narrativas. Isso torna Yelp Polarity um teste mais desafiador para modelos que dependem de contexto, pois as avaliações frequentemente contêm sarcasmo, gírias e termos específicos de domínio. Outro conjunto de dados relacionado é a polaridade do Amazon Reviews, que é construído de forma semelhante, mas a partir de avaliações de produtos. Pesquisadores frequentemente relatam resultados nos três para demonstrar generalização entre domínios.

Limitações e Críticas

Uma limitação do Yelp Polarity é que ele reduz o sentimento a uma distinção binária positivo/negativo, ignorando a nuance de opiniões neutras ou mistas. A exclusão de avaliações de 3 estrelas significa que o modelo nunca aprende a lidar com feedback ambíguo, que é comum em aplicações do mundo real. Além disso, o conjunto de dados é derivado de uma única plataforma, portanto pode não generalizar bem para outros domínios ou idiomas. Alguns pesquisadores notaram que o truncamento em nível de caractere pode cortar contexto importante no final de avaliações mais longas, potencialmente enviesando o modelo. Apesar dessas questões, ele permanece uma escolha popular devido à sua rotulagem limpa, classes balanceadas e facilidade de uso.

Impacto e Legado

A introdução do Yelp Polarity contribuiu para a tendência mais ampla de usar grandes conjuntos de dados publicamente disponíveis para impulsionar o progresso em aprendizado de máquina. Ele foi citado em milhares de artigos de pesquisa e está incluído em principais suítes de benchmarking, como GLUE e SuperGLUE, como uma tarefa downstream. O conjunto de dados também ajudou a popularizar o uso de características em nível de caractere na classificação de texto, o que posteriormente informou o design de modelos como FastText e certas variantes de transformers. Para profissionais, ele continua sendo um recurso essencial para prototipar sistemas de análise de sentimentos, frequentemente usado em tutoriais e trabalhos de curso.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:dataset·sentiment-analysis·natural-language-processing·benchmark
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico