Yelp Full é um conjunto de dados de referência amplamente utilizado em processamento de linguagem natural (PLN) para a tarefa de classificação de avaliações por nota. Ele consiste em avaliações do Yelp rotuladas com uma nota de 1 a 5 estrelas, e o objetivo é prever a nota com base no texto da avaliação. O conjunto de dados é comumente empregado para avaliar o desempenho de modelos de classificação de texto, incluindo abordagens tradicionais de aprendizado de máquina e arquiteturas modernas de aprendizado profundo.
O conjunto de dados foi introduzido como parte do artigo "Character-level Convolutional Networks for Text Classification" de Xiang Zhang et al. em 2015. Ele é derivado do conjunto de dados maior do Yelp, que contém milhões de avaliações de usuários sobre negócios locais. A versão Yelp Full é construída a partir de um subconjunto de avaliações, garantindo uma distribuição equilibrada entre as cinco classes de notas. O conjunto de treinamento contém 650.000 amostras, e o conjunto de teste contém 50.000 amostras. Cada avaliação é uma string de texto bruto, e o rótulo é a nota de estrelas correspondente (1 a 5).
Construção do Conjunto de Dados
O conjunto de dados Yelp Full é criado a partir do Yelp Dataset Challenge, que fornece uma grande coleção de avaliações de usuários. Para construir o subconjunto equilibrado, os autores amostraram aleatoriamente 130.000 avaliações por classe de nota para treinamento, totalizando 650.000, e 10.000 por classe para teste, totalizando 50.000. Esse design equilibrado garante que a acurácia seja uma métrica significativa, pois uma suposição aleatória resultaria em 20% de acurácia. As avaliações não são pré-processadas além da tokenização básica, preservando o texto original para modelagem em nível de caractere ou de palavra.
Uso em Pesquisa
Yelp Full é frequentemente usado como um padrão de referência para classificação de texto. Ele aparece em artigos de pesquisa que avaliam redes neurais convolucionais (CNNs), redes neurais recorrentes (RNNs) e modelos baseados em transformadores. Por exemplo, é um dos conjuntos de dados na suíte de referência amplamente citada por Zhang et al., que também inclui AG News, DBPedia e avaliações da Amazon. O conjunto de dados é particularmente útil para estudar o impacto da arquitetura do modelo, técnicas de incorporação e estratégias de treinamento na acurácia da classificação.
Nos últimos anos, Yelp Full tem sido usado para testar grandes modelos de linguagem (LLMs) e abordagens de aprendizado por transferência. Modelos como BERT e suas variantes alcançam alta acurácia nessa tarefa, frequentemente excedendo 95% no conjunto de teste. No entanto, o conjunto de dados permanece desafiador para modelos que não utilizam representações pré-treinadas, tornando-o uma linha de base útil para comparar diferentes metodologias de PLN.
Tarefas Relacionadas e Variantes
Yelp Full é frequentemente contrastado com o conjunto de dados Yelp Polarity, que é uma versão de classificação binária onde avaliações com notas 1-2 são rotuladas como negativas e 4-5 como positivas (a nota 3 é excluída). A versão completa é mais granular e, portanto, mais desafiadora. Pesquisadores às vezes usam Yelp Full para avaliar abordagens de regressão ou métodos de classificação ordinal, já que as notas têm uma ordem natural. O conjunto de dados também é usado em configurações de aprendizado multitarefa, onde os modelos preveem tanto a nota quanto outros atributos, como a utilidade da avaliação.
Métricas de Avaliação
A acurácia é a principal métrica de avaliação para Yelp Full, pois as classes são equilibradas. Alguns estudos também relatam F1-score, precisão e recall, particularmente ao analisar o desempenho por classe. Como o conjunto de dados é equilibrado, a acurácia fornece uma comparação direta entre modelos. Os resultados de estado da arte em Yelp Full melhoraram significativamente desde sua introdução, de cerca de 60% de acurácia com CNNs em nível de caractere para mais de 96% com modelos de transformadores ajustados.
Ver Também
- aprendizado de máquina
- aprendizado profundo
- rede neural
- grande modelo de linguagem
- transformador
- processamento de linguagem natural
Referências
- Zhang, X., Zhao, J., & LeCun, Y. (2015). Character-level Convolutional Networks for Text Classification. Advances in Neural Information Processing Systems.
- Yelp Dataset Challenge (https://www.yelp.com/dataset)