Yelp Full ist ein weit verbreiteter Benchmark-Datensatz in der Verarbeitung natürlicher Sprache (NLP) für die Aufgabe der Bewertungsklassifikation von Rezensionen. Er besteht aus Yelp-Rezensionen, die mit einer Sternebewertung von 1 bis 5 gekennzeichnet sind, und das Ziel besteht darin, die Bewertung anhand des Rezensionstexts vorherzusagen. Der Datensatz wird häufig verwendet, um die Leistung von Textklassifikationsmodellen zu bewerten, einschließlich traditioneller Ansätze des maschinellen Lernens und moderner Deep-Learning-Architekturen.
Der Datensatz wurde im Rahmen des Papers „Character-level Convolutional Networks for Text Classification“ von Xiang Zhang et al. im Jahr 2015 eingeführt. Er ist aus dem größeren Yelp-Datensatz abgeleitet, der Millionen von Nutzerbewertungen lokaler Unternehmen enthält. Die Yelp-Full-Version wird erstellt, indem eine Teilmenge von Rezensionen ausgewählt wird, die eine ausgewogene Verteilung über die fünf Bewertungsklassen gewährleistet. Der Trainingssatz enthält 650.000 Stichproben, und der Testsatz enthält 50.000 Stichproben. Jede Rezension ist ein roher Textstring, und das Label ist die entsprechende Sternebewertung (1 bis 5).
Datensatzkonstruktion
Der Yelp-Full-Datensatz wird aus der Yelp Dataset Challenge erstellt, die eine große Sammlung von Nutzerbewertungen bereitstellt. Um die ausgewogene Teilmenge zu erstellen, haben die Autoren zufällig 130.000 Rezensionen pro Bewertungsklasse für das Training ausgewählt, insgesamt 650.000, und 10.000 pro Klasse für das Testen, insgesamt 50.000. Dieses ausgewogene Design stellt sicher, dass die Genauigkeit eine aussagekräftige Metrik ist, da zufälliges Raten eine Genauigkeit von 20 % ergeben würde. Die Rezensionen werden über eine grundlegende Tokenisierung hinaus nicht vorverarbeitet, wodurch der ursprüngliche Text für die Modellierung auf Zeichen- oder Wortebene erhalten bleibt.
Verwendung in der Forschung
Yelp Full wird häufig als Standard-Benchmark für die Textklassifikation verwendet. Es erscheint in Forschungsarbeiten, die faltende neuronale Netze (CNNs), rekurrente neuronale Netze (RNNs) und transformerbasierte Modelle bewerten. Beispielsweise ist es einer der Datensätze in der vielzitierten Benchmark-Suite von Zhang et al., die auch AG News, DBPedia und Amazon-Rezensionen umfasst. Der Datensatz ist besonders nützlich, um die Auswirkungen von Modellarchitektur, Einbettungstechniken und Trainingsstrategien auf die Klassifikationsgenauigkeit zu untersuchen.
In den letzten Jahren wurde Yelp Full verwendet, um große Sprachmodelle (LLMs) und Transfer-Learning-Ansätze zu testen. Modelle wie BERT und seine Varianten erreichen bei dieser Aufgabe eine hohe Genauigkeit, die auf dem Testsatz oft 95 % übersteigt. Der Datensatz bleibt jedoch für Modelle herausfordernd, die keine vortrainierten Darstellungen nutzen, was ihn zu einer nützlichen Baseline für den Vergleich verschiedener NLP-Methoden macht.
Verwandte Aufgaben und Varianten
Yelp Full wird oft mit dem Yelp-Polarity-Datensatz kontrastiert, einer binären Klassifikationsversion, bei der Rezensionen mit Bewertungen von 1-2 als negativ und 4-5 als positiv gekennzeichnet sind (Bewertung 3 wird ausgeschlossen). Die Vollversion ist granularer und daher anspruchsvoller. Forscher verwenden Yelp Full manchmal, um Regressionsansätze oder ordinale Klassifikationsmethoden zu bewerten, da die Bewertungen eine natürliche Reihenfolge haben. Der Datensatz wird auch in Multi-Task-Learning-Einstellungen verwendet, in denen Modelle sowohl die Bewertung als auch andere Attribute wie die Nützlichkeit der Rezension vorhersagen.
Bewertungsmetriken
Genauigkeit ist die primäre Bewertungsmetrik für Yelp Full, da die Klassen ausgewogen sind. Einige Studien berichten auch über F1-Score, Präzision und Recall, insbesondere bei der Analyse der Leistung pro Klasse. Da der Datensatz ausgewogen ist, bietet die Genauigkeit einen unkomplizierten Vergleich zwischen Modellen. Die State-of-the-Art-Ergebnisse auf Yelp Full haben sich seit seiner Einführung erheblich verbessert, von etwa 60 % Genauigkeit mit zeichenbasierten CNNs auf über 96 % mit feinabgestimmten Transformer-Modellen.
Siehe auch
- maschinelles Lernen
- Deep Learning
- neuronales Netz
- großes Sprachmodell
- Transformer
- Verarbeitung natürlicher Sprache
Referenzen
- Zhang, X., Zhao, J., & LeCun, Y. (2015). Character-level Convolutional Networks for Text Classification. Advances in Neural Information Processing Systems.
- Yelp Dataset Challenge (https://www.yelp.com/dataset)