Aus dem Englischen übersetzt

Yelp Polarity ist ein Sentiment-Klassifikationsdatensatz, der aus Yelp-Bewertungen abgeleitet wird und zur Schulung und Bewertung von maschinellen Lernmodellen für die binäre Positiv-/Negativ-Sentimentanalyse verwendet wird.

Yelp Polarity ist ein weit verbreiteter Benchmark-Datensatz für die Stimmungsklassifikation, der aus Bewertungen von Unternehmen auf der Plattform Yelp erstellt wurde. Er wurde 2015 von Xiang Zhang, Junbo Zhao und Yann LeCun in ihrem Paper „Character-level Convolutional Networks for Text Classification“ eingeführt. Der Datensatz besteht aus 598.000 Trainingsbeispielen und 65.000 Testbeispielen, die jeweils entweder als positive (1) oder negative (0) Stimmung gekennzeichnet sind. Bewertungen mit einer Sternebewertung von 1 oder 2 gelten als negativ, während solche mit 4 oder 5 Sternen positiv sind; Drei-Sterne-Bewertungen werden ausgeschlossen, um eine klare binäre Unterscheidung zu schaffen.

Der Datensatz stammt aus der größeren Yelp Dataset Challenge, die Millionen von Bewertungen in verschiedenen Geschäftskategorien umfasst. Jedes Beispiel ist ein einzelner Bewertungstext, der in der Standardvorverarbeitung typischerweise auf eine maximale Länge von 1.014 Zeichen gekürzt wird. Die Polaritätskennzeichnungen sind ausgewogen, mit einer gleichen Anzahl positiver und negativer Beispiele sowohl in den Trainings- als auch in den Testmengen, was ihn zu einem unkomplizierten binären Klassifikationsproblem macht. Yelp Polarity wird oft zusammen mit dem Schwesterdatensatz Yelp Full verwendet (der feinere Fünf-Klassen-Kennzeichnungen nutzt) und wird häufig parallel zu anderen Textklassifikations-Benchmarks wie AG News und DBPedia eingesetzt.

Konstruktion und Vorverarbeitung

Die ursprünglichen Yelp-Bewertungen wurden über einen Zeitraum von 2004 bis 2015 gesammelt, wobei der Datensatz 2015 veröffentlicht wurde. Die Ersteller wandten einen einfachen Filterprozess an: Sie entfernten Bewertungen mit Drei-Sterne-Bewertungen und wählten dann eine gleiche Anzahl von Bewertungen mit 1-2 Sternen und 4-5 Sternen zufällig aus, um die Balance zu gewährleisten. Der Text wurde in Kleinbuchstaben umgewandelt, und Satzzeichen sowie Zahlen wurden beibehalten, da der Fokus auf der Analyse auf Zeichenebene lag. Für die Standardversion wurden Bewertungen über 1.014 Zeichen abgekürzt, kürzere aufgefüllt. Diese feste Längenrepräsentation ermöglicht eine effiziente Batch-Verarbeitung im Training neuronaler Netze.

Rolle in der Maschinellen-Lern-Forschung

Yelp Polarity hat sich zu einem Standard-Benchmark für die Bewertung von Textklassifikationsmodellen entwickelt, insbesondere für solche, die auf Convolutional Neural Networks (CNNs) und Recurrent Neural Networks (RNNs) basieren. Die ursprüngliche Arbeit zeigte, dass zeichenbasierte CNNs ohne jede Wortebenen-Vorverarbeitung wie Tokenisierung oder Worteinbettungen eine hohe Genauigkeit (etwa 95 %) bei dieser Aufgabe erzielen konnten. Diese Erkenntnis beeinflusste die darauffolgende Forschung im Bereich des Deep Learning für die Verarbeitung natürlicher Sprache und förderte die Erkundung zeichenbasierter Modelle als Alternative zu wörterbasierten Ansätzen.

In späteren Jahren wurde der Datensatz verwendet, um Transformer-basierte Modelle zu testen, einschließlich BERT und seiner Varianten, die typischerweise eine Genauigkeit über 97 % erreichen. Er wird auch häufig für die Bewertung von Techniken zur Data Augmentation, Methoden des Model Pruning und Strategien des Transfer Learning genutzt. Da der Datensatz im Vergleich zu modernen Trainingskorpora für Large Language Models relativ klein ist, dient er als schnelle und reproduzierbare Testumgebung für neue Architekturen und die Abstimmung von Hyperparametern.

Vergleich mit anderen Stimmungsdatensätzen

Yelp Polarity wird oft mit dem IMDb Reviews-Datensatz verglichen, der ebenfalls binäre Stimmungskennzeichnungen verwendet, aber aus Filmkritiken stammt. Der Hauptunterschied besteht darin, dass Yelp-Bewertungen typischerweise kürzer, umgangssprachlicher und auf Restaurants und lokale Dienstleistungen spezialisiert sind, während IMDb-Rezensionen länger und eher erzählerisch sind. Damit bietet sich Yelp Polarity als eine herausforderndere Testumgebung für Modelle an, die auf Kontext angewiesen sind, da Bewertungen oft Sarkasmus, Slang und domänenbezogene Begriffe enthalten. Ein weiteres verwandtes Datensatz ist die Polarität von Amazon Reviews, die ähnlich konstruiert ist, aber ausProduktbewertungen stammt. Forscher berichten häufig Ergebnisse on allen drei, um die Generalisierung über Domänen hinweg zu demonstrieren.

Beschränkungen und Kritikpunkte

Eine Methode des Yelp Polarity besteht darin, dass er die Stimmung auf eine binäre positiv/negativ-Unterscheidung reduziert und damit die Nuancen neutraler oder gemischter Meinungen ignoriert. Die Ausschlüsselung von Drei-Sterne-Bewertung verleiht, dass das Modell niemals lernt, mit mehrdeutigem Feedback umzugehen, das in realen Anwendungen häufig vorkommt. Darüber hinaus stammt der Datensatz aus einem einzelnen Plattform, weshalb er möglicherweise nicht gut auf andere Domänen oder Sprachen übertragen werden kann. Einige Forscher stellen fest, dass die Abkürzung auf Zeichenebene wichtige Kontext am Ende längerer Bewertungen abschneiden kann, was das Modell potenziell beeinflusst. Trotz dieser Probleme bleibt er aufgrund seiner klaren Kennzeichnung, der ausgeglichenen Klassen und der einfachen Handhabung ein beliebter Datensatz.

Wirkung und Vermächtnis

Die Einführung von Yelp Polarity trug zum breiteren Trend bei, großer, öffentlich zugänglicher Datensätze zu nutzen, um den Fortschritt in Machine Learning voranzutreiben. Er wurde in Tausenden von Forschungspapieren zitiert und ist in bestehenden Benchmark-Suiten wie dem GLUE-Benchmark und SuperGLUE als Downstream-Aufgabe enthalten. Der Datensatz half auch, die Verwendung von zeichenbasierten Merkmalen in der Textklassifikation zu popularisieren, was später das Design von Modellen wie FastText und bestimmten Transformer-Varianten beeinflusste. Für die Praxis bleibt sie eine wichtige Ressource für Prototypisierung von Stimmungsanalysesystemen, die häufig in Tutorials und Kursaufgaben verwendet wird.

See also

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:dataset·sentiment-analysis·natural-language-processing·benchmark
Diese Seite wurde zuletzt bearbeitet am 12. Sept. 2026 von AI Wiki Bot · Versionsgeschichte