Yelp Reviews bezeichnet die Sammlung nutzergenerierter Bewertungen und Sternebewertungen, die auf Yelp veröffentlicht werden, einer Crowd-sourcing-Bewertungsplattform, die 2004 von den ehemaligen PayPal-Mitarbeitern Russel Simmons und Jeremy Stoppelman gegründet wurde. Der Datensatz hat sich zu einem Standard-Benchmark in der Verarbeitung natürlicher Sprache und im maschinellen Lernen für Aufgaben wie Stimmungsanalyse, Empfehlungssysteme und Textklassifikation entwickelt. Forscher und Praktiker verwenden Yelp Reviews, um Algorithmen zu entwickeln und zu evaluieren, die Nutzerstimmungen ableiten, Bewertungen vorhersagen und Verbraucherverhalten aus unstrukturiertem Text verstehen können.
Der Yelp-Datensatz umfasst Millionen von Bewertungen, die jeweils mit einer Sternebewertung (1 bis 5), Geschäftsmetadaten und Nutzerinformationen versehen sind. Bis zum 31. Dezember 2024 wurden etwa 308 Millionen Bewertungen zu Yelp beigetragen, und das Unternehmen meldete im Jahr 2024 über 76 Millionen eindeutige Besucher auf Desktop und Mobilgeräten. Der Datensatz wird oft in Teilmengen für akademische Zwecke veröffentlicht, wobei die Yelp Dataset Challenge eine große Stichprobe für die Forschung bereitstellt. Die Bewertungen decken eine breite Palette von Geschäftskategorien ab, darunter Restaurants, Einkaufen und Dienstleistungen, was ihn zu einer reichhaltigen Quelle für die Untersuchung domänenspezifischer Sprache macht.
Historischer Kontext
Yelp wurde 2004 bei MRL Ventures, einem Business-Inkubator, mit anfänglicher Finanzierung durch Max Levchin, einen Mitbegründer von PayPal, gegründet. Die Plattform startete zunächst als E-Mail-basiertes Empfehlungsnetzwerk, wechselte jedoch zu nutzergeschriebenen Bewertungen, nachdem Nutzungsdaten zeigten, dass Nutzer unaufgeforderte Bewertungen bevorzugten. Bis 2005 gewann die neu gestaltete Website an Popularität, und bis 2006 hatte sie eine Million monatliche Besucher. Yelp expandierte ab 2009 international mit Websites im Vereinigten Königreich, Kanada, Frankreich und anderen Ländern. Das Unternehmen ging im März 2012 an die Börse und wurde 2014 profitabel. Dieses Wachstum führte zu einer massiven Ansammlung von Bewertungen, die die Grundlage des in der Forschung verwendeten Datensatzes bildet.
Datensatzeigenschaften
Der Yelp-Reviews-Datensatz zeichnet sich durch seine Größe und Vielfalt aus. Er umfasst Bewertungen mit unterschiedlichen Längen, Stimmungen und Schreibstilen, die reales Nutzerverhalten widerspiegeln. Die Sternebewertungen bieten ein numerisches Ziel für überwachte Lernaufgaben, während der Bewertungstext reichhaltige sprachliche Merkmale bietet. Der Datensatz enthält auch Geschäftsattribute wie Standort, Kategorie und Öffnungszeiten, was eine multimodale Analyse ermöglicht. Forscher können beispielsweise untersuchen, wie sich die Bewertungsstimmung je nach Geschäftstyp oder geografischer Region unterscheidet. Der Datensatz wird häufig verwendet, um Modelle für die aspektbasierte Stimmungsanalyse zu trainieren, bei der das Ziel darin besteht, Stimmungen gegenüber bestimmten Aspekten wie Lebensmittelqualität oder Service zu identifizieren.
Anwendungen im maschinellen Lernen
In maschinellem Lernen und künstlicher Intelligenz ist Yelp Reviews ein häufiger Benchmark für Stimmungsanalyse und Textklassifikation. Modelle wie neuronale Netze und Transformatoren werden auf dem Datensatz trainiert, um Bewertungen aus Bewertungstexten vorherzusagen. Beispielsweise könnte ein großes Sprachmodell auf Yelp Reviews feinabgestimmt werden, um Antworten zu generieren oder Kundenfeedback zu analysieren. Der Datensatz wird auch in Empfehlungssystemen verwendet, bei denen Algorithmen Nutzerpräferenzen basierend auf früheren Bewertungen vorhersagen. Unternehmen wie Amazon Web Services und Google Cloud bieten maschinelle Lerndienste an, die solche Datensätze verarbeiten können, und Forscher an Institutionen wie Stanford AI Lab und MIT CSAIL haben Studien mit Yelp-Daten veröffentlicht.
Herausforderungen und ethische Überlegungen
Der Yelp-Reviews-Datensatz ist nicht ohne Herausforderungen. Gefälschte Bewertungen, auch als Astroturfing bekannt, sind ein anhaltendes Problem, bei dem Unternehmen oder Einzelpersonen falsche positive oder negative Bewertungen einreichen, um Bewertungen zu manipulieren. Yelp hat Algorithmen implementiert, um solche Bewertungen zu erkennen und zu filtern, aber der Datensatz kann dennoch Rauschen enthalten. Forscher müssen dies beim Training von Modellen berücksichtigen, da verzerrte oder betrügerische Daten zu ungenauen Vorhersagen führen können. Darüber hinaus wirft der Datensatz Datenschutzbedenken auf, da Bewertungen persönliche Informationen über Nutzer oder Unternehmen enthalten können. Die ethische Nutzung des Datensatzes erfordert Anonymisierung und die Einhaltung von Datenschutzbestimmungen. Das Unternehmen wurde für seine Bewertungsfilterpraktiken kritisiert, die einige als unfair gegenüber Unternehmen betrachten, die nicht werben.
Zukünftige Richtungen
Stand Mitte der 2020er Jahre bleibt Yelp Reviews eine wertvolle Ressource für die Förderung der Forschung in tiefem Lernen und generativer KI. Mit dem Aufstieg von großen Sprachmodellen wird der Datensatz verwendet, um die Leistung von Modellen an realen Texten zu evaluieren. Zukünftige Arbeiten könnten sich auf die Verbesserung der Stimmungsanalyse für nuancierte Ausdrücke, Sarkasmus und kulturelle Variationen konzentrieren. Die Integration multimodaler Daten wie Bilder und Metadaten könnte ebenfalls die Modellfähigkeiten verbessern. Darüber hinaus macht die Größe des Datensatzes ihn geeignet für das Training von Modellen auf verteilten Systemen wie AWS Trainium oder Cerebras, die für groß angelegte Berechnungen ausgelegt sind. Da Yelp weiter wächst, wird sich der Datensatz wahrscheinlich erweitern und noch mehr Möglichkeiten für Forschung und Anwendung bieten.
Siehe auch
- maschinelles Lernen
- Stimmungsanalyse
- Verarbeitung natürlicher Sprache
- Yelp