Traduit de l'anglais

Yelp Reviews est un ensemble de données de critiques d'entreprises issues du crowdsourcing sur Yelp, largement utilisé dans la recherche en traitement du langage naturel et en analyse des sentiments. Il contient des millions de critiques générées par les utilisateurs avec des notes, utilisées pour entraîner et évaluer des modèles d'apprentissage automatique.

Les avis Yelp désignent la collection de critiques et d'évaluations générées par les utilisateurs et publiées sur Yelp, une plateforme d'avis participative fondée en 2004 par les anciens employés de PayPal, Russel Simmons et Jeremy Stoppelman. Cet ensemble de données est devenu une référence standard en traitement automatique du langage naturel et en apprentissage automatique pour des tâches telles que l'analyse des sentiments, les systèmes de recommandation et la classification de textes. Les chercheurs et les praticiens utilisent les avis Yelp pour développer et évaluer des algorithmes capables d'inférer les sentiments des utilisateurs, de prédire les évaluations et de comprendre le comportement des consommateurs à partir de textes non structurés.

L'ensemble de données Yelp comprend des millions d'avis, chacun accompagné d'une évaluation par étoiles (de 1 à 5), de métadonnées sur les entreprises et d'informations sur les utilisateurs. Au 31 décembre 2024, environ 308 millions d'avis avaient été contribués à Yelp, et l'entreprise a signalé plus de 76 millions de visiteurs uniques sur ordinateur et mobile en 2024. L'ensemble de données est souvent publié en sous-ensembles à des fins académiques, le Yelp Dataset Challenge fournissant un large échantillon pour la recherche. Les avis couvrent une large gamme de catégories d'entreprises, notamment les restaurants, les magasins et les services, ce qui en fait une source riche pour étudier le langage spécifique à un domaine.

Contexte historique

Yelp a été fondé en 2004 chez MRL Ventures, un incubateur d'entreprises, avec un financement initial de Max Levchin, cofondateur de PayPal. La plateforme a d'abord commencé comme un réseau de recommandations par courriel, mais s'est orientée vers des avis rédigés par les utilisateurs après que les données d'utilisation ont montré que les utilisateurs préféraient écrire des avis non sollicités. En 2005, le site repensé a gagné en popularité, et en 2006, il comptait un million de visiteurs mensuels. Yelp s'est étendu à l'international à partir de 2009, avec des sites au Royaume-Uni, au Canada, en France et dans d'autres pays. L'entreprise est entrée en bourse en mars 2012 et est devenue rentable en 2014. Cette croissance a conduit à une accumulation massive d'avis, formant la base de l'ensemble de données utilisé dans la recherche.

Caractéristiques de l'ensemble de données

L'ensemble de données des avis Yelp est remarquable par sa taille et sa diversité. Il comprend des avis de longueurs, de sentiments et de styles d'écriture variés, reflétant le comportement réel des utilisateurs. Les évaluations par étoiles fournissent une cible numérique pour les tâches d'apprentissage supervisé, tandis que le texte des avis offre des caractéristiques linguistiques riches. L'ensemble de données comprend également des attributs d'entreprise tels que l'emplacement, la catégorie et les horaires, permettant une analyse multimodale. Par exemple, les chercheurs peuvent étudier comment le sentiment des avis varie selon le type d'entreprise ou la région géographique. L'ensemble de données est souvent utilisé pour entraîner des modèles d'analyse des sentiments basée sur les aspects, où l'objectif est d'identifier les sentiments envers des aspects spécifiques comme la qualité de la nourriture ou le service.

Applications en apprentissage automatique

En apprentissage automatique et en intelligence artificielle, les avis Yelp constituent une référence courante pour l'analyse des sentiments et la classification de textes. Des modèles tels que les réseaux de neurones et les transformeurs sont entraînés sur l'ensemble de données pour prédire les évaluations à partir du texte des avis. Par exemple, un grand modèle de langage pourrait être affiné sur les avis Yelp pour générer des réponses ou analyser les commentaires des clients. L'ensemble de données est également utilisé dans les systèmes de recommandation, où des algorithmes prédisent les préférences des utilisateurs en fonction des avis passés. Des entreprises comme Amazon Web Services et Google Cloud proposent des services d'apprentissage automatique capables de traiter de tels ensembles de données, et des chercheurs d'institutions comme le laboratoire d'IA de Stanford et le CSAIL du MIT ont publié des études utilisant les données Yelp.

Défis et considérations éthiques

L'ensemble de données des avis Yelp n'est pas sans défis. Les faux avis, également connus sous le nom d'astroturfing, ont été un problème persistant, où des entreprises ou des individus soumettent de faux avis positifs ou négatifs pour manipuler les évaluations. Yelp a mis en œuvre des algorithmes pour détecter et filtrer ces avis, mais l'ensemble de données peut encore contenir du bruit. Les chercheurs doivent en tenir compte lors de l'entraînement des modèles, car des données biaisées ou frauduleuses peuvent conduire à des prédictions inexactes. De plus, l'ensemble de données soulève des préoccupations en matière de confidentialité, car les avis peuvent contenir des informations personnelles sur les utilisateurs ou les entreprises. Une utilisation éthique de l'ensemble de données nécessite l'anonymisation et le respect des réglementations sur la protection des données. L'entreprise a été critiquée pour ses pratiques de filtrage des avis, que certains jugent injustes envers les entreprises qui ne font pas de publicité.

Orientations futures

Au milieu des années 2020, les avis Yelp continuent d'être une ressource précieuse pour faire progresser la recherche en apprentissage profond et en IA générative. Avec l'essor des grands modèles de langage, l'ensemble de données est utilisé pour évaluer les performances des modèles sur des textes réels. Les travaux futurs pourraient se concentrer sur l'amélioration de l'analyse des sentiments pour les expressions nuancées, le sarcasme et les variations culturelles. L'intégration de données multimodales, telles que les images et les métadonnées, pourrait également améliorer les capacités des modèles. De plus, l'échelle de l'ensemble de données le rend adapté à l'entraînement de modèles sur des systèmes distribués comme AWS Trainium ou Cerebras, conçus pour le calcul à grande échelle. Alors que Yelp continue de croître, l'ensemble de données s'étendra probablement, offrant encore plus d'opportunités pour la recherche et les applications.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:dataset·sentiment-analysis·natural-language-processing
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique