Yelp Reviews se refiere a la colección de reseñas y calificaciones generadas por usuarios publicadas en Yelp, una plataforma de reseñas colaborativas fundada en 2004 por los ex empleados de PayPal Russel Simmons y Jeremy Stoppelman. El conjunto de datos se ha convertido en un punto de referencia estándar en el procesamiento del lenguaje natural y el aprendizaje automático para tareas como el análisis de sentimientos, los sistemas de recomendación y la clasificación de texto. Los investigadores y profesionales utilizan Yelp Reviews para desarrollar y evaluar algoritmos que puedan inferir el sentimiento del usuario, predecir calificaciones y comprender el comportamiento del consumidor a partir de texto no estructurado.
El conjunto de datos de Yelp incluye millones de reseñas, cada una acompañada de una calificación de estrellas (de 1 a 5), metadatos del negocio e información del usuario. Al 31 de diciembre de 2024, se habían contribuido aproximadamente 308 millones de reseñas a Yelp, y la empresa informó de más de 76 millones de visitantes únicos en escritorio y móvil en 2024. El conjunto de datos a menudo se publica en subconjuntos para uso académico, y el Yelp Dataset Challenge proporciona una muestra grande para la investigación. Las reseñas cubren una amplia gama de categorías de negocios, incluidos restaurantes, compras y servicios, lo que lo convierte en una fuente rica para estudiar el lenguaje específico de cada dominio.
Contexto histórico
Yelp fue fundada en 2004 en MRL Ventures, una incubadora de negocios, con financiación inicial de Max Levchin, cofundador de PayPal. La plataforma comenzó inicialmente como una red de referencias basada en correo electrónico, pero cambió a reseñas escritas por usuarios después de que los datos de uso mostraran que los usuarios preferían escribir reseñas no solicitadas. Para 2005, el sitio rediseñado ganó popularidad, y para 2006, tenía un millón de visitantes mensuales. Yelp se expandió internacionalmente a partir de 2009, con sitios en el Reino Unido, Canadá, Francia y otros países. La empresa salió a bolsa en marzo de 2012 y se volvió rentable en 2014. Este crecimiento condujo a una acumulación masiva de reseñas, formando la base del conjunto de datos utilizado en la investigación.
Características del conjunto de datos
El conjunto de datos de Yelp Reviews es notable por su tamaño y diversidad. Incluye reseñas con longitudes, sentimientos y estilos de escritura variados, lo que refleja el comportamiento real del usuario. Las calificaciones de estrellas proporcionan un objetivo numérico para tareas de aprendizaje supervisado, mientras que el texto de las reseñas ofrece características lingüísticas ricas. El conjunto de datos también incluye atributos del negocio como ubicación, categoría y horarios, lo que permite un análisis multimodal. Por ejemplo, los investigadores pueden estudiar cómo varía el sentimiento de las reseñas según el tipo de negocio o la región geográfica. El conjunto de datos se utiliza a menudo para entrenar modelos de análisis de sentimientos basado en aspectos, donde el objetivo es identificar sentimientos hacia aspectos específicos como la calidad de la comida o el servicio.
Aplicaciones en el aprendizaje automático
En Machine learning y Artificial intelligence, Yelp Reviews es un punto de referencia común para el análisis de sentimientos y la clasificación de texto. Modelos como redes neuronales y transformadores se entrenan con el conjunto de datos para predecir calificaciones a partir del texto de las reseñas. Por ejemplo, un Large language model podría ajustarse con Yelp Reviews para generar respuestas o analizar comentarios de clientes. El conjunto de datos también se utiliza en sistemas de recomendación, donde los algoritmos predicen las preferencias del usuario basándose en reseñas pasadas. Empresas como Amazon Web Services y Google Cloud ofrecen servicios de aprendizaje automático que pueden procesar dichos conjuntos de datos, e investigadores en instituciones como Stanford AI Lab y MIT CSAIL han publicado estudios que utilizan datos de Yelp.
Desafíos y consideraciones éticas
El conjunto de datos de Yelp Reviews no está exento de desafíos. Las reseñas falsas, también conocidas como astroturfing, han sido un problema persistente, donde negocios o individuos envían reseñas positivas o negativas falsas para manipular las calificaciones. Yelp ha implementado algoritmos para detectar y filtrar dichas reseñas, pero el conjunto de datos aún puede contener ruido. Los investigadores deben tener esto en cuenta al entrenar modelos, ya que los datos sesgados o fraudulentos pueden llevar a predicciones inexactas. Además, el conjunto de datos plantea preocupaciones de privacidad, ya que las reseñas pueden contener información personal sobre usuarios o negocios. El uso ético del conjunto de datos requiere anonimización y cumplimiento de las regulaciones de protección de datos. La empresa ha enfrentado críticas por sus prácticas de filtrado de reseñas, que algunos argumentan que son injustas para los negocios que no publicitan.
Direcciones futuras
A mediados de la década de 2020, Yelp Reviews continúa siendo un recurso valioso para avanzar en la investigación de Deep learning y Generative AI. Con el auge de los grandes modelos de lenguaje, el conjunto de datos se utiliza para evaluar el rendimiento de los modelos en texto del mundo real. El trabajo futuro puede centrarse en mejorar el análisis de sentimientos para expresiones matizadas, sarcasmo y variaciones culturales. La integración de datos multimodales, como imágenes y metadatos, también podría mejorar las capacidades del modelo. Además, la escala del conjunto de datos lo hace adecuado para entrenar modelos en sistemas distribuidos como AWS Trainium o Cerebras, que están diseñados para el cálculo a gran escala. A medida que Yelp continúa creciendo, es probable que el conjunto de datos se expanda, ofreciendo aún más oportunidades para la investigación y la aplicación.
Véase también
- Machine learning
- análisis de sentimientos
- Natural language processing
- yelp