As Reseñas de Yelp se refiere al conjunto de reseñas y calificaciones generadas por usuarios publicadas en Yelp, una plataforma de reseñas colaborativas fundada en 2004 por los exempleados de PayPal Russel Simmons y Jeremy Stoppelman. El conjunto de datos se ha convertido en un estándar de referencia en el procesamiento del lenguaje natural y el aprendizaje automático para tareas como el análisis de sentimientos, los sistemas de recomendación y la clasificación de textos. Investigadores y profesionales utilizan las Reseñas de Yelp para desarrollar y evaluar algoritmos que puedan inferir el sentimiento del usuario, predecir calificaciones y comprender el comportamiento del consumidor a partir de texto no estructurado.
El conjunto de datos de Yelp incluye millones de reseñas, cada una acompañada de una calificación de estrellas (de 1 a 5), metadatos del negocio e información del usuario. Hasta el 31 de diciembre de 2024, se habían aportado aproximadamente 308 millones de reseñas a Yelp, y la empresa reportó más de 76 millones de visitantes únicos en escritorio y móvil en 2024. El conjunto de datos a menudo se publica en subconjuntos para uso académico, y el Desafío de Datos de Yelp proporciona una gran muestra para la investigación. Las reseñas cubren una amplia gama de categorías de negocios, incluidos restaurantes, compras y servicios, lo que lo convierte en una fuente rica para estudiar el lenguaje específico de cada dominio.
Contexto Histórico
Yelp fue fundada en 2004 en MRL Ventures, una incubadora de negocios, con financiación inicial de Max Levchin, cofundador de PayPal. La plataforma comenzó inicialmente como una red de referencias basada en correo electrónico, pero giró hacia reseñas escritas por usuarios después de que los datos de uso mostraran que los usuarios preferían escribir reseñas no solicitadas. Para 2005, el sitio rediseñado ganó popularidad, y para 2006, tenía un millón de visitantes mensuales. Yelp se expandió internacionalmente a partir de 2009, con sitios en el Reino Unido, Canadá, Francia y otros países. La empresa salió a bolsa en marzo de 2012 y se volvió rentable en 2014. Este crecimiento condujo a una acumulación masiva de reseñas, formando la base del conjunto de datos utilizado en la investigación.
Características del Conjunto de Datos
El conjunto de datos de Reseñas de Yelp es notable por su tamaño y diversidad. Incluye reseñas con longitudes, sentimientos y estilos de escritura variados, lo que refleja el comportamiento real del usuario. Las calificaciones de estrellas proporcionan un objetivo numérico para tareas de aprendizaje supervisado, mientras que el texto de la reseña ofrece características lingüísticas ricas. El conjunto de datos también incluye atributos del negocio como ubicación, categoría y horarios, lo que permite un análisis multimodal. Por ejemplo, los investigadores pueden estudiar cómo varía el sentimiento de las reseñas según el tipo de negocio o la región geográfica. El conjunto de datos se utiliza a menudo para entrenar modelos de análisis de sentimientos basado en aspectos, donde el objetivo es identificar sentimientos hacia aspectos específicos como la calidad de la comida o el servicio.
Aplicaciones en Aprendizaje Automático
En Machine learning y Artificial intelligence, las Reseñas de Yelp son un punto de referencia común para el análisis de sentimientos y la clasificación de textos. Modelos como redes neuronales y transformadores se entrenan en el conjunto de datos para predecir calificaciones a partir del texto de la reseña. Por ejemplo, un modelo de lenguaje de gran tamaño podría ajustarse finamente con Reseñas de Yelp para generar respuestas o analizar comentarios de clientes. El conjunto de datos también se utiliza en sistemas de recomendación, donde los algoritmos predicen las preferencias del usuario basándose en reseñas pasadas. Empresas como Amazon Web Services y Google Cloud ofrecen servicios de aprendizaje automático que pueden procesar tales conjuntos de datos, e investigadores en instituciones como Stanford AI Lab y MIT CSAIL han publicado estudios que utilizan datos de Yelp.
Desafíos y Consideraciones Éticas
El conjunto de datos de Reseñas de Yelp no está exento de desafíos. Las reseñas falsas, también conocidas como astroturfing, han sido un problema persistente, donde negocios o individuos envían reseñas positivas o negativas falsas para manipular las calificaciones. Yelp ha implementado algoritmos para detectar y filtrar tales reseñas, pero el conjunto de datos aún puede contener ruido. Los investigadores deben tener esto en cuenta al entrenar modelos, ya que los datos sesgados o fraudulentos pueden llevar a predicciones inexactas. Además, el conjunto de datos plantea preocupaciones de privacidad, ya que las reseñas pueden contener información personal sobre usuarios o negocios. El uso ético del conjunto de datos requiere anonimización y cumplimiento de las regulaciones de protección de datos. La empresa ha enfrentado críticas por sus prácticas de filtrado de reseñas, que algunos argumentan que son injustas para los negocios que no publicitan.
Direcciones Futuras
A mediados de la década de 2020, las Reseñas de Yelp continúan siendo un recurso valioso para avanzar en la investigación de Deep learning y Generative AI. Con el auge de los modelos de lenguaje de gran tamaño, el conjunto de datos se utiliza para evaluar el rendimiento del modelo en texto del mundo real. El trabajo futuro puede centrarse en mejorar el análisis de sentimientos para expresiones matizadas, sarcasmo y variaciones culturales. La integración de datos multimodales, como imágenes y metadatos, también podría mejorar las capacidades del modelo. Además, la escala del conjunto de datos lo hace adecuado para entrenar modelos en sistemas distribuidos como AWS Trainium o Cerebras, que están diseñados para el cálculo a gran escala. A medida que Yelp continúa creciendo, el conjunto de datos probablemente se expandirá, ofreciendo aún más oportunidades para la investigación y la aplicación.
Véase También
- aprendizaje automático
- análisis de sentimientos
- procesamiento del lenguaje natural
- yelp