Amazon Polarity es un conjunto de datos de clasificación de sentimientos a gran escala construido a partir de reseñas de productos de Amazon. Se utiliza comúnmente como punto de referencia para evaluar modelos de aprendizaje automático y aprendizaje profundo en tareas de clasificación binaria de texto. El conjunto de datos empareja cada reseña con una etiqueta que indica si el sentimiento expresado es positivo o negativo, derivado de la calificación de estrellas de la reseña.
El conjunto de datos se introdujo como parte de un esfuerzo más amplio para crear puntos de referencia estandarizados para la clasificación de oraciones, junto con conjuntos de datos similares como IMDB y Yelp Polarity. Se presentó por primera vez en un artículo de 2015 de Xiang Zhang, Junbo Zhao y Yann LeCun, que también introdujo el conjunto de datos relacionado Amazon Full. La versión de polaridad simplifica el problema original de clasificación de cinco clases en dos clases: las reseñas con calificaciones de 1 o 2 estrellas se etiquetan como negativas, mientras que aquellas con 4 o 5 estrellas se etiquetan como positivas. Las reseñas con una calificación de 3 estrellas se excluyen del conjunto de datos.
Construcción y Estadísticas
El conjunto de datos se deriva de una colección más amplia de reseñas de Amazon que abarca más de 18 años de comentarios de productos. El corpus original contiene más de 35 millones de reseñas que cubren una amplia gama de categorías de productos, incluidos libros, electrónica, ropa y artículos para el hogar. Para la versión de polaridad, los creadores muestrearon un subconjunto para garantizar un equilibrio entre las dos clases.
El conjunto de datos final contiene 3,600,000 ejemplos de entrenamiento y 400,000 ejemplos de prueba. Cada ejemplo consiste en el texto de la reseña y una etiqueta binaria. Las reseñas se presentan como texto sin procesar sin preprocesamiento, preservando la ortografía, la puntuación y los errores tipográficos ocasionales originales. Esto hace que el conjunto de datos sea una prueba realista para modelos que deben manejar lenguaje informal y ruidoso.
Uso en Investigación
Amazon Polarity se ha convertido en un punto de referencia estándar en la investigación del procesamiento del lenguaje natural. Se utiliza con frecuencia para comparar el rendimiento de varios clasificadores, desde métodos tradicionales como máquinas de vectores de soporte y regresión logística hasta arquitecturas modernas de aprendizaje profundo. El gran tamaño del conjunto de datos lo hace particularmente adecuado para entrenar modelos de red neuronal, incluidas arquitecturas basadas en transformadores.
Los investigadores suelen informar la precisión en el conjunto de prueba como métrica principal. Los modelos de última generación, particularmente aquellos basados en modelos de lenguaje grandes como BERT y sus sucesores, logran una precisión superior al 95%. El conjunto de datos también se utiliza en estudios sobre adaptación de dominio, aprendizaje por transferencia y robustez frente a ejemplos adversarios. Debido a que las reseñas provienen de diversas categorías de productos, se espera que los modelos entrenados en Amazon Polarity generalicen a través de diferentes dominios del lenguaje del consumidor.
Relación con Otros Conjuntos de Datos
Amazon Polarity es parte de una familia de conjuntos de datos creados por los mismos autores, incluidos Amazon Full, IMDB y Yelp Polarity. Estos conjuntos de datos comparten un formato común y a menudo se utilizan juntos en estudios comparativos. El conjunto de datos IMDB, por ejemplo, se centra específicamente en reseñas de películas, mientras que Yelp Polarity se basa en reseñas de restaurantes y negocios. Juntos, proporcionan una variedad de estilos de texto y vocabulario, lo que permite a los investigadores probar la generalización de modelos a través de dominios.
El conjunto de datos también está relacionado con el corpus original de reseñas de Amazon compilado por Julian McAuley y sus colegas, que se utiliza ampliamente en la investigación de sistemas de recomendación. Ese corpus incluye metadatos adicionales como identificadores de producto, identificadores de usuario y marcas de tiempo, que no se incluyen en la versión de polaridad.
Limitaciones y Consideraciones
Una limitación de Amazon Polarity es que reduce un sistema de calificación de cinco estrellas matizado a una clasificación binaria. Esta simplificación pierde información sobre la intensidad del sentimiento, ya que una reseña de 1 estrella y una de 2 estrellas se tratan de manera idéntica. Además, la exclusión de reseñas de 3 estrellas crea un vacío en el medio del espectro de sentimientos, lo que puede no reflejar las distribuciones del mundo real.
El conjunto de datos también hereda sesgos presentes en las reseñas de Amazon, como una tendencia hacia calificaciones extremas y diferencias en el comportamiento de reseñas entre categorías de productos. Algunos investigadores han señalado que el conjunto de datos contiene reseñas duplicadas o casi duplicadas, lo que puede inflar las métricas de rendimiento si no se maneja con cuidado. A pesar de estos problemas, Amazon Polarity sigue siendo un punto de referencia ampliamente utilizado y confiable para el análisis de sentimientos.