MS MARCO (Microsoft Machine Reading Comprehension) es un conjunto de datos a gran escala introducido por Microsoft en 2016 para tareas de comprensión lectora y clasificación de pasajes. El conjunto de datos fue diseñado para abordar las limitaciones de los puntos de referencia anteriores de respuesta a preguntas, proporcionando consultas reales de usuarios provenientes de los registros del motor de búsqueda Bing, junto con pasajes relevantes de documentos web y respuestas en lenguaje natural generadas por humanos. Su creación y publicación pública permitieron a los investigadores desarrollar y evaluar sistemas que recuperan e interpretan texto a escala, cerrando la brecha entre la recuperación de información tradicional y los modelos de comprensión basados en aprendizaje profundo.
Cada muestra en MS MARCO consiste en una consulta real de usuario, un conjunto de pasajes evaluados por relevancia y, para un subconjunto de muestras, una respuesta escrita por humanos. El conjunto de datos incluye más de 100,000 consultas para la tarea original de respuesta a preguntas, con una versión más amplia para la clasificación de pasajes. Los datos publicados incluyen etiquetas de relevancia generadas mediante crowdsourcing, y las respuestas fueron redactadas por anotadores humanos. MS MARCO ha sido ampliamente utilizado como un punto de referencia estándar para tareas como el reordenamiento de pasajes, la comprensión lectora automática y la respuesta a preguntas en dominio abierto.
Estructura del conjunto de datos
El conjunto de datos original de MS MARCO organiza las consultas en tres categorías principales según el tipo de respuesta requerida: preguntas de entidad, preguntas numéricas y preguntas de estilo de pasaje. Para las tareas de clasificación de pasajes, el conjunto de datos proporciona ejemplos negativos (pasajes no relevantes) y ejemplos positivos basados en los juicios de los anotadores humanos. El conjunto de datos se divide en subconjuntos de entrenamiento, validación y prueba. Con el tiempo, Microsoft lanzó múltiples versiones y tareas derivadas, incluido un subconjunto de búsqueda conversacional (MS MARCO ConvSearch) y una colección más amplia para la clasificación de pasajes. La escala y el realismo del conjunto de datos, derivados de registros de búsqueda reales, lo distinguen de los conjuntos de datos sintéticos anteriores.
Tareas de referencia
MS MARCO introdujo varias tareas de evaluación estándar. La tarea principal es el reordenamiento de pasajes, donde un modelo debe ordenar un conjunto de pasajes recuperados según su relevancia para la consulta, utilizando las etiquetas humanas como referencia. La segunda tarea principal es la comprensión lectora automática (MRC), donde un modelo lee un pasaje relevante y genera una respuesta exacta (un fragmento) o produce una respuesta fluida y abstractiva. Posteriormente, se incluyeron tareas de clasificación de pasajes completos y respuesta a preguntas con contexto adicional. El rendimiento se mide típicamente mediante métricas como MRR (Mean Reciprocal Rank), nDCG (Normalized Discounted Cumulative Gain) y recall. El punto de referencia ha impulsado avances significativos en los sistemas de recuperación basados en transformadores.
Aplicaciones e impacto
MS MARCO se convirtió en un recurso fundamental para el desarrollo de modelos de recuperación neuronal. Fue utilizado con frecuencia por grupos de investigación líderes, incluidos los de universidades como MIT CSAIL y Stanford AI Lab, y por laboratorios industriales como Google DeepMind y Anthropic para el ajuste fino de modelos de lenguaje grandes y sistemas de recuperación densa. Los modelos avanzados desarrollados con este conjunto de datos han influido en el diseño de motores de búsqueda y asistentes conversacionales, pasando de la coincidencia léxica a los embeddings semánticos y los pipelines de reordenamiento neuronal. El éxito del conjunto de datos también llevó a su integración en las pistas oficiales de TREC (Text Retrieval Conference) como un pilar de evaluación.
Relevancia continua
MS MARCO también ha servido como precursor de puntos de referencia modernos, como el de clasificación de documentos, que proporcionó vectores de pasajes y documentos para entrenar modelos multi-vectoriales como ColBERT. A partir de 2024, el conjunto de datos sigue siendo un punto de referencia ampliamente citado y utilizado para evaluar nuevas técnicas tanto en recuperación densa como en comprensión lectora. Muchos sistemas de recuperación contemporáneos, incluidos aquellos que utilizan arquitecturas de transformadores y metodologías de preentrenamiento, se evalúan contra MS MARCO en tablas de clasificación públicas. Su base en datos del mundo real continúa apoyando la investigación en dominios específicos, eficiencia de datos y aprendizaje con pocos ejemplos.
Prompts relacionados
Los principios de diseño del conjunto de datos se alinean con otros recursos a gran escala creados por equipos de investigación en empresas como OpenAI y Anthropic, aunque estos se centran en tareas generativas. Su relevancia para la respuesta a preguntas y la clasificación de pasajes se superpone con temas en el entrenamiento de redes neuronales, la infraestructura de Azure y también con recursos de código abierto provenientes de páginas de Amazon, omitidos por el empleado[omitido].