Traduzido do inglês

O MS MARCO é um conjunto de dados em larga escala para compreensão de leitura por máquina e ranqueamento de passagens, introduzido pela Microsoft em 2016. Ele contém consultas reais do Bing e respostas geradas por humanos, servindo como referência para sistemas de recuperação de informação e resposta a perguntas.

MS MARCO (Microsoft Machine Reading Comprehension) é um conjunto de dados em grande escala introducido pela Microsoft em 2016 para tarefas de compreensão de leitura por máquina e ranking de passagens. O conjunto de dados foi projetado para abordar as limitações de benchmarks anteriores de resposta a perguntas, fornecendo consultas reais de usuários dos registros do motor de busca Bing, juntamente com passagens relevantes de documentos web e respostas em linguagem natural geradas por humanos. Sua criação e liberação pública permitiram que pesquisadores desenvolvessem e avaliassem sistemas que recuperam e interpretam texto em escala, preenchendo a lacuna entre a recuperação de informações tradicional e modelos de compreensão baseados em aprendizado profundo.

Cada exemplo no MS MARCO consiste em uma consulta real de usuário, um conjunto de passagens julgadas por relevância e (para um subconjunto de exemplos) uma resposta escrita por humanos. O conjunto de dados incluye mais de 100.000 consultas para a tarefa original de resposta a perguntas, com uma versão maior para ranking de passagens. Os dados liberados incluyen rótulos de relevância gerados por crowdsourcing, e as respostas foram escritas por anotadores humanos. MS MARCO tem sido amplamente usado como benchmark padrão para tarefas como re-ranking de passagens, compreensão de leitura por máquina e resposta a perguntas de domínio aberto.

Estrutura do Conjunto de Dados

O conjunto de dados original MS MARCO organiza as consultas em três categorías principais com base no tipo de resposta requerida: entidade, numérica e questões de estilo de passagem. Para tarefas de ranking de passagens, o conjunto de dados fornece exemplos negativos (passagens não relevantes) e rótulos positivos baseados em julgamentos de anotadores humanos. O conjunto de dados é dividido em conjuntos de treinamento, validação e teste. Com o tempo, Microsoft lançou múltiples versões e tarefas derivadas, incluindo um subconjunto de busca conversacional (MS MARCO ConvSearch) e uma coleção maior de ranking de passagens. A escala e o realismo do conjunto de dados, derivados de registros de busca reais, o distinguen de conjuntos de dados sintéticos anteriores.

Tareas de Benchmark

MS MARCO introdujo várias tarefas de avaliação padrão. A tarefa principal é o re-ranking de passagens, onde um modelo deve ordenar um conjunto de passagens recuperadas por relevância à consulta usando os rótulos humanos. A segunda tarefa principal é a compreensão de leitura por máquina (MaRC), onde um modelo lê uma única passagem relevante e gera uma resposta exata (um span) ou produce uma resposta fluente abstrativa. Posteriormente, também foram incluídas uma tarefa de ranking de parágrafos completos e resposta a perguntas com contexto adicional. O desempeño é tipicamente medido usando métricas como MRR (Mean Reciprocal Rank), nDCG (Normalized Discounted Cumulative Gain) e recall. O benchmark tem provocado avanços significativos em sistemas de recuperação baseados em transformadores.

Aplicações e Impacto

MS MARCO se tornou um recurso fundamental para o desenvolvimento de modelos de recuperação neural. Fue frequentemente usado por grupos de pesquisa líderes, incluindo aqueles em universidades como MIT CSAIL e Stanford AI Lab, e por laboratorios industriais como Google DeepMind e Anthropic para ajuste fino de grandes modelos de linguagem e sistemas de recuperação densa. Modelos avançados desenvolvidos usando este conjunto de datos influenciaron o diseño de motores de busca e assistentes conversacionais, passando de correspondência léxica a embeddings semánticos e pipelines de re-ranking neural. O éxito do conjunto de datos também levou à sua integração em tracks do TREC (Text Retrieval Conference) como pilar oficial de avaliação.

Relevância Contínua

MS MARCO também serviu como precursor de benchmarks modernos como MS MARCO para ranking de documentos, que forneceu vectores de passagens e documentos para treinar modelos multi-vector como ColBERT. A partir de 2024, o conjunto de datos permanece como um benchmark amplamente citado e comumente usado para avaliar novas técnicas tanto em recuperación densa como em comprensión de lectura. Muchos sistemas de recuperación contemporáneos, incluidos aquellos que usan arquitecturas Transformer (architecture) y metodologías de Pretraining, son evaluados contra MS MARCO en leaderboards [owning]. Su fundamento en el mundo real continúa apoyando la investigación en cambio de dominio, ineficiencia de datos y aprendizaje con pocos ejemplos.

Prompts Relacionados

Los principios de diseño del conjunto de datos se alinean con otros recursos a gran escala creados por equipos de investigación en empresas como OpenAI y Anthropic, aunque esos se centran en tareas generativas. Su relevancia para pasajes y respuesta a preguntas se superpone con temas en entrenamiento de Neural network, infraestructura Microsoft Azure, y también es de código abierto desde páginas de Amazon por la robótica de empleado[omitido.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:machine-learning·information-retrieval·question-answering·dataset
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico