Traducido del inglés

TriviaQA es un conjunto de datos de respuesta a preguntas a gran escala introducido en 2017, que contiene más de 650,000 tripletas de pregunta-respuesta-evidencia obtenidas de sitios web de trivia, diseñado para probar la comprensión lectora y los sistemas de respuesta a preguntas de dominio abierto.

TriviaQA es un conjunto de datos de referencia a gran escala para la respuesta a preguntas (QA) y la comprensión lectora, introducido en 2017 por investigadores de la Universidad de Washington. Fue creado para abordar las limitaciones en conjuntos de datos de QA anteriores, proporcionando preguntas de origen natural con respuestas complejas de múltiples oraciones y evidencia de apoyo sustancial. El conjunto de datos se ha convertido en una herramienta de evaluación estándar para modelos de Machine learning, particularmente aquellos basados en Deep learning y arquitecturas de Transformer (architecture).

El conjunto de datos comprende más de 650.000 tripletas de pregunta-respuesta-evidencia, derivadas de 95.000 pares de pregunta-respuesta recopilados de tres sitios web de trivia: QuizLeague, Wikipedia, y un rastreo web de páginas de trivia. Cada pregunta se empareja con múltiples documentos de evidencia, típicamente de artículos de Wikipedia, que contienen la respuesta. Este diseño obliga a los modelos a recuperar y razonar sobre pasajes largos, lo que lo hace más desafiante que conjuntos de datos anteriores como SQuAD, que se centraba en la extracción de un solo párrafo.

Construcción y Estadísticas

TriviaQA se construyó primero raspando preguntas de trivia y sus respuestas de la web. Las preguntas están formuladas de forma natural, a menudo involucrando razonamiento de múltiples saltos, razonamiento temporal, o conocimiento general del mundo. Para cada pregunta, los autores utilizaron una combinación de búsqueda de Bing y coincidencia de enlaces de Wikipedia para recopilar documentos de evidencia relevantes, resultando en un promedio de seis documentos de evidencia por pregunta.

El conjunto de datos se divide en conjuntos de entrenamiento, desarrollo, y prueba. El conjunto de entrenamiento contiene 78.785 pares de pregunta-respuesta, el conjunto de desarrollo 8.837, y el conjunto de prueba 11.313. Una característica notable es la inclusión de una división 'solo web', donde la evidencia se restringe a documentos web, y una división 'solo wikipedia', donde la evidencia proviene exclusivamente de Wikipedia. Esto permite a los investigadores aislar los efectos de la recuperación específica de dominio.

Evaluación y Métricas

La evaluación estándar para TriviaQA utiliza coincidencia exacta (EM) y puntuación F1, similar a otros puntos de referencia de QA. EM mide el porcentaje de predicciones que coinciden exactamente con una de las respuestas aceptadas, mientras que F1 calcula la superposición a nivel de tokens. Los modelos se evalúan típicamente en dos entornos: de libro cerrado(sin recuperación externa, dependiendo del conocimiento paramétrico)y de libro abierto(con recuperación de la evidencia proporcionada.

Desde su lanzamiento, TriviaQA ha sido un motor clave del progreso en la investigación de Large language model. Los primeros modelos de Neural network, como BiDAF y DrQA, lograron puntuaciones modestas, pero la llegada de modelos basados en Transformer (architecture) como BERT y T5 condujo a mejoras significativas. Para 2021, modelos como OpenAI's GPT-3 y Google's T5 podían superar el 70% de EM en el conjunto de desarrollo, y para 2023, sistemas de Generative AI como GPT-4 y Claude demostraron un rendimiento casi humano, con algunos informes de más del 90% de EM en ciertos subconjuntos.

Impacto en la Investigación de IA

TriviaQA ha influido en varias áreas de la investigación de Artificial intelligence. Popularizó el uso de preguntas de origen natural a gran escala para entrenar y evaluar sistemas de comprensión lectora. El conjunto de datos también impulsó el trabajo en QA de dominio abierto, donde los sistemas deben recuperar y razonar sobre un corpus grande sin evidencia preseleccionada. Esta línea de investigación contribuyó al desarrollo de la recuperación densa de pasajes(DPR)y otras técnicas de generación aumentada por recuperación, que ahora son integrales para muchos sistemas de QA de producción.

Además, TriviaQA se ha utilizado para estudiar la robustez y calibración de los modelos. Los investigadores han analizado cómo los modelos manejan preguntas ambiguas, razonamiento de múltiples saltos, y formatos de respuesta. La diversidad de tipos de preguntas del conjunto de datos lo ha convertido en un punto de referencia común para sondear las capacidades de conocimiento y razonamiento de los Large language model, junto con otros conjuntos de datos como Natural Questions y HotpotQA.

Limitaciones y Críticas

A pesar de su popularidad, TriviaQA tiene limitaciones conocidas. Las preguntas son predominantemente basadas en hechos y orientadas a trivia, lo que puede no reflejar las necesidades de QA del mundo real, como consultas conversacionales o orientadas a tareas. Los documentos de evidencia a veces son ruidosos o contienen la respuesta en múltiples formas, lo que puede llevar a inconsistencias en la evaluación. Además, el conjunto de datos ha sido criticado por posible fuga de respuestas: debido a que las preguntas fueron raspadas de la web, algunas respuestas pueden estar presentes en los corpus de entrenamiento de los grandes modelos de lenguaje, inflando el rendimiento en entornos de libro cerrado.

Para abordar estos problemas, los investigadores han propuesto versiones filtradas o han combinado TriviaQA con otros conjuntos de datos para crear puntos de referencia más robustos. Sin embargo, TriviaQA sigue siendo un punto de referencia ampliamente utilizado para comparar el rendimiento de los modelos, particularmente en el contexto de QA de dominio abierto y tareas intensivas en conocimiento.

Legado y Uso Continuado

TriviaQA continúa siendo un elemento básico en los conjuntos de evaluación de las principales organizaciones de investigación en IA, incluyendo Google DeepMind, Anthropic, y laboratorios académicos como Stanford AI Lab y BAIR (Berkeley AI Research). Se incluye frecuentemente en tarjetas de modelo e informes técnicos como una medida del conocimiento general y el razonamiento. El diseño del conjunto de datos también ha inspirado puntos de referencia posteriores, como Natural Questions y WebQuestions, que adoptan estructuras similares de múltiples evidencias.

A partir de mediados de la década de 2020, TriviaQA sigue siendo relevante, aunque los modelos de última generación a menudo logran puntuaciones que se acercan o superan los puntos de referencia humanos, lo que lleva a algunos a argumentar que el punto de referencia está cerca de la saturación. No obstante, sirve como un hito histórico en la evolución de los sistemas de QA y continúa utilizándose para el ajuste fino y la evaluación en entornos académicos e industriales.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:question-answering·dataset·natural-language-processing·benchmark
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial