ComplexWebQuestions es un conjunto de datos de referencia diseñado para evaluar la capacidad de los sistemas de inteligencia artificial para realizar respuestas a preguntas de múltiples saltos. A diferencia de las tareas simples de respuestas a preguntas que requieren recuperar un solo dato, las preguntas de múltiples saltos exigen que un modelo integre y combine información de múltiples fuentes, a menudo dispares, para llegar a una respuesta correcta. El conjunto de datos fue introducido en 2018 por un equipo de investigadores para abordar las limitaciones de los puntos de referencia existentes, que se centraban principalmente en el razonamiento de un solo salto o dependían de bases de conocimiento estructuradas sin la complejidad del texto web real.
El conjunto de datos consta de más de 34 000 pares de preguntas y respuestas, cada uno derivado del conjunto de datos WebQuestionsSP pero aumentado con restricciones adicionales y una estructura compositiva. Las preguntas están diseñadas para requerir dos o más pasos de razonamiento, a menudo involucrando entidades y relaciones que abarcan diferentes partes de un grafo de conocimiento o que requieren combinar información de una base de conocimiento con pasajes de texto. Por ejemplo, una pregunta podría ser: "¿Cuál es la capital del país donde se encuentra la Torre Eiffel?", lo que requiere primero identificar el país (Francia) y luego encontrar su capital (París).
La creación de ComplexWebQuestions implicó un proceso semiautomático. Los investigadores partieron de WebQuestionsSP, que contiene preguntas y sus correspondientes consultas SPARQL sobre el grafo de conocimiento Freebase. Luego aplicaron una serie de plantillas y transformaciones para introducir restricciones adicionales, como superlativos, comparaciones y filtros temporales o espaciales. Este proceso generó nuevas preguntas más complejas que no estaban presentes en el conjunto de datos original. Cada pregunta generada se emparejó con una consulta SPARQL que podía ejecutarse contra Freebase para obtener la respuesta correcta, asegurando así las etiquetas de verdad fundamental. El conjunto de datos también incluye un subconjunto de preguntas "no respondibles", es decir, preguntas para las que no se puede encontrar una respuesta válida en el contexto proporcionado, lo que añade una capa de realismo y desafío.
ComplexWebQuestions se utiliza típicamente para evaluar modelos en su capacidad de realizar razonamiento de múltiples saltos sobre una combinación de datos estructurados y no estructurados. La métrica de evaluación principal es la precisión de coincidencia exacta, donde la respuesta predicha por el modelo debe coincidir exactamente con la cadena de respuesta de referencia. Algunos estudios también informan sobre la puntuación F1, que tiene en cuenta coincidencias parciales. El punto de referencia se ha utilizado para probar varios enfoques, incluidos aquellos basados en redes neuronales, modelos de lenguaje grandes y sistemas híbridos que combinan aprendizaje automático con razonamiento simbólico. Los primeros resultados mostraron que incluso los modelos de última generación de la época tenían dificultades con el conjunto de datos, logrando una precisión inferior al 50 %, lo que destacó la dificultad del razonamiento de múltiples saltos.
ComplexWebQuestions se ha convertido en un punto de referencia estándar en el campo del procesamiento del lenguaje natural y la inteligencia artificial. Ha impulsado la investigación sobre mecanismos de razonamiento más sofisticados, como redes neuronales de grafos, mecanismos de atención y generación aumentada por recuperación. El énfasis del conjunto de datos en combinar bases de conocimiento con texto ha influido en el desarrollo de arquitecturas híbridas que pueden aprovechar tanto información estructurada como no estructurada. También sirve como banco de pruebas para evaluar las capacidades de razonamiento de los modelos basados en transformadores, incluidos los utilizados en los sistemas modernos de IA generativa. El punto de referencia ha sido citado en cientos de artículos y sigue siendo un punto de referencia para medir el progreso en la respuesta a preguntas de múltiples saltos.
A pesar de su uso generalizado, ComplexWebQuestions ha enfrentado algunas críticas. El conjunto de datos se deriva de una única base de conocimiento (Freebase), que puede no representar completamente la diversidad del contenido web. Además, el proceso de generación de preguntas, aunque automatizado, puede producir preguntas algo artificiales o con patrones lingüísticos que no son representativos de las consultas reales de los usuarios. Algunos investigadores han señalado que la dependencia del conjunto de datos en consultas SPARQL significa que los modelos a veces pueden explotar atajos, como aprender a reconocer patrones de consulta en lugar de razonar verdaderamente sobre el significado. Como resultado, se han introducido puntos de referencia más nuevos que buscan abordar estas limitaciones, pero ComplexWebQuestions sigue siendo un recurso valioso para comprender los desafíos del razonamiento de múltiples saltos.
El desarrollo de ComplexWebQuestions ha inspirado una familia de puntos de referencia relacionados, incluido HotpotQA, que se centra en el razonamiento de múltiples saltos sobre artículos de Wikipedia, y QAngaroo, que incluye conjuntos de datos para el razonamiento de múltiples saltos sobre textos científicos. Estos puntos de referencia colectivamente empujan los límites de lo que los sistemas de IA pueden lograr en términos de razonamiento complejo. Las direcciones futuras incluyen incorporar fuentes de datos más diversas, manejar preguntas abiertas y mejorar la interpretabilidad de los procesos de razonamiento de los modelos. A medida que el aprendizaje profundo y los modelos de lenguaje grandes continúan evolucionando, puntos de referencia como ComplexWebQuestions desempeñarán un papel crucial para evaluar si estos modelos realmente comprenden y razonan sobre el mundo o simplemente memorizan patrones.