Traducido del inglés

WebQuestions es un conjunto de datos de referencia que contiene 5,810 pares de preguntas y respuestas sobre Freebase, utilizado para evaluar sistemas de análisis semántico y respuesta a preguntas, introducido en 2013 por investigadores de Google.

WebQuestions es un conjunto de datos de referencia en el campo de la inteligencia artificial y el aprendizaje automático para evaluar sistemas de respuesta a preguntas sobre el grafo de conocimiento estructurado Freebase. El conjunto de datos contiene 5,810 pares de pregunta-respuesta, donde cada pregunta es una consulta en lenguaje natural y la respuesta es un conjunto de entidades o valores de Freebase. Fue introducido en 2013 por investigadores de Google para abordar la falta de puntos de referencia a gran escala y realistas para el análisis semántico y la respuesta a preguntas basada en conocimiento.

WebQuestions se construyó utilizando la API de Google Suggest para encontrar preguntas que las personas realmente escriben, y luego los anotadores emparejaron cada pregunta con entidades y respuestas en Freebase. Este diseño hace que las preguntas sean más representativas de las consultas de usuarios del mundo real que los puntos de referencia sintéticos anteriores. El conjunto de datos se divide en un conjunto de entrenamiento de 3,778 preguntas y un conjunto de prueba de 2,032 preguntas. También se creó un conjunto de desarrollo de 200 preguntas de uso común, aunque no forma parte de la distribución oficial. El punto de referencia se convirtió rápidamente en un banco de pruebas estándar para sistemas que mapean el lenguaje natural a formas lógicas o directamente a respuestas en una base de conocimiento.

Construcción y Anotación

Las preguntas se seleccionaron de los registros de sugerencias de búsqueda de Google, dirigidas específicamente a preguntas que comienzan con frases como "qué", "quién", "cuándo" y "dónde". Cada pregunta fue anotada manualmente con una consulta similar a SPARQL correspondiente utilizando un léxico predefinido, y la respuesta final es el resultado de ejecutar esa consulta contra la base de datos de Freebase. Las anotaciones se crearon mediante crowdsourcing (Amazon Mechanical Turk) y luego se verificaron con una segunda ronda de trabajadores. Un aspecto notable del conjunto de datos es que algunas preguntas son ambiguas - una pregunta podría tener múltiples respuestas válidas dependiendo de la interpretación, y se instruyó a los anotadores para elegir la respuesta más comúnmente esperada.

El artículo oficial del punto de referencia, "Semantic Parsing on Freebase from Question-Answer Pairs" (EMNLP 2013), introdujo el conjunto de datos y los resultados de referencia. Los autores Michael J. Cafarella, Jonathan Berant, Andrew Chou y Percy Liang - el autor principal - estaban en la Universidad de California, Berkeley. El conjunto de datos webQuestions sirvió como recurso central de evaluación para varios sistemas posteriores, incluido el analizador semántico basado en lambda-DCS del propio artículo.

Relevancia para la Investigación en Respuesta a Preguntas

WebQuestions fue diseñado para contrarrestar los conjuntos de datos de análisis sintáctico dominantes de la década de 2000, como el análisis semántico de GeoQuery o ATIS, que utilizaban preguntas sintéticas y dominios limitados. En contraste, WebQuestions es de dominio abierto y tiene un vocabulario mucho más amplio y una cobertura más extensa de entidades de Freebase. Permitió el desarrollo de sistemas que combinaban el análisis semántico lexicalizado con similitud basada en incrustaciones. En los años posteriores a su publicación, los investigadores construyeron muchas extensiones, incluido WebQSP (WebQuestions - una división de implicación más detallada) y una extracción de respuestas mejorada mediante modelos neuronales.

Una limitación notable de WebQuestions es que las respuestas están directamente vinculadas a Freebase, que es un grafo de conocimiento que Google descontinuó en 2015 (aunque los datos siguen siendo accesibles mediante instantáneas). Esto afecta la transferibilidad de muchos modelos a las bases de conocimiento actuales. Aun así, el punto de referencia sigue siendo un elemento básico para evaluar la generalización compositiva en la respuesta a preguntas.

El conjunto de datos también expone un desafío clave: la brecha léxica entre el lenguaje natural de forma libre y los términos del esquema de la base de conocimiento. Muchas preguntas requieren reconocer sinónimos, abreviaturas o relaciones indirectas. Esto inspiró una línea de investigación para aprender o extender la detección de menciones latentes y el enlace de entidades de manera semi-supervisada, que luego alimentó los enfoques modernos de la era de los modelos de lenguaje grandes.

Metodología y Métricas

La métrica de evaluación principal es el F1 promedio, donde para cada pregunta, el sistema predice un conjunto de entidades/valores de Freebase que se compara con el conjunto de respuestas de referencia. La precisión es la fracción de respuestas predichas que se encuentran en el conjunto de referencia, el recuerdo es la fracción de respuestas de referencia que el sistema encuentra, y la puntuación F1 es la media armónica. El código de evaluación oficial se ha compartido en el repositorio de GitHub de webQuestions. Los primeros sistemas de referencia lograron puntuaciones F1 alrededor de 0.30, y los sistemas contemporáneos en el conjunto de prueba original alcanzaron cerca de 0.78 a 0.79 alrededor de 2020, principalmente utilizando enfoques neuronales de extremo a extremo como GrailQA o lectores basados en Transformers. En 2023, se han reportado rendimientos de última generación cerca de 0.84, pero algunos implican estrategias extendidas de enlace de entidades.

Legado e Influencia

WebQuestions ha influido en otros esfuerzos de creación de puntos de referencia, como "ComplexQuestions" y "QALD" (Question Answering over Linked Data). También se ha utilizado como base para pruebas adversarias de modelos con incrustaciones de grafos de conocimiento. Muchos marcos de trabajo de QA de código abierto populares (como KELT-DELER, o freebase) utilizan WebQuestions para verificaciones de cordura. Sigue siendo un punto de referencia frecuentemente utilizado para la robustez del análisis semántico, particularmente al combinar un modelo de lenguaje preentrenado con una base de conocimiento externa.

El conjunto de datos WebQuestions es mantenido por sus creadores, pero a partir de 2023, está archivado en GitHub ("webquestions") y se puede acceder libremente. El conjunto de datos contiene un archivo con identificadores de preguntas que se vinculan a pares de entidades QR separados, lo que facilita su uso con indexación de KG, pero los usuarios deben asegurarse de que su versión del volcado de Freebase coincida con las anotaciones.

Véase También

--son algunos ejemplos que se basan en la misma idea de espacio de representación conjunto.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:question-answering·dataset·knowledge-graph·nlp
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial