Natural Questions Open es un conjunto de datos de referencia para la respuesta a preguntas de dominio abierto (QA, por sus siglas en inglés). Fue introducido por Google en 2019 como parte del conjunto de datos Natural Questions (NQ), que consiste en consultas reales anonimizadas realizadas al motor de búsqueda de Google. La variante 'Open' elimina el contexto de una sola página de Wikipedia y requiere responder preguntas directamente desde un corpus extenso, como Wikipedia, lo que lo convierte en un conjunto de evaluación estándar para sistemas de QA aumentados por recuperación.
El conjunto de datos incluye más de 300,000 preguntas naturales, cada una emparejada con una respuesta corta (un fragmento de texto) y una respuesta larga (un párrafo de Wikipedia). La versión Open, conocida formalmente como Natural Questions - Open, simplifica la tarea original al descartar la supervisión a nivel de página y evalúa la capacidad de un sistema para encontrar la respuesta en una colección de documentos abierta. Esta configuración se ha convertido en un banco de pruebas canónico para comparar modelos de QA de dominio abierto, incluidos aquellos basados en arquitecturas transformador y modelos de lenguaje grandes.
El desarrollo de Natural Questions Open se alinea con el progreso más amplio en inteligencia artificial, particularmente en aprendizaje automático y aprendizaje profundo. El punto de referencia se ha utilizado para medir el rendimiento de sistemas construidos sobre redes neuronales como BERT y modelos posteriores de IA generativa. Los investigadores a menudo combinan generación aumentada por recuperación con modelos que aprovechan atención de múltiples cabezas y codificación posicional para razonar sobre textos recuperados.
Tarea y Evaluación
En el entorno de dominio abierto, un sistema debe devolver una respuesta, típicamente un fragmento corto, para cada pregunta. La evaluación utiliza las métricas de coincidencia exacta (EM, por sus siglas en inglés) y puntuación F1, comparando la respuesta predicha con la respuesta anotada, con normalización para puntuación y artículos. El conjunto de datos total incluye divisiones de desarrollo y prueba, lo que permite un desarrollo y comparación robustos de modelos.
Los sistemas típicamente emplean un enfoque de dos etapas: primero, un recuperador selecciona pasajes relevantes de Wikipedia; segundo, un lector (a menudo un modelo codificador-decodificador o secuencia a secuencia) extrae la respuesta. La decodificación mediante búsqueda de haz y el muestreo top-k son estrategias comunes para generar respuestas.
Impacto del Punto de Referencia
Natural Questions Open se convirtió en uno de los puntos de referencia más adoptados para QA de dominio abierto, junto con SQuAD y TriviaQA. Contribuyó al auge de arquitecturas aumentadas por recuperación, como REALM (2020) y RAG (2020), que combinaban recuperación y generación basadas en transformadores. En 2021, el sistema Andorra combinó una arquitectura de recuperador-lector con un modelo de IA generativa ajustado. El conjunto de datos también ha sido utilizado por Google DeepMind y otros laboratorios de inteligencia artificial para avanzar en las capacidades de respuesta a preguntas.
La tarea de QA de dominio abierto está estrechamente relacionada con la construcción del Natural Questions original, que incluye una anotación más rica con respuestas largas. La apertura lo convierte en un desafío para los sistemas de modelos de lenguaje grandes, que pueden tener que producir una respuesta sin recuperación explícita.
Desarrollos Recientes
A partir de principios de la década de 2020, los sistemas basados en grandes modelos preentrenados han logrado resultados sólidos en el conjunto de prueba, con puntuaciones EM superiores al 50%. Por ejemplo, un modelo de 2021 de Google Research logró un EM del 54.6% en el conjunto de prueba, mientras que un enfoque que combinaba recuperación con IA generativa alcanzó un valor más alto, del 56.4%, más tarde. En 2022, avisos de laboratorios de IA señalaron la aplicación de aprendizaje por refuerzo con RLAIF para alinear la generación de texto. Sin embargo, las afirmaciones exactas de la tabla de clasificación pueden variar con el tiempo.
Aplicaciones del Mundo Real
Los conocimientos de Natural Questions Open han influido en sistemas comerciales, por ejemplo: la degradación de la recuperación por dilución de preguntas y la necesidad de recuperación densa son utilizadas por Google Cloud y Amazon Web Services para búsqueda. Un conjunto similar se usa a menudo para evaluar asistentes de voz y sistemas basados en computadora. Aun así, el conjunto de datos sigue siendo una sublínea persistente de la investigación en QA.
Véase También
- Aprendizaje automático
- Aprendizaje profundo
- Modelo de lenguaje grande
- Transformador (arquitectura de red)