Questions Naturelles Ouvertes

Traduit de l'anglais

Natural Questions Open est un ensemble de données de référence pour la réponse à des questions en domaine ouvert, dérivé des requêtes de recherche Google avec des réponses annotées par des humains.

Natural Questions Open est un ensemble de données de référence pour la réponse à des questions ouvertes (QA). Il a été introduit par Google en 2019 dans le cadre de l'ensemble de données Natural Questions (NQ), qui se compose de requêtes réelles anonymisées soumises au moteur de recherche Google. La variante « Open » supprime le contexte d'une seule page Wikipédia et exige de répondre aux questions directement à partir d'un vaste corpus, tel que Wikipédia, ce qui en fait un ensemble d'évaluation standard pour les systèmes de QA assistés par récupération.

L'ensemble de données comprend plus de 300 000 questions naturelles, chacune associée à une réponse courte (un extrait de texte) et à une réponse longue (un paragraphe de Wikipédia). La version Open, officiellement connue sous le nom de Natural Questions - Open, simplifie la tâche originale en éliminant la supervision au niveau de la page et en évaluant la capacité d'un système à trouver la réponse dans une collection de documents ouverte. Cette configuration est devenue un banc d'essai canonique pour comparer les modèles de QA ouverte, y compris ceux basés sur les architectures Transformer (architecture) et les grands modèles de langage.

Le développement de Natural Questions Open s'aligne sur les progrès plus larges en intelligence artificielle, en particulier en apprentissage automatique et apprentissage profond. Le benchmark a été utilisé pour mesurer les performances des systèmes construits sur des réseaux neuronaux tels que BERT et plus tard des modèles d'IA générative. Les chercheurs combinent souvent la génération augmentée par récupération avec des modèles qui exploitent l'attention multi-têtes et l'encodage positionnel pour raisonner sur les textes récupérés.

Tâche et évaluation

Dans le cadre de la question ouverte, un système doit renvoyer une réponse, généralement un court extrait, pour chaque question. L'évaluation utilise les métriques de correspondance exacte (EM) et de score F1, comparant la réponse prédite à la réponse annotée, avec normalisation pour la ponctuation et les articles. L'ensemble de données complet comprend des divisions de développement et de test, permettant un développement et une comparaison robustes des modèles.

Les systèmes utilisent généralement une approche en deux étapes : d'abord, un récupérateur sélectionne des passages pertinents dans Wikipédia ; ensuite, un lecteur (souvent un modèle encodeur-décodeur ou séquence à séquence) extrait la réponse. Le décodage par recherche en faisceau et l'échantillonnage top-k sont des stratégies courantes pour générer des réponses.

Impact du benchmark

Natural Questions Open est devenu l'un des benchmarks les plus largement adoptés pour la QA ouverte, aux côtés de SQuAD et TriviaQA. Il a contribué à l'essor des architectures augmentées par récupération, telles que REALM (2020) et RAG (2020), qui combinaient la récupération et la génération basées sur Transformer (architecture). En 2021, le système Andorra a combiné une architecture récupérateur-lecteur avec un modèle d'IA générative affiné. L'ensemble de données a également été utilisé par Google DeepMind et d'autres laboratoires d'intelligence artificielle pour faire progresser les capacités de réponse aux questions.

La tâche de QA ouverte est étroitement liée à la construction de l'original Natural Questions, qui comprend une annotation plus riche avec des réponses longues. L'ouverture en fait un défi pour les systèmes de grands modèles de langage, qui peuvent devoir fournir une réponse sans récupération explicite.

Développements récents

Au début des années 2020, les systèmes basés sur de grands modèles pré-entraînés ont obtenu des résultats solides sur l'ensemble de test, avec des scores EM dépassant 50 %. Par exemple, un modèle de Google Research de 2021 a atteint un EM de 54,6 % sur l'ensemble de test, tandis qu'une approche combinant la récupération avec l'IA générative a atteint plus tard 56,4 %. En 2022, des avis de laboratoires d'IA ont noté l'application de l'apprentissage par renforcement avec RLAIF pour aligner la génération de texte. Cependant, les affirmations exactes du classement peuvent varier au fil du temps.

Applications dans le monde réel

Les enseignements de la recherche sur Natural Questions Open ont influencé les systèmes commerciaux, par exemple : la dégradation de la récupération due à la dilution des questions et la nécessité d'une récupération dense sont utilisées par Google Cloud et Amazon Web Services pour la recherche. Un ensemble similaire est souvent utilisé pour évaluer les assistants vocaux et les systèmes informatiques. Néanmoins, l'ensemble de données reste une sous-ligne persistante de la recherche en QA.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:natural-language-processing·question-answering·benchmark·dataset
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique