StrategyQA est un banc d'essai de question-réponse conçu pour évaluer les capacités de raisonnement multi-étapes des systèmes d'intelligence artificielle, en particulier des grands modèles de langage. Introduit en 2021 par des chercheurs de l'Allen Institute for AI et de l'Université de Washington, l'ensemble de données se compose de 2 780 questions à réponse par oui ou non qui exigent des systèmes qu'ils combinent plusieurs éléments de connaissance implicite pour parvenir à une réponse. Contrairement aux bancs d'essai plus simples qui testent le rappel factuel, les questions de StrategyQA sont délibérément construites pour nécessiter une décomposition stratégique : un modèle doit décomposer une question complexe en sous-questions plus petites et répondables, puis synthétiser les résultats.
Le banc d'essai a été créé pour combler une lacune dans les méthodes d'évaluation existantes, qui se concentraient souvent sur la récupération à un seul saut ou sur la correspondance de motifs superficielle. Les questions de StrategyQA sont dérivées de Wikipédia et d'autres sources, mais les réponses ne sont pas directement énoncées dans un passage unique. Par exemple, une question comme « Un téléviseur de 50 pouces rentrerait-il dans une Mini Cooper de 2004 ? » nécessite un raisonnement sur les dimensions des deux objets, une étape qui implique une connaissance implicite et une inférence multi-étapes. Chaque question est accompagnée d'un ensemble de « faits de soutien » qui fournissent les informations de fond nécessaires, mais le modèle doit identifier et combiner ces faits correctement.
Conception et construction
L'ensemble de données StrategyQA a été construit grâce à un processus en plusieurs étapes impliquant à la fois des efforts automatisés et humains. Les créateurs ont d'abord collecté un ensemble de « questions stratégiques » auprès de travailleurs de la foule, à qui il était demandé de poser des questions nécessitant un raisonnement multi-étapes. Ces questions ont ensuite été décomposées en sous-questions par des annotateurs, créant ainsi un graphe d'étapes de raisonnement. L'ensemble de données final comprend 2 780 questions, chacune avec une moyenne de 2,7 faits de soutien et une réponse de référence de oui ou non. Les questions couvrent un large éventail de sujets, notamment la science, l'histoire, la technologie et la vie quotidienne, garantissant que les modèles ne peuvent pas s'appuyer sur des raccourcis spécifiques à un domaine.
Une caractéristique distinctive de StrategyQA est son accent sur le raisonnement « implicite ». Contrairement à des ensembles de données tels que HotpotQA, où les preuves nécessaires sont explicitement fournies dans plusieurs paragraphes, StrategyQA exige que le modèle s'appuie sur sa propre base de connaissances. Cela rend le banc d'essai particulièrement difficile pour les modèles qui manquent de connaissances mondiales étendues ou de la capacité à effectuer une inférence multi-étapes. L'ensemble de données comprend également un ensemble de validation de 489 questions et un ensemble de test de 2 291 questions, l'ensemble de test étant conservé privé pour éviter le surapprentissage.
Évaluation et métriques
La métrique principale pour StrategyQA est la précision sur la prédiction de réponse par oui ou non. Les évaluations précoces ont montré que les modèles de pointe de l'époque, tels que les versions affinées du transformateur T5, atteignaient environ 66 % de précision, nettement en dessous de la performance humaine estimée à 87 %. Cet écart a mis en évidence la difficulté du raisonnement multi-étapes et a stimulé davantage de recherches sur les architectures de modèles et les techniques d'entraînement. Les modèles ultérieurs, y compris ceux basés sur l'architecture GPT-3, ont amélioré les performances mais sont toujours restés en deçà du raisonnement de niveau humain. En 2023, les meilleurs systèmes, incorporant souvent la génération augmentée par récupération ou le prompting par chaîne de pensée, ont atteint des niveaux de précision dans les années 70 à 80, mais le banc d'essai reste un test difficile pour les capacités de raisonnement général.
Impact et signification
StrategyQA est devenu un banc d'essai largement utilisé dans les communautés de l'intelligence-artificielle et de l'apprentissage-automatique, en particulier pour évaluer les grands-modèles-de-langage. Son accent sur le raisonnement multi-étapes a influencé le développement de techniques telles que le prompting par chaîne de pensée, où les modèles sont encouragés à générer des étapes de raisonnement intermédiaires avant de produire une réponse finale. Le banc d'essai a également été utilisé pour étudier les limites des modèles basés sur les transformateurs, révélant qu'ils s'appuient souvent sur des corrélations superficielles plutôt que sur un raisonnement authentique. Cela a conduit à un intérêt accru pour les approches neuro-symboliques et l'intégration de sources de connaissances externes.
L'ensemble de données a également été incorporé dans des suites d'évaluation plus larges, telles que le banc d'essai BIG-bench, qui agrège plusieurs tâches pour évaluer les capacités des modèles. Sa conception a inspiré des bancs d'essai similaires dans d'autres domaines, notamment le raisonnement scientifique et la réponse à des questions de sens commun. Les chercheurs ont noté que les questions de StrategyQA nécessitent souvent une connaissance « en domaine ouvert », ce qui signifie que les modèles doivent accéder à des informations absentes de leurs données d'entraînement, ce qui a des implications pour le développement de systèmes augmentés par récupération.
Limites et critiques
Malgré sa popularité, StrategyQA a fait face à plusieurs critiques. Certains chercheurs soutiennent que le format oui/non simplifie à l'excès le processus de raisonnement, car les modèles peuvent atteindre une précision modérée en devinant ou en exploitant des biais dans l'ensemble de données. Par exemple, la distribution des réponses oui/non n'est pas parfaitement équilibrée, et certaines questions contiennent des indices lexicaux qui peuvent guider involontairement les modèles. De plus, les faits de soutien fournis dans l'ensemble de données ne sont pas toujours suffisants pour répondre à la question, obligeant les modèles à s'appuyer sur des connaissances externes qui peuvent être incohérentes ou obsolètes.
Une autre limite est le potentiel de contamination des données, car les questions sont dérivées de sources publiques et peuvent apparaître dans les corpus d'entraînement des grands modèles de langage. Cela peut gonfler les métriques de performance et obscurcir la véritable capacité de raisonnement. Pour atténuer cela, certains chercheurs ont proposé des bancs d'essai dynamiques qui génèrent de nouvelles questions à la volée, mais StrategyQA reste une ressource statique. Malgré ces problèmes, le banc d'essai continue d'être un outil précieux pour diagnostiquer les faiblesses des modèles et stimuler les progrès dans la recherche sur le raisonnement multi-étapes.
Orientations futures
Les leçons tirées de StrategyQA ont informé la conception de bancs d'essai plus récents visant à être plus robustes et complets. Par exemple, le cadre de StrategyQA a été étendu pour inclure des questions à choix multiples et des tâches de génération ouverte, qui exigent des modèles qu'ils produisent des explications plutôt que de simples étiquettes. Il existe également un intérêt croissant pour l'utilisation de StrategyQA afin d'évaluer les capacités de raisonnement des modèles dans des domaines spécialisés, tels que la découverte scientifique et l'analyse juridique. À mesure que les systèmes d'ia-générative deviennent plus capables, des bancs d'essai comme StrategyQA évolueront probablement pour incorporer des chaînes de raisonnement plus complexes, y compris le raisonnement temporel et causal, afin de suivre le rythme des avancées des modèles.
Dans le contexte plus large de la recherche en apprentissage-profond, StrategyQA souligne l'importance de dépasser la reconnaissance de motifs pour parvenir à une compréhension authentique. Le banc d'essai a catalysé des travaux sur l'interprétabilité, les stratégies de prompting et l'intégration du raisonnement symbolique avec les réseaux neuronaux. Bien qu'aucun modèle n'ait encore atteint une performance de niveau humain sur StrategyQA, le banc d'essai reste un étalon critique pour mesurer les progrès dans l'un des aspects les plus fondamentaux de l'intelligence : la capacité à raisonner étape par étape.