Traduzido do inglês

StrategyQA é um conjunto de dados de referência para avaliar o raciocínio de múltiplas etapas em sistemas de IA, apresentando perguntas que exigem conhecimento implícito e decomposição estratégica em sub-perguntas mais simples.

StrategyQA é um benchmark de resposta a perguntas projetado para avaliar as capacidades de razoamento multi-salto de sistemas de inteligência artificial, particularmente grandes modelos de linguagem. Introducido em 2021 por pesquisadores do Allen Institute for AI e da Universidade de Washington, o conjunto de dados consiste em 2.780 perguntas de sí/no que exigem que os sistemas combinem múltiples peças de conhecimento implícito para chegar a uma resposta. Diferente de benchmarks más simples que testam a recordação factual, as perguntas de StrategyQA são deliberadamente construídas para exigir decomposição estratégica: um modelo deve dividir uma pregunta complexa em sub-preguntas menores e respondibles e depois sintetizar os resultados.

O benchmark foi criado para abordar uma lacuna nos métodos de avaliação existentes, que muitas vezes se concentraban na recuperação de um único salto ou no reconhecimento superficial de padrões. As perguntas de StrategyQA são derivadas da Wikipedia e outras fontes, mas as respostas não estão diretamente declaradas em nenhum único texto. Por exemplo, uma pregunta como "Cabería um televisor de 50 polegadas em um Mini Cooper de 2004?" exige razoamento sobre as dimensões de ambos objetos, um passo que envolve conhecimento implícito e inferência multi-passo. Cada pregunta é acompanhada por um conjunto de "fatos de apoio" que fornecem as informações de contexto necessárias, mas o modelo deve identificar e combinar esses fatos corretamente.

Design e Construção

O conjunto de dados StrategyQA foi construído através de um processo multi-etapa que envolve tanto esforços automatizados como humanos. Os criadores primeiro coletaram um conjunto de "preguntas estratégicas" de trabalhadores da multidão, a quem se pediu que formulassem preguntas que exigissem razoamento multi-salto. Estas preguntas foram depois decompostas em sub-preguntas por anotadores, criando um grafo de passos de razoamento. O conjunto de dados final incluye 2.780 preguntas, cada uma com uma média de 2,7 fatos de apoio e uma resposta de ouro de sí ou no. As preguntas abarcam uma amplia gama de temas, incluindo ciência, história, tecnologia e vida cotidiana, garantizando que os modelos não possam depender de atajos específicos de domínio.

Uma característica distintiva de StrategyQA é seu foco no razoamento "implícito". Diferente de conjuntos de dados como HotpotQA, onde a evidencia necessária é explicitamente fornecida em múltiples parágrafos, StrategyQA exige que o modelo se base em sua própria base de conhecimento. Isto faz que o benchmark seja particularmente desafiante para modelos que carecen de conhecimento mundial amplio ou da capacidade de realizar inferência multi-passo. O conjunto de dados também incluye um conjunto de validación de 489 preguntas e um conjunto de teste de 2.291 preguntas, com o conjunto de teste mantido privado para prevenir o sobreajuste.

Evaluación e Métricas

A métrica principal para StrategyQA é a precisão na predicción da resposta de sí/no. Evaluaciones iniciales mostraram que os modelos de última generación na época, como versões afinadas do transformador T5, alcanzaram ao redor de 66% de precisión, significativamente por debajo do rendimiento humano estimado de 87%. Esta brecha destacou a dificuldade do razoamento multi-salto e impulsionou investigações adicionales sobre arquitecturas de modelos e técnicas de entrenamiento. Modelos subsequentes, incluindo aqueles baseados na arquitectura GPT-3, melhoraram o rendimiento mas ainda ficaram por debajo do razoamento a nível humano. A partir de 2023, os melhores sistemas, muitas vezes incorporando generación aumentada por recuperación ou prompting de cadena de pensamento, alcanzaron níveis de precisión na metade dos anos 70 a baixos 80, mas o benchmark permanece como um teste desafiante para capacidades de razoamento geral.

Impacto e Significado

StrategyQA se converteu em um benchmark amplamente utilizado nas comunidades de Artificial intelligence e Machine learning, particularmente para evaluar Large language models. Seu ênfase no razoamento multi-salto influenciou o desenvolvimento de técnicas como prompting de cadena de pensamento, onde se anima aos modelos a generar passos de razoamento intermediários antes de produzir uma resposta final. O benchmark também foi utilizado para estudar as limitações dos modelos baseados em Transformer (architecture), revelando que muitas vezes dependen de correlações superficiais em lugar de razoamento genuino. Isto levou a um interesse crescente em enfoques neuro-simbólicos e na integração de fontes de conhecimento externas.

O conjunto de dados também foi incorporado em suites de evaluación más amplias, como o benchmark BIG-bench, que agrega múltiples tarefas para evaluar as capacidades dos modelos. Seu diseño inspirou benchmarks similares em outros domínios, incluindo razoamento científico e respuesta a preguntas de sentido común. Os pesquisadores notaram que as preguntas de StrategyQA muitas vezes exigem conhecimento "de domínio aberto", o que significa que os modelos devem acessar informações que não estão presentes em seus dados de entrenamiento, o que tem implicações para o desenvolvimento de sistemas aumentados por recuperación.

Limitaciones e Críticas

A pesar de sua popularidade, StrategyQA enfrentou várias críticas. Alguns pesquisadores argumentam que o formato de sí/no simplifica excessivamente o processo de razoamento, já que os modelos podem alcanzar precisión moderada através de adivinanzas ou explotando sesgos no conjunto de dados. Por exemplo, a distribución de respostas de sí/no não está perfeitamente equilibrada, e algumas preguntas contienen pistas léxicas que podem guiar inadvertidamente aos modelos. Adicionalmente, os fatos de apoio fornecidos no conjunto de dados não são sempre suficientes para responder à pregunta, exigindo que os modelos dependan de conhecimento externo que pode ser inconsistente ou desatualizado.

Outra limitación é o potencial de contaminação de dados, já que as preguntas são derivadas de fontes públicas e podem aparecer nos corpus de entrenamiento de grandes modelos de linguagem. Isto pode inflar as métricas de rendimiento e obscurecer a verdadeira capacidade de razoamento. Para mitigar isto, alguns pesquisadores propuseron benchmarks dinámicos que generan novas preguntas sobre a marcha, mas StrategyQA permanece como um recurso estático. A pesar destes problemas, o benchmark continua sendo uma herramienta valiosa para diagnosticar debilidades nos modelos e impulsionar o progresso na pesquisa de razoamento multi-salto.

Direcciones Futuras

As lecciones de StrategyQA informaron o diseño de benchmarks más novos que buscan ser más robustos e completos. Por exemplo, o marco de StrategyQA foi estendido para incluir preguntas de múltipla escolha e tarefas de generación de final aberto, que exigem que os modelos produzcan explicaciones em lugar de só etiquetas. Também há um interesse crescente em usar StrategyQA para evaluar as capacidades de razoamento de modelos em domínios especializados, como descobrimento científico e análise legal. A medida que os sistemas de Generative AI se tornam más capaces, benchmarks como StrategyQA provavelmente evoluirán para incorporar cadenas de razoamento más complexas, incluindo razoamento temporal e causal, para manter o ritmo com os avanços dos modelos.

No contexto más amplio da pesquisa em Deep learning, StrategyQA subraya a importância de ir más allá do reconhecimiento de padrões hacia uma compreensão genuina. O benchmark catalizou trabalho sobre interpretabilidade, estratégias de prompting e a integração de razoamento simbólico com redes neuronales. Aunque ningún modelo alcanzó ainda rendimiento a nível humano em StrategyQA, o benchmark permanece como uma vara de medir crítica para avaliar o progresso em um dos aspectos más fundamentales da inteligência: a capacidade de razoar passo a passo.

Vea También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:benchmark·multi-hop-reasoning·question-answering·natural-language-processing
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico