SciQ é um conjunto de dados de 13.679 perguntas de ciências de múltipla escolha, projetado para o treinamento e a avaliação de sistemas de inteligência artificial. Cada pergunta é acompanhada de uma resposta correta e de uma explicação de apoio, tornando-o um recurso valioso para a pesquisa em compreensão de leitura por máquina e raciocínio científico. O conjunto de dados foi criado por pesquisadores do Allen Institute for Artificial Intelligence e lançado em 2017, e desde então se tornou um padrão de referência no campo da pesquisa em IA.
As perguntas do SciQ são extraídas dos currículos de ciências do ensino fundamental e médio, abrangendo tópicos como física, química, biologia e ciências da Terra. O conjunto de dados foi construído a partir da mineração de perguntas em recursos educacionais online e, em seguida, da filtragem e limpeza para garantir a qualidade. As explicações fornecidas para cada resposta geralmente têm uma ou duas frases, oferecendo uma justificativa concisa para a escolha da opção correta. Essa característica distingue o SciQ de muitos outros conjuntos de dados de perguntas e respostas, que frequentemente fornecem apenas a resposta correta, sem qualquer justificativa.
Construção e Composição
O conjunto de dados SciQ foi construído usando uma combinação de processos automatizados e manuais. O conjunto inicial de perguntas foi coletado de repositórios de exames de ciências publicamente disponíveis e sites educacionais. Os pesquisadores então aplicaram uma série de filtros para remover perguntas malformadas ou ambíguas, resultando em um conjunto final de 13.679 itens. Cada pergunta tem quatro opções de resposta, com exatamente uma opção correta. O conjunto de dados é dividido em conjuntos de treinamento (11.679 perguntas), validação (1.000 perguntas) e teste (1.000 perguntas), permitindo uma avaliação consistente entre diferentes modelos.
Um aspecto notável do SciQ é que ele inclui uma explicação para cada pergunta, mesmo aquelas no conjunto de treinamento. Essa escolha de design permite o uso do conjunto de dados para tarefas além da simples previsão de respostas, como a geração de explicações e o aprendizado multitarefa. As explicações são tipicamente curtas e factuais, fornecendo o princípio científico chave necessário para resolver a pergunta.
Uso na Pesquisa em IA
O SciQ foi amplamente adotado como um padrão de referência para avaliar as habilidades de raciocínio de modelos de aprendizado de máquina, particularmente no contexto de aprendizado profundo e redes neurais. Os primeiros modelos testados no SciQ incluíam redes com memória aumentada e arquiteturas baseadas em atenção, que alcançaram precisão modesta em comparação com o desempenho humano. O conjunto de dados também foi usado para treinar e avaliar modelos de linguagem de grande escala, que mostraram melhorias significativas no desempenho à medida que os modelos cresceram em tamanho e sofisticação.
Um dos principais desafios apresentados pelo SciQ é que ele exige que os modelos não apenas recuperem conhecimento factual, mas também apliquem raciocínio lógico para selecionar a resposta correta entre os distratores. As explicações fornecem um sinal útil para treinar modelos a gerar justificativas, o que pode melhorar a interpretabilidade e a confiança nos sistemas de IA. Os pesquisadores também usaram o SciQ para estudar o efeito do tamanho dos dados de treinamento, da arquitetura do modelo e das estratégias de ajuste fino no desempenho de perguntas e respostas.
Limitações e Críticas
Apesar de sua popularidade, o SciQ tem várias limitações. As perguntas são relativamente simples e focam na recuperação factual, em vez de raciocínio complexo de múltiplas etapas. Como resultado, modelos de última geração alcançaram precisão quase perfeita no conjunto de teste, levando alguns pesquisadores a argumentar que o padrão de referência se tornou saturado. Além disso, o conjunto de dados é limitado à língua inglesa e a uma faixa estreita de tópicos de ciências, o que pode não generalizar para outros domínios ou idiomas.
Outra crítica é que as explicações, embora úteis, nem sempre são suficientes para que um modelo aprenda raciocínio robusto. Algumas perguntas podem ser respondidas corretamente por correspondência de padrões na linguagem da pergunta e das opções de resposta, sem uma compreensão profunda da ciência subjacente. Isso levou ao desenvolvimento de padrões de referência mais desafiadores, como aqueles que exigem raciocínio de múltiplos saltos ou a integração de conhecimento externo.
Conjuntos de Dados e Padrões de Referência Relacionados
O SciQ faz parte de uma família mais ampla de conjuntos de dados de perguntas e respostas na comunidade de IA. Ele é frequentemente comparado com outros conjuntos de dados focados em ciências, como o ARC (AI2 Reasoning Challenge), que contém perguntas mais difíceis que exigem raciocínio mais complexo. Enquanto o ARC é projetado para ser mais desafiador, o SciQ é valorizado por seu tamanho maior e pela presença de explicações. Outros padrões de referência relacionados incluem o OpenBookQA, que testa conhecimento de senso comum sobre ciências, e o QASC, que foca na combinação de fatos de múltiplas frases.
A disponibilidade do SciQ contribuiu para o desenvolvimento de sistemas de IA generativa que podem responder perguntas e fornecer explicações. Ele também foi usado em aplicações de tecnologia educacional, como sistemas de tutoria automatizados que ajudam os alunos a aprender ciências, fornecendo soluções passo a passo.
Impacto e Legado
Desde seu lançamento, o SciQ foi citado em centenas de artigos de pesquisa e se tornou uma ferramenta padrão para avaliar modelos de IA na comunidade de processamento de linguagem natural. Seu formato simples e protocolo de avaliação claro o tornam acessível a pesquisadores com recursos computacionais limitados. O conjunto de dados também foi incorporado a vários padrões de referência maiores, como SuperGLUE e MMLU, que agregam múltiplas tarefas para fornecer uma avaliação mais abrangente das capacidades dos modelos.
O sucesso do SciQ inspirou a criação de conjuntos de dados semelhantes em outros domínios, como medicina e direito, onde as explicações são igualmente importantes. Ele também destacou o valor de incluir justificativas legíveis por humanos nos dados de treinamento, uma prática que foi adotada em muitos sistemas modernos de IA. Em 2025, o SciQ permanece um recurso útil para fins educacionais e para a avaliação inicial de novos modelos, mesmo enquanto padrões de referência mais desafiadores continuam a surgir.