RACE (ReAding Comprehension from Examinations) é um conjunto de dados de referência para avaliar as capacidades de compreensão de leitura e raciocínio de sistemas de inteligência artificial. Foi introduzido em 2017 por pesquisadores da Universidade Carnegie Mellon e da Microsoft Research, e consiste em mais de 100.000 perguntas de múltipla escolha provenientes de exames de língua inglesa aplicados a estudantes do ensino fundamental e médio na China. O conjunto de dados é notável por sua ênfase em passagens longas, tipos de perguntas complexos e pela exigência de inferência profunda além da simples correspondência de texto.
Ao contrário de conjuntos de dados de compreensão de leitura anteriores, que frequentemente dependiam de passagens curtas ou consultas baseadas em fatos, o RACE apresenta perguntas que demandam uma variedade de habilidades cognitivas, incluindo a capacidade de inferir informações implícitas, compreender a estrutura narrativa e aplicar raciocínio de senso comum. O conjunto de dados é dividido em dois subconjuntos principais: RACE-M (ensino fundamental) e RACE-H (ensino médio), sendo a parte do ensino médio geralmente considerada mais desafiadora devido a passagens mais longas e perguntas mais abstratas.
Estrutura e Composição
O RACE contém 27.933 passagens e 97.687 perguntas no total, divididas em conjuntos de treinamento, desenvolvimento e teste. As passagens são extraídas de exames reais, cada uma acompanhada por várias perguntas de múltipla escolha com quatro opções de resposta. O comprimento médio das passagens é de cerca de 320 palavras, o que é significativamente maior do que muitos benchmarks contemporâneos de compreensão de leitura. Esse comprimento exige que os modelos mantenham o contexto ao longo de textos extensos e identifiquem informações relevantes distribuídas em múltiplos parágrafos.
As perguntas no RACE são categorizadas em vários tipos, incluindo aquelas que testam recordação factual, inferência e raciocínio sobre a intenção do autor ou motivações dos personagens. Uma característica notável é a presença de perguntas de "porquê" e "como", que frequentemente exigem sintetizar informações de diferentes partes da passagem.
Impacto na Pesquisa em IA
O RACE rapidamente se tornou um benchmark padrão para avaliar modelos de compreensão de leitura. Quando foi lançado, os modelos de última geração alcançavam taxas de precisão bem abaixo do desempenho humano, estimado em cerca de 95%. Modelos neurais iniciais, incluindo aqueles baseados em redes neurais e transformadores, tinham dificuldade em superar 60% de precisão no conjunto de teste. Essa lacuna estimulou pesquisas significativas em novas arquiteturas e técnicas de treinamento.
O conjunto de dados desempenhou um papel no desenvolvimento de grandes modelos de linguagem e sistemas de IA generativa. À medida que os modelos cresceram em escala e foram pré-treinados em corpora massivos, seu desempenho no RACE melhorou drasticamente. Em 2021, modelos como o GPT-3 da OpenAI e iterações posteriores alcançaram precisão acima de 90%, aproximando-se do desempenho humano. Esse progresso destacou a importância da escala e do pré-treinamento na abordagem de tarefas complexas de raciocínio.
Comparação com Outros Benchmarks
O RACE é frequentemente comparado a outros conjuntos de dados de compreensão de leitura, como SQuAD (Stanford Question Answering Dataset) e CNN/Daily Mail. Ao contrário do SQuAD, que foca na extração de respostas onde a resposta é um trecho de texto, o RACE exige a seleção entre opções predefinidas e frequentemente envolve perguntas que não podem ser respondidas por simples busca textual. Isso torna o RACE um teste mais exigente de compreensão e raciocínio genuínos.
O design do conjunto de dados também influenciou benchmarks subsequentes, como o mais desafiador RACE-C e outros conjuntos de dados adversariais que visam expor fraquezas no raciocínio dos modelos. Pesquisadores usaram o RACE para estudar fenômenos como o excesso de confiança dos modelos e a tendência de depender de pistas superficiais em vez de compreensão profunda.
Limitações e Críticas
Apesar de seu uso generalizado, o RACE tem limitações. Alguns pesquisadores notaram que as perguntas do conjunto de dados, embora derivadas de exames reais, podem conter vieses ou ambiguidades que as tornam menos adequadas para avaliar raciocínio geral. Por exemplo, algumas perguntas dependem de conhecimento cultural específico dos contextos educacionais chineses, o que pode prejudicar modelos treinados principalmente em texto em inglês. Além disso, o formato de múltipla escolha pode permitir que modelos explorem regularidades estatísticas nas opções de resposta, como viés de posição ou heurísticas de comprimento.
Esforços para abordar essas questões levaram à criação de versões modificadas do conjunto de dados, como o RACE-C, que adiciona perguntas mais desafiadoras e reduz o impacto de pistas superficiais. Essas variantes continuam a ser usadas em pesquisas sobre compreensão de leitura robusta.
Legado e Uso Contínuo
O RACE permanece um benchmark amplamente citado no campo da inteligência artificial e do aprendizado de máquina. Ele está incluído em muitos pacotes de avaliação de modelos, como os benchmarks GLUE e SuperGLUE, e é usado por grandes organizações de pesquisa, incluindo Google DeepMind e Anthropic, para avaliar as capacidades de seus modelos. A longevidade do conjunto de dados é um testemunho de seu design, que antecipou muitos dos desafios que mais tarde se tornaram centrais na pesquisa em IA, como a compreensão de contextos longos e a inferência em múltiplas etapas.
Em 2025, o RACE continua sendo usado em pesquisa acadêmica e avaliações da indústria, embora benchmarks mais recentes, como MMLU e BIG-bench, tenham parcialmente suplantado seu uso para avaliar conhecimento geral. No entanto, o foco do RACE em perguntas estilo exame o torna uma ferramenta valiosa para medir o progresso em aplicações educacionais de IA e sistemas de tutoria automatizada.