ReCoRD (Reading Comprehension with Commonsense Reasoning) é um conjunto de dados de referência (benchmark) para avaliar as capacidades de raciocínio de sistemas de inteligência artificial, particularmente no domínio da compreensão de linguagem natural. Foi introduzido em 2018 por pesquisadores da Universidade de Maryland e da Universidade de Washington. O conjunto de dados foi projetado para medir a capacidade de um modelo de realizar raciocínio de senso comum durante a leitura, indo além da simples recuperação de fatos ou correspondência de padrões.
A tarefa central do ReCoRD envolve um trecho de texto, geralmente extraído de artigos de notícias, no qual certas entidades foram mascaradas. O modelo deve prever a entidade mascarada a partir de uma lista de entidades candidatas que aparecem em outras partes do trecho. Crucialmente, a resposta correta frequentemente exige compreensão do contexto, resolução de correferências e aplicação de conhecimento de mundo que não está explicitamente declarado. Por exemplo, se um trecho menciona uma pessoa e uma cidade, e a entidade mascarada é um local, o modelo deve inferir qual cidade é relevante com base na narrativa.
O ReCoRD contém mais de 120.000 exemplos, divididos em conjuntos de treinamento, validação e teste. Os trechos são provenientes de artigos de notícias, e as consultas são geradas mascarando entidades nomeadas. O conjunto de dados enfatiza que a resposta correta é sempre uma das entidades candidatas, todas mencionadas no trecho, tornando-o uma tarefa de cloze com um espaço de respostas restrito. Esse design força os modelos a raciocinar sobre as relações entre as entidades e os eventos descritos, em vez de depender de bases de conhecimento externas.
Construção e Design
O conjunto de dados ReCoRD foi construído usando um processo de duas etapas. Primeiro, artigos de notícias foram coletados de várias fontes, e entidades nomeadas foram identificadas usando um reconhecedor de entidades padrão. Em seguida, para cada artigo, um conjunto de consultas foi criado mascarando aleatoriamente uma entidade e fornecendo uma lista de entidades candidatas que aparecem no mesmo artigo. Os candidatos incluem a resposta correta e vários distratores, que são outras entidades do mesmo artigo. Isso garante que o modelo não possa simplesmente escolher a entidade mais frequente ou depender de estatísticas superficiais.
Uma característica notável do ReCoRD é sua ênfase no raciocínio de senso comum. As consultas são projetadas para que a resposta correta não seja trivialmente determinada pelo contexto local. Em vez disso, o modelo deve integrar informações de múltiplas frases e inferir relações implícitas. Por exemplo, se um trecho descreve uma pessoa ganhando um prêmio em um campo específico, o modelo deve saber que o prêmio é tipicamente associado a esse campo, um conhecimento de senso comum.
O conjunto de dados foi dividido em 101.249 exemplos de treinamento, 6.353 exemplos de validação e 10.000 exemplos de teste. O conjunto de teste é reservado, e os modelos são avaliados nele por meio de um sistema de submissão. A principal métrica de avaliação é a precisão de correspondência exata, em que a entidade prevista pelo modelo deve corresponder exatamente à resposta correta.
Avaliação e Desempenho
O ReCoRD tornou-se um benchmark padrão no campo do processamento de linguagem natural. Modelos iniciais, incluindo aqueles baseados em redes neurais recorrentes e primeiras arquiteturas de transformadores, alcançaram precisões na faixa de 60-70% no conjunto de validação. A introdução de grandes modelos de linguagem pré-treinados, como BERT e seus sucessores, melhorou significativamente o desempenho, com alguns modelos excedendo 90% de precisão até 2020.
No entanto, mesmo os modelos de última geração ainda enfrentam dificuldades com certos tipos de consultas que exigem raciocínio profundo de senso comum, como aquelas envolvendo raciocínio temporal, raciocínio espacial ou convenções sociais sutis. Isso tornou o ReCoRD uma ferramenta valiosa para diagnosticar as limitações dos sistemas de IA atuais. O benchmark também tem sido usado para estudar o impacto do tamanho do modelo, dos dados de treinamento e das escolhas arquitetônicas na capacidade de raciocínio.
Relação com Outros Benchmarks
O ReCoRD faz parte de uma família mais ampla de benchmarks de compreensão de leitura que inclui SQuAD, RACE e DROP. Diferentemente do SQuAD, que foca na extração de trechos de resposta do texto, o ReCoRD exige a seleção de um conjunto de entidades, tornando-o uma tarefa de cloze de múltipla escolha. Comparado ao RACE, que é baseado em exames de inglês, o domínio de notícias do ReCoRD fornece um contexto mais diverso e menos formalizado. O DROP, por outro lado, exige raciocínio numérico, enquanto o ReCoRD enfatiza a inferência de senso comum.
O ReCoRD é frequentemente usado em conjunto com outros benchmarks para fornecer uma avaliação abrangente das capacidades de um modelo. É particularmente relevante para testar a integração de técnicas de inteligência artificial e aprendizado de máquina na compreensão de linguagem natural. O benchmark foi adotado por grupos de pesquisa em grandes instituições, incluindo Google DeepMind, OpenAI e Anthropic, como parte de seus conjuntos de avaliação de modelos.
Impacto e Direções Futuras
A introdução do ReCoRD estimulou mais pesquisas sobre raciocínio de senso comum em IA. Ele destacou a lacuna entre reconhecimento de padrões e compreensão verdadeira, incentivando esforços para desenvolver modelos que possam raciocinar sobre situações cotidianas. Benchmarks subsequentes, como CommonsenseQA e Social IQA, basearam-se nas lições aprendidas com o ReCoRD, focando em conhecimento de senso comum mais explícito.
Uma limitação do ReCoRD é que as entidades candidatas são todas do mesmo trecho, o que às vezes pode tornar a tarefa mais fácil se o modelo aprender a explorar pistas estatísticas. Pesquisadores propuseram variantes que introduzem conhecimento externo ou exigem raciocínio de múltiplos saltos. Apesar desses desafios, o ReCoRD continua sendo um benchmark amplamente citado e utilizado, e continua a informar o desenvolvimento de sistemas de IA mais robustos e interpretáveis.
No início dos anos 2020, o ReCoRD ainda é considerado um benchmark relevante, embora modelos mais novos frequentemente alcancem pontuações quase perfeitas. Seu legado reside em demonstrar a importância do raciocínio de senso comum na compreensão de linguagem natural e em fornecer uma tarefa concreta para medir o progresso nessa área.