QNLI, abreviação de Question Natural Language Inference, é um conjunto de dados de referência no campo da artificial-intelligence e do machine-learning. Foi introduzido como parte do benchmark GLUE (General Language Understanding Evaluation), uma coleção de tarefas projetadas para avaliar o desempenho de modelos em diversos desafios de compreensão de linguagem natural. O conjunto de dados é derivado do Stanford Question Answering Dataset (SQuAD), especificamente de sua versão v1.1, e transforma a tarefa de resposta a perguntas em um problema de classificação binária.
A tarefa central no QNLI é determinar se uma determinada frase contém a resposta para uma determinada pergunta. Cada exemplo consiste em uma pergunta e uma frase, e o modelo deve classificar o par como 'entailment' (a frase fornece a resposta) ou 'not entailment' (a frase não fornece). Essa formulação converte a tarefa original de resposta extrativa a perguntas em um problema de inferência de linguagem natural, que é o motivo pelo qual recebe o nome de Question Natural Language Inference.
Origem e Construção
O QNLI foi criado pela equipe do Stanford AI Lab como parte do benchmark GLUE, que foi lançado em 2018. O conjunto de dados foi construído a partir de pares de pergunta e resposta do SQuAD v1.1, combinando cada pergunta com frases do contexto correspondente. Para cada pergunta, a frase que contém a resposta correta é rotulada como 'entailment', enquanto outras frases do mesmo contexto são rotuladas como 'not entailment'. Esse processo resulta em um conjunto de dados equilibrado, com números aproximadamente iguais de exemplos positivos e negativos.
O conjunto de dados original do SQuAD contém mais de 100.000 pares de pergunta e resposta baseados em artigos da Wikipédia. Para o QNLI, os criadores selecionaram um subconjunto e o reformataram, resultando em aproximadamente 108.000 exemplos de treinamento e 5.700 exemplos de validação. O conjunto de teste é mantido reservado e usado para o ranking oficial do GLUE, que acompanha o desempenho em todas as nove tarefas do benchmark.
Definição da Tarefa e Avaliação
No QNLI, cada entrada é um par de segmentos de texto: uma pergunta e uma frase. O modelo deve gerar um rótulo binário indicando se a frase implica a resposta à pergunta. A métrica de avaliação é a acurácia, que mede a porcentagem de pares classificados corretamente. Essa métrica simples torna a tarefa fácil de comparar entre diferentes modelos e abordagens.
A tarefa é projetada para testar a capacidade de um modelo de realizar inferência de linguagem natural e de entender a relação entre uma pergunta e um trecho de texto. Ela exige que o modelo não apenas identifique informações relevantes, mas também raciocine sobre se essas informações respondem diretamente à pergunta. Isso envolve compreensão sintática e semântica, bem como a capacidade de lidar com paráfrases e perguntas reformuladas.
Papel no Benchmark GLUE
O QNLI é uma das nove tarefas do benchmark GLUE, que foi introduzido para fornecer uma avaliação padronizada para modelos de compreensão de linguagem natural de uso geral. O benchmark inclui tarefas como análise de sentimento, implicação textual e resposta a perguntas, cada uma com seu próprio conjunto de dados e métrica de avaliação. O GLUE foi projetado para incentivar o desenvolvimento de modelos que possam ter bom desempenho em múltiplas tarefas, em vez de serem especializados em uma única.
Desde seu lançamento, o QNLI se tornou um campo de teste padrão para avaliar modelos baseados em Transformer (architecture), incluindo large-language-model. Muitos modelos proeminentes, como BERT, RoBERTa e T5, relataram seu desempenho no QNLI como parte de seus resultados de benchmark. A tarefa também foi incluída no benchmark SuperGLUE, um sucessor mais desafiador do GLUE, onde é referida como BoolQ, mas com uma formulação diferente.
Impacto e Significância
A introdução do QNLI teve um impacto significativo no campo do processamento de linguagem natural. Ao converter uma tarefa de resposta a perguntas em um problema de classificação, ele forneceu uma maneira mais simples, porém eficaz, de avaliar a compreensão de leitura e as habilidades de inferência de um modelo. Isso acelerou o progresso no desenvolvimento de modelos, pois os pesquisadores puderam iterar rapidamente em arquiteturas e técnicas de treinamento.
Além disso, o QNLI contribuiu para uma compreensão mais ampla de como os modelos lidam com fenômenos linguísticos complexos, como resolução de correferência e raciocínio lógico. Ele também tem sido usado como uma ferramenta diagnóstica para identificar fraquezas nos modelos, como sua tendência a depender de pistas superficiais em vez de compreensão profunda. Como resultado, permanece um benchmark relevante, mesmo com a introdução de conjuntos de dados mais novos e complexos.