Traduzido do inglês

MultiNLI é um conjunto de dados em larga escala para inferência em linguagem natural, contendo 433 mil pares de frases em múltiplos gêneros. Ele é utilizado para treinar e avaliar modelos no reconhecimento de implicação textual, contradição e neutralidade.

MultiNLI, abreviação de Multi-Genre Natural Language Inference, é um conjunto de dados em larga escala projetado para a tarefa de inferência em linguagem natural (NLI). Foi introduzido em 2017 por pesquisadores da Universidade de Stanford, com base no corpus anterior SNLI (Stanford Natural Language Inference). O conjunto de dados contém 433.000 pares de frases, cada um rotulado como uma de três relações: implicação, contradição ou neutro. Sua característica definidora é a inclusão de dez gêneros distintos de texto, que vão de ficção e guias de viagem a fala telefônica e relatórios de emergência 911, tornando-o um benchmark mais desafiador e realista do que seu predecessor.

O propósito principal do MultiNLI é treinar e avaliar modelos de aprendizado de máquina na tarefa de reconhecimento de implicação textual. Nessa tarefa, um modelo recebe uma frase premissa e uma frase hipótese, e deve determinar se a hipótese segue logicamente da premissa (implicação), conflita diretamente com ela (contradição) ou não está relacionada (neutro). O MultiNLI é amplamente utilizado no campo de processamento de linguagem natural e se tornou um benchmark padrão para avaliar as capacidades de raciocínio de modelos de rede neural, incluindo aqueles baseados em transformadores.

Estrutura do Conjunto de Dados e Gêneros

O conjunto de dados é dividido em duas divisões principais: os conjuntos de teste correspondente e não correspondente. O conjunto correspondente contém exemplos dos mesmos gêneros que os dados de treinamento, enquanto o conjunto não correspondente inclui gêneros não vistos durante o treinamento. Esse design testa a capacidade de um modelo de generalizar entre diferentes tipos de texto. Os dez gêneros incluem diálogo face a face, ficção, documentos governamentais, cartas, relatórios do 11 de setembro, fala telefônica, guias de viagem e outros. Cada gênero contribui com um número aproximadamente igual de exemplos, garantindo representação equilibrada. O conjunto de treinamento consiste em aproximadamente 392.000 pares, com o restante alocado para conjuntos de validação e teste.

Criação e Anotação

O conjunto de dados foi criado usando uma plataforma de crowdsourcing, semelhante ao SNLI. Anotadores humanos recebiam uma frase premissa de um texto-fonte e eram solicitados a escrever uma hipótese que fosse implicada, contradita ou neutra em relação à premissa. Cada par era então validado por múltiplos anotadores para garantir qualidade. Os rótulos finais eram determinados por votação majoritária entre os anotadores. Esse processo resultou em um conjunto de dados de alta qualidade, com um alto nível de concordância entre anotadores, tornando-o um recurso confiável para treinamento e avaliação.

Papel no Desenvolvimento de Modelos

O MultiNLI desempenhou um papel significativo no desenvolvimento de grandes modelos de linguagem modernos. Foi um dos benchmarks-chave usados na suíte de benchmarks GLUE (General Language Understanding Evaluation), introduzida em 2018. Modelos como BERT, RoBERTa e muitos outros foram avaliados no MultiNLI para medir sua capacidade de realizar tarefas de raciocínio complexas. O conjunto de dados também foi usado para treinar modelos para outras tarefas downstream, como resposta a perguntas e sumarização de texto, pois incentiva os modelos a aprender representações semânticas robustas.

Limitações e Críticas

Apesar de sua popularidade, o MultiNLI foi criticado por certas limitações. Uma questão é que as hipóteses geradas por crowdsourcing às vezes podem ser artificiais ou conter artefatos que os modelos podem explorar, levando a uma superestimação do desempenho. Por exemplo, algumas hipóteses contêm palavras de negação que são fortes indicadores de contradição, permitindo que os modelos façam previsões sem compreender totalmente o texto. Além disso, o foco do conjunto de dados em inferência no nível da frase não captura formas mais complexas de raciocínio que exigem contexto de múltiplas frases ou conhecimento de mundo. Pesquisadores propuseram conjuntos de dados alternativos, como ANLI (Adversarial NLI), para abordar algumas dessas deficiências.

Impacto e Legado

O MultiNLI teve um impacto duradouro no campo da inteligência artificial e do aprendizado de máquina. Foi citado em milhares de artigos de pesquisa e continua sendo um benchmark padrão para avaliar a compreensão de linguagem natural. Sua introdução de dados multigênero influenciou o design de conjuntos de dados subsequentes, incentivando um movimento em direção a ambientes de avaliação mais diversos e realistas. A partir do início da década de 2020, o MultiNLI continua a ser usado em pesquisa acadêmica e aplicações industriais, particularmente no desenvolvimento de sistemas de IA generativa que exigem fortes capacidades de raciocínio.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:natural-language-processing·dataset·benchmark·machine-learning
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico