MultiNLI, abreviatura de Multi-Genre Natural Language Inference, es un corpus a gran escala para la investigación de la inferencia del lenguaje natural (NLI). Publicado en 2017 por investigadores de la Universidad de Stanford, amplía el conjunto de datos SNLI anterior al incorporar texto de diez géneros distintos, incluyendo ficción, documentos gubernamentales, discurso telefónico y guías de viaje. El corpus está diseñado para evaluar la capacidad de un modelo para determinar la relación lógica entre una premisa y una hipótesis, clasificándola como implicación, contradicción o neutral.
El conjunto de datos contiene más de 430,000 pares de oraciones, lo que lo convierte en uno de los recursos NLI más grandes en el momento de su publicación. Cada par está etiquetado por anotadores humanos, con la premisa extraída de un texto fuente y la hipótesis generada por trabajadores de crowdsourcing. MultiNLI fue un punto de referencia clave para la comprensión del lenguaje natural, empujando a los modelos a generalizar entre dominios en lugar de sobreajustarse a un único estilo de escritura.
Construcción y Anotación
MultiNLI fue construido por un equipo liderado por Adina Williams, Nikita Nangia y Samuel Bowman en la Universidad de Stanford. Las oraciones de premisa se muestrearon de diez géneros: ficción, documentos gubernamentales, discurso telefónico, guías de viaje, cartas, informes del once de septiembre, revista Slate, transcripciones verbales, conversaciones cara a cara y artículos académicos. Esta diversidad pretendía probar la robustez ante el cambio de dominio, un modo de fallo común en los modelos NLI anteriores.
Las hipótesis fueron generadas por trabajadores de Amazon Mechanical Turk, a quienes se les pidió escribir oraciones que implicaran, contradijeran o fueran neutrales con respecto a la premisa. Cada hipótesis fue luego validada por un segundo conjunto de anotadores, asegurando etiquetas de alta calidad. El conjunto de datos final se dividió en conjuntos de entrenamiento, desarrollo y prueba, con los conjuntos de desarrollo y prueba divididos además en condiciones emparejadas y no emparejadas según si los géneros se superponían con los datos de entrenamiento.
Importancia en el Procesamiento del Lenguaje Natural
MultiNLI se convirtió en un punto de referencia estándar para evaluar modelos de comprensión de oraciones. Fue incluido en el benchmark GLUE, una colección de tareas diseñadas para medir la comprensión del lenguaje de propósito general. Modelos como BERT y sus sucesores lograron mejoras significativas en MultiNLI, demostrando el valor del preentrenamiento en grandes corpus de texto. El corpus también influyó en conjuntos de datos posteriores como ANLI, que se centró en ejemplos adversariales, y SuperGLUE, que incluyó tareas NLI más desafiantes.
El diseño multi-género destacó la importancia de la adaptación de dominio. Los modelos entrenados en un solo género a menudo funcionaban mal en géneros no vistos, y MultiNLI proporcionó un entorno controlado para estudiar este problema. También impulsó la investigación sobre la generalización entre dominios, con métodos como el entrenamiento adversarial de dominio y la aumentación de datos siendo evaluados en su conjunto de prueba no emparejado.
Relación con Otros Conjuntos de Datos NLI
MultiNLI se basa en el corpus Stanford Natural Language Inference (SNLI), que consiste en subtítulos de imágenes. Mientras que SNLI se limita a un solo género, MultiNLI amplía el alcance a texto escrito y hablado. Los dos conjuntos de datos se usan a menudo juntos, con SNLI sirviendo como fuente de preentrenamiento y MultiNLI como una evaluación más desafiante. Posteriormente, el conjunto de datos XNLI extendió NLI a múltiples idiomas, y el conjunto de datos HANS introdujo una evaluación basada en heurísticas para sondear las debilidades del modelo.
MultiNLI también comparte principios de diseño con las tareas de Reconocimiento de Implicación Textual (RTE) del Desafío PASCAL, que utilizaban conjuntos de datos más pequeños y curados manualmente. La escala y diversidad de géneros de MultiNLI lo convirtieron en un recurso de entrenamiento más práctico para los modelos modernos de Machine learning.
Impacto y Legado
La publicación de MultiNLI coincidió con el auge de los modelos basados en Transformer (architecture) en el Deep learning. Su inclusión en GLUE ayudó a estandarizar la evaluación entre grupos de investigación, acelerando el progreso en la comprensión del lenguaje natural. A principios de la década de 2020, los modelos de última generación como los grandes modelos de lenguaje logran un rendimiento casi humano en MultiNLI, aunque aún tienen dificultades con ejemplos adversariales y fuera de distribución.
El corpus ha sido ampliamente citado en la literatura académica y sigue siendo un punto de referencia para la investigación NLI. Su metodología de muestreo multi-género influyó en los esfuerzos posteriores de creación de conjuntos de datos, incluidos los de respuesta a preguntas y razonamiento de sentido común. MultiNLI está disponible gratuitamente para uso en investigación y se aloja en plataformas como Hugging Face y el sitio web del benchmark GLUE.
Véase También
- inteligencia artificial
- procesamiento del lenguaje natural (si está disponible)
- glue-benchmark (si está disponible)
- SNLI (si está disponible)
Referencias
- Williams, A., Nangia, N., & Bowman, S. (2018). A Broad-Coverage Challenge Corpus for Sentence Understanding through Inference. Proceedings of NAACL-HLT.
- Wang, A., et al. (2018). GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding. Proceedings of ICLR.