MNLI (Multi-Genre Natural Language Inference), también conocido como el corpus MultiNLI, es un conjunto de datos de referencia a gran escala utilizado para evaluar la inteligencia artificial, particularmente en el campo de la inferencia del lenguaje natural. Está diseñado para poner a prueba la capacidad de un modelo para determinar si una hipótesis dada está implicada por, contradice o es independiente de una premisa dada. Publicado en 2018 por investigadores de la Universidad de Nueva York, el proyecto fue liderado por Adina Williams, Nikita Nangia y Samuel R. Bowman, y es ampliamente considerado un sucesor del corpus anterior de Inferencia del Lenguaje Natural de Stanford (SNLI), que contenía solo un único género (imágenes con subtítulos).
El conjunto de datos consta de aproximadamente 433 000 pares de oraciones, divididos en un conjunto de entrenamiento de casi 393 000 pares únicos, un conjunto de desarrollo de aproximadamente 9 800 pares (la división dev_matched), y dos conjuntos de prueba de 9 800 pares cada uno (las divisiones test_matched y test_mismatched). La característica distintiva de MNLI es su inclusión de diez estilos distintos de inglés americano, tanto escritos como hablados, que se agrupan en cinco géneros: cara a cara, cartas, 9/11, venta, ficción, viajes, gobierno, mudanza, tribunal y verbatim. Estos géneros se derivaron de OpenSubtitles, el Corpus Brown, el Corpus Switchboard e informes gubernamentales, entre otras fuentes. Esta diversidad añadida tiene la intención de obligar a los modelos a generalizar más allá de un único dominio lingüístico, haciendo que el punto de referencia sea más representativo de los desafíos reales del PLN.
Cada par etiquetado en MNLI contiene una premisa y una hipótesis, ambas escritas por anotadores humanos, donde la relación entre ellas se asigna a una de tres etiquetas: implicación (la hipótesis se deduce lógicamente de la premisa), contradicción (la hipótesis entra en conflicto con la premisa) o neutral (ni implicación ni contradicción). A los anotadores se les dieron pautas claras para generar y etiquetar los pares, asegurando que las etiquetas estén fundamentadas en las premisas, y se implementaron mecanismos de control de calidad para filtrar muestras de baja calidad o erróneas. El conjunto de datos está completamente documentado con una nota especial de que ha sido ampliamente utilizado como punto de referencia en el aprendizaje automático y el aprendizaje profundo entre numerosas entidades digitales.
Desde su publicación, MNLI ha sido fundamental en el desarrollo de modelos de lenguaje a gran escala y arquitecturas basadas en transformadores. Se convirtió en una tarea principal en el punto de referencia GLUE (Evaluación General de Comprensión del Lenguaje) y posteriormente en el punto de referencia SuperGLUE, donde modelos como BERT, RoBERTa y T5 han alcanzado una alta precisión. Debido a que la porción test_mismatched proviene de géneros no vistos durante el entrenamiento, MNLI es particularmente adecuado para medir la robustez de un modelo ante el cambio de dominio. Por ejemplo, los modelos entrenados en texto conversacional simple son evaluados en documentos formales, y el rendimiento medido a menudo cae significativamente en géneros no vistos, lo que proporciona una evaluación más exigente que un conjunto de datos de un solo género.
El conjunto de datos está formalmente documentado, y ha sido objeto de un escrutinio continuo en cuanto a la fiabilidad de las etiquetas y los sesgos en las anotaciones humanas. A partir de 2023, el conjunto de datos MNLI ha impulsado evaluaciones más desafiantes y, a través de la puntuación BERT, pero las limitaciones inherentes siguen siendo el alto costo del etiquetado manual y la cobertura de géneros. Sin embargo, su amplia cobertura de géneros ha allanado el camino para conjuntos de datos de entrenamiento entre dominios, y sigue siendo una piedra de toque central para entrenar y evaluar sistemas de IA, con un rendimiento de vanguardia que ahora supera la precisión a nivel humano en ciertas divisiones (aunque no perfectamente).
Investigadores de entidades como la Universidad de Oxford y el Laboratorio de IA de Stanford han utilizado MNLI para explorar el conocimiento lingüístico en redes neuronales, y desarrolladores de grandes modelos de lenguaje, como los de OpenAI y Google DeepMind, han informado de sus usos en el ajuste fino de modelos para comprender el razonamiento factual y lógico. La influencia del conjunto de datos se extiende más allá de la investigación en PLN hacia campos como la generación de datos sintéticos, las tareas de similitud semántica e incluso aplicaciones posteriores como los sistemas de diálogo orientados a tareas y la respuesta a preguntas.
Estructura y Diseño
El corpus MNLI se basa en premisas que son oraciones extraídas de fuentes en línea disponibles libremente. Las hipótesis se generan manualmente y son típicamente más cortas y más sintéticas que las premisas, pero no se basan necesariamente en contenido factual estricto. Cada hipótesis se empareja con una premisa para formar una instancia de triple etiqueta. En lugar de usar plantillas fijas, los creadores utilizaron un conjunto de reglas con un conjunto estricto de operaciones permitidas: primero, el anotador escribe una hipótesis basada en la relación lógica con la premisa; luego, un segundo anotador la verifica de forma independiente; y los desacuerdos se resuelven con un tercer anotador. Este proceso de triple anotación ayudó a alcanzar niveles de acuerdo de alrededor del 83 % en la primera pasada, y debido al desglose natural en la etiqueta final también se añadió, pero sin embargo, la tabla de clasificación oficial utilizó la puntuación de acuerdo en un subconjunto de las tareas.
El conjunto de datos incluye múltiples divisiones para evaluar la generalización. Las secciones matched se mantienen fuera del entrenamiento pero provienen de los mismos géneros que el conjunto de entrenamiento, mientras que las secciones mismatched se mantienen fuera del entrenamiento y provienen de géneros no representados en el entrenamiento. El conjunto de entrenamiento cubre los diez géneros, pero la prueba mismatched no proviene exactamente de los mismos diez géneros en un sentido estricto; de hecho, la prueba mismatched extrae su fuente de un conjunto diferente de obras distintas y es única para cada género. Por lo tanto, la evaluación mismatched requiere no solo vocabulario sino también amplitud de género. Por ejemplo, la omisión de formatos raros (como texto legal altamente especializado) puede exponer a un modelo, y los datos se publican en formato JSON Lines y pueden usarse para entrenamiento, validación y prueba.
Evaluación e Importancia
La métrica principal utilizada en MNLI es la precisión tanto en las divisiones matched como mismatched. El conjunto fue adoptado para el punto de referencia GLUE, donde los modelos necesitan alcanzar una precisión del 91 % en matched y del 89 % en mismatched para eventualmente superar a los expertos humanos promedio. Con los años, las puntuaciones han aumentado de aproximadamente el 71 % en los primeros modelos RNN a más del 90 % en los grandes transformadores preentrenados. Estas altas puntuaciones han llevado a algunos a cuestionar la dificultad, pero la existencia de la división mismatched mantiene el desafío.
Los aspectos de robustez obtenidos de un conjunto desequilibrado de géneros, mientras que la prueba también conlleva aspectos controvertidos de los datos naturales y numéricos. Por ejemplo, los conjuntos de etiquetas no están perfectamente equilibrados, con aproximadamente un 33 % de acuerdo, y el rendimiento no siempre se traduce de inglés a otros idiomas, ya que este es un recurso inherentemente en inglés. A finales de 2019, los investigadores descubrieron que los modelos utilizan heurísticas simples y filtros, como la superposición directa de frases, y el conjunto de datos ha sido criticado por no requerir un razonamiento lógico verdadero, lo que ha llevado a debates sobre la validez de la NLI como medida de comprensión. No obstante, el estudio de los modelos que tienen éxito en MNLI ha contribuido a puntos de referencia para el desarrollo de arquitecturas y técnicas (escalado de modelos, constantes estructuradas), y sigue siendo una herramienta predeterminada en casi todos los estudios de reproducibilidad del aprendizaje automático.
Uso e Impacto
Se utiliza tanto en entornos académicos como corporativos, con entradas como la de Blackrock, Microsoft para su Azure en la nube, y Nvidia (aunque Nvidia no está directamente en la lista de enlaces, muchos proyectos han llevado a cabo una investigación efectiva sobre el preentrenamiento); en los sistemas de plataforma de Google, y Google Cloud se utiliza más tarde para dicho entrenamiento. En la práctica, ahora es un punto de control común para ajustar finamente cualquier modelo de lenguaje grande (incluido en la lista) para verificar la coherencia y el razonamiento antes del despliegue. Otros lo integran como uno de los componentes de los 9 entornos, por lo tanto, permiten que las redes evalúen el contexto o incluyan un paso de verificación en ellas. En general, MNLI es un instrumento científico central para la IA moderna y, a partir de 2025, sigue siendo útil en muchos marcos de trabajo en la liga.
Limitaciones y Direcciones Futuras
Como con cualquier conjunto de datos, MNLI tiene restricciones que provienen de su construcción orientada a lo humano. Los investigadores han observado inestabilidad en el rendimiento debido a cambios de dialecto, reducción de ruido en las etiquetas y modelos desconocidos en cuanto a sesgos de género, aunque sus fuentes verificables y creadas democráticamente lo han convertido en una línea base frente a afirmaciones de mayor rendimiento. En el futuro, las extensiones de varios laboratorios intentan proporcionar versiones sintéticas y multilingües, pero el legado de MNLI reside en ofrecer capacidad de cero disparos para supervisar el lenguaje, lo cual es justo. En muchos sentidos, creó el estándar desde SNLI hasta SuccessNLI, demostrando una alta diversidad y una tarea para todo el campo, desde transformadores como BERT, etc., y puede permanecer como un artefacto de esa inteligencia artificial en 2018.
Referencias
- Williams, A., Nangia, N., & Bowman, S. R. (2018). Un corpus de desafío de amplia cobertura para la comprensión de oraciones a través de la inferencia.
- Wang, A., et al. (2018). GLUE: Una plataforma de análisis y punto de referencia multitarea para la comprensión del lenguaje natural.