WNLI, abreviatura de Winograd Natural Language Inference, es una tarea de referencia en el procesamiento del lenguaje natural que evalúa la capacidad de un sistema de inteligencia artificial para realizar inferencia en lenguaje natural sobre esquemas de Winograd. Un esquema de Winograd es un par de oraciones que difieren solo en una palabra o frase, pero que requieren resoluciones diferentes de un pronombre u otra referencia ambigua. La tarea consiste en determinar si una hipótesis dada se deduce de una premisa, la contradice o es neutral con respecto a ella, donde la respuesta correcta depende de la comprensión del contexto del mundo real y no de patrones léxicos simples.
El punto de referencia se introdujo como parte de GLUE (General Language Understanding Evaluation), una colección de nueve tareas de comprensión del lenguaje natural diseñadas para medir las capacidades generales de los modelos de aprendizaje automático. WNLI se incluyó específicamente para evaluar el razonamiento de sentido común y la resolución de correferencias, áreas en las que los primeros modelos neuronales a menudo fallaban a pesar de su buen desempeño en otras tareas. El conjunto de datos se deriva del desafío original de esquemas de Winograd, propuesto por Hector Levesque en 2011 como una alternativa al test de Turing, centrado en problemas que son fáciles para los humanos pero difíciles para las máquinas.
Estructura y ejemplos
Cada instancia de WNLI consiste en una oración premisa, una oración hipótesis y una etiqueta que indica si la hipótesis se deduce de la premisa (implicación), la contradice (contradicción) o no está relacionada (neutral). La premisa típicamente contiene un pronombre ambiguo, y la hipótesis resuelve ese pronombre de una de dos maneras posibles. Por ejemplo, la premisa "El trofeo no cabe en la maleta marrón porque es demasiado pequeño" podría emparejarse con la hipótesis "El trofeo es demasiado pequeño" (implicación) o "La maleta es demasiado pequeña" (contradicción). La etiqueta correcta requiere comprender las relaciones físicas de tamaño y las propiedades típicas de los objetos.
El desafío original de esquemas de Winograd contiene 273 ejemplos de este tipo, pero la versión de GLUE incluye un subconjunto de estos, reformateados para el formato de inferencia en lenguaje natural. La tarea está deliberadamente construida para que las pistas estadísticas, como la frecuencia de palabras o la co-ocurrencia, sean insuficientes para resolverla de manera confiable. Esto convierte a WNLI en una prueba sólida de si un modelo puede realizar un razonamiento genuino sobre situaciones cotidianas.
Desempeño histórico y desafíos
Cuando GLUE se lanzó en 2018, WNLI resultó ser una de las tareas más difíciles para los modelos contemporáneos. Muchos sistemas tempranos, incluidos los basados en redes neuronales recurrentes y las primeras arquitecturas de transformadores, lograban una precisión apenas superior al azar. Un problema notable era que el conjunto de entrenamiento de WNLI era muy pequeño, con solo 634 ejemplos, y el conjunto de validación era aún más reducido. Esta limitación de datos dificultaba que los modelos aprendieran patrones generalizables.
Además, surgió una complicación significativa: los ejemplos originales del desafío de esquemas de Winograd no fueron diseñados para el formato de inferencia en lenguaje natural. Varios investigadores observaron que el proceso de conversión introducía inconsistencias, y algunos ejemplos tenían etiquetas ambiguas o discutibles. En 2019, un artículo de un equipo de la Universidad de Washington demostró que muchos ejemplos de WNLI podían resolverse con heurísticas simples, como predecir siempre "implicación" para ciertas estructuras de oraciones, lo que socavaba la dificultad prevista del punto de referencia. Esto llevó a críticas de que WNLI no era una medida confiable del razonamiento de sentido común.
Relación con los sistemas modernos de IA
Con la llegada de los grandes modelos de lenguaje, como los desarrollados por OpenAI, Anthropic y Google DeepMind, el desempeño en WNLI ha mejorado drásticamente. Los modelos modernos basados en transformadores, incluidos aquellos con miles de millones de parámetros, pueden alcanzar una precisión casi perfecta en el punto de referencia. Sin embargo, esta mejora se atribuye en parte a la exposición de los modelos a grandes cantidades de texto durante el preentrenamiento, que puede incluir paráfrasis de los propios esquemas de Winograd. Como resultado, algunos investigadores argumentan que las puntuaciones altas en WNLI ya no demuestran una capacidad genuina de razonamiento, sino más bien memorización o coincidencia de patrones a partir de los datos de entrenamiento.
El punto de referencia también se ha incorporado en suites de evaluación más amplias, como SuperGLUE, que reemplazó a WNLI con una versión más robusta llamada Winogrande. Winogrande expande el conjunto de datos a más de 44,000 ejemplos y utiliza un formato de elección binaria en lugar de inferencia en lenguaje natural, abordando algunas de las debilidades de la tarea original. A pesar de estos cambios, WNLI sigue siendo un punto de referencia históricamente importante en el desarrollo de evaluaciones de comprensión del lenguaje natural.
Críticas y legado
WNLI ha sido objeto de un extenso análisis metodológico. Se han documentado el pequeño tamaño del conjunto de datos, las etiquetas inconsistentes y la facilidad con la que los modelos pueden explotar patrones superficiales. En 2021, un análisis de investigadores del Instituto Allen de Inteligencia Artificial encontró que un sistema basado en reglas simples podía lograr más del 70% de precisión en WNLI, superando con creces el desempeño de muchos modelos neuronales de la época. Este hallazgo subrayó la importancia de un diseño cuidadoso de los puntos de referencia y la necesidad de métodos de evaluación adversariales.
A pesar de estas críticas, WNLI desempeñó un papel crucial en el avance de la investigación sobre resolución de correferencias y razonamiento de sentido común. Motivó el desarrollo de nuevas arquitecturas y técnicas de entrenamiento, como la predicción basada en tramos y los modelos mejorados con conocimiento. Las lecciones aprendidas de WNLI influyeron en el diseño de puntos de referencia posteriores, incluidos Winogrande y las suites GLUE y SuperGLUE, que siguen siendo ampliamente utilizadas en la evaluación de grandes modelos de lenguaje.
Estado actual
A principios de la década de 2020, WNLI rara vez se utiliza como métrica de evaluación independiente, ya que ha sido superado por conjuntos de datos más robustos. Sin embargo, sigue apareciendo en análisis históricos y como línea base en trabajos de investigación. El legado de la tarea persiste en el esfuerzo continuo por crear puntos de referencia que evalúen genuinamente el razonamiento en lugar de la memorización, un desafío que sigue siendo central en el campo de la inteligencia artificial. El desafío original de esquemas de Winograd todavía se menciona en discusiones sobre los límites del aprendizaje estadístico y la necesidad de capacidades de razonamiento simbólico.