抱歉,您提供的源文本为空。请提供需要翻译的英文维基百科条目标题,我将按照规则翻译为西班牙语。

Traducido del inglés

SNLI (Stanford Natural Language Inference) es un conjunto de datos a gran escala de 570k pares de oraciones etiquetados por humanos para tareas de inferencia de lenguaje natural, introducido en 2015 por investigadores de la Universidad de Stanford para evaluar las capacidades de implicación textual de los modelos de aprendizaje automático.

El corpus de Stanford para la inferencia de lenguaje natural (SNLI) es un conjunto de datos de referencia para la inferencia de lenguaje natural (NLI), también conocida como reconocimiento de implicación textual. Publicado en 2015 por investigadores de la Universidad de Stanford, proporciona 570,000 pares de oraciones anotados por humanos, cada uno etiquetado como implicación, contradicción o neutral. El conjunto de datos se convirtió en una herramienta de evaluación estándar para modelos de aprendizaje automático y aprendizaje profundo, particularmente aquellos que usan arquitecturas de red neuronal, y sigue siendo ampliamente citado en el campo de la inteligencia artificial. Desarrollado principalmente en el Stanford AI Lab, SNLI fue presentado por Samuel Bowman, Gabor Angeli, Christopher Potts y Christopher D. Manning, cuyo artículo "A large annotated corpus for learning natural language inference" lo presentó en la Conferencia de 2015 sobre Métodos Empíricos en Procesamiento de Lenguaje Natural (EMNLP). El corpus se construyó mediante crowdsourcing de subtítulos del conjunto de datos de descripción de imágenes Flickr30k, que proporcionó pares naturales y diversos. Se pidió a los trabajadores que escribieran una oración que implicara, contradijera o fuera neutral con respecto a una premisa dada. Este proceso produjo un conjunto de entrenamiento de alta calidad con más de 570,000 pares, además de aproximadamente 10,000 ejemplos de validación y prueba cada uno, todos revisados de forma independiente. El equipo diseñó intencionalmente SNLI para evitar sesgos sobre-lexicalizados, asegurando que las decisiones requieran un razonamiento genuino sobre el significado en lugar de una mera superposición de palabras. Desde su publicación, SNLI ha impulsado avances importantes en NLI, generando variantes como MultiNLI y sirviendo como campo de entrenamiento para modelos basados en la arquitectura transformador.

Estructura del conjunto de datos y anotación

Cada par en SNLI consiste en una premisa (un subtítulo corto, por ejemplo, "Dos mujeres se abrazan mientras sostienen paquetes para llevar") y una hipótesis (una oración adicional). La etiqueta puede ser 'implicación' (la hipótesis se deduce de la premisa), 'contradicción' (no pueden ser ambas verdaderas) o 'neutral' (ninguna asegura lógicamente la otra). El esquema de anotación original también incluía una categoría de 'contradicción' que luego se refinó. Los datos se dividen en conjuntos de entrenamiento, desarrollo y prueba, siendo los dos últimos diseñados para ser más difíciles y evitar el engaño mediante memorización. El proceso de anotación incluyó múltiples rondas: escritura inicial, luego una segunda anotación para control de calidad y finalmente validación automática para filtrar casos complicados. Este enfoque de múltiples pasadas buscaba reducir etiquetas ruidosas y produjo un acuerdo entre anotadores de aproximadamente el 73%, considerado alto para una tarea semántica.

Papel en la evaluación de modelos

SNLI se convirtió en una prueba temprana para modelos de aprendizaje profundo en comprensión semántica. Antes de su publicación, la inferencia de lenguaje natural se abordaba principalmente con características hechas a mano y clasificadores tradicionales. El tamaño del conjunto de datos permitió entrenar grandes modelos condicionales, como redes neuronales recurrentes (RNN), redes de memoria a largo plazo (LSTM) y, eventualmente, mecanismos basados en atención. Por ejemplo, en 2016, un modelo basado en Bi-LSTM con atención alcanzó alrededor del 86% de precisión en SNLI, lo que fue una mejora significativa sobre los puntos de referencia anteriores. Más tarde, los grandes modelos de lenguaje entrenados en amplios corpus de texto han logrado más del 90% de precisión, reflejando tanto la relevancia continua del conjunto de datos como los límites de SNLI como punto de referencia fijo. Los investigadores también han utilizado SNLI para sondear la generalización, notando que los modelos a menudo explotan atajos estadísticos, como la superposición léxica, en lugar de una inferencia verdadera.

Desafíos y limitaciones

A pesar de su influencia, SNLI tiene debilidades conocidas. Las hipótesis se generaron a partir de subtítulos, por lo que los datos están sesgados hacia escenarios concretos y visuales, limitando la diversidad en dominios como la ciencia o la medicina. Además, las etiquetas obtenidas por crowdsourcing pueden ser subjetivas; lo que un anotador considera una contradicción podría ser neutral para otro. Análisis de investigadores como Marie-Catherine de Marneffe y otros han mostrado que muchos ejemplos se pueden resolver con heurísticas superficiales (por ejemplo, coincidencia de palabras), lo que significa que una alta precisión puede no reflejar un razonamiento robusto. El conjunto de datos también sufre de desequilibrio de clases: la implicación y la neutral son más comunes que la contradicción, aunque los creadores fijaron la distribución en aproximadamente un tercio cada una. Estos problemas han motivado conjuntos de datos más nuevos como Multi-Genre NLI (MultiNLI) y NLI adversarial, que ofrecen una cobertura más amplia y ejemplos más difíciles.

Legado e influencia

SNLI ha sido fundamental para avanzar en el subcampo de la inferencia de lenguaje natural, de manera similar a cómo ImageNet transformó la visión por computadora. Popularizó el uso de grandes conjuntos de datos anotados por humanos para la semántica y estableció un estándar de reproducibilidad. El corpus está disponible gratuitamente a través del sitio web del Laboratorio de IA de Stanford y está integrado en herramientas principales como la biblioteca de conjuntos de datos de Hugging Face. Hasta 2025, ha sido citado decenas de miles de veces, y sus principios de diseño se han adoptado para otros conjuntos de datos de implicación en varios idiomas. Aunque han surgido puntos de referencia más complejos, SNLI sigue siendo un punto de partida para los recién llegados al campo y una verificación de cordura para nuevas arquitecturas de modelos.

Desarrollos relacionados

El éxito de SNLI fomentó la creación de la NLI más amplia como una tarea unificada para la evaluación comparativa, lo que llevó al desarrollo del punto de referencia GLUE en 2018, que incluía MultiNLI como tarea central. De manera similar, el conjunto de datos XNLI extendió las anotaciones similares a SNLI a 15 idiomas, permitiendo la evaluación de modelos multilingües. En el lado de la infraestructura, proveedores como Amazon Web Services y Google Cloud han alojado SNLI como un conjunto de datos tutorial para servicios de aprendizaje automático, haciéndolo accesible para profesionales. En el ámbito académico, MIT CSAIL y BAIR (Berkeley AI Research) han utilizado SNLI para sondear representaciones contextuales, y sigue siendo un elemento básico en cursos de Carnegie Mellon University y otros lugares.

Véase también

Referencias

Bowman, S. R., Angeli, G., Potts, C., y Manning, C. D. (2015). A large annotated corpus for learning natural language inference. En Actas de EMNLP.

Página oficial de SNLI del Laboratorio de IA de Stanford.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:natural-language-processing·dataset·entailment·nlp-benchmark
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial