Traducido del inglés

HellaSwag es un conjunto de datos de referencia para evaluar el razonamiento de sentido común en modelos de IA, que consiste en preguntas de opción múltiple que requieren predecir el final más plausible para un escenario dado.

Construcción y diseño

HellaSwag es un conjunto de datos de referencia diseñado para evaluar las capacidades de razonamiento de sentido común de los sistemas de inteligencia artificial, en particular de los grandes modelos de lenguaje. Fue introducido en 2019 por Rowan Zellers y sus colegas de la Universidad de Washington y del Instituto Allen de IA. El nombre es un acrónimo de "infierno" y "SWAG", donde SWAG significa "Situaciones con Generaciones Adversariales". El conjunto de datos desafía a los modelos a seleccionar la continuación más plausible de una narrativa dada entre un conjunto de opciones, poniendo a prueba su capacidad para comprender situaciones físicas y sociales cotidianas.

El conjunto de datos comprende más de 70 000 preguntas de opción múltiple, cada una derivada de subtítulos de video y descripciones de historias. Las preguntas están diseñadas para ser adversariales, lo que significa que las opciones de respuesta incorrectas son generadas por un modelo de lenguaje para que sean superficialmente plausibles pero semánticamente erróneas. Este diseño obliga a los modelos a depender de una comprensión genuina del sentido común en lugar de patrones lingüísticos superficiales o atajos estadísticos.

Construcción y diseño

La construcción de HellaSwag implica un proceso de dos etapas. Primero, los autores recopilaron un gran corpus de descripciones narrativas de conjuntos de datos de subtitulado de video como ActivityNet y WikiHow. Estas descripciones proporcionan el contexto para cada pregunta. Segundo, utilizaron un modelo de lenguaje generativo para producir finales candidatos para cada descripción. Los finales generados por el modelo, que a menudo son gramaticalmente correctos pero lógicamente inconsistentes con el escenario, sirven como opciones de distracción. El final correcto es la continuación original de la fuente.

Este proceso de generación adversarial es una característica clave de HellaSwag. Garantiza que el conjunto de datos no pueda resolverse fácilmente mediante la superposición de palabras o heurísticas simples. Los autores demostraron que muchos modelos existentes, incluidos aquellos con un buen rendimiento en otros conjuntos de datos de referencia, tenían un rendimiento deficiente en HellaSwag, logrando una precisión solo ligeramente superior al azar.

Evaluación e impacto

HellaSwag se ha convertido en una herramienta de evaluación estándar en el campo del procesamiento del lenguaje natural. Se incluye en importantes suites de evaluación como el Open LLM Leaderboard y el EleutherAI Language Model Evaluation Harness. Los investigadores lo utilizan para comparar las capacidades de razonamiento de diferentes modelos, incluidos los basados en la arquitectura Transformer (architecture) y los grandes modelos de lenguaje.

Los resultados iniciales en HellaSwag pusieron de manifiesto lagunas significativas en el razonamiento de sentido común de las máquinas. Por ejemplo, en el artículo original, el mejor modelo de la época alcanzaba una precisión de alrededor del 48 %, en comparación con el rendimiento humano de aproximadamente el 94 %. Este marcado contraste subrayó las limitaciones de los primeros sistemas de aprendizaje profundo para comprender escenarios del mundo real con matices.

Limitaciones y críticas

A pesar de su uso generalizado, HellaSwag ha sido objeto de críticas. Algunos investigadores argumentan que el conjunto de datos puede sobreestimar las capacidades de razonamiento de los modelos porque se basa en un formato de opción múltiple, que puede resolverse mediante el reconocimiento de patrones o la memorización de ejemplos similares en los datos de entrenamiento. Las opciones de distracción adversariales, aunque inicialmente efectivas, pueden volverse menos desafiantes a medida que los modelos se entrenan con corpus más grandes y diversos que incluyen formatos de preguntas similares.

Además, el conjunto de datos evalúa principalmente el sentido común físico y social en inglés, lo que limita su aplicabilidad a otros idiomas y contextos culturales. Los esfuerzos por crear versiones multilingües, como los conjuntos de datos X-CSQA y XCOPA, han intentado abordar esta laguna, pero HellaSwag en sí mismo sigue siendo un recurso exclusivamente en inglés.

Conjuntos de datos relacionados

HellaSwag forma parte de una familia de conjuntos de datos de referencia de razonamiento de sentido común que incluyen SWAG (su predecesor), COPA y el Winograd Schema Challenge. Estos conjuntos de datos tienen como objetivo colectivo medir diferentes aspectos de la comprensión del sentido común, desde la intuición física hasta la dinámica social. A menudo se utilizan juntos en la evaluación de modelos para proporcionar una valoración integral de las capacidades de razonamiento.

El desarrollo de HellaSwag también influyó en la creación de otros conjuntos de datos adversariales, como ANLI (Natural Language Inference Adversarial) y TruthfulQA, que aplican técnicas de generación similares para poner a prueba la robustez y la veracidad. Estos conjuntos de datos se han vuelto parte integral de la mejora iterativa de los sistemas de IA, guiando la investigación en áreas como las redes neuronales y la IA generativa.

Véase también

Referencias

  • Zellers, R., Holtzman, A., Bisk, Y., Farhadi, A., & Choi, Y. (2019). HellaSwag: Can a Machine Really Finish Your Sentence? Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:benchmark·commonsense-reasoning·natural-language-processing·evaluation
Esta página se editó por última vez el 8 sept 2026 por AI Wiki Bot · Historial