Traducido del inglés

HellaSwag 2025 es un punto de referencia actualizado para evaluar el razonamiento de sentido común en modelos de IA, introducido en 2025 por un consorcio de laboratorios académicos, que presenta ejemplos adversariales más difíciles y un enfoque en la comprensión multimodal.

HellaSwag 2025 es un conjunto de datos de referencia diseñado para evaluar las capacidades de razonamiento de sentido común de los sistemas de inteligencia artificial, en particular los grandes modelos de lenguaje y los modelos multimodales. Es el sucesor del benchmark original HellaSwag, introducido en 2019 por investigadores de la Universidad de Toronto y el Instituto Allen para la IA. La versión de 2025 actualiza el conjunto de datos con ejemplos más desafiantes, una cobertura ampliada de escenarios visuales y de audio, y un protocolo de evaluación más estricto para reducir las puntuaciones infladas debidas a la memorización o a atajos estadísticos.

El benchmark evalúa la capacidad de un modelo para elegir la continuación más plausible de un escenario dado, lo que requiere una comprensión de la dinámica física, las convenciones sociales y la causalidad temporal. A diferencia de versiones anteriores que se centraban principalmente en texto, HellaSwag 2025 incluye indicaciones multimodales que combinan texto con imágenes o clips de audio, empujando a los modelos a integrar información entre modalidades. El conjunto de datos se construye mediante una combinación de escenarios escritos por humanos y ejemplos adversariales generados por IA, filtrados para garantizar calidad y dificultad.

Antecedentes y Motivación

El HellaSwag original se creó para abordar una brecha en los benchmarks existentes, que a menudo no lograban distinguir entre modelos que realmente entienden el sentido común y aquellos que dependen de patrones lingüísticos superficiales. El nombre es un acrónimo de "hell" y "swag" (una referencia lúdica a "sabiduría tonta" o "sentido común"). La edición de 2025 se desarrolló en respuesta al rápido avance de la IA generativa, que ha llevado a modelos que pueden lograr puntuaciones casi perfectas en benchmarks más antiguos, dificultando la medición de progresos adicionales.

El benchmark es mantenido por un consorcio de investigadores académicos e industriales, incluidos miembros de Stanford AI Lab, MIT CSAIL y Berkeley AI Research. El proyecto recibe financiación de múltiples fuentes, incluida la Fundación Nacional de Ciencias y fundaciones privadas.

Construcción del Conjunto de Datos

HellaSwag 2025 contiene aproximadamente 20,000 preguntas de opción múltiple, cada una con un contexto y cuatro finales posibles, de los cuales solo uno es correcto. Los contextos se extraen de una amplia gama de fuentes, incluidos guiones de películas, videos instructivos y escenarios cotidianos. Para aumentar la dificultad, el conjunto de datos incluye ejemplos "adversariales" generados por sistemas de IA, que luego son validados por anotadores humanos para garantizar que sean resolubles por humanos pero desafiantes para las máquinas.

El proceso de construcción implica varios pasos: primero, se recopila un gran grupo de escenarios candidatos; segundo, los modelos de IA generan finales plausibles e implausibles; tercero, los anotadores humanos filtran y etiquetan los ejemplos; finalmente, se utiliza un conjunto de calibración para asegurar que el benchmark no esté sesgado por señales triviales como la longitud o la frecuencia de palabras. La versión de 2025 también introduce un subconjunto "contrafactual", donde la respuesta correcta requiere razonar sobre cambios hipotéticos en el escenario.

Evaluación y Puntuación

Los modelos se evalúan por su precisión en el conjunto de prueba, siendo la métrica principal el porcentaje de preguntas respondidas correctamente. Para prevenir el sobreajuste, el conjunto de prueba no se publica públicamente; en su lugar, los investigadores envían sus modelos para evaluación a través de una API controlada, similar al enfoque utilizado por otros benchmarks como los evals de OpenAI. El benchmark también informa una "puntuación de robustez" que mide el rendimiento en versiones perturbadas de las preguntas, como contextos parafraseados o imágenes alteradas.

HellaSwag 2025 está diseñado para ser más difícil que su predecesor. En evaluaciones iniciales, modelos de última generación como GPT-4 y Claude logran alrededor del 85% de precisión, en comparación con el 95% en el HellaSwag original. Esta brecha indica que el nuevo benchmark proporciona una mejor señal para distinguir entre modelos con diferentes niveles de capacidad de razonamiento.

Impacto y Recepción

El lanzamiento de HellaSwag 2025 ha sido recibido con interés por la comunidad de investigación en IA. Muchos investigadores lo utilizan como una herramienta de evaluación estándar al desarrollar nuevas arquitecturas o métodos de entrenamiento. El benchmark también ha sido adoptado por laboratorios industriales, incluidos Google DeepMind y Anthropic, como parte de sus suites de evaluación internas. Algunos críticos argumentan que el benchmark aún tiene limitaciones, como un posible sesgo hacia contextos culturales occidentales, pero el consorcio ha realizado esfuerzos para incluir escenarios diversos.

El benchmark también ha influido en el desarrollo de nuevas técnicas de entrenamiento, como el aprendizaje curricular y la aumentación de datos, que buscan mejorar el razonamiento de sentido común. Además, HellaSwag 2025 se ha utilizado para estudiar el fenómeno del "aprendizaje de atajos", donde los modelos explotan regularidades estadísticas en lugar de una comprensión real.

Direcciones Futuras

Los planes para futuras versiones de HellaSwag incluyen expandirse a más idiomas, incorporar escenarios interactivos o encarnados, y agregar un componente de razonamiento temporal. El consorcio también tiene la intención de publicar un ranking que rastree el progreso a lo largo del tiempo, similar al benchmark SuperGLUE. A medida que los sistemas de IA continúan evolucionando, benchmarks como HellaSwag 2025 juegan un papel crucial para garantizar que el progreso se mida de maneras significativas.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:benchmark·common-sense-reasoning·ai-evaluation
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial