BBH 2024 es un punto de referencia para evaluar modelos de lenguaje de gran tamaño (LLM) en un conjunto de tareas de razonamiento desafiantes. Es una versión actualizada del punto de referencia BIG-Bench Hard (BBH), que a su vez era un subconjunto seleccionado del conjunto más amplio BIG-Bench. BBH 2024 se publicó en 2024 para abordar las limitaciones del BBH original, en particular la saturación del rendimiento por parte de modelos más nuevos y la necesidad de protocolos de evaluación más robustos.
El punto de referencia consta de 23 tareas seleccionadas de BIG-Bench que se identificaron como particularmente difíciles para los modelos de lenguaje. Estas tareas cubren una variedad de habilidades de razonamiento, incluyendo juicio causal, comprensión de fechas, desambiguación y deducción lógica. BBH 2024 introduce indicaciones revisadas, formatos de respuesta actualizados y una nueva metodología de puntuación que penaliza las respuestas parcialmente correctas de manera más estricta que el BBH original. El punto de referencia actualizado tiene como objetivo proporcionar una medida más confiable de las capacidades del modelo en la frontera de la investigación en IA.
Composición y selección de tareas
Las 23 tareas en BBH 2024 son las mismas que en el BBH original, pero con modificaciones significativas. Por ejemplo, la tarea de 'Juicio causal' ahora incluye 100 escenarios contrafácticos adicionales, y la tarea de 'Comprensión de fechas' se ha ampliado para cubrir una gama más amplia de formatos de calendario. La tarea de 'Deducción lógica' ahora requiere que los modelos generen una secuencia de pasos de razonamiento en lugar de solo la respuesta final. Estos cambios se realizaron para reducir la efectividad del simple emparejamiento de patrones y fomentar un razonamiento genuino.
Cada tarea incluye una indicación de pocos ejemplos con 3 a 5 ejemplos, como en el BBH original. Sin embargo, BBH 2024 proporciona ejemplos actualizados que reflejan el uso del lenguaje más reciente e incluyen explicaciones para las respuestas correctas. El punto de referencia también introduce un modo de evaluación de 'cadena de pensamiento', donde se indica a los modelos que produzcan pasos de razonamiento intermedios antes de la respuesta final, y un modo 'directo' sin dicha indicación.
Puntuación y evaluación
BBH 2024 utiliza un sistema de puntuación que otorga crédito completo solo para coincidencias exactas con la respuesta de referencia. Se otorga crédito parcial para respuestas que contienen la respuesta final correcta pero incluyen texto adicional. El punto de referencia informa tanto la precisión promedio en todas las tareas como la desviación estándar. Para el modo de cadena de pensamiento, la precisión se calcula sobre la respuesta final después de los pasos de razonamiento, y se introduce una métrica separada, 'coherencia de razonamiento', para evaluar la consistencia lógica de los pasos generados.
En el BBH original, modelos como GPT-3 lograron una precisión promedio de alrededor del 40% en las tareas. Para 2024, modelos de última generación como GPT-4 y Claude 3 han superado el 80% en el BBH original, lo que impulsó la necesidad de una versión más desafiante. BBH 2024 incluye un nuevo 'modo difícil' donde las indicaciones se perturban de manera adversaria, y el punto de referencia informa resultados tanto para los modos estándar como difícil.
Rendimiento del modelo y saturación
Los resultados iniciales en BBH 2024, publicados a mediados de 2024, muestran que los modelos con mejor rendimiento, incluidos GPT-4 Turbo y Claude 3 Opus, logran alrededor del 70% de precisión promedio en el modo estándar y alrededor del 50% en el modo difícil. Esto es una caída significativa desde su casi saturación en el BBH original, lo que indica que el punto de referencia actualizado proporciona una evaluación más discriminativa. El punto de referencia ha sido adoptado por varios laboratorios de investigación en IA, incluidos OpenAI, Anthropic y Google DeepMind, como una herramienta de evaluación estándar para sus modelos.
BBH 2024 también incluye un estudio de 'línea base humana', donde se reclutaron 100 participantes humanos a través de una plataforma de crowdsourcing. La precisión de la línea base humana en el modo estándar es del 85%, y en el modo difícil es del 75%, lo que muestra que el punto de referencia aún deja espacio para mejorar en los sistemas de IA.
Relación con otros puntos de referencia
BBH 2024 es parte de un ecosistema más amplio de puntos de referencia de IA. Complementa otros conjuntos como MMLU (Comprensión de lenguaje multitarea masiva) y HellaSwag, pero se centra específicamente en tareas que requieren razonamiento de múltiples pasos. A diferencia de MMLU, que cubre una amplia gama de dominios de conocimiento, BBH 2024 enfatiza tareas que son fáciles para los humanos pero difíciles para la IA, como se definió originalmente en BIG-Bench. La versión actualizada mantiene esta filosofía mientras aumenta la dificultad y la robustez de la evaluación.
El punto de referencia está disponible públicamente en GitHub, y los autores proporcionan una tabla de clasificación con resultados de varios modelos. La tabla de clasificación se actualiza regularmente, y a finales de 2024, la entrada principal es un modelo de Google DeepMind con una precisión promedio del 72.3% en el modo estándar.
Direcciones futuras
Los creadores de BBH 2024 han indicado que planean publicar actualizaciones anuales para mantenerse al día con las mejoras de los modelos. También están explorando la inclusión de tareas que requieran razonamiento multimodal, como interpretar gráficos y diagramas. Se espera que el punto de referencia siga siendo un punto de referencia clave para evaluar las capacidades de razonamiento en modelos de lenguaje de gran tamaño en el futuro previsible.
Véase también
- BIG-Bench
- MMLU
- Cadena de pensamiento
- Evaluación de sistemas de IA