Un punto de referencia de IA es un conjunto de datos, tarea o suite de tareas estandarizado que se utiliza para medir y comparar el rendimiento de los sistemas de IA, proporcionando un criterio común que permite a los investigadores y al público comparar modelos entre laboratorios y a lo largo del tiempo. Los puntos de referencia han desempeñado un papel central en el progreso de la IA desde al menos la competencia ImageNet, que ayudó a catalizar la era del aprendizaje profundo, y siguen siendo la herramienta principal utilizada en la evaluación de LLM en la actualidad.
Tipos de puntos de referencia
Los puntos de referencia varían ampliamente según lo que miden. Los puntos de referencia de conocimiento y razonamiento, como MMLU, prueban la capacidad factual y de razonamiento amplia en materias académicas. Los puntos de referencia de codificación, como HumanEval y SWE-bench, miden la capacidad de un modelo para escribir o corregir código. Los puntos de referencia de razonamiento abstracto, como ARC-AGI, tienen como objetivo resistir la memorización al probar la resolución de problemas novedosos en lugar del recuerdo. Los puntos de referencia multimodales prueban la comprensión de imágenes o videos, y los puntos de referencia de seguridad investigan salidas dañinas, susceptibilidad a jailbreak o sesgo. Más allá de los conjuntos de datos estáticos, las plataformas de preferencia humana, como LMArena, clasifican modelos mediante comparaciones por pares provenientes de la multitud en lugar de conjuntos de pruebas fijos.
Saturación
Un patrón recurrente es la saturación de puntos de referencia: a medida que los modelos mejoran, el rendimiento en un punto de referencia dado aumenta hacia el techo, a menudo superando el rendimiento humano bien calibrado, momento en el cual el punto de referencia deja de diferenciar útilmente entre modelos. MMLU, introducido en 2020, vio a los modelos líderes superar el 90% de precisión en pocos años, lo que impulsó la creación de sucesores más difíciles. Este ciclo, en el que un punto de referencia se introduce, se adopta ampliamente, se satura y luego se reemplaza, se ha repetido en casi todas las áreas principales de capacidad, y es una de las razones por las que las suites de puntos de referencia se actualizan o complementan frecuentemente con variantes más difíciles.
Contaminación
Un problema relacionado y serio es la contaminación de datos: debido a que los modelos de lenguaje grandes se entrenan con vastas extracciones de internet, incluido Common Crawl, las preguntas y respuestas de los puntos de referencia pueden filtrarse en los datos de entrenamiento, ya sea directamente o a través de discusiones en línea sobre el punto de referencia, inflando el rendimiento medido de un modelo sin reflejar una capacidad genuina. Detectar la contaminación es difícil, y algunos puntos de referencia, incluido ARC-AGI, fueron diseñados específicamente con generación de problemas novedosos para resistirla. Las preocupaciones sobre la contaminación han llevado a algunos en el campo a ser escépticos sobre las puntuaciones autoinformadas de los laboratorios sin verificación independiente.
Otras críticas
Los puntos de referencia también pueden ser manipulados u optimizados directamente, una forma de hacking de recompensa en el proceso de desarrollo más amplio, donde un laboratorio ajusta un modelo para que funcione bien en puntos de referencia populares sin ganancias proporcionales en utilidad en el mundo real. Los puntos de referencia estáticos también pueden no capturar capacidades agénticas, de múltiples pasos o de horizonte largo relevantes para el uso real, lo que motiva un cambio hacia evaluaciones más dinámicas y basadas en tareas, incluido el uso de problemas reales de GitHub por parte de SWE-bench, y hacia cómputo en tiempo de prueba intensivo en modelos de razonamiento evaluados en conjuntos de problemas retenidos más difíciles.
Papel en el campo
A pesar de sus limitaciones, los puntos de referencia siguen siendo centrales en cómo se informa, comercializa y debate el progreso de la IA, apareciendo en casi todos los anuncios de lanzamiento de modelos y en discusiones políticas sobre umbrales de capacidad. Sus limitaciones han impulsado un creciente interés en métodos de evaluación complementarios, incluidas plataformas de preferencia humana, enfoques de LLM como juez y evaluaciones más estrechas y curadas por expertos menos susceptibles a la contaminación y la saturación.