El modelo de Bradley–Terry es un modelo probabilístico para comparaciones por pares, introducido por Ralph A. Bradley y Milton E. Terry en 1952. Estima la probabilidad de que un elemento supere a otro basándose en puntuaciones de habilidad latentes, asumiendo que las probabilidades de ganar son proporcionales a la razón de las fortalezas de los elementos. El modelo se aplica ampliamente en clasificaciones deportivas, aprendizaje automático y aprendizaje de preferencias, incluido el entrenamiento de modelos de lenguaje grandes modernos mediante técnicas como RLHF y RLAIF.
El modelo define la probabilidad de que el elemento \(i\) supere al elemento \(j\) como \(P(i > j) = \frac{p_i}{p_i + p_j}\), donde \(p_i\) y \(p_j\) son parámetros de fortaleza positivos. En la práctica, los parámetros suelen transformarse mediante un enlace logit, lo que conduce a una formulación de regresión logística. El modelo puede estimarse a partir de resultados observados por pares utilizando la estimación de máxima verosimilitud, típicamente mediante algoritmos iterativos como el algoritmo EM de Bradley-Terry o métodos basados en gradientes.
Historia y Orígenes
El modelo de Bradley–Terry fue introducido en 1952 por Ralph A. Bradley y Milton E. Terry en un artículo titulado "Rank Analysis of Incomplete Block Designs" (Biometrika). El modelo se desarrolló originalmente para analizar comparaciones por pares en diseños experimentales, como pruebas de sabor y estudios de preferencias del consumidor. Amplió trabajos anteriores sobre el método de comparaciones por pares de Thurstone (1927) y otros, proporcionando un marco más flexible y estadísticamente riguroso.
A lo largo de las décadas, el modelo se ha generalizado de diversas maneras, incluida la adición de empates, ventajas de campo y fortalezas dinámicas que varían con el tiempo. Se ha convertido en una herramienta estándar en el análisis deportivo, donde se utiliza para clasificar equipos según los resultados de los partidos, y en psicometría para medir preferencias subjetivas.
Formulación Matemática
El núcleo del modelo de Bradley–Terry es la probabilidad de un resultado binario en una comparación. Para dos elementos \(i\) y \(j\) con fortalezas \(p_i\) y \(p_j\), la probabilidad de que \(i\) gane se da por:
\[ P(i \text{ supera a } j) = \frac{p_i}{p_i + p_j} \]
Equivalentemente, usando log-fortalezas \(\lambda_i = \log p_i\), el log-odds de que \(i\) supere a \(j\) es \(\lambda_i - \lambda_j\). Esta formulación hace que el modelo sea un caso especial de regresión logística, donde el predictor es la diferencia en puntuaciones latentes.
Dado un conjunto de comparaciones observadas, la función de verosimilitud es el producto de las probabilidades de los resultados observados. La estimación de máxima verosimilitud puede realizarse mediante ajuste proporcional iterativo o métodos de Newton-Raphson. El modelo es identificable hasta una constante aditiva, por lo que se necesita una restricción como fijar la suma de las fortalezas a 1 o fijar la fortaleza de un elemento.
Aplicaciones en Aprendizaje Automático
En el aprendizaje automático moderno, el modelo de Bradley–Terry juega un papel crucial en el aprendizaje de preferencias y el aprendizaje por refuerzo a partir de retroalimentación humana. Por ejemplo, en el entrenamiento de modelos de lenguaje grandes, los anotadores humanos comparan respuestas de diferentes modelos, y el modelo de Bradley–Terry se utiliza para convertir estas preferencias por pares en un modelo de recompensa. Este modelo de recompensa luego guía la optimización del modelo de lenguaje mediante técnicas como RLHF (Aprendizaje por Refuerzo a partir de Retroalimentación Humana) o RLAIF (Aprendizaje por Refuerzo a partir de Retroalimentación de IA).
El modelo también se utiliza en sistemas de recomendación, donde las preferencias de los usuarios se infieren a partir de elecciones por pares, y en recuperación de información para aprender a clasificar. Su simplicidad e interpretabilidad lo convierten en una opción popular para modelar juicios comparativos.
Extensiones y Variantes
Varias extensiones del modelo de Bradley–Terry abordan sus limitaciones. La extensión de Davidson maneja empates añadiendo un parámetro para la probabilidad de un empate. El modelo de Thurstone-Mosteller asume una distribución normal de utilidades latentes en lugar de una logística. Las versiones dinámicas permiten que las fortalezas varíen con el tiempo, como en el sistema de calificación Elo utilizado en ajedrez y otros juegos.
En el análisis deportivo, el modelo puede incorporar la ventaja de campo añadiendo una constante a la log-fortaleza del equipo local. En comparaciones multiclase, el modelo de Plackett-Luce generaliza el modelo de Bradley–Terry a clasificaciones de más de dos elementos.
Aspectos Computacionales
Estimar el modelo de Bradley–Terry a partir de grandes conjuntos de datos puede ser computacionalmente intensivo. Sin embargo, la log-verosimilitud es cóncava, por lo que se garantizan estimaciones de máxima verosimilitud globales. Los algoritmos eficientes incluyen el algoritmo de minorización-maximización (MM) y el descenso de gradiente estocástico, que son particularmente útiles cuando el número de elementos es grande, como en aplicaciones de aprendizaje automático con millones de usuarios o elementos.
Las implementaciones modernas a menudo utilizan diferenciación automática y optimización con Adam, que son estándar en los marcos de aprendizaje profundo. El modelo también puede integrarse en arquitecturas de redes neuronales, donde las fortalezas se aprenden como incrustaciones.
Véase También
Referencias
- Bradley, R. A., & Terry, M. E. (1952). Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324-345.
- Davidson, R. R. (1970). On extending the Bradley-Terry model to accommodate ties in paired comparison experiments. Journal of the American Statistical Association, 65(329), 317-328.
- Plackett, R. L. (1975). The analysis of permutations. Applied Statistics, 24(2), 193-202.