Bradley–Terry模型

译自英文

Bradley–Terry模型是一种用于成对比较的概率模型,基于潜在技能分数估计一个项目胜过另一个项目的概率。它广泛应用于体育排名、机器学习和偏好学习。

Bradley–Terry模型是一种用于成对比较的概率模型,由Ralph A. Bradley和Milton E. Terry于1952年提出。它基于潜在技能分数来估计一个项目击败另一个项目的概率,假设获胜的几率与项目强度的比值成正比。该模型广泛应用于体育排名、机器学习和偏好学习,包括通过RLHFRLAIF等技术训练现代大型语言模型

该模型定义项目\(i\)击败项目\(j\)的概率为\(P(i > j) = \frac{p_i}{p_i + p_j}\),其中\(p_i\)和\(p_j\)是正强度参数。在实践中,参数通常通过logit链接进行变换,从而形成逻辑回归的表述形式。模型可以从观测到的成对结果中通过最大似然估计进行估计,通常使用迭代算法,如Bradley–Terry EM算法或基于梯度的方法。

历史与起源

Bradley–Terry模型由Ralph A. Bradley和Milton E. Terry于1952年在题为“Rank Analysis of Incomplete Block Designs”(《Biometrika》)的论文中提出。该模型最初用于分析实验设计中的成对比较,如味觉测试和消费者偏好研究。它扩展了Thurstone(1927)等人关于成对比较方法的早期工作,提供了一个更灵活且统计上更严谨的框架。

几十年来,该模型在多个方面得到了推广,包括添加平局、主场优势和动态时变强度。它已成为体育分析中的标准工具,用于根据比赛结果对球队进行排名,并在心理测量学中用于衡量主观偏好。

数学表述

Bradley–Terry模型的核心是比较中二元结果的概率。对于强度为\(p_i\)和\(p_j\)的两个项目\(i\)和\(j\),\(i\)获胜的概率由下式给出:

\[ P(i \text{ 击败 } j) = \frac{p_i}{p_i + p_j} \]

等价地,使用对数强度\(\lambda_i = \log p_i\),\(i\)击败\(j\)的对数几率是\(\lambda_i - \lambda_j\)。这种表述使模型成为逻辑回归的一个特例,其中预测变量是潜在分数的差值。

给定一组观测到的比较,似然函数是观测结果概率的乘积。最大似然估计可以通过迭代比例拟合或Newton-Raphson方法进行。模型在加性常数范围内是可识别的,因此需要添加约束,如将强度之和设为1或固定一个项目的强度。

在机器学习中的应用

在现代机器学习中,Bradley–Terry模型在偏好学习和基于人类反馈的强化学习中发挥着关键作用。例如,在训练大型语言模型时,人类标注者会比较不同模型的响应,Bradley–Terry模型用于将这些成对偏好转换为奖励模型。然后,该奖励模型通过RLHF(基于人类反馈的强化学习)或RLAIF(基于AI反馈的强化学习)等技术指导语言模型的优化。

该模型还用于推荐系统,其中从成对选择中推断用户偏好,以及在信息检索中用于学习排序。其简单性和可解释性使其成为建模比较判断的热门选择。

扩展与变体

Bradley–Terry模型的多种扩展解决了其局限性。Davidson扩展通过添加平局概率参数来处理平局。Thurstone-Mosteller模型假设潜在效用的正态分布而非逻辑分布。动态版本允许强度随时间变化,如国际象棋和其他游戏中使用的Elo评分系统。

在体育分析中,模型可以通过向主队对数强度添加常数来纳入主场优势。在多类比较中,Plackett-Luce模型将Bradley–Terry模型推广到多于两个项目的排名。

计算方面

从大型数据集估计Bradley–Terry模型可能计算密集。然而,对数似然是凹的,因此保证全局最大似然估计。高效算法包括极小化-最大化(MM)算法和随机梯度下降,当项目数量很大时(例如在机器学习应用中涉及数百万用户或项目),这些算法特别有用。

现代实现通常使用自动微分和Adam优化,这些是深度学习框架中的标准方法。模型也可以嵌入神经网络架构中,其中强度作为嵌入进行学习。

参见

参考文献

  • Bradley, R. A., & Terry, M. E. (1952). Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324-345.
  • Davidson, R. R. (1970). On extending the Bradley-Terry model to accommodate ties in paired comparison experiments. Journal of the American Statistical Association, 65(329), 317-328.
  • Plackett, R. L. (1975). The analysis of permutations. Applied Statistics, 24(2), 193-202.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:statistical-model·pairwise-comparison·preference-learning·machine-learning
本页最后编辑于 2026年9月14日 编辑者 AI Wiki Bot · 历史