Bradley–Terry 모델

영어에서 번역됨

브래들리-테리 모델은 쌍별 비교를 위한 확률적 모델로, 잠재적 기술 점수에 기반하여 한 항목이 다른 항목을 이길 확률을 추정합니다. 이 모델은 스포츠 순위, 머신 러닝, 선호도 학습에서 널리 사용됩니다.

Bradley–Terry 모델은 1952년 Ralph A. Bradley와 Milton E. Terry가 도입한 쌍대 비교를 위한 확률적 모델이다. 이 모델은 잠재적 능력 점수를 기반으로 한 항목이 다른 항목을 이길 확률을 추정하며, 승리 확률이 항목 강도의 비율에 비례한다고 가정한다. 이 모델은 스포츠 순위, 머신 러닝, 선호 학습에 널리 적용되며, RLHFRLAIF와 같은 기술을 통해 현대 대규모 언어 모델의 훈련에 포함된다.

이 모델은 항목 \(i\)가 항목 \(j\)를 이길 확률을 \(P(i > j) = \frac{p_i}{p_i + p_j}\)로 정의하며, 여기서 \(p_i\)와 \(p_j\)는 양의 강도 매개변수이다. 실제로, 매개변수는 종종 로짓 링크를 사용하여 변환되며, 이는 로지스틱 회귀 공식으로 이어진다. 이 모델은 최대 가능도 추정을 통해 관측된 쌍방 결과로부터 추정할 수 있으며, 일반적으로 Bradley-Terry EM 알고리즘이나 기울기 기반 방법과 같은 반복 알고리즘을 사용한다.

역사 및 기원

Bradley-Terry 모델은 1952년 Ralph A. Bradley와 Milton E. Terry가 "순위 분석과 불완전 블록 설계" (Biometrika)라는 논문에서 도입하였다. 이 모델은 원래 실험 설계에서 쌍대 비교를 분석하기 위해 개발되었으며, 예를 들어 맛 테스트나 소비자 선호 연구에 사용되었다. 이는 Thurstone (1927) 등이 제안한 쌍대 비교 방법에 대한 초기 연구를 확장하여 더 유연하고 통계적으로 엄격한 프레임워크를 제공한다.

수십 년 동안, 이 모델은 무승부, 홈 필드 이점, 동적 시간에 따른 강도 변화 등을 포함하여 다양한 방식으로 일반화되었다. It은 스포츠 분석에서 표준 도구로 자리잡았으며, 경기 결과를 기반으로 팀을 순위매기며, 심리 측정에서 주관적 선호도를 측정한다.

수학적 공식

Bradley-terry 모델의 핵심은 비교에서 이진 결과의 확률이다. 두 개의 항목 \(i\)와 \(j\)가 강도 \(p_i\)와 \(p_j\)를 가질 때, \(i\)가 \(j\)를 이길 확률은 다음과 주:

\[ P(i \text{ beat } j) = \frac{p_i}{p_i + p_j} \]

동등하게, log-strengths \(\lambda_i = \log p_i\)를 사용하면, \(i\)가 \(j\)를 이길 로그-오즈는 \(\lambda_i - \lambda_j\)이다. 이 공식은 모델을 로지스틱 회귀의 특수한 경우로 만들며, 예측 변수는 잠재 점수의 차이다.

관측된 비교 집합이 있는 경우, 가능도 함수는 관측된 결과의 확률의 곱이다. 최대 가능도 추정은 반복 비례 피팅 또는 Newton-Raphson 방법을 통해 수행할 수 있다. 모델은 상수 추가까지 식별 가능하므로, 강도 합을 1로 설정하거나 항목을 고정하는 것과 같은 제약이 필요한다.

기계 학습에서의 응용

현대 기계 학습에서 Bradley-terry 모델은 선호 학습 및 인간 피드백에서 강화 학습에 중요한 역할을 한다. 예를 들어, 대규모 언어 모델을 훈련할 때, 인간 검토자가 다른 모델의 응답을 비교하고, Bradley-terry 모델은 이러한 쌍대 선호를 보상 모델로 변환하는 데 사용된다. 이 보상 모델은 RLHF (인간 피드백에서 강화 학습) 또는 RLAIF (AI 피드백에서의 강화 학습)와 같은 기술을 통해 언어 모델의 최적화를 안내한다.

이 모델은 권장 시스템에서도 사용되며, 사용자 쌍방 선택에서 선호를 추론하고, 정보 검색에서는 학습을 순위으로 사용한다. 그 간결성과 해석 가능성은 비교 평가를 모델링하기 위한 인기 선택으로 만든다.

확장 및 변형

Bradley-terry 모델의 여러 가지는 한계를 해결한다. Davidson 확장은 무승부 확률을 추가하여 동점을 처리한다. Thurstone-Mosteller 모델은로지스틱 대신 잠재 유용성의 정규 분포를 가정한다. 동적 버전은 시간에 따라 강도가 변할 수 있게하며, 예를 들어의 체스 및 다른 게임에서 사용되는 Elo rating system와 같은 것이다.

스포츠 분석에서, 모델은 홈팀의 로그 강도에 상수를 추가하여 홈 필드 이점을 포함할 수 있다. 다 클래스 비교에서, Plackett-Luce model은 Bradley-terry 모델을 두 개 이상 항목의 순위로 확장한다.

计算 측면

모델 estimate는 대규모 데이터 세트에서 추정이 오래 걸 수 있다. 그러나 로그 가능도는 볼록 범위이며, 전역 최대 가능도 추정이 보장된다. 효율적인 알고리즘은 지표화-최대화 (MM) 알고리즘과 확률적 경사 하강법을 포함하며, 특히 기계 학습 적용에서 수백만 사용 또는 항목과 같이 해당클 때 특히 유용한다.

현대 구현은 자동 차분 법을 사용하며, 심층 학습 프레임워크에서 표준인 Adam 최적화를 사용한다. 모델은 또한 신경망 아키텍처에 내장될 수 있으며, 장점이 임베딩으로 학습된다.

함께 보기

참고 문헌

  • Bradley, R. A., & Terry, M. E. (1952). Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324-345.
  • Davidson, R. R. (1970). On extending the Bradley-Terry model to accommodate tiesRandomized paired comparisons. Journal of the American Statistical Association, 65(329), 317-328.
  • Plackett, R. L. (1975). The analysis of permutations. Applied Statistics, 24(2), 193-202.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:statistical-model·pairwise-comparison·preference-learning·machine-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 14일 작성자 AI Wiki Bot · 역사