ब्रैडली–टेरी मॉडल एक प्रायिकतात्मक मॉडल है जो जोड़ीवार तुलनाओं के लिए उपयोग किया जाता है, जिसे 1952 में राल्फ ए. ब्रैडली और मिल्टन ई. टेरी द्वारा प्रस्तुत किया गया था। यह अव्यक्त कौशल स्कोर के आधार पर यह अनुमान लगाता है कि एक वस्तु दूसरी वस्तु को हराने की प्रायिकता क्या है, यह मानते हुए कि जीतने की संभावना वस्तुओं की शक्तियों के अनुपात के समानुपाती होती है। यह मॉडल खेल रैंकिंग, मशीन लर्निंग और वरीयता सीखने में व्यापक रूप से लागू होता है, जिसमें आधुनिक बड़े भाषा मॉडल का प्रशिक्षण शामिल है, जो RLHF और RLAIF जैसी तकनीकों के माध्यम से किया जाता है।
मॉडल परिभाषित करता है कि वस्तु \(i\) के वस्तु \(j\) को हराने की प्रायिकता \(P(i > j) = \frac{p_i}{p_i + p_j}\) है, जहाँ \(p_i\) और \(p_j\) धनात्मक शक्ति पैरामीटर हैं। व्यवहार में, पैरामीटरों को अक्सर लॉगिट लिंक का उपयोग करके रूपांतरित किया जाता है, जिससे लॉजिस्टिक रिग्रेशन सूत्रीकरण प्राप्त होता है। मॉडल का अनुमान देखे गए जोड़ीवार परिणामों से अधिकतम संभावना अनुमान का उपयोग करके लगाया जा सकता है, आमतौर पर ब्रैडली–टेरी EM एल्गोरिथ्म या ग्रेडिएंट-आधारित विधियों जैसे पुनरावृत्त एल्गोरिथ्मों के माध्यम से।
इतिहास और उत्पत्ति
ब्रैडली–टेरी मॉडल 1952 में राल्फ ए. ब्रैडली और मिल्टन ई. टेरी द्वारा "रैंक एनालिसिस ऑफ इनकम्प्लीट ब्लॉक डिज़ाइन्स" (बायोमेट्रिका) शीर्षक वाले एक पेपर में प्रस्तुत किया गया था। यह मॉडल मूल रूप से प्रयोगात्मक डिज़ाइनों में युग्मित तुलनाओं का विश्लेषण करने के लिए विकसित किया गया था, जैसे कि स्वाद परीक्षण और उपभोक्ता वरीयता अध्ययन। इसने थर्स्टोन (1927) और अन्य लोगों द्वारा युग्मित तुलनाओं की विधि पर पहले के कार्य का विस्तार किया, जिससे एक अधिक लचीला और सांख्यिकीय रूप से कठोर ढांचा प्रदान किया गया।
दशकों में, मॉडल को विभिन्न तरीकों से सामान्यीकृत किया गया है, जिसमें टाई, होम-फील्ड लाभ और गतिशील समय-परिवर्तनशील शक्तियों का जोड़ शामिल है। यह खेल विश्लेषण में एक मानक उपकरण बन गया है, जहाँ इसका उपयोग खेल परिणामों के आधार पर टीमों को रैंक करने के लिए किया जाता है, और मनोमिति में व्यक्तिपरक वरीयताओं को मापने के लिए किया जाता है।
गणितीय सूत्रीकरण
ब्रैडली–टेरी मॉडल का मूल एक तुलना में द्विआधारी परिणाम की प्रायिकता है। दो वस्तुओं \(i\) और \(j\) के लिए शक्तियों \(p_i\) और \(p_j\) के साथ, \(i\) के जीतने की प्रायिकता निम्न द्वारा दी गई है:
\[ P(i \text{ जीतता है } j) = \frac{p_i}{p_i + p_j} \]
समतुल्य रूप से, लॉग-शक्तियों \(\lambda_i = \log p_i\) का उपयोग करके, \(i\) के \(j\) को हराने का लॉग-ऑड्स \(\lambda_i - \lambda_j\) है। यह सूत्रीकरण मॉडल को लॉजिस्टिक रिग्रेशन का एक विशेष मामला बनाता है, जहाँ भविष्यवक्ता अव्यक्त स्कोर में अंतर है।
देखी गई तुलनाओं के एक समूह को देखते हुए, संभावना फलन देखे गए परिणामों की प्रायिकताओं का गुणनफल है। अधिकतम संभावना अनुमान पुनरावृत्त आनुपातिक फिटिंग या न्यूटन-राफसन विधियों का उपयोग करके किया जा सकता है। मॉडल एक योगात्मक स्थिरांक तक पहचाना जा सकता है, इसलिए शक्तियों के योग को 1 पर सेट करने या एक वस्तु की शक्ति को स्थिर करने जैसा एक बाधा आवश्यक है।
मशीन लर्निंग में अनुप्रयोग
आधुनिक मशीन लर्निंग में, ब्रैडली–टेरी मॉडल वरीयता सीखने और मानव प्रतिक्रिया से सुदृढीकरण सीखने में महत्वपूर्ण भूमिका निभाता है। उदाहरण के लिए, बड़े भाषा मॉडल के प्रशिक्षण में, मानव एनोटेटर विभिन्न मॉडलों से प्रतिक्रियाओं की तुलना करते हैं, और ब्रैडली–टेरी मॉडल का उपयोग इन जोड़ीवार वरीयताओं को एक पुरस्कार मॉडल में परिवर्तित करने के लिए किया जाता है। यह पुरस्कार मॉडल फिर RLHF (मानव प्रतिक्रिया से सुदृढीकरण सीखना) या RLAIF (AI प्रतिक्रिया से सुदृढीकरण सीखना) जैसी तकनीकों के माध्यम से भाषा मॉडल के अनुकूलन का मार्गदर्शन करता है।
मॉडल का उपयोग अनुशंसा प्रणालियों में भी किया जाता है, जहाँ उपयोगकर्ता वरीयताओं का अनुमान जोड़ीवार विकल्पों से लगाया जाता है, और सूचना पुनर्प्राप्ति में रैंक करना सीखने के लिए किया जाता है। इसकी सरलता और व्याख्यात्मकता इसे तुलनात्मक निर्णयों के मॉडलिंग के लिए एक लोकप्रिय विकल्प बनाती है।
विस्तार और प्रकार
ब्रैडली–टेरी मॉडल के कई विस्तार इसकी सीमाओं को संबोधित करते हैं। डेविडसन विस्तार ड्रॉ की प्रायिकता के लिए एक पैरामीटर जोड़कर टाई को संभालता है। थर्स्टोन-मोस्टेलर मॉडल लॉजिस्टिक के बजाय अव्यक्त उपयोगिताओं का सामान्य वितरण मानता है। गतिशील संस्करण शक्तियों को समय के साथ बदलने की अनुमति देते हैं, जैसा कि शतरंज और अन्य खेलों में उपयोग की जाने वाली एलो रेटिंग प्रणाली में होता है।
खेल विश्लेषण में, मॉडल होम टीम की लॉग-शक्ति में एक स्थिरांक जोड़कर होम-फील्ड लाभ को शामिल कर सकता है। बहु-वर्ग तुलनाओं में, प्लैकेट-लूस मॉडल ब्रैडली–टेरी मॉडल को दो से अधिक वस्तुओं की रैंकिंग के लिए सामान्यीकृत करता है।
कम्प्यूटेशनल पहलू
बड़े डेटासेट से ब्रैडली–टेरी मॉडल का अनुमान लगाना कम्प्यूटेशनल रूप से गहन हो सकता है। हालाँकि, लॉग-संभावना उत्तल है, इसलिए वैश्विक अधिकतम संभावना अनुमान की गारंटी है। कुशल एल्गोरिथ्मों में माइनराइज़ेशन-मैक्सिमाइज़ेशन (MM) एल्गोरिथ्म और स्टोकेस्टिक ग्रेडिएंट डिसेंट शामिल हैं, जो विशेष रूप से तब उपयोगी होते हैं जब वस्तुओं की संख्या बड़ी होती है, जैसे कि लाखों उपयोगकर्ताओं या वस्तुओं वाले मशीन लर्निंग अनुप्रयोगों में।
आधुनिक कार्यान्वयन अक्सर स्वचालित विभेदन और Adam अनुकूलन का उपयोग करते हैं, जो डीप लर्निंग फ्रेमवर्क में मानक हैं। मॉडल को तंत्रिका नेटवर्क आर्किटेक्चर में भी एम्बेड किया जा सकता है, जहाँ शक्तियों को एम्बेडिंग के रूप में सीखा जाता है।
यह भी देखें
संदर्भ
- ब्रैडली, आर. ए., और टेरी, एम. ई. (1952)। अपूर्ण ब्लॉक डिज़ाइनों का रैंक विश्लेषण। बायोमेट्रिका, 39(3/4), 324-345।
- डेविडसन, आर. आर. (1970)। युग्मित तुलना प्रयोगों में टाई को समायोजित करने के लिए ब्रैडली-टेरी मॉडल का विस्तार। जर्नल ऑफ द अमेरिकन स्टैटिस्टिकल एसोसिएशन, 65(329), 317-328।
- प्लैकेट, आर. एल. (1975)। क्रमपरिवर्तनों का विश्लेषण। एप्लाइड स्टैटिस्टिक्स, 24(2), 193-202।