नेटफ्लिक्स प्राइज़ नेटफ्लिक्स, एक वीडियो स्ट्रीमिंग सेवा, द्वारा आयोजित एक खुली प्रतियोगिता थी, जिसका उद्देश्य फिल्मों के लिए उपयोगकर्ता रेटिंग की भविष्यवाणी करने के लिए सर्वोत्तम सहयोगी फ़िल्टरिंग एल्गोरिदम विकसित करना था। 2 अक्टूबर 2006 को शुरू की गई इस प्रतियोगिता में 1,000,000 अमेरिकी डॉलर का भव्य पुरस्कार उस टीम को दिया जाना था जो नेटफ्लिक्स के अपने अनुशंसा एल्गोरिदम, सिनेमैच, में रूट मीन स्क्वेयर एरर (RMSE) में 10% सुधार कर सके। यह प्रतियोगिता नेटफ्लिक्स से जुड़े किसी भी व्यक्ति के लिए खुली नहीं थी और न ही क्यूबा या उत्तर कोरिया जैसे कुछ प्रतिबंधित देशों के निवासियों के लिए। 21 सितंबर 2009 को, भव्य पुरस्कार बेलकोर के प्रैग्मैटिक कैओस टीम को प्रदान किया गया, जिसने सिनेमैच पर 10.06% सुधार हासिल किया।
यह प्रतियोगिता मशीन-लर्निंग के क्षेत्र में एक ऐतिहासिक घटना थी, जिसने एन्सेम्बल विधियों की शक्ति का प्रदर्शन किया और सहयोगी-फ़िल्टरिंग तकनीकों में व्यापक रुचि जगाई। इसने एक अद्वितीय, बड़े पैमाने का डेटासेट और एक स्पष्ट उद्देश्य प्रदान किया, जिसने 150 से अधिक देशों की 20,000 से अधिक टीमों को आकर्षित किया।
समस्या और डेटा सेट
नेटफ्लिक्स ने 100,480,507 रेटिंग्स का एक प्रशिक्षण डेटा सेट प्रदान किया, जो 480,189 उपयोगकर्ताओं ने 17,770 फिल्मों को दी थीं। प्रत्येक प्रशिक्षण रेटिंग <उपयोगकर्ता, फिल्म, ग्रेड की तारीख, ग्रेड> के रूप में एक चतुष्क थी, जहाँ उपयोगकर्ता और फिल्म पूर्णांक आईडी थे और ग्रेड 1 से 5 तक पूर्णांक थे। योग्यता डेटा सेट में <उपयोगकर्ता, फिल्म, ग्रेड की तारीख> के रूप में 2,817,131 से अधिक त्रिक शामिल थे, जिनके ग्रेड केवल जूरी को ज्ञात थे। एक भाग लेने वाली टीम के एल्गोरिदम को पूरे योग्यता सेट पर ग्रेड की भविष्यवाणी करनी थी, लेकिन टीम को केवल आधे डेटा के लिए स्कोर सूचित किया गया था: 1,408,342 रेटिंग्स का एक क्विज़ सेट। दूसरा आधा, 1,408,789 रेटिंग्स का परीक्षण सेट, जूरी द्वारा पुरस्कार विजेताओं को निर्धारित करने के लिए उपयोग किया गया था। केवल न्यायाधीशों को पता था कि कौन सी रेटिंग क्विज़ सेट में थीं और कौन सी परीक्षण सेट में, जिससे परीक्षण सेट पर ओवरफिट करना मुश्किल हो गया।
प्रस्तुत भविष्यवाणियों को RMSE का उपयोग करके वास्तविक ग्रेड के विरुद्ध स्कोर किया गया था, और लक्ष्य इस त्रुटि को जितना संभव हो उतना कम करना था। नेटफ्लिक्स ने प्रशिक्षण डेटा सेट के भीतर 1,408,395 रेटिंग्स का एक प्रोब उपसमुच्चय भी पहचाना, जिसे क्विज़ और परीक्षण सेटों के समान सांख्यिकीय गुण रखने के लिए चुना गया था। प्रशिक्षण सेट इस तरह से बनाया गया था कि औसत उपयोगकर्ता ने 200 से अधिक फिल्मों को रेट किया, और औसत फिल्म को 5,000 से अधिक उपयोगकर्ताओं द्वारा रेट किया गया, लेकिन व्यापक भिन्नता थी: कुछ फिल्मों में केवल 3 रेटिंग थीं, जबकि एक उपयोगकर्ता ने 17,000 से अधिक फिल्मों को रेट किया। ग्राहक गोपनीयता की रक्षा के लिए, कुछ रेटिंग डेटा को जानबूझकर रेटिंग हटाकर, वैकल्पिक रेटिंग और तारीखें डालकर, या रेटिंग तारीखों को संशोधित करके विकृत किया गया था।
RMSE को परिभाषित मीट्रिक के रूप में चुनने पर कुछ विवाद था, क्योंकि यह दावा किया गया था कि RMSE में 1% सुधार भी किसी उपयोगकर्ता के लिए शीर्ष-10 अनुशंसित फिल्मों की रैंकिंग को महत्वपूर्ण रूप से प्रभावित कर सकता है।
पुरस्कार
पुरस्कार नेटफ्लिक्स के अपने एल्गोरिदम, सिनेमैच, पर सुधार पर आधारित थे, या पिछले वर्ष के स्कोर पर यदि किसी टीम ने एक निश्चित सीमा से अधिक सुधार किया था। एक तुच्छ एल्गोरिदम जो प्रत्येक फिल्म के औसत ग्रेड की भविष्यवाणी करता था, क्विज़ सेट पर 1.0540 का RMSE उत्पन्न करता था। सिनेमैच, जिसने बहुत सारे डेटा कंडीशनिंग के साथ सीधे सांख्यिकीय रैखिक मॉडल का उपयोग किया, ने क्विज़ डेटा पर 0.9514 का RMSE प्राप्त किया, जो तुच्छ एल्गोरिदम पर लगभग 10% सुधार था। भव्य पुरस्कार जीतने के लिए, एक टीम को परीक्षण सेट पर 0.8572 का RMSE प्राप्त करना था, जो सिनेमैच पर 10% सुधार था।
जब तक किसी टीम ने भव्य पुरस्कार नहीं जीता, तब तक हर साल सर्वोत्तम परिणाम के लिए $50,000 का प्रगति पुरस्कार दिया जाता था, बशर्ते एल्गोरिदम ने पिछले प्रगति पुरस्कार विजेता (या पहले वर्ष में सिनेमैच पर) की तुलना में क्विज़ सेट पर RMSE में कम से कम 1% सुधार किया हो। पुरस्कार का दावा करने के लिए, एक प्रतिभागी को एक सप्ताह के भीतर जूरी को स्रोत कोड और एल्गोरिदम का विवरण प्रदान करना था, और सत्यापन के बाद, नेटफ्लिक्स को एक गैर-अनन्य लाइसेंस प्रदान करना था। नेटफ्लिक्स केवल विवरण प्रकाशित करेगा, स्रोत कोड नहीं। टीमें जितनी चाहें उतनी भविष्यवाणी सेट जमा कर सकती थीं, शुरू में सप्ताह में एक बार लेकिन बाद में दिन में एक बार। एक बार जब किसी टीम ने 10% सुधार हासिल कर लिया, तो जूरी ने अंतिम कॉल जारी किया, जिससे सभी टीमों को अपने अंतिम प्रविष्टियाँ जमा करने के लिए 30 दिन मिले। प्रतियोगिता तब तक चलती रहेगी जब तक भव्य पुरस्कार विजेता घोषित नहीं हो जाता, लेकिन यदि कोई विजेता नहीं निकला तो कम से कम पाँच वर्षों (2 अक्टूबर 2011 तक) के बाद नेटफ्लिक्स के विवेक पर समाप्त कर दी जाती।
वर्षों में प्रगति
प्रतियोगिता 2 अक्टूबर 2006 को शुरू हुई। 8 अक्टूबर तक, WXYZConsulting नामक एक टीम ने पहले ही सिनेमैच के परिणामों को पीछे छोड़ दिया था। 15 अक्टूबर तक, तीन टीमों ने सिनेमैच को हरा दिया था, एक ने 1.06% से, जो वार्षिक प्रगति पुरस्कार के लिए अर्हता प्राप्त करने के लिए पर्याप्त था। जून 2007 तक, 150 से अधिक देशों की 20,000 से अधिक टीमों ने पंजीकरण किया था, और 2,000 टीमों ने 13,000 से अधिक भविष्यवाणी सेट जमा किए थे।
पहले वर्ष के दौरान, कई अग्रणी टीमों ने पहला स्थान बदला, जिनमें WXYZConsulting (वेई ज़ू और यी झांग), टोरंटो विश्वविद्यालय से प्रोफेसर जेफ्री हिंटन के नेतृत्व में ML@UToronto A, बुडापेस्ट प्रौद्योगिकी विश्वविद्यालय से ग्रेविटी, और AT&T लैब्स से बेलकोर शामिल थे। इन टीमों ने विभिन्न तकनीकों का उपयोग किया, जिनमें मैट्रिक्स-फैक्टराइज़ेशन, एन्सेम्बल-लर्निंग, और तंत्रिका-नेटवर्क दृष्टिकोण शामिल थे, अक्सर वृद्धिशील सुधार प्राप्त करने के लिए कई मॉडलों को संयोजित किया।
प्रभाव और विरासत
नेटफ्लिक्स प्राइज़ का अनुशंसा-प्रणालियों और मशीन-लर्निंग के क्षेत्र पर महत्वपूर्ण प्रभाव पड़ा। इसने अत्याधुनिक परिणाम प्राप्त करने के लिए कई भविष्यवाणी मॉडलों के मिश्रण की प्रभावशीलता का प्रदर्शन किया, एक तकनीक जो उद्योग में व्यापक रूप से अपनाई गई। प्रतियोगिता ने बड़े पैमाने पर, वास्तविक-विश्व डेटासेट पर डेटा-माइनिंग के महत्व को भी उजागर किया और सहयोगी-फ़िल्टरिंग एल्गोरिदम में अनुसंधान को प्रेरित किया। विजेता टीम, बेलकोर के प्रैग्मैटिक कैओस, ने अंतिम 10.06% सुधार प्राप्त करने के लिए प्रतिबंधित-बोल्ट्ज़मैन-मशीनों और मैट्रिक्स-फैक्टराइज़ेशन वेरिएंट सहित 100 से अधिक विभिन्न मॉडलों को संयोजित किया।
प्रतियोगिता ने डेटा साझाकरण में गोपनीयता के मुद्दों के बारे में जागरूकता भी बढ़ाई, क्योंकि नेटफ्लिक्स को बाद में डेटासेट के जारी होने पर मुकदमे का सामना करना पड़ा, जो संभावित रूप से उपयोगकर्ताओं की पहचान कर सकता था। इन चिंताओं के बावजूद, नेटफ्लिक्स प्राइज़ कृत्रिम-बुद्धिमत्ता और डेटा-विज्ञान के इतिहास में एक बेंचमार्क बना हुआ है, जो समान प्रतियोगिताओं को प्रेरित करता है और स्ट्रीमिंग सेवाओं और ई-कॉमर्स प्लेटफार्मों द्वारा उपयोग की जाने वाली आधुनिक अनुशंसा प्रणालियों के विकास में योगदान देता है।
यह भी देखें
- मशीन-लर्निंग
- collaborative-filtering
- recommender-systems
- data-mining