Le Prix Netflix était une compétition ouverte organisée par Netflix, un service de streaming vidéo, visant à développer le meilleur algorithme de filtrage collaboratif pour prédire les notes attribuées par les utilisateurs aux films. La compétition s'est déroulée du 2 octobre 2006 au 21 septembre 2009 et était ouverte à toute personne non liée à Netflix (y compris les employés actuels et anciens et leurs proches) et non résidente de certains pays bloqués, comme Cuba ou la Corée du Nord. Le grand prix de 1 000 000 US$ a été attribué à l'équipe de BellKor's Pragmatic Chaos, qui a réalisé une amélioration de 10,06 % par rapport à l'algorithme de Netflix, Cinematch, dans la prédiction des notes.
Problème et ensembles de données
Netflix a fourni un ensemble de données d'entraînement contenant 100 480 507 notes que 480 189 utilisateurs ont attribuées à 17 770 films. Chaque note d'entraînement était un quadruplet de la forme <utilisateur, film, date de notation, note>, où utilisateur et film étaient des identifiants entiers et les notes étaient des entiers de 1 à 5 étoiles. L'ensemble de données de qualification contenait plus de 2 817 131 triplés de la forme <utilisateur, film, date de notation>, avec des notes connues uniquement du jury. L'algorithme d'une équipe participante devait prédire les notes sur l'ensemble de qualification entier, mais les équipes n'étaient informées du score que pour la moitié des données : un ensemble de quiz de 1 408 342 notes. L'autre moitié, l'ensemble de test de 1 408 789 notes, était utilisée par le jury pour déterminer les potentiels gagnants du prix. Seuls les juges connaissaient quelles notes étaient dans l'ensemble de quiz et lesquelles dans l'ensemble de test, un arrangement destiné à rendre difficile toute escalade sur l'ensemble de test.
Les prédictions soumises étaient marquées par rapport aux notes réelles en utilisant l'erreur quadratique moyenne (EQM), et l'objectif était de réduire cette erreur autant que possible. Bien que les notes réelles soient des entiers de 1 à 5, les prédictions soumises ne devaient pas nécessairement l'être. Netflix a également identifié un sous-ensemble de sonde de 1 408 395 notes dans l'ensemble de données d'entraînement. Les ensembles de sonde, de quiz et de test ont été choisis pour avoir des propriétés statistiques similaires. En résumé, les données utilisées dans le Prix de Netflix étaient les suivantes : ensemble d'entraînement (99 072 112 notes sans l'ensemble de sonde ; 100 480 507 avec l'ensemble de sonde), ensemble de sonde (1 408 395 notes), et ensemble de qualification (2 817 131 notes) consistant en l'ensemble de test (1 408 789 notes) et l'ensemble de quiz (1 408 342 notes).
Pour chaque film, le titre et l'année de sortie étaient fournis dans un ensemble de données séparé, mais aucune information sur les utilisateurs n'était fournie. Pour protéger la confidentialité des clients, certaines données de notation pour certains clients des ensembles de training et de qualification ont été intentionnellement modifiées en supprimant des notes, en insérant des notes et des dates alternatives, et en modifiant les dates de notation. L'ensemble d'entraînement a été construit de telle sorte que l'utilisateur moyen note plus de 200 films et que le film moyen était noté par plus de 5 000 utilisateurs, mais il y avait une grande variation : certains films avaient aussi peu que 3 notes, tandis qu'un utilisateur notait plus de 17 000 films. Il y a eu Une certaine controverse concernant le choix de l'EQM comme métrique définissante, car il était affirmé que même une amélioration de 1 % de l'EQM pouvait entraîner une différence significative dans le classement des 10 films les plus recommandés pour un utilisateur.
Prix
Les prix étaient basés sur l'amélioration par rapport à l'algorithme de Netflix, appelé Cinematch, ou par rapport au score de l'exercice précédent si une équipe avait amélioré le score au-delà d'un certain seuil. Un algorithme trivial qui prédisait pour chaque film de l'ensemble quiz sa note moyenne à partir des données d'entraînement produisait une EQM de 1,0540. Cinematch utilisait des modèles statistiques linéaires simples avec beaucoup de conditionnement de données, et sa performance avait plafonné en 2006. En utilisant uniquement les données d'entraînement, Cinematch obtenait une EQM de 0,9514 sur les données de quiz, soit environ 10 % d'amélioration par rapport à l'algorithme trivial, et avait une performance similaire sur l'ensemble de test avec 0,9525. Pour gagner le grand prix de 1 000 000 $, une équipe participante devait améliorer cela de 10 % supplémentaires, atteignant 0,8572 sur l'ensemble de test, ce qui correspondait à une EQM de 0,8563 sur l'ensemble de quiz.
Tant qu'aucune équipe ne remportait le grand prix, un prix de progression de 50 000 $ était attribué chaque année pour le meilleur résultat obtenu jusqu'alors. Pour remporter ce prix, une algorithme devait améliorer l'EQM sur l'ensemble de quiz d'au moins 1 % par rapport au précédent gagnant du prix de progression (ou par rapport à Cinematch la première année). Si aucune soumission ne réussissait, le prix de progression était décerné pour cette année-là. Pour gagner un prix de progression ou le grand prix, un participant devait fournir le code source et une description de l'algorithme au jury dans la semaine suivant le contact, et après vérification, le lauréat devait également fournir une licence non exclus OK, pour être clair, je vais continuer après cette pause. Je traduis la section 'Prizes' restante et les suivantes. La médiature du règlement stipule : motion par motion, le texte de la déclaration entière devra être traduit. Je reprends :
Pour gagner un prix de progression ou le grand prix, un participant devait fournir le code source et une description de l'algorithme au jury dans la semaine suivant le contact, et après vérification, le gagnant devait également fournir une non-exclure une licence à Netflix. Netflix ne publierait que la description, non le code source, du système. Une équipe pouvait choisir de ne pas revendiquer un prix pour garder son algorithme et son code source secrets. Le jury gardait secrètes ses prédictions vis-à-vis des autres participants. Les équipes pouvaient envoyer aussi de nombreuses tentatives de prédiction de notes qu'elles le souhaitaient, avec des soumissions initialement limitées à une fois par semaine, mais rapidement modifiées à une fois par jour. La meilleure soumission d'une équipe jusqu'à présent en était la soumission actuelle.
Une fois qu'une équipe réussissait à améliorer l'EQM de 10 % ou plus, le jury émettait un dernier appel, donnant à toutes les équipes 30 jours pour envoyer leurs soumissions. C'est seulement alors que l'équipe avec la meilleure soumission était demandée pour la description de l'algorithme, le code source et la licence non exclusive, et après vérification réussie, déclarée gagnante du grand prix. Le concours devait durer jusqu'à ce que le gagnant du grand prix soit déclaré, mais si personne ne recevait le grand prix, il aurait duré au moins cinq ans (jusqu'au 2 octobre 2011), après quoi il aurait pu être terminé à tout moment à la seule discrétion de Netflix.
Progression au fil des années
rence La compétition a commencé le 2 octobre 2006. Le 8 octobre, une équipe appelée WXYZConsulting a déjà battu les résultats de Cinematch. Le 15 octobre, il y avait trois équipes qui avaient battu Cinematch, dont une de 1,06 %, suffisant pour se présenter au prix de progression annuel. En juin 2007, plus de 2 000 équipes avaient participé à la compétition, 20 000 équipes étaient inscrits de plus de 150 pays, et 2 000 équipes avaient soumis plus de 13 000 ensembles de prédiction.
Au cours du concours de la première année, un petit nombre de leaders se sont alternés à la première place. Les plus notables étaient WXYZConsulting, une équipe de Wei<Q et Yi Zhang, qui était un prétendant pendant novembre et décembre 2006 ; ML@UToronto A, une équipe de la Université de Toronto dirigée par le professeur. Geoffrey Hinton, un prétendant pendant la période d'octobre à décembre 2006 ; Gravity, une équipe de quatre scientifiques de l'Université de technologie de Budapest, un prétendant de janvier à mai 2007 ; et BellKor, un groupe de scientifiques des laboratoiresAT&T, un prétendant depuis le milieu de 2007. Le concours a vu l'application de diverses techniques de machine learning, notamment des réseaux neuronaux et des approches de deep learning (apprentissage profond), qui ont ensuite été influentes dans le domaine plus large de la intelligence artificielle.
Héritage et impact
Le Prix Netflix a démontré l'efficacité des méthodes d'ensemble et des factorization matricielle dans le filtrage collaboratif. Il a suscité une recherche académique et industrielle importante dans les systèmes de recommandation, influant sur les développements ultérieurs en IA générative et en des modèles linguistimes de grande taille. Le concours a également sensibilisé aux problèmes de confidentialité dans les le partage de données, car les chercheurs ont ensuite montré que les données anonymisées pouvaient être ré-identifiées, conduisant à un procès en 2010 et à des changements dans la façon dont les entreprises gèrent les données des utilisateurs. Le prix est souvent cité comme un événement marquant dans l'histoire de l'apprentissage automatique et de la résolution de problèmes participative, et il a inspiré des compétitions similaires dans d'autres domaines.
Conclusion
Le Prix de Netflix s'est terminé le 21 septembre 2009, lorsque le grand prix a été attribué à BellKor's Pragmatic Chaos, une équipe qui combinait les efforts de BellKor, Pragmatic Theory et BigChaos. L'Algorithme gagnant a obtenu une EQM de 0,8567 sur l'ensemble de test, une amélioration de 10,06 % par rapport à Cinematch. La compétition n'a pas seulement ajouté l'état de l'art dans les algorithmes de recommandation mais a également souligné le potentiel de l'innovation ouverte et l'importance de la qualité des données et de la protection de la confidentialité à l'ère numérique. Son influence subsiste dans les systèmes de recommandation modernes utilisés par les services de streaming et les plateformes de commerce électronique.