Le Prix Netflix était une compétition ouverte organisée par Netflix, un service de streaming vidéo, visant à développer le meilleur algorithme de filtrage collaboratif pour prédire les notes des films. Lancé le 2 octobre 2006, le concours offrait un grand prix d'un million de dollars américains à toute équipe capable d'améliorer l'algorithme de recommandation propre à Netflix, Cinematch, de 10 % en termes d'erreur quadratique moyenne (RMSE). La compétition était ouverte à toute personne non liée à Netflix et ne résidant pas dans certains pays bloqués, comme Cuba ou la Corée du Nord. Le 21 septembre 2009, le grand prix a été décerné à l'équipe BellKor's Pragmatic Chaos, qui a réalisé une amélioration de 10,06 % par rapport à Cinematch.
La compétition a été un événement marquant dans le domaine de l'apprentissage automatique, démontrant la puissance des méthodes d'ensemble et suscitant un large intérêt pour les techniques de filtrage collaboratif. Elle a fourni un ensemble de données unique à grande échelle et un objectif clair, attirant plus de 20 000 équipes provenant de plus de 150 pays.
Problème et ensembles de données
Netflix a fourni un ensemble de données d'entraînement de 100 480 507 notes attribuées par 480 189 utilisateurs à 17 770 films. Chaque note d'entraînement était un quadruplet de la forme <utilisateur, film, date de la note, note>, où utilisateur et film étaient des identifiants entiers et les notes étaient des entiers de 1 à 5. L'ensemble de données de qualification contenait plus de 2 817 131 triplets de la forme <utilisateur, film, date de la note>, dont les notes n'étaient connues que du jury. L'algorithme d'une équipe participante devait prédire les notes sur l'ensemble de qualification entier, mais l'équipe n'était informée du score que pour la moitié des données : un ensemble de quiz de 1 408 342 notes. L'autre moitié, l'ensemble de test de 1 408 789 notes, était utilisée par le jury pour déterminer les gagnants du prix. Seuls les juges savaient quelles notes se trouvaient dans l'ensemble de quiz et lesquelles dans l'ensemble de test, ce qui rendait difficile le surajustement sur l'ensemble de test.
Les prédictions soumises étaient évaluées par rapport aux notes réelles à l'aide de la RMSE, et l'objectif était de réduire cette erreur autant que possible. Netflix a également identifié un sous-ensemble de 1 408 395 notes au sein de l'ensemble d'entraînement, choisi pour avoir des propriétés statistiques similaires à celles des ensembles de quiz et de test. L'ensemble d'entraînement a été construit de telle sorte que l'utilisateur moyen avait noté plus de 200 films et que le film moyen avait été noté par plus de 5 000 utilisateurs, mais il y avait une grande variance : certains films n'avaient que 3 notes, tandis qu'un utilisateur avait noté plus de 17 000 films. Pour protéger la vie privée des clients, certaines données de notation ont été délibérément perturbées en supprimant des notes, en insérant des notes et des dates alternatives, ou en modifiant les dates.
Il y a eu une certaine controverse sur le choix de la RMSE comme métrique de référence, car il a été affirmé qu'une amélioration même de 1 % de la RMSE pouvait affecter de manière significative le classement des 10 meilleurs films recommandés pour un utilisateur.
Prix
Les prix étaient basés sur l'amélioration par rapport à l'algorithme propre de Netflix, Cinematch, ou par rapport au score de l'année précédente si une équipe avait dépassé un certain seuil. Un algorithme trivial qui prédisait la note moyenne de chaque film produisait une RMSE de 1,0540 sur l'ensemble de quiz. Cinematch, qui utilisait des modèles linéaires statistiques simples avec beaucoup de conditionnement de données, obtenait une RMSE de 0,9514 sur les données de quiz, soit environ 10 % d'amélioration par rapport à l'algorithme trivial. Pour gagner le grand prix, une équipe devait atteindre une RMSE de 0,8572 sur l'ensemble de test, soit une amélioration de 10 % par rapport à Cinematch.
Tant qu'aucune équipe n'avait gagné le grand prix, un prix de progression de 50 000 dollars américains était décerné chaque année pour le meilleur résultat, à condition que l'algorithme améliore la RMSE sur l'ensemble de quiz d'au moins 1 % par rapport au gagnant du prix de progression de l'année précédente (ou par rapport à Cinematch la première année). Pour réclamer un prix, un participant devait fournir le code source et une description de l'algorithme au jury dans un délai d'une semaine, et après vérification, fournir une licence non exclusive à Netflix. Netflix ne publierait que la description, pas le code source. Les équipes pouvaient soumettre autant d'ensembles de prédictions qu'elles le souhaitaient, initialement une fois par semaine puis une fois par jour. Une fois qu'une équipe avait atteint une amélioration de 10 %, le jury lançait un appel final, donnant à toutes les équipes 30 jours pour soumettre leurs entrées finales. Le concours durerait jusqu'à ce que le gagnant du grand prix soit déclaré, mais aurait été résilié à la discrétion de Netflix après au moins cinq ans (jusqu'au 2 octobre 2011) si aucun gagnant n'avait émergé.
Progression au fil des ans
La compétition a commencé le 2 octobre 2006. Dès le 8 octobre, une équipe appelée WXYZConsulting avait déjà battu les résultats de Cinematch. Le 15 octobre, trois équipes avaient battu Cinematch, dont une avec 1,06 % d'amélioration, suffisant pour se qualifier pour le prix de progression annuel. En juin 2007, plus de 20 000 équipes s'étaient inscrites, venant de plus de 150 pays, et 2 000 équipes avaient soumis plus de 13 000 ensembles de prédictions.
Au cours de la première année, plusieurs équipes de tête ont échangé la première place, notamment WXYZConsulting (Wei Xu et Yi Zhang), ML@UToronto A de l'université de Toronto dirigée par le professeur Geoffrey Hinton, Gravity de l'Université de technologie de Budapest, et BellKor d'AT&T Labs. Ces équipes ont employé une variété de techniques, y compris la factorisation matricielle, l'apprentissage d'ensemble et les approches par réseau de neurones, combinant souvent plusieurs modèles pour réaliser des améliorations progressives.
Impact et héritage
Le Prix Netflix a eu un impact significatif sur le domaine des systèmes de recommandation et de l'apprentissage automatique. Il a démontré l'efficacité du mélange de nombreux modèles prédictifs pour atteindre des résultats de pointe, une technique qui est devenue largement adoptée dans l'industrie. La compétition a également mis en lumière l'importance de l'exploration de données sur des ensembles de données réels à grande échelle et a stimulé la recherche sur les algorithmes de filtrage collaboratif. L'équipe gagnante, BellKor's Pragmatic Chaos, a combiné plus de 100 modèles différents, y compris des machines de Boltzmann restreintes et des variantes de factorisation matricielle, pour réaliser l'amélioration finale de 10,06 %.
La compétition a également soulevé des questions sur la vie privée dans le partage de données, car Netflix a ensuite fait face à un procès concernant la publication de l'ensemble de données, qui pouvait potentiellement identifier les utilisateurs. Malgré ces préoccupations, le Prix Netflix reste une référence dans l'histoire de l'intelligence artificielle et de la science des données, inspirant des compétitions similaires et contribuant au développement des systèmes de recommandation modernes utilisés par les plateformes de streaming et de commerce électronique.
Voir aussi
- apprentissage automatique
- filtrage collaboratif
- système de recommandation
- exploration de données