El Premio Netflix fue una competencia abierta organizada por Netflix, un servicio de transmisión de video, para desarrollar el mejor algoritmo de filtrado colaborativo para predecir las calificaciones de los usuarios sobre películas. La competencia se llevó a cabo del 2 de octubre de 2006 al 21 de septiembre de 2009 y estuvo abierta a cualquier persona no vinculada con Netflix (incluidos empleados actuales y anteriores y sus familiares cercanos) y que no residiera en ciertos países bloqueados, como Cuba o Corea del Norte. El gran premio de 1.000.000 de dólares estadounidenses fue otorgado al equipo BellKor's Pragmatic Chaos, que logró una mejora del 10,06 % sobre el algoritmo propio de Netflix, Cinematch, en la predicción de calificaciones.
Problema y conjuntos de datos
Netflix proporcionó un conjunto de datos de entrenamiento que contenía 100.480.507 calificaciones que 480.189 usuarios otorgaron a 17.770 películas. Cada calificación de entrenamiento era una cuádrupla de la forma <usuario, película, fecha de calificación, calificación>, donde usuario y película eran identificadores enteros y las calificaciones eran números enteros de 1 a 5 estrellas. El conjunto de datos de calificación contenía más de 2.817.131 triplas de la forma <usuario, película, fecha de calificación>, cuyas calificaciones solo conocía el jurado. El algoritmo de un equipo participante debía predecir las calificaciones de todo el conjunto de calificación, pero los equipos solo recibían información sobre la puntuación de la mitad de los datos: un conjunto de prueba de 1.408.342 calificaciones. La otra mitad, un conjunto de prueba de 1.408.789 calificaciones, era utilizada por el jurado para determinar a los posibles ganadores del premio. Solo los jueces sabían qué calificaciones estaban en el conjunto de prueba y cuáles en el conjunto de prueba, una disposición diseñada para dificultar el sobreajuste al conjunto de prueba.
Las predicciones enviadas se puntuaban comparándolas con las calificaciones reales mediante el error cuadrático medio (ECM), y el objetivo era reducir este error tanto como fuera posible. Si bien las calificaciones reales eran números enteros en el rango de 1 a 5, las predicciones enviadas no tenían que serlo. Netflix también identificó un subconjunto de prueba dentro del conjunto de datos de entrenamiento que contenía 1.408.395 calificaciones. Los conjuntos de prueba, prueba y prueba se eligieron de modo que tuvieran propiedades estadísticas similares. En resumen, los datos utilizados en el Premio Netflix eran los siguientes: conjunto de entrenamiento (99.072.112 calificaciones sin incluir el subconjunto de prueba; 100.480.507 incluyéndolo), subconjunto de prueba (1.408.395 calificaciones) y conjunto de calificación (2.817.131 calificaciones), que consistía en el conjunto de prueba (1.408.789 calificaciones) y el conjunto de prueba (1.408.342 calificaciones).
Para cada película, se proporcionaron el título y el año de estreno en un conjunto de datos separado, pero no se proporcionó información sobre los usuarios. Para proteger la privacidad de los clientes, algunos datos de calificación de algunos clientes en los conjuntos de entrenamiento y calificación se alteraron deliberadamente eliminando calificaciones, insertando calificaciones y fechas alternativas, y modificando fechas de calificación. El conjunto de entrenamiento se construyó de modo que el usuario promedio calificara más de 200 películas y la película promedio fuera calificada por más de 5.000 usuarios, pero había una gran variación: algunas películas tenían tan solo 3 calificaciones, mientras que un usuario calificó más de 17.000 películas. Hubo cierta controversia sobre la elección del ECM como métrica definitoria, ya que se afirmó que incluso una mejora del 1 % en el ECM podría resultar en una diferencia significativa en la clasificación de las 10 películas más recomendadas para un usuario.
Premios
Los premios se basaban en la mejora con respecto al algoritmo propio de Netflix, llamado Cinematch, o con respecto a la puntuación del año anterior si un equipo había logrado una mejora más allá de cierto umbral. Un algoritmo trivial que predijera para cada película en el conjunto de prueba su calificación promedio a partir de los datos de entrenamiento producía un ECM de 1,0540. Cinematch utilizaba modelos lineales estadísticos sencillos con mucho acondicionamiento de datos, y su rendimiento se había estabilizado en 2006. Usando solo los datos de entrenamiento, Cinematch obtuvo un ECM de 0,9514 en el conjunto de prueba, aproximadamente una mejora del 10 % sobre el algoritmo trivial, y tuvo un rendimiento similar en el conjunto de prueba con 0,9525. Para ganar el gran premio de 1.000.000 de dólares, un equipo participante tenía que mejorar esto en otro 10 %, logrando 0,8572 en el conjunto de prueba, lo que correspondía a un ECM de 0,8563 en el conjunto de prueba.
Mientras ningún equipo ganara el gran premio, se otorgaba un premio de progreso de 50.000 dólares cada año por el mejor resultado hasta ese momento. Para ganar este premio, un algoritmo tenía que mejorar el ECM en el conjunto de prueba en al menos un 1 % con respecto al ganador del premio de progreso anterior (o con respecto a Cinematch en el primer año). Si ninguna propuesta lograba esa mejora, el premio de progreso no se otorgaba ese año. Para ganar un premio de progreso o el gran premio, un participante debía proporcionar el código fuente y una descripción del algoritmo al jurado en un plazo de una semana después de ser contactado, y, tras la verificación, el ganador también debía otorgar una licencia no exclusiva a Netflix. Netflix publicaría solo la descripción, no el código fuente, del sistema. Un equipo podía optar por no reclamar un premio para mantener su algoritmo y código fuente en secreto. El jurado mantenía sus predicciones en secreto frente a otros participantes. Los equipos podían enviar tantas predicciones como quisieran, aunque inicialmente los envíos se limitaban a una vez por semana, pero pronto se cambiaron a una vez al día. La mejor propuesta de un equipo hasta el momento se consideraba su propuesta actual.
Una vez que un equipo lograba una mejora del 10 % o más en el ECM, el jurado emitía una convocatoria final, dando a todos los equipos 30 días para enviar sus propuestas. Solo entonces, el equipo con la mejor propuesta debía proporcionar la descripción del algoritmo, el código fuente y la licencia no exclusiva, y, tras una verificación exitosa, era declarado ganador del gran premio. La competencia duraría hasta que se declarara un ganador del gran premio, pero si nadie lo recibía, habría durado al menos cinco años (hasta el 2 de octubre de 2011), después de lo cual Netflix podría terminarla en cualquier momento a su entera discreción.
Progreso a lo largo de los años
La competencia comenzó el 2 de octubre de 2006. Para el 8 de octubre, un equipo llamado WXYZConsulting ya había superado los resultados de Cinematch. Para el 15 de octubre, había tres equipos que habían superado a Cinematch, uno de ellos por un 1,06 %, suficiente para calificar para el premio de progreso anual. Para junio de 2007, más de 20.000 equipos de más de 150 países se habían registrado en la competencia, y 2.000 equipos habían enviado más de 13.000 conjuntos de predicciones.
Durante el primer año de la competencia, un puñado de equipos líderes se turnaron en la primera posición. Entre los más destacados se encontraban WXYZConsulting, un equipo de Wei Xu y Yi Zhang, que lideró durante noviembre y diciembre de 2006; ML@UToronto A, un equipo de la Universidad de Toronto dirigido por el Prof. Geoffrey Hinton, que lideró durante partes de octubre a diciembre de 2006; Gravity, un equipo de cuatro científicos de la Universidad de Tecnología y Economía de Budapest, que lideró de enero a mayo de 2007; y BellKor, un grupo de científicos de los laboratorios de AT&T, que lideró desde mediados de 2007. La competencia vio la aplicación de diversas técnicas de aprendizaje automático, incluyendo enfoques de redes neuronales y aprendizaje profundo, que más tarde influirían en el campo más amplio de la inteligencia artificial.
Legado e impacto
El Premio Netflix demostró la eficacia de los métodos de conjunto y las técnicas de factorización de matrices en el filtrado colaborativo. Impulsó una investigación académica e industrial significativa en los sistemas de recomendación, influyendo en desarrollos posteriores en IA generativa y modelos de lenguaje a gran escala. La competencia también generó conciencia sobre los problemas de privacidad en el intercambio de datos, ya que investigadores demostraron más tarde que los datos anonimizados podían ser reidentificados, lo que llevó a una demanda en 2010 y a cambios posteriores en la forma en que las empresas manejan los datos de los usuarios. El premio se cita a menudo como un hito en la historia del aprendizaje automático y la resolución de problemas mediante crowdsourcing, e inspiró competencias similares en otros ámbitos.
Conclusión
El Premio Netflix concluyó el 21 de septiembre de 2009, cuando el gran premio fue otorgado a BellKor's Pragmatic Chaos, un equipo que combinó los esfuerzos de BellKor, Pragmatic Theory y BigChaos. El algoritmo ganador logró un ECM de 0,8567 en el conjunto de prueba, una mejora del 10,06 % sobre Cinematch. La competencia no solo avanzó el estado del arte en los algoritmos de recomendación, sino que también destacó el potencial de la innovación abierta y la importancia de la calidad de los datos y la privacidad en la era digital. Su influencia persiste en los sistemas de recomendación modernos utilizados por los servicios de transmisión y las plataformas de comercio electrónico.