O Prêmio Netflix foi uma competição aberta realizada pela Netflix, um serviço de streaming de vídeo, para desenvolver o melhor algoritmo de filtragem colaborativa para prever avaliações de filmes pelos usuários. O concurso, lançado em 2 de outubro de 2006, oferecia um prêmio principal de US$ 1.000.000 para qualquer equipe que conseguisse melhorar o algoritmo de recomendação da própria Netflix, o Cinematch, em 10% na raiz do erro quadrático médio (RMSE). A competição era aberta a qualquer pessoa não vinculada à Netflix e que não residisse em determinados países bloqueados, como Cuba ou Coreia do Norte. Em 21 de setembro de 2009, o prêmio principal foi concedido à equipe BellKor's Pragmatic Chaos, que alcançou uma melhoria de 10,06% sobre o Cinematch.
A competição foi um evento marcante no campo do aprendizado de máquina, demonstrando o poder dos métodos de conjunto e despertando amplo interesse em técnicas de filtragem colaborativa. Ela forneceu um conjunto de dados único e em grande escala, além de um objetivo claro, atraindo mais de 20.000 equipes de mais de 150 países.
Problema e conjuntos de dados
A Netflix forneceu um conjunto de dados de treinamento com 100.480.507 avaliações que 480.189 usuários deram a 17.770 filmes. Cada avaliação de treinamento era uma quádrupla da forma <usuário, filme, data da nota, nota>, onde usuário e filme eram IDs inteiros e as notas eram inteiros de 1 a 5. O conjunto de dados de qualificação continha mais de 2.817.131 triplas da forma <usuário, filme, data da nota>, com notas conhecidas apenas pelo júri. O algoritmo de uma equipe participante tinha que prever as notas em todo o conjunto de qualificação, mas a equipe era informada da pontuação apenas para metade dos dados: um conjunto de quiz com 1.408.342 avaliações. A outra metade, o conjunto de teste com 1.408.789 avaliações, era usada pelo júri para determinar os vencedores do prêmio. Apenas os juízes sabiam quais avaliações estavam no conjunto de quiz e quais estavam no conjunto de teste, dificultando o sobreajuste no conjunto de teste.
As previsões submetidas eram pontuadas contra as notas verdadeiras usando RMSE, e o objetivo era reduzir esse erro o máximo possível. A Netflix também identificou um subconjunto de sonda com 1.408.395 avaliações dentro do conjunto de dados de treinamento, escolhido para ter propriedades estatísticas semelhantes aos conjuntos de quiz e teste. O conjunto de treinamento foi construído de modo que o usuário médio avaliasse mais de 200 filmes, e o filme médio fosse avaliado por mais de 5.000 usuários, mas havia grande variação: alguns filmes tinham apenas 3 avaliações, enquanto um usuário avaliou mais de 17.000 filmes. Para proteger a privacidade do cliente, alguns dados de avaliação foram deliberadamente perturbados, excluindo avaliações, inserindo avaliações e datas alternativas ou modificando as datas das avaliações.
Houve alguma controvérsia sobre a escolha do RMSE como métrica definidora, pois foi alegado que mesmo uma melhoria de 1% no RMSE poderia afetar significativamente a classificação dos 10 melhores filmes recomendados para um usuário.
Prêmios
Os prêmios eram baseados na melhoria sobre o algoritmo da própria Netflix, o Cinematch, ou sobre a pontuação do ano anterior se uma equipe tivesse melhorado além de um certo limite. Um algoritmo trivial que previsse a nota média de cada filme produzia um RMSE de 1,0540 no conjunto de quiz. O Cinematch, que usava modelos lineares estatísticos diretos com muito condicionamento de dados, obteve um RMSE de 0,9514 nos dados de quiz, aproximadamente uma melhoria de 10% sobre o algoritmo trivial. Para ganhar o prêmio principal, uma equipe tinha que alcançar um RMSE de 0,8572 no conjunto de teste, uma melhoria de 10% sobre o Cinematch.
Enquanto nenhuma equipe ganhasse o prêmio principal, um prêmio de progresso de US$ 50.000 era concedido todos os anos pelo melhor resultado, desde que o algoritmo melhorasse o RMSE no conjunto de quiz em pelo menos 1% sobre o vencedor do prêmio de progresso anterior (ou sobre o Cinematch no primeiro ano). Para reivindicar um prêmio, um participante tinha que fornecer o código-fonte e uma descrição do algoritmo ao júri dentro de uma semana e, após verificação, fornecer uma licença não exclusiva à Netflix. A Netflix publicaria apenas a descrição, não o código-fonte. As equipes podiam submeter quantos conjuntos de previsões desejassem, inicialmente uma vez por semana, mas depois uma vez por dia. Uma vez que uma equipe alcançasse uma melhoria de 10%, o júri emitia um último aviso, dando a todas as equipes 30 dias para submeter suas entradas finais. O concurso duraria até que o vencedor do prêmio principal fosse declarado, mas teria sido encerrado a critério da Netflix após pelo menos cinco anos (até 2 de outubro de 2011) se nenhum vencedor tivesse surgido.
Progresso ao longo dos anos
A competição começou em 2 de outubro de 2006. Em 8 de outubro, uma equipe chamada WXYZConsulting já havia superado os resultados do Cinematch. Em 15 de outubro, três equipes haviam superado o Cinematch, uma por 1,06%, o suficiente para se qualificar para o prêmio de progresso anual. Em junho de 2007, mais de 20.000 equipes haviam se registrado de mais de 150 países, e 2.000 equipes haviam submetido mais de 13.000 conjuntos de previsões.
Ao longo do primeiro ano, vários líderes alternaram a primeira posição, incluindo WXYZConsulting (Wei Xu e Yi Zhang), ML@UToronto A da Universidade de Toronto liderada pelo Prof. Geoffrey Hinton, Gravity da Universidade de Tecnologia e Economia de Budapeste, e BellKor dos Laboratórios AT&T. Essas equipes empregaram uma variedade de técnicas, incluindo fatoração de matrizes, aprendizado de conjunto e abordagens de redes neurais, frequentemente combinando múltiplos modelos para alcançar melhorias incrementais.
Impacto e legado
O Prêmio Netflix teve um impacto significativo no campo de sistemas de recomendação e aprendizado de máquina. Ele demonstrou a eficácia de combinar muitos modelos preditivos para alcançar resultados de ponta, uma técnica que se tornou amplamente adotada na indústria. A competição também destacou a importância da mineração de dados em conjuntos de dados reais e em grande escala e estimulou a pesquisa em algoritmos de filtragem colaborativa. A equipe vencedora, BellKor's Pragmatic Chaos, combinou mais de 100 modelos diferentes, incluindo máquinas de Boltzmann restritas e variantes de fatoração de matrizes, para alcançar a melhoria final de 10,06%.
A competição também levantou questões de privacidade no compartilhamento de dados, pois a Netflix enfrentou posteriormente um processo judicial sobre a liberação do conjunto de dados, que poderia potencialmente identificar usuários. Apesar dessas preocupações, o Prêmio Netflix permanece um marco na história da inteligência artificial e da ciência de dados, inspirando competições semelhantes e contribuindo para o desenvolvimento de sistemas modernos de recomendação usados por serviços de streaming e plataformas de comércio eletrônico.
Ver também
- aprendizado de máquina
- filtragem colaborativa
- sistemas de recomendação
- mineração de dados