Netflix Prizeは、Netflixが主催した公開コンペティションであり、映画に対するユーザーの評価を予測するための最良の協調フィルタリングアルゴリズムを開発することを目的としていた。このコンペティションは2006年10月2日から2009年9月21日まで開催され、Netflixに関係しない者(現職・元従業員およびその近親者を含む)や、キューバや北朝鮮などの特定のブロック対象国に居住しない者であれば、誰でも参加可能だった。賞金総額100万米ドルは、BellKor's Pragmatic Chaosチームに授与され、同チームはNetflix自身のアルゴリズムであるCinematchと比較して、評価予測において10.06%の改善を達成した。
問題とデータセット
Netflixは、480,189人のユーザーが17,770本の映画に対して付けた100,480,507件の評価を含むトレーニングデータセットを提供した。各トレーニング評価は、<ユーザー、映画、評価日、評価>の形式の4つ組であり、ユーザーと映画は整数ID、評価は1から5の星の整数だった。予選データセットには、<ユーザー、映画、評価日>の形式の2,817,131件の3つ組が含まれており、評価は審査員のみが知っていた。参加チームのアルゴリズムは予選セット全体の評価を予測する必要があったが、チームにはデータの半分のみのスコアが通知された。その半分とは、1,408,342件の評価からなるクイズセットである。残りの半分、1,408,789件の評価からなるテストセットは、審査員が潜在的な賞受賞者を決定するために使用した。どの評価がクイズセットに含まれ、どの評価がテストセットに含まれるかを知っていたのは審査員だけであり、この取り決めはテストセットでのヒルクライミングを困難にすることを意図していた。
提出された予測は、真の評価に対して二乗平均平方根誤差(RMSE)を用いてスコアリングされ、目標はこの誤差を可能な限り減らすことだった。実際の評価は1から5の範囲の整数だったが、提出された予測は整数である必要はなかった。Netflixはまた、トレーニングデータセット内の1,408,395件の評価からなるプローブサブセットを特定した。プローブ、クイズ、テストの各データセットは、類似した統計的特性を持つように選択された。要約すると、Netflix Prizeで使用されたデータは以下の通りである:トレーニングセット(プローブセットを除く99,072,112件の評価、プローブセットを含む100,480,507件)、プローブセット(1,408,395件の評価)、および予選セット(2,817,131件の評価)で、これはテストセット(1,408,789件)とクイズセット(1,408,342件)から構成される。
各映画について、タイトルと公開年は別のデータセットで提供されたが、ユーザーに関する情報は提供されなかった。顧客のプライバシーを保護するため、トレーニングセットと予選セットの一部の顧客の評価データは、評価の削除、代替評価と日付の挿入、評価日付の変更によって意図的に改変された。トレーニングセットは、平均的なユーザーが200本以上の映画を評価し、平均的な映画が5,000人以上のユーザーによって評価されるように構築されたが、大きなばらつきがあった:一部の映画はわずか3件の評価しかなく、一方で1人のユーザーは17,000本以上の映画を評価していた。RMSEを定義する指標として選択したことについてはいくつかの論争があり、RMSEの1%の改善でも、ユーザーに対するトップ10の推奨映画のランキングに有意な差をもたらす可能性があると主張された。
賞
賞は、Netflix自身のアルゴリズムであるCinematch、またはチームが特定のしきい値を超えて改善を行った場合は前年度のスコアに対する改善に基づいていた。クイズセット内の各映画について、トレーニングデータからの平均評価を予測する自明なアルゴリズムは、RMSE 1.0540を生成した。Cinematchは、多くのデータ調整を伴う単純な統計的線形モデルを使用しており、その性能は2006年までに頭打ちになっていた。トレーニングデータのみを使用して、CinematchはクイズデータでRMSE 0.9514を記録し、これは自明なアルゴリズムよりも約10%の改善であり、テストセットでも0.9525と同様の性能を示した。100万ドルのグランプリを獲得するには、参加チームはこれをさらに10%改善し、テストセットで0.8572を達成する必要があり、これはクイズセットでRMSE 0.8563に相当した。
グランプリを獲得したチームがいない限り、進歩賞として5万ドルが毎年、その時点での最良の結果に対して授与された。この賞を獲得するには、アルゴリズムがクイズセットのRMSEを前回の進歩賞受賞者(または初年度はCinematch)と比較して少なくとも1%改善する必要があった。提出が成功しなかった場合、その年の進歩賞は授与されなかった。進歩賞またはグランプリを獲得するには、参加者は連絡を受けてから1週間以内にソースコードとアルゴリズムの説明を審査員に提供し、検証後、受賞者はNetflixに非独占的ライセンスも提供する必要があった。Netflixはシステムの説明のみを公開し、ソースコードは公開しなかった。チームは、アルゴリズムとソースコードを秘密に保つために賞を請求しないことを選択できた。審査員は予測を他の参加者から秘密に保った。チームは評価を予測する試みを好きなだけ送信でき、提出は当初週1回に制限されていたが、すぐに1日1回に変更された。チームのこれまでの最良の提出が現在の提出としてカウントされた。
チームがRMSEを10%以上改善することに成功すると、審査員は最終呼び出しを発行し、全チームに提出を送信するための30日間を与えた。その後にのみ、最良の提出を持つチームにアルゴリズムの説明、ソースコード、非独占的ライセンスが要求され、検証が成功した後、グランプリ受賞者として宣言された。コンペティションはグランプリ受賞者が宣言されるまで続くことになっていたが、誰もグランプリを受け取らなかった場合、少なくとも5年間(2011年10月2日まで)続き、その後はNetflixの単独の裁量でいつでも終了できた。
年ごとの進展
コンペティションは2006年10月2日に始まった。10月8日までに、WXYZConsultingというチームがすでにCinematchの結果を上回っていた。10月15日までに、Cinematchを上回ったチームが3つあり、そのうちの1つは1.06%の改善で、年間進歩賞の資格を得るのに十分だった。2007年6月までに、150か国以上から20,000以上のチームがコンペティションに登録し、2,000チームが13,000以上の予測セットを提出した。
コンペティションの最初の年に、少数の先頭集団が1位を交代した。より顕著なものには、WXYZConsulting(Wei XuとYi Zhangのチーム)が2006年11月から12月にかけて先頭集団にいた;ML@UToronto A(トロント大学のGeoffrey Hinton教授が率いるチーム)が2006年10月から12月の一部にかけて先頭集団にいた;Gravity(ブダペスト工科大学の4人の科学者チーム)が2007年1月から5月にかけて先頭集団にいた;そしてBellKor(AT&T Labsの科学者グループ)が2007年半ばから先頭集団にいた。コンペティションでは、機械学習のさまざまな技術が適用され、ニューラルネットワークや深層学習のアプローチも含まれており、これらは後に人工知能のより広い分野に影響を与えた。
遺産と影響
Netflix Prizeは、協調フィルタリングにおけるアンサンブル手法と行列分解技術の有効性を示した。それはレコメンデーションシステムにおける重要な学術的および産業的研究を促進し、後の生成AIや大規模な言語モデルの発展に影響を与えた。このコンペティションはまた、データ共有におけるプライバシー問題への認識を高め、研究者が後に匿名化されたデータが再識別可能であることを示し、2010年の訴訟とその後の企業がユーザーデータを扱う方法の変更につながった。この賞は、機械学習とクラウドソーシングによる問題解決の歴史における画期的な出来事としてしばしば引用され、他の分野での同様のコンペティションに影響を与えた。
結論
Netflix Prizeは2009年9月21日に終了し、グランプリはBellKor、Pragmatic Theory、BigChaosの努力を組み合わせたチームであるBellKor's Pragmatic Chaosに授与された。受賞アルゴリズムはテストセットでRMSE 0.8567を達成し、Cinematchに対して10.06%の改善だった。このコンペティションは、レコメンデーションアルゴリズムの最先端を進めただけでなく、オープンイノベーションの可能性と、デジタル時代におけるデータ品質とプライバシーの重要性を強調した。その影響は、ストリーミングサービスやeコマースプラットフォームで使用される現代のレコメンデーションシステムに今も続いている。