Netflix Prizeは、Netflixが開催したオープンコンペティションであり、ユーザーと映画に関する他の情報なしに、過去の評価に基づいて映画のユーザー評価を予測する最良の協調フィルタリングアルゴリズムを開発することを目的としていた。このコンペティションは2006年10月2日から2009年9月21日に大賞が授与されるまで開催された。100万ドルの大賞は、BellKor's Pragmatic Chaosチームが受賞し、彼らはNetflix自身のアルゴリズムであるCinematchの評価予測に対して10.06%の改善を達成した。
問題とデータセット
Netflixは、480,189人のユーザーが17,770本の映画に付けた100,480,507件の評価からなるトレーニングデータセットを提供した。各トレーニング評価は、<ユーザー、映画、評価日、評価>という形式の4つ組であり、ユーザーと映画は整数ID、評価は1から5星までの整数だった。資格データセットには、<ユーザー、映画、評価日>という形式の2,817,131件以上の3つ組が含まれており、評価は審査員のみが知っていた。参加チームのアルゴリズムは資格セット全体の評価を予測する必要があったが、データの半分、すなわち1,408,342件の評価からなるクイズセットについてのみスコアが通知された。残りの半分はテストセットであり、1,408,789件の評価で構成され、審査員が潜在的な賞受賞者を決定するために使用した。どの評価がクイズセットにあり、どの評価がテストセットにあるかを知っていたのは審査員だけであり、テストセットでのヒルクライミングを困難にしていた。提出された予測は二乗平均平方根誤差(RMSE)を使用してスコアリングされ、この誤差を可能な限り減らすことが目標だった。Netflixはまた、トレーニングデータセット内の1,408,395件の評価からなるプローブサブセットを特定し、これはクイズセットとテストセットと同様の統計的特性を持つように選択された。
トレーニングセットは、平均的なユーザーが200本以上の映画を評価し、平均的な映画が5,000人以上のユーザーによって評価されるように構築された。しかし、ばらつきは大きく、一部の映画はわずか3件の評価しかなく、一方で1人のユーザーは17,000本以上の映画を評価していた。顧客のプライバシーを保護するために、一部の顧客の評価データは、評価の削除、代替評価と日付の挿入、または評価日付の変更によって意図的に改変された。ユーザーに関する情報は整数ID以外は提供されなかった。
RMSEを定義メトリクスとして選択したことにはいくつかの論争があった。RMSEのわずか1%の改善でも、ユーザーに対する上位10件の推奨映画のランキングに有意な差をもたらす可能性があると主張された。
賞
賞は、Netflix自身のアルゴリズムであるCinematch、またはチームが特定のしきい値を超えて改善した場合は前年のスコアに対する改善に基づいていた。クイズセットの各映画の平均評価を予測する自明なアルゴリズムは、RMSE 1.0540を生成した。多くのデータ調整を伴う単純な統計的線形モデルを使用したCinematchは、クイズデータでRMSE 0.9514を記録し、自明なアルゴリズムよりも約10%の改善だった。100万ドルの大賞を獲得するには、チームはこれをさらに10%改善し、テストセットで0.8572(クイズセットで0.8563)を達成する必要があった。
大賞を獲得したチームがいない限り、年間進歩賞として5万ドルが毎年、これまでの最良の結果に対して授与され、アルゴリズムがクイズセットのRMSEを前年の進歩賞受賞者(または初年度はCinematch)に対して少なくとも1%改善した場合に限られた。賞を請求するには、参加者は1週間以内にソースコードとアルゴリズムの説明を審査員に提供し、検証後にNetflixに非独占的ライセンスを提供する必要があった。Netflixは説明のみを公開し、ソースコードは公開しなかった。チームは好きなだけ予測を提出でき、当初は週1回に制限されていたが、後に1日1回に変更された。チームがRMSEを10%以上改善することに成功すると、審査員は最終呼び出しを発行し、全チームに30日間の提出期間を与えた。最良の提出を行ったチームは、アルゴリズムの説明、ソースコード、ライセンスを求められ、検証後に大賞受賞者として宣言された。
コンテストは大賞受賞者が宣言されるまで続くことになっていた。誰も勝たなかった場合、少なくとも5年間(2011年10月2日まで)続き、その後Netflixはいつでも終了できた。
年ごとの進歩
コンペティションは2006年10月2日に始まった。10月8日までに、WXYZConsultingというチームがすでにCinematchの結果を上回っていた。10月15日までに、3つのチームがCinematchを上回り、そのうち1つは1.06%の改善で、年間進歩賞の資格を得るのに十分だった。2007年6月までに、150か国以上から20,000以上のチームが登録し、2,000チームが13,000以上の予測セットを提出した。
最初の1年間で、いくつかの先頭チームが首位を交代した。これには以下が含まれる:
- WXYZConsulting、Wei XuとYi Zhangによるチーム(2006年11月〜12月の先頭ランナー)。
- ML@UToronto A、トロント大学のGeoffrey Hinton教授が率いるチーム(2006年10月〜12月の一部の期間の先頭ランナー)。
- Gravity、ブダペスト工科大学の4人の科学者によるチーム(2007年1月〜5月の先頭ランナー)。
- BellKor、AT&T Labsの科学者グループ(2007年以降の先頭ランナー)。
これらのチームは、機械学習の高度な技術、ニューラルネットワークやアンサンブル手法を含むものを頻繁に使用し、RMSEの漸進的な改善を絞り出していた。
受賞アルゴリズムとその後
受賞チームであるBellKor's Pragmatic Chaosは、3つの主要チーム、BellKor(AT&T Labsから)、Pragmatic Theory、Chaosの合併だった。彼らのアルゴリズムは、行列分解や制限付きボルツマンマシンを含む複数の予測モデルを組み合わせ、ブレンディングを使用して予測を統合した。チームはテストセットでCinematchに対して10.06%の改善を達成し、最終提出期限で20分差で2位のチームThe Ensembleを僅差で破った。
Netflix Prizeは、実世界のアプリケーションにおける協調フィルタリングと機械学習の力を実証し、レコメンデーションシステムの研究を大きく促進した。このコンペティションはまた、プライバシーに関する懸念を引き起こし、訴訟やNetflixのユーザーデータの取り扱いの変更につながった。コンペティション中に開発された技術は、深層学習や生成AIのその後の発展に影響を与え、分野が伝統的な機械学習からより洗練されたトランスフォーマーベースのモデルへと進化するにつれて、その影響は続いた。