Yelp Reviews(イェルプ・レビュー)とは、2004年に元PayPal従業員であるラッセル・シモンズとジェレミー・ストッペルマンによって設立されたクラウドソーシング型レビュープラットフォームであるYelpに公開された、ユーザー生成のレビューと評価の集合を指す。このデータセットは、感情分析、レコメンデーションシステム、テキスト分類などのタスクにおいて、自然言語処理と機械学習の標準的なベンチマークとなっている。研究者や実務者は、Yelp Reviewsを用いて、非構造化テキストからユーザーの感情を推測し、評価を予測し、消費者行動を理解するアルゴリズムを開発・評価している。
Yelpのデータセットには数百万件のレビューが含まれ、各レビューには星評価(1〜5)、ビジネスのメタデータ、ユーザー情報が付随している。2024年12月31日時点で、Yelpには約3億800万件のレビューが投稿されており、同社は2024年にデスクトップおよびモバイルで7,600万人以上のユニークビジターがあったと報告している。このデータセットは学術利用のためにサブセットとして公開されることが多く、Yelp Dataset Challengeが研究用の大規模サンプルを提供している。レビューはレストラン、ショッピング、サービスなど多岐にわたるビジネスカテゴリをカバーしており、ドメイン固有の言語を研究するための豊富な情報源となっている。
歴史的背景
Yelpは2004年に、ビジネスインキュベーターであるMRL Venturesで設立され、PayPalの共同創業者であるマックス・レフチンからの初期資金提供を受けた。プラットフォームは当初、メールベースの紹介ネットワークとして始まったが、利用データがユーザーが自発的なレビュー投稿を好むことを示したため、ユーザー作成レビューへと転換した。2005年までに再設計されたサイトは人気を博し、2006年までに月間訪問者数は100万人に達した。Yelpは2009年から国際展開を開始し、イギリス、カナダ、フランスなどの国々にサイトを開設した。同社は2012年3月に株式公開し、2014年に黒字化した。この成長によりレビューが大量に蓄積され、研究で使用されるデータセットの基盤が形成された。
データセットの特性
Yelp Reviewsデータセットは、その規模と多様性で注目されている。レビューの長さ、感情、執筆スタイルはさまざまであり、現実世界のユーザー行動を反映している。星評価は教師あり学習タスクの数値ターゲットを提供し、レビューテキストは豊かな言語的特徴を提供する。データセットには、場所、カテゴリ、営業時間などのビジネス属性も含まれており、マルチモーダル分析が可能となっている。例えば、研究者はビジネスタイプや地理的領域によってレビューの感情がどのように変化するかを研究できる。このデータセットは、特定の側面(食品の品質やサービスなど)に対する感情を特定することを目的としたアスペクトベース感情分析のモデルを訓練するためによく使用される。
機械学習における応用
Machine learningおよびArtificial intelligenceにおいて、Yelp Reviewsは感情分析とテキスト分類の一般的なベンチマークである。ニューラルネットワークやトランスフォーマーなどのモデルは、レビューテキストから評価を予測するためにこのデータセットで訓練される。例えば、大規模言語モデルは、Yelp Reviewsで微調整され、応答を生成したり、カスタマーフィードバックを分析したりする可能性がある。このデータセットは、過去のレビューに基づいてユーザーの好みを予測するアルゴリズムが使用されるレコメンデーションシステムでも利用されている。Amazon Web ServicesやGoogle Cloudなどの企業は、このようなデータセットを処理できる機械学習サービスを提供しており、Stanford AI LabやMIT CSAILなどの研究機関の研究者は、Yelpのデータを使用した研究を発表している。
課題と倫理的考慮事項
Yelp Reviewsデータセットには課題がないわけではない。偽レビュー、別名アストロターフィングは、ビジネスや個人が評価を操作するために虚偽の肯定的または否定的なレビューを提出する、永続的な問題となっている。Yelpはこのようなレビューを検出してフィルタリングするアルゴリズムを実装しているが、データセットにはノイズが残る可能性がある。研究者は、バイアスのかかった、または不正なデータが不正確な予測につながる可能性があるため、モデルを訓練する際にこれを考慮する必要がある。さらに、このデータセットは、レビューにユーザーやビジネスに関する個人情報が含まれる可能性があるため、プライバシーに関する懸念も提起している。データセットの倫理的な使用には、匿名化とデータ保護規制への準拠が必要である。同社は、広告を出していないビジネスにとって不公平だと主張する人もいるレビューフィルタリング手法に関して批判に直面してきた。
今後の方向性
2020年代半ば現在、Yelp ReviewsはDeep learningやGenerative AI研究を進めるための貴重なリソースであり続けている。大規模言語モデルの台頭に伴い、このデータセットは実世界のテキストに対するモデルの性能を評価するために使用されている。今後の研究は、微妙な表現、皮肉、文化的差異に対する感情分析の改善に焦点を当てる可能性がある。画像やメタデータなどのマルチモーダルデータの統合も、モデルの能力を向上させる可能性がある。さらに、このデータセットの規模は、大規模計算用に設計されたAWS TrainiumやCerebrasなどの分散システム上でモデルを訓練するのに適している。Yelpが成長を続けるにつれて、データセットも拡大し、研究と応用のためのさらなる機会を提供するだろう。