推荐系统(或推荐引擎)是一种软件,用于预测用户的偏好,并推荐用户可能想要的项目,例如产品、电影、音乐或新闻文章。推荐系统支撑着现代互联网个性化体验的很大一部分,从电子商务产品列表到视频和音乐流媒体信息流,再到社交媒体时间线,并且是机器学习在经济上最重要的应用之一。
技术方法
该领域以两种经典方法为主。协同过滤通过相似用户的行为来推断用户的偏好,而无需直接理解项目内容。基于内容的过滤则利用项目自身的特征,推荐与用户过去喜欢的内容在属性上相似的项目。Netflix在2006年至2009年举办的公开竞赛,旨在将其协同过滤准确率提高10%,并提供100万美元奖金,是推广矩阵分解技术并吸引主流关注该领域的里程碑事件;该竞赛于2009年由一个通过集成方法组合多个模型的团队获胜。现代系统越来越多地采用深度学习,将用户和项目表示为向量,即嵌入,通过学习使得相似的用户和项目在共享空间中彼此靠近,然后可以使用向量数据库以及与语义搜索相关的技术进行高效搜索。神经网络架构,如双塔模型,以及自2020年代以来的基于Transformer的序列模型(将用户历史视为序列以预测下一个可能的交互),已在大型平台中变得普遍。
应用与商业影响
推荐系统是亚马逊商业模式的核心,其产品推荐推动了很大一部分销售额;Netflix和YouTube的内容推荐驱动了大部分观看量;Spotify的音乐发现功能也依赖于此;以及TikTok和Instagram等社交平台,其信息流排序算法被广泛认为推动了用户参与度和广告收入。
批评
推荐系统在多个方面受到了批评。纯粹为参与度优化的信息流排序算法与过滤气泡和极化现象有关,因为最大化观看时间或点击量可能偏向于耸人听闻或极端的内容。批评者还提出了对算法偏见的担忧,即基于历史交互数据训练的系统可能会强化在向谁推荐什么内容方面的现有差异;此外,还有关于这些系统不透明性的担忧,这一问题在可解释AI和可解释性研究中得到探讨,因为用户和监管者往往无法看到推荐特定项目的原因。隐私问题也很常见,因为有效的个性化通常需要收集详细的行为数据。随着大型语言模型的成熟,一些平台已开始探索基于LLM的对话式推荐界面,让用户用自然语言描述他们想要的内容,而不是仅仅依赖隐性的行为信号。