Yahoo! Answers是一个由社区驱动的问答平台,于2005年由Yahoo!推出。它允许用户就广泛的主题发布问题,并从其他社区成员那里获得答案。该平台运营至2021年关闭,但其存档数据已成为机器学习研究的宝贵资源,特别是在文本分类任务方面。
Yahoo! Answers数据集来源于平台内容,是自然语言处理中广泛使用的基准。它包含问题及其对应的答案,并标注为10个不同的主题类别。该数据集在训练和评估神经网络模型方面发挥了关键作用,用于主题分类和问答等任务。
数据集结构与类别
Yahoo! Answers数据集包含超过140万个问题和答案,每个都归入以下10个类别之一:社会与文化、科学与数学、健康、教育与参考、计算机与互联网、体育、商业与金融、娱乐与音乐、家庭与人际关系,以及政治与政府。该数据集通常分为训练集和测试集,典型的划分是140万个训练样本和6万个测试样本。每个样本包括问题标题、问题内容和最佳答案,以及类别标签。
在机器学习研究中的作用
该数据集已被广泛用于机器学习研究中,以基准测试分类算法。它是评估深度学习模型(包括基于Transformer的架构)的标准基准。研究人员利用它来测试大型语言模型和其他生成式AI系统在理解和分类用户生成内容方面的性能。该数据集的多类别性质和真实世界文本使其成为测试模型泛化能力的具有挑战性和现实性的测试平台。
对AI发展的影响
Yahoo! Answers数据集的可用性通过提供大规模、带标签的语料库,为训练和评估人工智能的进步做出了贡献。它已被用于比较各种损失函数、优化技术和数据增强方法有效性的研究。该数据集还支持迁移学习和少样本学习的研究,在这些研究中,预训练于大规模语料库的模型会在较小的带标签数据集(如本例)上进行微调。
遗产与持续使用
尽管平台已关闭,Yahoo! Answers数据集仍然是学术和工业研究中的热门资源。它被纳入许多基准套件,并用于评估新模型的性能,包括基于多头注意力和位置编码的模型。该数据集的长期存在凸显了社区生成内容在推进人工智能研究方面的价值。