译自英文

TF-IDF(词频-逆文档频率)是一种用于信息检索和文本挖掘的数值加权方案,旨在反映一个词项在文档中相对于整个语料库的重要性。

TF-IDF(词频-逆文档频率)是一种数值统计量,旨在反映一个词对集合或语料库中某篇文档的重要程度。它由两个部分组成:词频(TF),衡量一个词在文档中出现的频率;以及逆文档频率(IDF),对在众多文档中频繁出现的词进行降权。该技术于20世纪70年代发展起来,在基于机器学习神经网络的方法兴起之前,成为信息检索、文本分类和搜索引擎排序的基础方法。

TF-IDF的核心直觉是,一个词在单篇文档中频繁出现但在语料库其余部分中很少出现,很可能高度描述该文档的内容。相反,诸如“的”或“和”之类的常见词几乎出现在每篇文档中,因此判别力很低。通过将局部频率与全局稀有性相结合,TF-IDF为每个词-文档对分配一个权重,可用于将文档表示为高维空间中的向量,从而实现相似度计算和聚类。

历史发展

按文档频率对词进行加权的概念源于20世纪50年代和60年代,早期工作由施乐帕克研究中心的汉斯·彼得·卢恩等人完成。TF-IDF的现代公式通常归功于卡伦·斯帕克·琼斯,她于1972年发表了一篇题为“词特异性的统计解释及其在检索中的应用”的开创性论文。她的工作确立了逆文档频率作为对数缩放因子的组成部分。随后,杰拉德·萨尔顿及其在康奈尔大学的同事将TF-IDF整合到SMART信息检索系统中,该系统成为标准的研究平台。

数学公式

对于文档 \( d \) 中的词 \( t \),词频 \( tf(t,d) \) 通常是原始出现次数,尽管也有使用对数缩放或二元存在性的变体。逆文档频率定义为:

\[ idf(t) = \log \frac{N}{df(t)} \]

其中 \( N \) 是语料库中的文档总数,\( df(t) \) 是包含该词的文档数量。TF-IDF权重则为:

\[ tfidf(t,d) = tf(t,d) \times idf(t) \]

在实践中,通常会添加平滑处理以避免对语料库中不存在的词进行除零操作,并对文档向量应用归一化(如L2归一化)以减轻长度偏差。

在信息检索中的应用

在经典信息检索系统中,TF-IDF权重用于根据用户查询对文档进行排序。查询被表示为TF-IDF权重的向量,文档则通过查询向量与每个文档向量之间的余弦相似度进行排序。这种向量空间模型由萨尔顿推广,是20世纪80年代和90年代搜索引擎的主导方法。TF-IDF还支撑着许多文本挖掘任务,包括文档聚类、关键词提取和自动摘要。

局限性与现代背景

TF-IDF存在若干已知局限性。它将词视为独立的,忽略了语义关系和词序。由于词重叠稀疏,它在短文档或短查询上表现不佳。随着大型语言模型和基于Transformer架构的出现,密集向量嵌入已在许多任务中取代了TF-IDF,因为它们能捕捉上下文语义。然而,TF-IDF仍被广泛用作基线、传统机器学习模型的特征,以及在计算资源有限的领域中使用。它也是结合稀疏和密集信号的混合检索系统中的常见组成部分。

变体与扩展

TF-IDF存在多种变体,包括BM25(最佳匹配25),它引入了词频饱和和文档长度归一化,在现代搜索系统中通常更受青睐。其他扩展则结合了词性标注或使用次线性词频缩放。由斯蒂芬·罗伯逊和卡伦·斯帕克·琼斯在20世纪90年代开发的Okapi BM25排序函数,至今仍是信息检索的标准,并被Elasticsearch等许多开源搜索引擎所使用。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:information-retrieval·text-mining·statistics
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史