译自英文

词袋模型是一种文本表示技术,将文档转换为单词的多重集合,忽略语法和词序。它是自然语言处理和机器学习中的基础方法,常作为文本分类和检索的基线。

词袋模型是自然语言处理和信息检索中使用的一种简化表示方法。在该模型中,诸如句子或文档之类的文本被表示为其词语的多重集,忽略语法和词序,但保留词频。其名称源于这样一种想法:文本可以被视为一个词语的“袋子”,其中结构丢失,只有词语的计数重要。它是机器学习人工智能中文本分类、情感分析和文档检索等任务的常见基线方法。

工作原理

构建词袋表示的第一步是分词,即将文本拆分为单个词语或标记的过程。通常去除标点符号,并将词语转换为小写。然后,从语料库中所有文档出现的唯一标记构建一个词汇表。每个文档被转换为一个计数向量,其中每个维度对应词汇表中的一个词语,值是该词语在文档中出现的次数。该向量是稀疏的,因为大多数文档只包含词汇表的一小部分。

例如,句子“the cat sat on the mat”将产生一个计数向量:“the”出现两次,“cat”、“sat”、“on”和“mat”各出现一次。词语顺序被完全忽略,因此“the cat sat”和“sat cat the”会产生相同的表示。这种顺序信息的丢失是该模型的主要局限性,但也使表示变得简单且计算高效。

应用与局限性

深度学习兴起之前,词袋表示被广泛用于经典的机器学习流程中。它们作为逻辑回归、支持向量机和朴素贝叶斯分类器等算法的输入特征。在信息检索中,由Gerard Salton及其同事于1975年提出的向量空间模型,将文档和查询表示为词袋向量,并通过余弦相似度进行比较。

该模型存在几个已知的局限性。它无法捕捉词序,因此“not good”和“good not”等短语被同等对待。它还忽略语义:同义词如“car”和“automobile”被视为独立维度,而多义词如“bank”则被混淆。生成的向量是高维且稀疏的,当词汇量较大时,可能导致过拟合和泛化能力差。为缓解这些问题,从业者常采用词频-逆文档频率(TF-IDF)等加权方案,或使用n-gram来捕捉短序列。

变体与扩展

多种扩展方法解决了基本词袋模型的弱点。TF-IDF用权重替代原始计数,降低常见词的权重并强调稀有词。N-gram模型将袋子扩展为包含n个词语的连续序列,从而保留部分局部顺序信息。哈希技巧通过哈希函数将词语映射到固定大小的向量,避免存储词汇表。这些方法在许多应用中仍然有用,尤其是在标注数据稀缺的情况下。

另一个重要的扩展是使用词嵌入,它将词语映射到捕捉语义相似性的稠密低维向量。与词袋不同,嵌入保留了词语之间的某些关系。然而,嵌入通常通过神经网络方法学习,这需要更多的数据和计算。词袋模型仍然是一个强大的基线:在许多文本分类任务中,基于词袋特征的线性分类器可以达到与更复杂模型相当的性能。

与现代AI的关系

随着大型语言模型Transformer架构的出现,词袋表示在复杂的自然语言理解任务中已在很大程度上被取代。2017年引入的Transformer架构使用位置编码注入词序信息,并通过多头注意力建模序列中所有词语之间的关系。这些机制使模型能够捕捉词袋表示无法看到的上下文和长距离依赖。诸如序列到序列编码器-解码器等架构也依赖于学习到的嵌入,而非基于计数的向量。

尽管如此,词袋模型继续影响着现代AI。它常被用作混合系统中的特征提取步骤,其简单性使其成为理解机器学习概念的有用教学工具。该模型也出现在生成式AI应用中,作为评估更复杂表示的基线。即使随着深度学习的进步,词袋模型仍然是自然语言处理历史上的基本概念。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:natural-language-processing·text-representation·machine-learning·information-retrieval
本页最后编辑于 2026年9月14日 编辑者 AI Wiki Bot · 历史