译自英文

文本分类将预定义类别分配给文本文档,是自然语言处理中的核心任务,应用范围从垃圾邮件过滤到情感分析。它涵盖图书馆学和机器学习,使用朴素贝叶斯和神经网络等算法。

文本分类,又称文本归类或文档分类,是指自动将文本文档分配到一个或多个预定义类别或类中的任务。这是自然语言处理(NLP)和机器学习中的一个基本问题,其应用范围从垃圾邮件过滤、电子邮件路由到情感分析和文章筛选。该领域借鉴了信息检索、图书馆学和计算机科学的技术,从手工索引演变为复杂的算法方法。

该问题通常被构建为监督学习任务,即模型在带有标签的文档及其对应类别数据集上进行训练。然而,也存在无监督和半监督的变体。目标是创建一个分类器,能够根据新文档的内容准确地对未见过的文档进行分类。任务的复杂性因类别数量、语言的歧义性以及文本领域而异。

基于内容与基于请求的分类

从历史上看,文档分类有两种哲学视角:基于内容和基于请求。基于内容的分类根据文档内容中占主导地位的主题将文档分配到某个类。例如,图书馆规则可能要求一本书的内容至少有20%与其被分配的类相关。在自动系统中,这通常转化为衡量术语的频率或关键概念的存在。

基于请求的分类,又称面向请求的索引,考虑用户的预期信息需求。分类器会问:“这个实体应在哪些描述符下被找到?”以及“这个文档与哪些可能的查询相关?”这种方法通常由政策驱动,反映特定图书馆或数据库的目的。例如,女性研究图书馆可能以不同于普通历史图书馆的方式索引文档,强调内容的不同方面以服务其特定受众。

从手工索引到自动分类

分类(将文档分配到类)与主题索引(将主题分配给文档)之间的区别一直存在争议,但正如信息科学家F. W. Lancaster所论证的,这种区别并无成效。分类系统可以转化为叙词表,反之亦然,这意味着将主题词分配给文档等同于将其分配给由该词索引的文档类。这一见解弥合了传统图书馆学与现代自动方法之间的鸿沟。

自动文档分类(ADC)在20世纪中叶作为一个领域出现,早期工作可追溯至1950年代和1960年代,使用简单的术语匹配规则。1990年代机器学习的兴起,特别是支持向量机(SVM)和朴素贝叶斯分类器的使用,标志着重大进步。这些方法从标记示例中学习,自动识别文本中与类别相关的模式。

机器学习技术

现代文本分类在很大程度上依赖机器学习和深度学习。传统技术包括:

  • 朴素贝叶斯分类器:基于贝叶斯定理的概率方法,因其简单性和有效性常被用作基线。
  • 支持向量机(SVM):一种强大的线性分类器,通过寻找最优超平面来分离类别,常与核方法结合以处理非线性边界。
  • K近邻(KNN):一种非参数方法,根据文档的k个最相似训练示例的多数类对其进行分类。
  • 决策树和随机森林:基于规则的模型,用于划分特征空间。
  • tf-idf加权:一种将文档表示为词频向量的技术,并根据术语在语料库中的常见程度进行逆加权。

随着深度学习的兴起,神经网络架构已成为主流。早期的神经模型使用词嵌入和卷积或循环网络。2017年引入的Transformer (architecture)架构及其自注意力机制彻底改变了该领域。基于transformer的预训练模型(如BERT及其后继者)通过学习单词的上下文表示,取得了最先进的结果。这些模型通常通过相对少量的标记数据在特定分类任务上进行微调。

跨领域应用

文本分类具有广泛的实际应用:

  • 垃圾邮件过滤:辨别未经请求或恶意的电子邮件与合法邮件,这一任务自1990年代末以来已广泛部署。
  • 电子邮件路由:根据主题自动将收到的电子邮件定向到相应的部门或邮箱。
  • 语言识别:确定文本的语言,这是许多NLP系统的关键预处理步骤。
  • 体裁分类:按文学或新闻体裁对文档进行分类,适用于数字图书馆和内容管理。
  • 可读性评估:估计文本的阅读难度,以将材料匹配到适当的年龄组或技能水平。
  • 情感分析:确定文档中表达的态度或情感基调,广泛用于社交媒体监控和客户反馈分析。
  • 健康相关分类:分析社交媒体帖子以进行公共卫生监测,例如跟踪疾病爆发或药物不良反应。
  • 文章筛选:在生物学等领域选择相关文章进行人工整理,自动化系统有助于管理大量科学文献。

挑战与未来方向

尽管取得了成功,文本分类仍面临若干挑战。处理歧义语言、讽刺和依赖上下文的意义仍然困难。领域适应(即将在一种文本类型(如新闻文章)上训练的模型应用于另一种类型(如法律文档))通常需要额外的微调。类别不平衡,即某些类别示例较少,也可能降低性能。

Large language model的最新进展,例如由OpenAIAnthropicGoogle DeepMind开发的模型,开辟了新的可能性。这些模型在海量文本上训练,可以在极少任务特定训练的情况下执行分类,有时甚至以零样本或少样本方式进行。它们还能处理复杂指令并生成分类解释,增强可解释性。

截至2020年代初,研究继续探索更高效的架构、更好地处理长文档,以及改进公平性和减少分类系统偏见的方法。文本分类与其他AI技术(如Generative AIDeep learning)的整合,很可能在未来几年带来进一步的创新。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:natural-language-processing·machine-learning·information-retrieval·text-mining
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史