文档分类,又称文档归类,是图书馆学、信息科学和计算机科学中的一项任务,涉及将文档分配到一个或多个类别或分类中。该分配可以手动执行,通常由图书馆员或学科专家完成,也可以通过计算技术以算法方式实现。知识分类历来是图书馆学的核心,而算法分类则是信息科学和计算机科学的核心主题,尽管这两个领域在很大程度上重叠,并促进了跨学科研究。
待分类的文档可以包括文本、图像、音乐和其他媒体,每种类型都带来不同的分类挑战。除非另有说明,该术语通常隐含文本分类。文档可以按主题或按其他属性(如文档类型、作者或出版年份)进行分类,但主题分类是最常见的焦点。两种广泛的哲学指导主题分类:基于内容的和基于请求的方法。
基于内容与基于请求的分类
基于内容的分类根据文档中专门涉及特定主题的内容权重或比例,将文档分配到某个类别。例如,图书馆通常应用一条规则,即一本书的内容至少要有20%与所分配的类别相关。在自动系统中,这种权重可能对应于文档中某些词语或术语的出现频率。
基于请求的分类,也称为面向请求的分类或索引,优先考虑用户的预期需求。分类器会询问哪些描述符能帮助用户找到该文档,考虑所有可能的查询,并确定该文档与哪些查询相关。这种方法通常反映特定的受众或机构政策;例如,女性研究数据库可能以不同于普通历史图书馆的方式对文档进行索引。基于请求的分类更应被理解为政策驱动,而非纯粹的用户驱动,除非它纳入了关于实际用户行为的经验数据。
分类与索引
将文档分配到类别(分类)与将主题分配给文档(主题索引)之间的区别通常被认为是表面的。信息科学家弗雷德里克·威尔弗里德·兰卡斯特认为,这种术语上的区别毫无意义,并会造成混淆。这一观点得到了分类系统与叙词表互换性的支持:分类方案可以转换为叙词表,反之亦然。将主题词分配给文档等同于将其分配给由该主题词索引的文档类别,因为共享同一主题词的所有文档都属于同一类别。
自动文档分类
自动文档分类(ADC)使用计算方法和机器学习来对文档进行分类。ADC任务分为三类:监督分类,其中外部反馈(如人工标签)提供正确的分类;无监督分类,也称为文档聚类,在没有外部参考的情况下运行;以及半监督分类,结合了标记和未标记的数据。存在许多不同许可证模型下的软件产品。
常用技术包括人工神经网络方法、决策树(如ID3或C4.5)、期望最大化、潜在语义索引、朴素贝叶斯分类器、支持向量机(SVM)、k近邻算法以及词频-逆文档频率(tf-idf)。深度学习和变换器架构的进步使得更复杂的模型得以实现,例如基于大型语言模型的分类器,它们能捕捉超越简单词频的语义上下文。
应用
文档分类的实际应用多种多样。在垃圾邮件过滤中,算法区分不需要的邮件和合法消息。电子邮件路由使用分类根据主题将消息定向到适当的收件人。语言识别自动检测文档的语言,而体裁分类则确定其文学或修辞类型。可读性评估评估不同年龄段或阅读水平文本的复杂性,通常支持文本简化系统。情感分析识别文档中表达的态度或情感基调。在公共卫生监测中,对社交媒体帖子的分类有助于监测疾病爆发。文章分诊,特别是在生物学中,选择相关论文以供数据库中的手动策展。
挑战与趋势
自动分类中的一个关键挑战是处理文档类型的多样性和自然语言的模糊性。早期系统依赖手工设计的特征,但现代方法利用深度学习自动学习表示。生成式人工智能和预训练变换器模型的兴起,将该领域转向微调和少样本学习,减少了对大量标记数据集的需求。然而,偏见、可解释性和计算成本等问题仍是活跃的研究领域。图书馆学、信息科学和计算机科学之间的跨学科合作继续完善手动和算法分类,确保系统能够适应不断变化的用户需求和文档格式。