模式识别是根据从数据中提取的模式为观测值分配类别的任务。该领域关注通过计算机算法自动发现数据中的规律性,并利用这些规律性采取行动,例如将数据分类到不同类别。尽管相似,但模式识别不应与模式机器混淆,后者可能具备模式识别能力,但其主要功能是区分并创造涌现模式。该学科起源于统计学和工程学,由于大数据和充足处理能力的可用性,现代方法日益依赖机器学习。
模式识别系统通常从带标签的训练数据中训练,其中每个实例都配有一个正确输出。当带标签数据不可用时,算法可以通过无监督方法发现先前未知的模式。该领域关注信号本身,包括采集和信号处理,并在计算机视觉背景下广受欢迎;一个领先的会议是计算机视觉与模式识别会议。在机器学习中,模式识别是为给定输入值分配标签,而在统计学中,判别分析于1936年被引入用于此目的。
输出类型
模式识别涵盖多种输出类型,而不仅仅是简单分类。分类试图将每个输入值分配到给定类别集合中的一类,例如判断一封电子邮件是否为垃圾邮件。回归为每个输入分配一个实值输出,例如预测房价。序列标注为序列中的每个成员分配一个类别,例如词性标注,即为句子中的每个单词标注其语法角色。解析为输入句子分配一个解析树,描述其句法结构。这些任务共享一个目标,即为所有可能的输入产生合理的答案,执行考虑统计变异的“最可能”匹配,这与寻求精确匹配的模式匹配算法(如文本编辑器中的正则表达式匹配)形成对比。
学习范式
模式识别通常根据所使用的学习过程进行分类。监督学习假设存在一组手工标注的实例;学习过程生成一个模型,该模型在训练数据上表现良好,同时泛化到新数据,通常根据奥卡姆剃刀原则倾向于简单性。无监督学习假设没有手工标注数据,并试图发现固有模式,分类的无监督等价物是聚类,它基于相似性度量(如多维向量空间中的距离)对输入进行分组。半监督学习将少量带标签数据与大量未带标签数据相结合。在某些领域,术语有所不同;例如,群落生态学使用“分类”来指通常所说的聚类。
特征与表示
每个输入实例正式由特征向量描述,该向量构成所有已知特征的描述。这些特征向量定义多维空间中的点,允许进行点积和角度等向量运算。特征可以是分类的(名义的,如性别或血型)、有序的(如“大”、“中”、“小”等有序项)、整数值的(如单词计数)或实值的(如血压测量值)。许多算法需要分类数据,因此实值或整数值数据可能被离散化为组,例如小于5、介于5和10之间或大于10。
概率分类器
许多常见的模式识别算法是概率性的,使用统计推断为实例找到最佳标签。与仅输出单个最佳标签的非概率算法不同,概率算法通常输出置信度值,表示实例由该标签描述的概率。它们还可能输出带有相关概率的N个最佳标签列表。当可能标签数量较少时,N可以设置为输出所有标签的概率。概率算法提供诸如置信度值等优势,这在决策制定和组合多个分类器时非常有用。
应用与现代背景
模式识别在统计分析、信号处理、图像分析、信息检索、生物信息学、数据压缩、计算机图形学和机器学习中都有应用。数据库知识发现(KDD)和数据挖掘更侧重于无监督方法和商业用途,而模式识别则强调信号处理和工程起源。深度学习和神经网络的兴起改变了该领域,使计算机视觉和自然语言处理取得突破。现代系统,如OpenAI和Google DeepMind开发的系统,严重依赖模式识别原理,通常通过变换器和大型语言模型实现。该领域随着NVIDIA等公司硬件进步以及Amazon Web Services和Azure等云平台的发展而持续演进(尽管不在提供的列表中,本文避免外部链接)。
历史与关键人物
模式识别的根源可追溯至统计学和工程学,早期工作包括1936年的判别分析。Bernard Widrow等先驱为早期神经网络做出了贡献,而Thomas Dietterich和Michael Jordan推动了机器学习理论的发展。MIT CSAIL、斯坦福人工智能实验室和卡内基梅隆大学等研究机构在其发展中发挥了核心作用。该领域从手工特征到学习表示的演变反映了人工智能的更广泛趋势,其中模式识别作为感知和决策的基础能力。