命名实体识别

译自英文

命名实体识别(NER)是信息抽取的一个子任务,旨在从非结构化文本中定位并分类命名实体至预定义类别,如人物、组织、地点和时间表达式。

命名实体识别(NER),又称实体识别、实体分块和实体抽取,是信息抽取的一个子任务,旨在从非结构化文本中定位并分类所提及的命名实体,将其归入预定义类别,例如人名(PER)、组织(ORG)、地点(LOC)、地缘政治实体(GPE)、车辆(VEH)、医疗代码、时间表达式、数量、货币值和百分比。大多数关于NER系统的研究被构架为:将一段未标注的文本,例如将“Jim bought 300 shares of Acme Corp. in 2006”转换为突出显示实体名称的标注文本:“[Jim]Person bought 300 shares of [Acme Corp.]Organization in [2006]Time。”在此示例中,检测并分类了一个由单个词元组成的人名、一个由两个词元组成的公司名以及一个时间表达式。

术语“命名实体”将任务限制为那些由一个或多个字符串(如单词或短语)相当一致地指代某个指称对象的实体。这与索尔·克里普克定义的严格指示词密切相关,尽管在实践中NER处理许多在哲学上并非“严格”的名称和指称对象。例如,亨利·福特于1903年创建的汽车公司可被称为“Ford”或“Ford Motor Company”,尽管“Ford”也可指许多其他实体。严格指示词包括专有名称以及某些生物物种和物质的术语,但排除代词(参见共指消解)、通过属性挑选指称对象的描述,以及指称事物类别而非个体的名称。

问题定义

完整的命名实体识别通常被概念上(也可能在实现中)分解为两个不同的问题:名称检测,以及按实体所指类型(例如人、组织或地点)对名称进行分类。第一阶段通常简化为一个分词问题:名称被定义为连续的词元跨度,且无嵌套,因此“Bank of America”是一个单一名称,而忽略该名称内部“America”子串本身也是一个名称的事实。此分词问题在形式上类似于分块。第二阶段需要选择一种本体来组织事物类别。

时间表达式和一些数值表达式(例如货币、百分比)在NER任务上下文中也可能被视为命名实体。虽然这些类型中的某些实例是严格指示词的典型例子(例如2001年),但也有许多无效实例(例如“我在六月度假”)。在第一种情况下,2001年指公历的第2001年。在第二种情况下,六月可能指未定义年份的月份(过去的六月、下一个六月、每个六月)。可以说,在这种情况下,出于实际原因,命名实体的定义被放宽了。因此,术语“命名实体”的定义并不严格,通常需要在使用它的上下文中加以解释。

文献中已提出某些命名实体类型的层级结构。BBN类别于2002年提出,用于问答系统,包含29种类型和64种子类型。Sekine的扩展层级结构也于2002年提出,由200种子类型组成。更近期,在2011年,Ritter在针对社交媒体文本的NER开创性实验中使用了基于常见Freebase实体类型的层级结构。

难点

NER可能存在指称消解歧义,即同一名称可指同一类型的不同实体。例如,“JFK”可指美国前总统或其儿子。同一名称也可指完全不同的类型:“JFK”可能指纽约的机场,而“IRA”可指个人退休账户、国际阅读协会或爱尔兰共和军。这可能是由转喻引起的;例如,“白宫”可指一个组织而非地点。

形式化评估

为评估NER系统输出的质量,已定义了几种度量标准。常用度量称为精确率、召回率和F1分数。然而,在如何计算这些值方面仍存在若干问题。这些统计度量在明显情况下(即完全找到或遗漏真实实体,以及找到非实体)效果尚可。但NER可能以许多其他方式失败,其中许多可被视为“部分正确”,不应计为完全成功或失败。例如,识别出真实实体但词元少于预期(例如遗漏“John Smith, M.D.”的最后一个词元)、词元多于预期(例如包含“The University of MD”的第一个词)、对相邻实体进行不同划分(例如将“Smith, Jones Robinson”视为2个而非3个实体)、分配完全错误的类型(例如将人名称为组织)、分配相关但不精确的类型(例如“物质”与“药物”,或“学校”与“组织”),或正确识别实体但用户想要的是更小或更大范围的实体(例如将“James Madison”识别为人名,而它是“James Madison University”的一部分)。某些NER系统施加限制,即实体不得重叠或嵌套,这意味着在某些情况下必须做出任意或任务特定的选择。

一种过于简单的准确性度量方法仅计算文本中所有词元中被正确或错误识别为实体引用部分(或作为正确类型实体)的比例。这至少存在两个问题:首先,现实文本中的绝大多数词元不属于实体名称,因此基线准确性(始终预测“非实体”)异常高,通常超过90%;其次,对实体名称完整跨度的错误预测未得到适当惩罚(仅找到人名中的名字而遗漏其后的姓氏可能被计为一半准确性)。

在CoNLL等学术会议中,F1分数的一种变体定义如下:精确率是预测的实体名称跨度与黄金标准评估数据中跨度完全对齐的数量。例如,当预测为[Person Hans] [Person Blick]但要求为[Person Hans Blick]时,该预测名称的精确率为零。精确率随后对所有预测实体名称取平均。召回率类似地是黄金标准中出现在预测中完全相同位置的名称数量。F1分数是这两者的调和平均值。由上述定义可知,任何遗漏单个词元、包含多余词元或类型错误的预测,对该跨度而言均计为完全失败。

方法与应用程序

传统NER系统依赖手工规则和基于特征的统计模型,如条件随机场。随着机器学习深度学习的兴起,现代系统通常使用神经网络架构,包括基于Transformer (architecture)的模型,这些已成为最先进性能的标准。这些模型通常在大规模语料库上进行预训练,并针对NER任务进行微调,受益于OpenAIAnthropicGoogle DeepMind等组织开发的大型语言模型的进展。NER广泛用于信息抽取管道,服务于问答、搜索和知识库构建,并且是许多自然语言处理应用程序的关键组件。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:natural-language-processing·information-extraction·machine-learning
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史