自然语言理解(NLU,也称自然语言解释,NLI)是人工智能和自然语言处理的一个子集,专注于机器阅读理解。它涉及使计算机能够从人类语言输入中推导出含义,无论是口语还是书面语。NLU被称为AI难题,因为它需要广泛的世界知识以及处理歧义、语境和表达变异的能力。该领域具有相当大的商业利益,因为其在自动推理、机器翻译、问答、新闻采集、文本分类、语音激活、归档和大规模内容分析中的应用
NLU系统在范围和深度上差异很大。广度指的是系统能处理的词汇和语法的大小,而深度指的是其理解接近流利母语者的程度。简单的命令解释器既窄又浅,而解析完整报纸文章的系统则既广又深。大多数实际应用介于这两个极端之间,例如按主题分类消息的电子邮件路由系统,而无需深层语义理解
历史发展
对NLU的早期尝试可追溯到1960年代。1964年,Daniel Bobrow在麻省理工学院为其博士论文编写了STUDENT程序,该程序通过理解简单的自然语言输入来解决代数应用题。一年后,Joseph Weizenbaum在麻省理工学院创建了ELIZA,这是一个交互式程序,通过将关键词与预设短语进行模式匹配来模拟对话,尽管ELIZA缺乏真正的理解,但它展示了公众对机器对话的兴趣
1969年,Roger Schank在斯坦福大学引入了概念依赖理论,该理论通过原始动作来表示意义,并对后来耶鲁大学的工作产生了影响,1970年,William A. Woods开发了增强转移网络(ATN),一种使用递归有限状态自动机解析自然语言的形式体系,1971年,Terry Winograd在麻省理工学院完成了SHRDLU,该系统能够通过英语命令理解和操作一个虚拟的积木世界,这是展示情境理解的一个里程碑
在1970年代和1980年代,SRI International等研究小组推进了NLU技术,商业努力也随之出现,包括Symantec(由Gary Hendrix于1982年创立)和Cognitive Systems Corp.(由Roger Schank共同创立)1983年,Michael Dyer在耶鲁大学构建了BORIS系统,该系统处理叙事理解,然而,这些系统仅限于狭窄领域,缺乏通用理解能力
机器学习时代
第三个千年带来了机器学习方法到NLU。IBM Watson在2011年赢得了问答节目《危险边缘!》,它使用统计方法进行问答,尽管哲学家John Searle等批评者认为Watson并未真正理解问题,在2010年代,word2vec等词嵌入将单词表示为稠密向量,捕捉句法和语义关系,后来,基于变换器的模型如BERT引入了大规模预训练后微调,显著提高了问答和自然语言推理等任务的性能
这些进展,由深度学习和神经网络驱动,导致了大型语言模型的发展,如GPT-3及其后继者,,它们生成流畅的文本并以高准确度执行许多NLU任务,,然而,专家们争论这些模型是否表现出真正的理解还是仅仅是统计模式匹配,,认知科学家John Ball,Patom Theory的发明者,,认为传统NLP仍然失败,因为人类语言中有成千上万种方式请求某物,,Wibe Wagemans指出,,与机器进行有意义的对话需要将每个单词与基于上下文的正确含义匹配,,就像3岁孩子无需猜测就能做到的那样
核心任务和技术
NLU包含几个核心任务,,包括命名实体识别、词性标注、句法解析、语义角色标注和共指消解,,这些任务为更高级的应用提供支持,,如对话系统中的意图检测、情感分析和自然语言推理,,传统方法使用基于规则的语法和手工设计的特征,,但现代系统主要依赖机器学习,,尤其是变换器架构
词嵌入如word2vec以及来自BERT等模型的上下文嵌入,,使系统能够以捕捉基于用法的含义的方式表示单词,,在大型语料库上进行预训练后针对特定任务进行微调已成为标准范式,,这种方法在问答方面取得了突破,,系统可以从段落中提取答案,,在自然语言推理中,,它们确定假设是否从前提中得出
应用和商业利益
NLU有许多实际应用,,语音助手如Apple的Siri、Amazon的Alexa和Google Assistant依赖NLU来解释用户命令,,客户服务聊天机器人使用NLU来路由查询并提供响应,,文本分类系统自动分类电子邮件、新闻文章和法律文件,,机器翻译系统如Google Translate使用NLU来理解源文本并生成翻译,,在医疗保健中,,NLU帮助从临床笔记中提取信息,,在金融中,,它分析收益报告和新闻以获取交易信号
商业利益强劲,,因为NLU可以自动化以前需要人类阅读和理解的任务,,像OpenAI、Anthropic和Google DeepMind这样的公司大力投资开发先进的NLU模型,,云提供商如Amazon Web Services、Microsoft Azure和Google Cloud提供NLU服务作为API,,然而,,当前系统的局限性,,特别是缺乏稳健的常识推理,,仍然是完全理解的障碍
挑战和未来方向
NLU面临持续的挑战,,包括歧义、上下文依赖性以及对世界知识的需求,,理解一个句子通常需要关于物理和社交世界的知识,,这些知识并未明确说明,,例如,,"奖杯放不进棕色手提箱,因为它太小了"需要知道哪个物体小,,当前模型通常难以进行此类语用推理
未来方向包括将NLU与外部知识库集成、改进少样本和零样本学习以及开发能够推理和解释其决策的模型,,研究人员还在探索多模态理解,,其中语言与视觉和其他模态相结合,,截至2020年代初,,没有系统达到人类水平的NLU,,它仍然是人工智能中的一个开放问题