深度语言处理是自然语言处理(NLP)中的一个框架,它借鉴了理论语言学和描述语言学。它主要通过形式句法和语义理论来建模语言,例如组合范畴语法(CCG)、中心语驱动短语结构语法(HPSG)、词汇功能语法(LFG)、树邻接语法(TAG)以及布拉格学派。与较浅层的方法不同,深度语言处理生成表达丰富的结构表示,能够直接捕捉长距离依赖和底层的谓词-论元结构,旨在对语言进行知识密集型的分析。
这种知识密集型方法历来需要大量计算资源,有时被认为难以处理。然而,到21世纪初,研究已显著提高了深度处理的效率,而在现代,对于使用深度语言处理的应用来说,效率已不再是主要障碍。
与浅层语言处理的对比
传统上,深度语言处理关注于用于解析和生成的计算语法开发。这些语法是手动开发的,维护成本高且计算开销大。近年来,机器学习方法(也称为浅层语言处理)从根本上改变了NLP。快速创建健壮且覆盖广泛的机器学习工具所需的手动劳动大幅减少,因此深度方法受到的关注较少。
然而,一些计算语言学家认为,为了让计算机理解自然语言或进行推理,详细的句法和语义表示是必要的。浅层系统可能缺乏类人理解。首先,考虑句子:“如果微软位于乔治亚州,情况会有所不同。”浅层信息提取系统可能错误地推断微软总部在乔治亚州,而人类从反事实中理解微软从未设在那里。其次,考虑:“以色列心理研究所于1971年5月由Prof. Joel成立,作为以色列心理生物学中心。”浅层系统可能错误地推断以色列成立于1971年,而人类知道这是指该研究所。这些例子表明,浅层处理通过统计操作文本和标注资源提供知识较匮乏的分析,而深度处理通过手动开发的语法提供知识密集型的分析。
子社区与形式体系
深度计算语言学家根据采用的语法形式主义分为不同子社区。DELPH-IN倡议是一个重大的合作项目,致力于HPSG;HPSG会议是其核心论坛。ParGram 和 ParSem 合作项目聚焦于基于LFG的语法和语义开发,LFG会议则作为中心事件。XTAG研究小组致力于TAG,并以其TAG+会议为核心聚集地。这些群体并非详尽无遗,其他形式主义和社区也贡献于深度语言处理。
现代发展与整合
虽然深度语言处理起源于手动语法编写,但它日益与 Machine learning 和 Deep learning 技术相结合。一些研究将深度句法和语义表示与 Neural network 模型结合,以提高解析的准确性和鲁棒性。然而,目前主流NLP大多依赖基于 Transformer (architecture) 架构的 Large language model,这与深度语法方法形成鲜明对比。尽管如此,深度语言处理在需要精确语义解释的任务中仍具有价值,例如在专业领域的 Machine learning 或自然语言推理中。
与当代AI的关系
在更广泛的 Artificial intelligence 研究背景下,深度语言处理提供了一种符号化、基于规则的替代新兴统计方法。组织如 Nokia Bell Labs 和 Xerox PARC 在计算语言学史上有所贡献。 MIT CSAIL、Stanford AI Lab 和 University of Toronto 的现代工作常探索混合方法。深度处理中使用的形式主义语法提供了可解释的结构,这不同于 Neural network 模型的不透明表示。这种可解释性被认为对需要需要问责或逻辑推理的任务至关重要。
尽管存在竞争,深度语言处理仍持续作为研究范式。它影响了资源(包括树库和语法工程工具)的开发,并继续促进理论语言学的发展。截至2020年代,没有任何单一方法能完全替代先进NLP应用中对深度、结构化语言理解的需求。
参见
- Artificial intelligence
- Machine learning
- Large language model
- Transformer (architecture)
- Sequence-to-Sequence (Seq2Seq)