计算语义学是人工智能和计算语言学的一个子领域,专注于自然语言表达意义表示的自动构建与操作。它弥合了形式语义学(使用逻辑和数学描述语言意义)与实用工程之间的鸿沟,使计算机能够处理、存储并推理人类生成文本的内容。该学科探讨的问题包括如何表示句子的意义,如何从句法结构和词汇中推导出该表示,以及如何在智能系统中使用这些表示,从大型语言模型到问答引擎。
历史上,计算语义学源于20世纪70年代和80年代对受限领域(如数据库查询接口)进行解析和解释的努力,在这些领域中,形式语法可以将句子直接映射为逻辑形式。早期系统采用阿隆佐·丘奇引入的lambda演算来处理组合性,即整体意义是其部分意义及其组合规则的函数。理查德·蒙塔古等研究者在20世纪60年代末和70年代初证明,自然语言可以用与逻辑相同的形式工具进行分析,这一基础性洞见是计算语义学作为关注自动化的领域所强烈依赖的。到20世纪90年代,研究兴趣转向适用于无限制文本的稳健、可扩展方法,将基于语料库的概率技术与逻辑框架相结合。
组合方法与形式框架
经典计算语义学建立在组合性之上,使用神经网络和符号逻辑来构建表示。标准方法通过类型化lambda演算将句子的解析树转换为逻辑表达式,通常是一阶逻辑或其扩展形式。例如,句子“Every dog sleeps”可能表示为∀x(dog(x) → sleep(x)),其中量词“every”和谓词形式按严格顺序应用。为处理更复杂的现象,研究者开发了序列到序列模型和其他算法,将表层结构映射到语义图,如抽象意义表示(AMR),它以有根有向图的形式编码基于框架的意义。
歧义是一个核心挑战:词汇歧义(如“bank”)、辖域歧义(如“every man loves a woman”)和指称歧义都需要消解。在计算实践中,这通常通过欠指定来管理,即表示保持部分未实例化,直到上下文提供解决方案,或通过基于解析语料库的统计学习,其中概率引导对可能解释的选择。2010年代变换器和多头注意力的整合使得话语分析远超手工编码规则,因为它们通过关注远距离上下文信息来编码意义。
统计与神经方法
机器学习的普及,尤其是深度学习,已将计算语义学从纯粹的形式逻辑转向分布式和习得表示。在神经网络模型中,词义表示为高维向量,句子意义通过残差网络和位置编码等操作获得。一个突出方向使用编码器-解码器架构,其中编码器接收句子,解码器生成语义解析,通常为树或图结构,在标注数据集(如AMR标注语料库,例如2013年的AMR发布版、2020年的AMR 3.0语料库)上训练。
另一个主要家族围绕所谓的“自然语言推理”(NLI)和“迁移学习”出现,其中大型预训练模型,如BERT(2018年)或后来的变换器,将句子嵌入向量空间,使得语义相似的句子彼此靠近。这些模型随后用于下游任务:问答、机器翻译和信息检索。此类系统的有效性通过句子变换器准确率或下游任务性能等指标衡量,尽管它们通常不透明且往往缺乏显式符号表示,这引发了研究者之间关于它们是否构成真正的语义还是仅仅是统计技巧的争论。
应用与实用系统
现实世界的计算语义学驱动着许多技术。在搜索引擎和问答中,语义解析器将用户查询转换为类似SQL的逻辑查询,如2011年早期的IBM Watson系统和现代Google DeepMind及OpenAI产品所示。例如,大型语言模型的问答组件可能使用内部语义推理来检索和组合事实。在对话系统中,语义用于理解意图和调度实体,如苹果的Siri或亚马逊的Alexa等虚拟助手,它们将用户语句映射到正式对话行为标签和参数,然后使用这些表示生成响应。
另一个领域是机器翻译,其中关键步骤是跨语言保持语义不变性:诸如基于中间语言的MT框架在20世纪80至90年代流行(如CCLINC系统),旨在实现抽象的语言中立意义表示。当代神经翻译不显式使用语义,而是依赖由编码器-解码器和多头注意力层习得的向量表示。尽管如此,交叉注意力和其他注意力机制用于对齐句子间的意义,模型通常根据语义保持度进行评估(例如通过BLEU,但越来越多地使用语言推理式指标)。
接地问题,即语言意义如何与世界相连,是该领域的另一面。在机器人和具身AI中,计算语义学可能通过将文本指称连接到感知输入来接近图形解释,如Waymo或Figure AI的研究。在此类设置中,使用专用语义解析和概率推理的框架被实现来推断“pick up the red mug”这样的命令是否指代计算机视觉领域中的实际对象。
与形式逻辑语义学的融合
另一条研究路线试图通过使用形式逻辑对机器输出施加约束来调和机器学习与经典语义学。这种混合方法旨在或用于对生成文本施加许可一致性、语法一致性或逻辑连贯性。例如,语义约束生成器可能被训练为包含特定模板化关系或使用规则进行逻辑量化。另一种方法是重新融合符号知识库作为教师,如约书亚·特南鲍姆在因果建模和布伦丹·莱克在类人概念学习中的工作所示。
在实践中,这些技术旨在弥合“符号接地”差距和可解释性。在安全关键问题中,如从医院记录或法律文件中提取信息,通过清晰语义进行验证是部署的前提条件。“语义约束的合规性”因此成为计算生成式AI的主要研究领域。
未来方向与开放问题
在整个领域中,仍有几个开放问题。首先,组合泛化问题:即使最先进的神经系统也无法处理训练中未观察到的已知部分组合。这导致了对SCAN或COGS等数据集的评估,这些数据集惩罚此类普通行为。其次,分布外鲁棒性和双语猜测鲁棒性仍然存在。第三,知识图谱和语言数据上的量化解释仍是一个未解决的挑战,系统对此相对精确。第四,将计算语义学与常识知识联系起来,如在大规模语料库中训练的常识,通过使用全局记忆模块来解决。
最终前沿是将分布式和逻辑方法统一到一个连贯框架中。随着大型语言模型中上下文句子表示的发展以及学术界某些部分(如麻省理工学院、斯坦福AI实验室和多伦多大学)中符号AI主题的复兴,研究者旨在识别同时产生神经和显式模型的力量。当前关于检索增强生成和基于实际认知事实的接地研究表明,混合语义方法既必要又可行。
主要研究中心与基础贡献者
几个学术和工业实验室一直处于计算语义学洞见的前沿。概率语义学的稳健使用与克里斯托弗·毕晓普的工作相关,他将贝叶斯方法与机器学习相结合,以及迈克尔·乔丹,他形式化了概率图模型,可直接解析为语义决策。伯纳德·威德罗在自适应滤波方面对当代RAK和学习理论做出了早期贡献。在自然语言处理中,OpenAI和Google DeepMind产生了主要架构原型,而IBM的Watson(2011年)展示了链接框架以回答问题的大规模应用。
在学术方面,多伦多大学和Stelifon von Tyche(???)推动了量化方法。在西方大学或研究经验中,人们必须记住大型语言模型,如GPT系列(2018年引入)和BERT(2018年),它们是语义向量表示的突破。随着领域的发展,标准工具现已通过学术团体倡议(如斯坦福的CoreNLP(2014年))公开可用,但研究界定了基本的理论基础。
最终,计算语义学学科既不是静态的也不是确定性的。它随着AI的进步而动态重构,因为主力语言模型融入了逻辑邻近技巧,并且交互程序挑战着意义计算的边界。目前,计算语义学从精确的自动证明论推理延伸到LLM中的参数波。所有这些努力共享共同目标:将自然语言转化为可供系统行动的计算意义。