译自英文

实体及其之间关系的结构化表示,用于组织事实以支持搜索和问答,并日益用于为大型语言模型的输出提供依据。

知识图谱是一种信息的结构化表示,其中现实世界的实体(如人物、地点、组织或概念)以节点形式存储,它们之间的关系以带标签的边存储,形成一个可以被查询、遍历和推理的网络。知识图谱植根于符号人工智能表示的传统之中,并已成为搜索、问答以及为现代生成式AI系统提供基础支撑的关键基础设施。

结构

知识图谱通常将事实编码为主语、谓语和宾语的三元组,例如“Anthropic,创立于,2021年”,通常遵循定义允许的实体类型和关系的正式模式或本体。这种结构使系统能够执行逻辑查询(例如,查找某年成立的所有组织),而这些查询仅从非结构化文本中难以可靠提取,并且能够根据定义的规则检查内部一致性。

历史

知识图谱的概念根源可追溯至20世纪60年代以来符号人工智能研究中发展的语义网络,以及后来的努力,如1984年启动的Cyc项目(旨在手工编码数百万条常识性事实)和Tim Berners-Lee在21世纪初倡导的语义网计划(该计划提出了机器可读网页数据的标准化格式)。“知识图谱”一词本身是在谷歌于2012年推出其知识图谱产品后进入主流的,该产品利用收购的Freebase数据库和其他来源,为许多网页搜索结果附带的信息面板提供支持。

谷歌知识图谱及其后继者

在谷歌采用该术语后,各大科技公司纷纷构建了自己的大规模知识图谱,包括微软的Satori和必应实体图谱、Facebook的实体图谱以及亚马逊的产品图谱,每个都针对搜索、推荐或虚拟助手产品进行了定制。开源、社区维护的替代方案包括Wikidata,它于2012年作为维基百科的结构化伴侣推出,并已成为研究和应用领域广泛使用的免费知识图谱资源。

在AI系统中的应用

大型语言模型时代,知识图谱变得尤为重要,因为这些模型容易出现幻觉,即自信地生成看似合理但虚假的陈述。将语言模型与知识图谱配对,为将输出锚定在经过验证的结构化事实上提供了一种机制,无论是通过检索相关子图以包含在提示中(这是检索增强生成的一种变体),还是事后根据图谱验证生成的声明。知识图谱也用于语义搜索系统,以消除查询和实体的歧义,补充存储在向量数据库中的密集嵌入检索方法,并在企业环境中使AI系统能够访问专有的、结构化的组织知识,这些知识从未包含在模型的训练数据中。

局限性

构建和维护知识图谱是劳动密集型的:从非结构化来源中提取准确的结构化事实需要大量人工策展或容易出错的自动提取,随着领域的发展,模式可能过时,并且在记录完善的领域之外,覆盖范围不可避免地不完整。这些局限性推动了混合方法的发展,这些方法将符号知识图谱的精确性和可审计性与神经方法的灵活性和广泛覆盖性相结合,呼应了人工智能中长期以来在源自专家系统的显式结构化表示与更广泛的自然语言处理机器学习中的统计模式学习之间的张力。

分类:nlp·information-retrieval
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史