译自英文

接地是系统所使用的符号或表征与其现实世界指称、感官体验或可验证事实相连接所面临的挑战,而非仅与其他符号相连。

在人工智能领域,接地(Grounding)指的是将系统所使用的符号、词语或表征连接到现实世界的指称物、感官体验或可验证的外部事实,而不是让它们仅仅指代系统内部的其他符号。这一问题由认知科学家史蒂文·哈纳德(Stevan Harnad)在1990年一篇关于“符号接地问题”的论文中正式提出,该论文探讨了一个纯粹操作符号的系统如何能让其符号具有意义,而不仅仅是按照句法规则洗牌无意义的标记。

随着大型语言模型的兴起,这一问题再次变得紧迫,因为这些模型仅基于文本模式进行训练,与它们所描述的世界没有直接的感官接触,这一担忧与随机鹦鹉批评密切相关,即模型能生成流畅但可能无意义的输出。

作为工程问题的接地

在实践中,“接地”模型的输出已成为行业术语,指将其答案限制在可验证的外部来源上,而不是仅仅依赖参数化记忆,最常见的方式是通过检索增强生成,其中检索到的文档被引用或引用以减少幻觉。搜索增强型助手和企业聊天机器人经常被描述为在输出可追溯到特定检索段落时产生“接地”答案,这与纯粹从模型训练数据中提取的无约束生成形成对比。

通过具身性和模态的接地

另一个研究传统认为,真正的接地需要与物理世界的感官运动交互,这推动了具身AI机器人学领域的工作,在这些领域中,系统的表征是通过作用于环境并感知环境而形成的,而不是通过阅读关于环境的文本。多模态视觉语言模型部分解决了这一问题,通过将语言与图像、音频或视频联系起来,为表征提供了至少感知上的锚点,而关于世界模型的相关研究则试图为系统提供对物理因果关系的内部预测模拟。

持续争论

当前语言技术是否能仅通过文本和多模态数据实现真正的接地,还是它必然仍然是一种复杂的模式补全形式,这一问题尚未解决。一些研究者认为接地是一个程度问题,检索、工具使用和多模态感知各自增加了部分接地,而不是彻底解决问题,而另一些人则坚持认为,哲学意义上的接地需要具身经验,而当前任何系统都不具备这种经验。这一争论与随机鹦鹉批评提出的问题密切相关但有所不同,因为一个系统原则上可以很好地接地于检索到的事实,同时仍然缺乏对这些事实更深层次的概念理解。

分类:cognitive-science·natural-language-processing·ai-safety
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史