随机鹦鹉是一个术语,用来指代一种语言模型,它通过统计性地重组训练数据中的模式,流畅地生成听起来合理的文本,但对其所生成词语背后的含义并无真正的理解。这一说法源自2021年论文《论随机鹦鹉的危险:语言模型会不会太大?》的标题,作者是Emily Bender、Timnit Gebru、Angelina McMillan-Major和Margaret Mitchell。这篇论文成为对大型语言模型研究方向最常被引用且最具争议的批评之一,而该方向不久后催生了GPT-3级别的系统,以及后来的ChatGPT。
该论文认为,基于抓取的网络文本训练越来越大的语言模型会带来严重风险:环境和财务成本、未经筛选的训练语料库中编码并放大的偏见,以及研究人员和公众都容易将流畅的输出误认为真正的理解。
起源与争议
这篇论文的发表与Gebru在2020年12月离开谷歌一事纠缠在一起。她称自己是因为公司要求她撤回论文或移除谷歌附属合著者的名字而被解雇;谷歌则称这是辞职。这一事件引起了广泛关注,凸显了大型实验室中AI伦理研究与产品团队之间的内部紧张关系,并成为AI伦理领域最广为讨论的事件之一。Bender和Gebru更广泛的论点延续了自然语言处理研究中关于训练数据质量和审计网络规模语料库难度的早期关切。
核心论点
语言模型被训练为根据先前上下文预测统计上最可能的下一词元,作者认为这一目标产生了令人信服的形式,但词语并未扎根于现实世界的意义或意图,这与AI中更广泛的Grounding (AI)问题密切相关。论文警告说,这种缺乏根基的流畅性使得幻觉和带有偏见的内容尤其危险,因为人类读者会本能地将理解和可靠性归因于流畅的文本。
反响与后续争论
这一术语进入了日常使用,既作为严肃的研究批评,也作为针对LLM热潮的修辞性贬损。支持规模扩展的人反驳说,后来关于涌现能力以及模型在推理、工具使用和多步规划方面表现出的明显能力的研究,使纯粹的“随机”定性变得复杂,但批评者坚持认为流畅的输出仍可与经过验证的理解区分开来。这一争论尚未解决,并继续塑造着关于大型语言模型究竟真正知道什么还是仅仅复制的讨论,同时也在后来的术语中有所回响,例如描述大规模机器生成文本低质量端的AI垃圾内容。