Emily M. Bender是华盛顿大学的语言学教授,也是学术界对大型语言模型理解或知晓能力的夸大说法进行批评的主要声音之一。
Bender的学术背景是计算语言学,她的研究长期以来聚焦于语言形式与意义之间的关系,以及将流畅的语言生成视为真正理解证据的风险。在2020年与Alexander Koller合著的论文《攀登NLU:数据时代的意义、形式与理解》中,Bender提出了“章鱼测试”,这是一个思想实验,其中一只超级聪明的章鱼仅通过观察两个人通过电缆交流,而无法接触他们所描述的物理世界,学会了生成统计上合理的回应,却从未理解词语所指的内容。Bender用这个类比来论证,仅基于文本统计模式训练的系统,无论规模多大,都不能假定其像人类说话者那样获得了意义或理解。
随机鹦鹉
2021年,Bender与Timnit Gebru、Angelina McMillan-Major和Margaret Mitchell合著了《论随机鹦鹉的危险:语言模型能否过大?》。这篇论文在Gebru和Mitchell任职于谷歌期间撰写,认为扩展大型语言模型会带来环境成本,可能编码并放大网络抓取训练数据中存在的社会偏见,生成难以审计事实准确性的文本,并鼓励用户甚至研究人员将流畅输出误认为理解,这一批评为该领域提供了广泛使用的术语随机鹦鹉。该论文的发表以及谷歌对其的反对意见,促成了Gebru高调离开该公司。
公开评论
Bender一直是反对将语言拟人化的最显眼的学术声音之一,她描述聊天机器人并推动使用更精确、非心智化的词汇来描述大型语言模型的行为,例如反对将模型描述为在字面意义上理解、知晓或产生幻觉,即使接受诸如幻觉之类的术语作为该领域内的既定简称。她与社会学家Alex Hanna共同主持播客“Mystery AI Hype Theater 3000”,在节目中两人批判性地审视媒体对AI能力的报道和行业声明。
影响
Bender基于语言学的怀疑态度已成为关于通用人工智能时间线和大型模型中涌现理解能力主张的辩论中的标准参考点,经常与Gary Marcus等研究者的批评一起被引用,作为对主要AI实验室更乐观叙事的制衡。