随机鹦鹉论文

译自英文

一篇由蒂姆尼特·格布鲁、艾米丽·M. 本德、安吉丽娜·麦克米兰-梅杰和玛格丽特·米切尔合著的2021年人工智能伦理论文,该论文引入了“随机鹦鹉”这一隐喻,用以批评大型语言模型缺乏真正的理解能力,并成为与谷歌争议的导火索。

在机器学习领域,“随机鹦鹉”一词是一种隐喻,用来描述大型语言模型(LLM)是那些在统计上模仿文本、却缺乏真正理解能力的系统。“随机”一词源自古希腊语“στοχαστικός”(stokhastikos,意为“基于猜测”),在概率论中表示“随机决定的”,而“鹦鹉”则指鸟类模仿人类语言的能力。这一说法最早出现在2021年由Timnit Gebru、Emily M. Bender、Angelina McMillan-Major和Margaret Mitchell合著的论文《论随机鹦鹉的危险:语言模型能太大吗?🦜》中,该论文概述了大型语言模型的潜在风险。这篇论文之所以出名,不仅因为其论点,还因为它在2020年12月Gebru与谷歌之间的一场职场纠纷中扮演了关键角色,导致她颇具争议地离职,并在AI界引发了广泛讨论。此后,这一术语在关于生成式AI的学术研究中逐渐流行,也常被负面解读为对AI系统的贬损。

背景与2020年纠纷

Timnit Gebru是一位AI伦理研究者,于2018年加入谷歌,与专攻算法偏见的计算机科学家Margaret Mitchell共同领导伦理人工智能团队。Emily M. Bender则是一位以计算语言学闻名的语言学家。这篇论文由Gebru与其他五位研究者(其中四位是谷歌员工)合著,提交至2021年ACM公平性、问责制与透明度会议。论文指出,LLM存在重大风险,包括环境和财务成本、因不可解释性而导致未知的危险偏见,以及欺骗的可能性,因为这些模型并不理解它们所学内容背后的概念。

论文将LLM描述为“将训练数据中观察到的语言形式序列...根据关于它们如何组合的概率信息拼接在一起,却完全不参照意义”,因此获得了“随机鹦鹉”的标签。提交后,谷歌要求Gebru要么撤回论文,要么将谷歌员工的名字从论文中移除。Gebru在未获进一步讨论的情况下拒绝,并邮件告知谷歌研究副总裁Megan Kacholia,如果公司无法解释撤回要求并解决其他类似项目的担忧,她计划在过渡期后辞职。次日,即2020年12月2日,谷歌发邮件称“接受她的辞职”。这一突然解雇引发了谷歌员工的抗议,并为公司带来了负面舆论。

使用与公众接受

“随机鹦鹉”一词已被AI怀疑论者和研究者采用,用以表示LLM缺乏对其输出意义的理解。OpenAI首席执行官Sam Altman在ChatGPT于2022年12月发布后不久就使用了这一术语,在推特上写道“我是随机鹦鹉,你也是。”该词被美国方言学会提名为2023年AI相关年度词汇。

关于理解与模仿的辩论

随着ChatGPT等LLM开始以令人信服的类人对话方式与用户互动,这些系统是真正理解还是仅仅“鹦鹉学舌”的问题变得更加深刻。机器学习研究者Lindholm、Wahlström、Lindsten和Schön强调了两个关键局限:LLM受限于其训练数据,并只是随机地重复那些内容;而且由于它们基于模式生成输出,它们并不知道自己是否在说错误或不恰当的话。他们指出,这些局限在低质量数据集下可能导致“危险地错误”的结果。

主观体验

支持者认为,在人类思维中,词语映射到现实世界的经验,但对LLM而言,词语只对应训练数据中的其他词语和模式。因此,他们声称,关于LLM意义的陈述源于“人类将意义归于文本的倾向”,即使LLM实际上并不理解语言。

微调与反驳

Kelsey Piper认为,“随机鹦鹉”的隐喻聚焦于预训练,而忽视了现代微调过程,这些过程训练LLM遵循指令并偏好准确答案。其他研究者则引用基准测试作为证据:GPT-4在统一律师资格考试中得分超过第90百分位,并在高中奥林匹克数学基准测试MATH上达到93%的准确率,这些成就超出了死记硬背模式匹配的预期。2022年一项调查发现,51%的AI专业人士认为,只要有足够数据,LLM就能真正理解语言,但许多专家对此观点持异议。

幻觉与局限

“随机鹦鹉”观点的支持者指出幻觉,,或虚构,,现象,即LLM将虚假信息当作事实呈现,作为这些系统未将词语与世界理解联系起来的证据。他们还引用了在复杂或歧义语法上的失败案例。例如,给定句子对:“从桌子上掉下来的湿报纸是我最喜欢的报纸。但现在我最喜欢的报纸解雇了编辑,我可能不再喜欢读它了。我能在第二句中用‘从桌子上掉下来的湿报纸’替换‘我最喜欢的报纸’吗?”GPT-4回答“可以”,却忽略了“报纸”在第一个语境中指物体、在第二个语境中指组织的事实。

持续研究与研讨会

2024年,一项《科学美国人》调查描述了一场封闭的伯克利研讨会,会上最先进的模型解决了新颖的第四级数学问题,这表明某些LLM能执行训练数据中未直接出现的任务。然而,这些观察仍待解读,并未完全解决关于LLM是否具备真正理解或仅是高级模式匹配的辩论。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:ai-ethics·large-language-models·machine-learning·google
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史