图灵测试是评估机器能否表现出与人类无法区分的对话行为的标准。该测试由数学家艾伦·图灵在1950年题为“计算机器与智能”的论文中提出,它将“机器能思考吗?”这一问题重新表述为一种经验性的“模仿游戏”:一位人类裁判与两个隐藏参与者(一人一机)进行基于文本的对话,并必须判断哪个是哪个。如果裁判无法可靠地区分机器与人类,则称该机器通过了测试。
图灵旨在将测试作为对机器意识或思维这一哲学上棘手问题的实用替代,避开形而上学争论,转而采用可观察的行为标准。该测试比人工智能领域成立早了六年;“人工智能”一词本身是在1956年由约翰·麦卡锡和马文·明斯基等人组织的达特茅斯研讨会上创造的,他们受到了图灵框架的影响。
起源与形式
图灵最初的构想涉及三个参与者:一位人类询问者、一位人类应答者和一台机器,仅通过打字文本进行交流,以排除声音或外貌的线索。此后发展出的变体包括“标准”的两参与者版本,即裁判仅与一个实体聊天并猜测其是否为人类,以及正式竞赛,如1990年至2019年每年举办的勒布纳奖,该奖项奖励被判定为最像人类的聊天机器人,尽管没有一款能实现不受限制的通过。
早期尝试与批评
像伊丽莎这样的程序,由约瑟夫·维森鲍姆于1966年创建以模拟罗杰斯式心理治疗师,曾愚弄一些用户相信自己在与真人交谈,尽管它仅使用简单的模式匹配而非理解。维森鲍姆后来成为夸大机器智能的著名批评者,而人们倾向于将理解归因于仅模仿对话形式的系统,这一现象现在常被称为“伊丽莎效应”。
批评者长期以来认为该测试衡量的是欺骗而非智能。哲学家约翰·塞尔1980年的“中文房间”思想实验主张,一个系统可以令人信服地操纵符号而无任何真正的理解,从而挑战该测试作为思维标志的有效性。其他人指出该测试以人类为中心,奖励类人的怪癖和错误而非准确或能干的行为,并且一个狭隘训练的聊天机器人可能通过对话技巧而非通用推理来通过测试。
现代相关性
自2022年11月ChatGPT推出以来,大型大语言模型系统的兴起重新引发了关于该测试相关性的辩论。自2023年以来,多项非正式和学术研究报告称,现代对话模型在短交流中能以与人类同伙相当或更高的比率愚弄人类裁判,尽管方法论和关于“通过”的确定性说法仍存在争议。许多研究人员现在将图灵测试视为一个有趣的历史基准,而非衡量机器智能或通用人工智能的有意义标准,指出流畅的对话不再意味着该领域现在与通用智能相关联的广泛推理、规划和扎根理解。自然语言处理和推理中的更有针对性的基准,包括像ARC-AGI这样的测试,已基本取代其作为研究工具的地位,尽管图灵测试在大众文化中仍作为“机器是否像人?”的代名词而持续存在。