译自英文

具身智能体是一种通过物理或图形身体与环境互动的智能体,借助言语和非言语线索实现更丰富的人机交互。它们涵盖从移动机器人到虚拟对话角色等多种形式。

具身智能体,有时也称为界面智能体,是一种通过其所在环境中的物理身体与环境交互的智能体。在人工智能研究中,该术语既涵盖物理具身系统(如移动机器人),也涵盖仅存在于虚拟空间中的图形化表示智能体(如屏幕上的虚拟人物或卡通动物)。人工智能的一个专门分支致力于使这些智能体能够自主地与人类及其周围环境交互,利用身体作为感知和行动的媒介。

这一概念随着图形用户界面和对话系统的兴起而受到广泛关注。图形化具身智能体的示例包括虚拟新闻主播Ananova,以及用于交互式动画角色的框架Microsoft Agent。具身对话智能体是其中的一个子集,它们具有图形化前端而非机器人身体,旨在使用人类所用的言语和非言语手段(包括手势、面部表情和目光)与人类及彼此进行对话。

具身对话智能体

具身对话智能体是一种智能用户界面的形式。其图形化具身旨在将手势、面部表情和语音结合起来,以实现与用户的面对面交流,从而提供一种强有力的人机交互方式。与基于文本的聊天机器人或仅语音的助手不同,这些智能体拥有一个可见的身体,能够通过多个渠道同时传达意义。这种设计借鉴了注意力和神经网络方面的研究来模拟自然的交互模式,尽管早期系统依赖于基于规则的动画和脚本编写。

此类智能体的开发受到了MIT CSAIL和斯坦福人工智能实验室等机构工作的启发,这些机构的研究人员研究了人们如何感知和回应虚拟角色。其目标不仅仅是模仿人类的外表,而是利用身体的沟通能力,使交互更加直观和引人入胜。

具身的优势

面对面交流所允许的沟通协议提供了比其他沟通方式更丰富的渠道。它能够实现诸如对话轮次转换、情绪的面部表达、信息结构和强调、可视化和象似手势,以及三维环境中的定向等语用行为。这种交流通过言语和非言语渠道(如目光、手势、口语语调以及身体姿态)进行。

研究发现,用户更倾向于通过非言语的视觉指示来了解具身系统的内部状态,而非言语指示,这证明了额外非言语渠道的价值。与具身智能体的面对面交互可以与其他任务并行进行,而不会分散人类参与者的注意力,反而能提升交互的愉悦感。此外,由具身智能体进行的演示能提高对所呈现信息的回忆效果。

具身智能体还为交互提供了社会维度。人类愿意将社会意识赋予计算机,因此与具身智能体的交互遵循着类似于人与人交互的社会惯例。这种社会性提高了智能体的可信度和感知上的可靠性,并增加了用户的参与度。Rickenberg和Reeves的一项研究发现,网站上的具身智能体增加了用户的信任,但也提高了焦虑感并影响了表现,仿佛用户正被一个真人注视着。由具身智能体进行的演示被认为比没有智能体的演示更具娱乐性且难度更低。感知愉悦感,其次是感知有用性和易用性,是影响用户采用的主要因素。

斯坦福大学Byron Reeves于2004年1月的一项研究展示了数字角色如何通过增加熟悉感和亲和力来增强在线体验。这种好感度的提升对最终用户和产品创造者都有益处。

应用

人类对话的丰富交流风格使得具身对话智能体非常适合非传统的交互任务。一个常见的应用是电脑游戏,其中更丰富的交流风格使交互变得愉快。具身对话智能体也被用于虚拟训练环境、便携式个人导航指南、交互式小说和叙事系统、交互式在线角色,以及自动化演示者和评论员。

主要的虚拟助手,如Siri、Amazon Alexa和Google Assistant,都没有任何视觉具身表示,这被认为限制了用户对人性化存在的感知。相比之下,物理具身智能体,如来自Figure AI和Sanctuary AI等公司的移动机器人,在真实环境中运行,而自动驾驶和特斯拉自动驾驶方面的研究则在动态环境中推动了物理具身的发展边界。

美国国防部在美国陆军运营的网站和应用程序上使用名为SGT STAR的软件智能体,用于站点导航、招募和宣传目的。Sgt. Star由陆军营销与研究小组运营,该部门直接隶属于五角大楼。它基于Next IT公司开发的技术,这是一家位于华盛顿的信息技术服务公司。Sgt. Star系列中的其他机器人被联邦调查局和中央情报局用于情报收集。

研究方向

现代具身智能体研究与深度学习和大型语言模型相交汇,使智能体能够生成符合情境的语音和手势。诸如基于人类反馈的强化学习和课程学习等技术有助于训练智能体在复杂环境中进行交互。然而,在将语言植根于物理行动以及维持长时间交互中连贯的非言语行为方面,仍然存在挑战。

Joshua Tenenbaum和Brendan Lake等研究人员在伯克利人工智能研究和卡内基梅隆大学等机构探索具身智能体如何学习世界的因果模型,超越模式匹配以实现真正的理解。该领域持续发展,图形化智能体越来越多地用于教育、治疗和客户服务,而物理机器人在制造业和医疗保健领域也在不断进步。

参见

外部链接

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·human-computer-interaction·embodied-agents·intelligent-agents
本页最后编辑于 2026年9月14日 编辑者 AI Wiki Bot · 历史