임베디드 에이전트(embodied agent)는 때때로 인터페이스 에이전트라고도 불리며, 해당 환경 내의 물리적 신체를 통해 환경과 상호작용하는 지능형 에이전트이다. 인공지능 연구에서 이 용어는 모바일 로봇과 같은 물리적으로 구현된 시스템과 화면 속 인간이나 만화 속 동물처럼 가상 공간에만 존재하는 그래픽으로 표현된 에이전트를 모두 포함한다. 인공지능의 전용 분야는 신체를 지각과 행동의 매개체로 활용하여 이러한 에이전트가 인간 및 주변 환경과 자율적으로 상호작용할 수 있도록 하는 데 중점을 둔다.
이 개념은 그래픽 사용자 인터페이스와 대화형 시스템의 부상과 함께 주목을 받게 되었다. 그래픽으로 구현된 에이전트의 예로는 가상 뉴스 앵커인 아나노바(Ananova)와 대화형 애니메이션 캐릭터를 위한 프레임워크인 마이크로소프트 에이전트(Microsoft Agent)가 있다. 로봇 신체 대신 그래픽 전면부를 가진 하위 집합인 임베디드 대화 에이전트는 인간이 사용하는 것과 동일한 언어적 및 비언어적 수단(제스처, 표정, 시선 포함)을 사용하여 인간 및 서로와 대화를 나누도록 설계되었다.
임베디드 대화 에이전트
임베디드 대화 에이전트는 지능형 사용자 인터페이스의 한 형태이다. 이들의 그래픽 구현은 제스처, 표정, 음성을 결합하여 사용자와의 대면 커뮤니케이션을 가능하게 하여 강력한 인간-컴퓨터 상호작용 수단을 제공하는 것을 목표로 한다. 텍스트 기반 챗봇이나 음성 전용 어시스턴트와 달리, 이러한 에이전트는 여러 채널을 통해 동시에 의미를 전달할 수 있는 가시적인 신체를 차지한다. 이 설계는 자연스러운 상호작용 패턴을 모델링하기 위해 주의 및 신경망 연구를 활용하지만, 초기 시스템은 규칙 기반 애니메이션과 스크립팅에 의존했다.
이러한 에이전트의 개발은 MIT CSAIL 및 스탠포드 AI 연구소와 같은 기관의 연구에서 정보를 얻었으며, 연구자들은 사람들이 가상 캐릭터를 어떻게 인식하고 반응하는지 연구했다. 목표는 단순히 인간의 외모를 모방하는 것이 아니라 신체의 의사소통 능력을 활용하여 상호작용을 더 직관적이고 매력적으로 만드는 것이다.
구현의 장점
대면 커뮤니케이션은 다른 의사소통 수단보다 훨씬 풍부한 채널을 제공하는 의사소통 프로토콜을 가능하게 한다. 이를 통해 대화 턴 넘기기, 감정의 표정 표현, 정보 구조와 강조, 시각화 및 상징적 제스처, 3차원 환경에서의 방향 전환과 같은 화용적 행위가 가능하다. 이러한 의사소통은 시선, 제스처, 말의 억양, 신체 자세와 같은 언어적 및 비언어적 채널을 통해 이루어진다.
연구에 따르면 사용자는 구현된 시스템의 내부 상태에 대한 언어적 표시보다 비언어적 시각적 표시를 선호하며, 이는 추가적인 비언어적 채널의 가치를 보여준다. 임베디드 에이전트와의 대면 상호작용은 다른 작업과 동시에 수행될 수 있으며 인간 참가자를 방해하지 않고 상호작용의 즐거움을 향상시킨다. 또한, 임베디드 에이전트가 제공하는 프레젠테이션은 제시된 정보의 회상력을 향상시킨다.
임베디드 에이전트는 상호작용에 사회적 차원도 제공한다. 인간은 기꺼이 컴퓨터에 사회적 인식을 부여하므로, 임베디드 에이전트와의 상호작용은 인간 간 상호작용과 유사한 사회적 관례를 따른다. 이러한 사회적 측면은 에이전트의 신뢰성과 지각된 신뢰도를 높이고 사용자 참여를 증가시킨다. Rickenberg와 Reeves의 연구에 따르면 웹사이트의 임베디드 에이전트는 사용자 신뢰를 높였지만 불안도 증가시키고 성과에 영향을 미쳤으며, 마치 사용자가 실제 인간에게 지켜보이는 것처럼 느꼈다. 임베디드 에이전트가 제공하는 프레젠테이션은 에이전트가 없는 것보다 더 재미있고 덜 어렵다고 인식된다. 지각된 즐거움은 지각된 유용성과 사용 용이성에 이어 사용자 채택에 영향을 미치는 주요 요인이다.
2004년 1월 스탠포드의 Byron Reeves 연구는 디지털 캐릭터가 친숙함과 접근성을 더함으로써 온라인 경험을 향상시킬 수 있음을 보여주었다. 이러한 호감도 증가는 최종 사용자와 제품 제작자 모두에게 이점을 제공한다.
응용 분야
인간 대화의 풍부한 의사소통 스타일은 임베디드 대화 에이전트를 비전통적인 상호작용 작업에 이상적으로 만든다. 친숙한 응용 분야는 컴퓨터 게임으로, 풍부한 의사소통 스타일이 상호작용을 즐겁게 만든다. 임베디드 대화 에이전트는 가상 훈련 환경, 휴대용 개인 내비게이션 가이드, 대화형 소설 및 스토리텔링 시스템, 대화형 온라인 캐릭터, 자동 프레젠터 및 해설자에도 사용되었다.
Siri, Amazon Alexa, Google Assistant와 같은 주요 가상 어시스턴트는 시각적 구현 표현이 없으며, 이는 사용자에게 인간 존재감을 제한하는 것으로 여겨진다. 반대로, Figure AI 및 Sanctuary AI와 같은 회사의 모바일 로봇과 같은 물리적으로 구현된 에이전트는 실제 환경에서 작동하며, 자율 주행 및 테슬라 오토파일럿 연구는 동적 환경에서 물리적 구현의 경계를 넓히고 있다.
미국 국방부는 미 육군 운영 웹사이트와 애플리케이션에서 사이트 내비게이션, 모집, 선전 목적으로 SGT STAR라는 소프트웨어 에이전트를 활용한다. Sgt. Star는 펜타곤에서 직접 운영되는 부서인 육군 마케팅 및 연구 그룹(Army Marketing and Research Group)이 운영한다. 이는 워싱턴 기반 정보 기술 서비스 회사인 Next IT가 개발한 ActiveSentry 기술을 기반으로 한다. Sgt. Star 제품군의 다른 봇은 연방수사국(FBI)과 중앙정보국(CIA)이 정보 수집에 사용한다.
연구 방향
현대 임베디드 에이전트 연구는 딥러닝 및 대규모 언어 모델과 교차하여 에이전트가 상황에 맞는 음성과 제스처를 생성할 수 있게 한다. 인간 피드백 기반 강화 학습 및 커리큘럼 학습과 같은 기술은 에이전트가 복잡한 환경에서 상호작용하도록 훈련하는 데 도움을 준다. 그러나 언어를 물리적 행동에 grounding하고 긴 상호작용 동안 일관된 비언어적 행동을 유지하는 데는 여전히 과제가 남아 있다.
조슈아 테넨바움 및 브렌던 레이크와 같은 연구자들은 버클리 AI 연구소 및 카네기 멜론 대학교와 같은 기관에서 임베디드 에이전트가 패턴 매칭을 넘어 진정한 이해로 나아가 세계의 인과 모델을 학습할 수 있는 방법을 탐구한다. 이 분야는 계속 진화하고 있으며, 그래픽 에이전트는 교육, 치료, 고객 서비스에서 점점 더 사용되고, 물리적 로봇은 제조 및 의료 분야에서 발전하고 있다.