유진 구스트먼(Eugene Goostman)은 13세 우크라이나 소년을 시뮬레이션하도록 설계된 챗봇 프로그램이다. 이 프로그램은 2001년 러시아 출신 프로그래머 블라디미르 베셀로프(Vladimir Veselov)와 우크라이나 출신 프로그래머 유진 뎀첸코(Eugene Demchenko)가 만들었다. 이 챗봇은 2014년 6월 런던 왕립학회에서 열린 튜링 테스트를 통과한 최초의 프로그램이 되면서 국제적 주목을 받았으며, 5분간의 텍스트 대화에서 인간 심사위원의 33%가 인간이라고 판단하도록 설득했다.
유진 구스트먼의 페르소나는 영어가 모국어가 아닌 화자로서 언어 구사 능력이 제한적이고, 젊고 회피적인 성격을 지니도록 의도적으로 설계되었다. 이러한 설계 선택은 챗봇이 무지를 주장하거나, 화제를 바꾸거나, 유머러스한 동문서답을 통해 어려운 질문을 피하는 데 도움을 준다. 제작자들은 페르소나의 특이한 점이 심사위원에게 더 설득력 있게 보이도록 한다고 주장했는데, 이는 영어가 모국어가 아닌 청소년에게서 사소한 문법 오류나 동문서답이 예상되기 때문이다.
역사와 개발
베셀로프와 뎀첸코는 둘 다 학생이던 2001년에 유진 구스트먼 개발을 시작했다. 이 프로젝트는 처음에는 취미였지만, 10년 이상의 개선을 거쳐 발전했다. 챗봇의 이름은 베셀로프의 이름(유진)과 뎀첸코의 성(뎀첸코, 구스트먼으로 각색)을 결합한 것이다. 이 프로그램은 현대의 Machine learning이나 Neural network 기술이 아닌 규칙 기반 아키텍처로 구축되었다. 이는 대규모 스크립트 응답 데이터베이스, 패턴 매칭, 휴리스틱 규칙에 의존하여 응답을 생성했다.
2014년 튜링 테스트 행사는 레딩 대학교 교수인 케빈 워릭(Kevin Warwick)이 조직했으며, 5개의 챗봇이 30명의 인간 심사위원과 경쟁했다. 각 심사위원은 챗봇과 인간과 각각 5분간 별도의 대화를 나눈 후 어느 쪽이 인간인지 결정했다. 유진 구스트먼은 33%의 성공률을 달성했으며, 이는 앨런 튜링이 1950년 논문에서 기계 지능의 기준으로 제안한 30% 임계값을 초과한 것이다. 이 결과는 전 세계 미디어에서 널리 보도되었지만, 페르소나의 회피성이 테스트의 한계를 부당하게 이용했다고 주장하는 연구자들의 비판도 받았다.
기술적 접근
OpenAI나 Google DeepMind가 개발한 것과 같은 현대의 Large language model 시스템과 달리, 유진 구스트먼은 Deep learning이나 Transformer (architecture) 아키텍처를 사용하지 않는다. 그 핵심은 결정론적이고 규칙 기반 시스템이다. 챗봇은 대화의 단기 기억을 유지하고 키워드 매칭을 사용하여 수천 개의 사전 작성된 응답 중에서 선택한다. 또한 "성격 특성" 세트 - 예를 들어 조지라는 기니피그와 치과의사인 어머니가 있다고 주장하는 것 - 을 사용하여 일관된 가상 정체성을 만든다.
이 프로그램은 원래 C 언어로 작성되었으며 나중에 다른 언어로 이식되었다. 이는 AWS Trainium이나 Groq 가속기와 같은 특수 하드웨어가 필요 없이 표준 개인용 컴퓨터에서 실행되었다. 제작자들은 테스터의 피드백을 바탕으로 응답 데이터베이스를 주기적으로 업데이트하고 새로운 대화 패턴을 추가했다. 그러나 기본 아키텍처는 변경되지 않아 새로운 주제나 복잡한 추론 작업을 처리하는 능력이 제한되었다.
튜링 테스트 논란
2014년 결과는 Artificial intelligence 커뮤니티 내에서 상당한 논쟁을 촉발했다. Melanie Mitchell 및 다른 연구자들을 포함한 비평가들은 유진 구스트먼의 성공이 진정한 지능보다는 테스트 설계 결함을 반영한 것이라고 주장했다. 챗봇의 페르소나는 질문에 직접 답하는 것을 피할 수 있게 했으며, 문법 오류는 기능이 아니라 속임수로 간주되었다. 일부는 33%라는 수치가 30% 임계값을 간신히 넘는 수준이며, 작은 표본 크기(심사위원 30명, 챗봇 5개)로 인해 결과가 통계적으로 취약하다고 지적했다.
지지자들은 이 테스트가 인간-컴퓨터 상호작용의 이정표이며, 잘 만들어진 페르소나가 제한된 환경에서 인간을 속일 수 있음을 보여준다고 반박했다. 이 행사는 또한 좁은 대화 능력과 일반 지능의 차이를 부각시켰으며, 이는 현대 Generative AI 시스템에 대한 논의에서 여전히 중심적인 구분이다. 이 논란은 Winograd Schema Challenge와 이후 Large language model 추론을 위한 벤치마크와 같은 더 엄격한 평가 방법 개발에 기여했다.
유산과 영향
유진 구스트먼의 명성은 짧았지만 영향력이 있었다. 이는 챗봇 성능을 개선하기 위해 가상 페르소나를 사용하는 아이디어를 대중화했으며, 이 기술은 나중에 일부 상업용 어시스턴트가 채택했다. 이 프로그램은 또한 2010년대 후반 Deep learning과 Transformer (architecture) 모델의 부상으로 곧 가려진 규칙 기반 시스템의 한계에 대한 경고 사례로 작용했다.
오늘날 유진 구스트먼은 대체로 역사적 호기심으로 남아 있다. 제작자들은 다른 프로젝트를 계속 진행했지만, 챗봇 자체는 더 이상 적극적으로 유지 관리되지 않는다. 2014년 행사는 튜링 테스트와 기계 지능 철학에 대한 논의에서 여전히 참조점으로 남아 있으며, Chess computer 승리와 같은 초기 이정표와 함께 자주 인용된다. ChatGPT나 Gemini와 같은 현대 시스템이 유진 구스트먼의 능력을 훨씬 능가하지만, 그 이야기는 좁은 맥락에서 영리한 설계와 인간 심리학이 기계와 인간 사이의 경계를 흐릴 수 있는 방법을 보여준다.