튜링 테스트

영어에서 번역됨

앨런 튜링이 1950년에 제안한 기준으로, 기계의 대화 행동이 인간의 것과 구별할 수 없는지 판단하는 데 사용되며, 역사적으로 기계 지능의 비공식적 벤치마크로 사용되었습니다.

튜링 테스트는 기계가 인간과 구별할 수 없는 대화 행동을 보일 수 있는지를 평가하는 기준이다. 수학자 앨런 튜링이 1950년 논문 "Computing Machinery and Intelligence"에서 제안한 이 테스트는 "기계가 생각할 수 있는가?"라는 질문을 경험적인 "모방 게임"으로 재구성한다. 인간 심판이 텍스트 기반 대화를 두 명의 숨은 참가자(한 명은 인간, 한 명은 기계)와 나누고, 어느 쪽이 어느 쪽인지 판별해야 한다. 심판이 기계와 인간을 확실히 구별하지 못하면, 그 기계는 테스트를 통과한 것으로 간주된다.

튜링은 이 테스트를 기계 의식이나 사고에 대한 철학적으로 논쟁적인 질문에 대한 실용적 대체물로 의도했으며, 형이상학적 논쟁을 피하고 관찰 가능한 행동 기준을 채택했다. 이 테스트는 인공지능 분야가 설립되기 6년 전에 등장했다. "인공지능"이라는 용어 자체는 1956년 다트머스 워크숍에서 존 매카시마빈 민스키 등이 조직한 자리에서 처음 만들어졌으며, 이들은 튜링의 프레임에 영향을 받았다.

기원과 형식

튜링의 원래 구성은 세 명의 참가자(인간 심문자, 인간 응답자, 기계)를 포함하며, 음성이나 외모의 단서를 제거하기 위해 오직 타이핑된 텍스트로만 소통했다. 이후 개발된 변형으로는 심판이 단일 개체와 대화하고 그것이 인간인지 추측하는 "표준" 두 참가자 버전과, 1990년부터 2019년까지 매년 열린 로브너 상(Loebner Prize) 같은 공식 대회가 있다. 이 대회는 가장 설득력 있게 인간처럼 보이는 챗봇에 상을 수여했지만, 제한 없는 통과를 달성한 사례는 없었다.

초기 시도와 비판

엘리자와 같은 프로그램은 1966년 조지프 와이젠바움이 로저스식 심리치료사를 시뮬레이션하기 위해 만든 것으로, 단순한 패턴 매칭을 사용했음에도 일부 사용자가 실제 사람과 대화한다고 믿게 했다. 와이젠바움은 이후 기계 지능을 과장하는 것에 대한 저명한 비평가가 되었으며, 사람들이 단순히 대화 형식을 모방하는 시스템에 이해를 부여하는 경향은 현재 "엘리자 효과"라고 불린다.

비평가들은 오랫동안 이 테스트가 지능보다는 기만을 측정한다고 주장해 왔다. 철학자 존 설(John Searle)의 1980년 "중국어 방" 사고 실험은 시스템이 진정한 이해 없이도 설득력 있게 기호를 조작할 수 있다고 주장하며, 테스트의 타당성에 도전한다. 다른 이들은 테스트가 인간 중심적이며, 정확하거나 유능한 행동보다 인간적인 특성과 오류를 보상한다고 지적하고, 좁게 훈련된 챗봇이 일반 추론이 아닌 대화적 트릭으로 통과할 수 있다고 말한다.

현대적 관련성

2022년 11월 챗GPT 출시 이후 대규모 대규모 언어 모델 시스템의 부상은 테스트의 관련성에 대한 논쟁을 부활시켰다. 2023년 이후 여러 비공식 및 학술 연구는 현대 대화형 모델이 짧은 교환에서 인간 심판을 인간 공모자와 비슷하거나 더 높은 비율로 속일 수 있다고 보고했지만, 방법론과 결정적 "통과" 주장은 여전히 논쟁 중이다. 많은 연구자들은 이제 튜링 테스트를 기계 지능이나 인공 일반 지능의 의미 있는 척도라기보다 흥미로운 역사적 벤치마크로 간주하며, 유창한 대화가 더 이상 일반 지능과 관련된 광범위한 추론, 계획, 그리고 근거 있는 이해를 의미하지 않는다고 지적한다. 자연어 처리 및 추론 분야의 더 표적화된 벤치마크(예: ARC-AGI)는 연구 도구로서 이를 대체했지만, 튜링 테스트는 "기계가 인간처럼 보이는가?"라는 대중 문화의 약어로 여전히 지속되고 있다.

분류:ai-history·evaluation·philosophy-of-ai
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사