환각은 인공지능의 맥락에서, 생성 모델, 특히 대규모 언어 모델이 자신 있고 유창하지만 사실적으로 부정확하거나, 날조되었거나, 훈련 데이터나 제공된 어떤 출처에 의해 뒷받침되지 않는 진술을 생성하는 경향을 의미한다. 이 용어는 인간 심리학에서 느슨하게 차용된 것으로, 언어 모델이 텍스트를 생성하는 더 기계적인 과정보다는 지각 오류를 암시하기 때문에 연구자들 사이에서 논쟁의 대상이 된다.
원인
언어 모델은 사실을 검증하는 것이 아니라 텍스트의 그럴듯한 연속을 예측하도록 훈련되므로, 모델에는 잘 뒷받침된 주장과 유창하지만 날조된 주장을 구별할 수 있는 내장 메커니즘이 없다. 환각은 프롬프트가 훈련 데이터에 드물게 또는 일관되지 않게 나타난 정보를 요구하거나, 질문이 모델의 컨텍스트 창이나 지식 차단 시점을 벗어나거나, 법률 판례 인용이나 학술 참고문헌과 같이 모델이 정확히 암기하도록 훈련되지 않은 특정 출처, 날짜 또는 숫자를 인용하도록 요청받을 때 더 발생할 가능성이 높다. 일부 연구자들은 문제의 일부를 RLHF에 귀속시키며, 모델이 자신 있게 들리고 인간 평가자를 만족시키도록 훈련하는 것이 불확실성을 인정하는 것보다 유창한 추측에 보상을 줄 수 있다고 주장한다. 환각은 더 넓은 접지 문제와 밀접하게 관련되어 있다. 순수하게 텍스트로만 훈련된 모델은 출력과 세계의 상태 사이에 직접적인 연결이 없으므로, 훈련 과정에서 사실적 정확성을 보장하는 것은 아무것도 없다.
주목할 만한 사건
환각은 2022년 말 ChatGPT의 공개 출시 이후 대규모 언어 모델이 대중에게 널리 보급되면서 학문적 우려에서 공공의 문제로 옮겨갔다. 2023년 널리 보도된 사건에서 뉴욕 연방 소송의 변호사들이 ChatGPT가 날조한 허위 판례 인용을 포함한 서면을 제출하여 제재를 받았고, 모델 출력을 검증 없이 신뢰하는 위험에 대한 광범위한 주의를 끌었다. 웹 결과를 요약하는 검색 엔진과 어시스턴트도 환각 요약을 생성하여, 기업들이 AI 생성 답변에 인용과 신뢰도 경고를 추가하도록 촉구했다.
완화
가장 널리 배포된 완화 방법은 검색 증강 생성으로, 시스템이 쿼리 시점에 관련 문서를 검색하고 모델이 이를 기반으로 답변하도록 지시하여 날조된 주장의 비율을 줄이지만 완전히 제거하지는 않는다. 다른 접근 방식에는 모델을 보정된 불확실성을 표현하도록 특별히 미세 조정하는 것, 모델이 출처를 인용하거나 사고 사슬을 통해 추론을 보여주도록 요청하는 프롬프트 기법, 그리고 사용자에게 표시하기 전에 외부 데이터베이스에 대해 주장을 검증하는 사후 사실 확인 파이프라인이 포함된다. 벤치마크와 평가 제품군은 점점 더 일반 능력과 함께 추적 지표로 환각 비율을 포함하고 있으며, 일부 연구소는 평가 과정의 일부로 새 모델 출시에 대한 환각 통계를 보고한다.
지속적인 논쟁
연구자들은 환각이 해결 가능한 엔지니어링 문제인지, 아니면 자동 회귀 언어 모델이 텍스트를 생성하는 방식의 고유한 속성인지에 대해 의견이 분분하다. 일부는 확장과 더 나은 훈련 데이터가 환각 비율을 꾸준히 줄일 것이라고 주장하며, 연속적인 모델 세대에 걸쳐 측정된 개선을 지적한다. 다른 이들은 언어 모델이 각 토큰을 생성하는 방식에 내장된 지상 진실 검증 단계가 없기 때문에 외부 도구 없이는 어느 정도의 날조가 불가피하며, 실용적인 목표는 환각이 발생할 것이라고 가정하고 이를 포착하도록 설계된 인터페이스와 워크플로우를 구축하는 것이어야 한다고 주장한다.