자기 일관성(Self-consistency)은 대규모 언어 모델과 함께 사용되어 다단계 추론 작업에서 성능을 개선하는 디코딩 전략이다. 단일 탐욕적 또는 샘플링 패스를 통해 하나의 답변을 생성하는 대신, 모델은 동일한 프롬프트에 대해 여러 개의 독립적인 추론 경로를 생성한 다음, 최종 답변 간의 다수결 투표를 통해 결과를 집계한다. 이 접근 방식은 개별 추론 체인에 오류가 포함될 수 있지만, 정답은 다양한 샘플링 경로에서 더 일관되게 나타나는 경향이 있다는 직관을 활용한다.
이 기법은 2022년 구글 리서치와 스탠포드 대학의 연구자들, 특히 왕쉐즈(Xuezhi Wang)와 동료들에 의해 소개되었다. 이는 연쇄적 사고 프롬프팅(chain-of-thought prompting)에 대한 간단하고 훈련이 필요 없는 개선책으로 설계되었으며, 연쇄적 사고 프롬프팅은 이미 단계별 추론을 유도하는 것이 산술, 상식, 기호 추론 벤치마크에서 성능을 향상시킨다는 것을 보여주었다. 자기 일관성은 단일 탐욕적 디코딩 경로를 여러 샘플로 대체함으로써 이를 확장하며, 일반적으로 다양성을 촉진하기 위해 0보다 큰 온도 설정을 사용한 다음 모든 샘플에서 가장 자주 나타나는 답변을 선택한다.
메커니즘 및 구현
자기 일관성은 전적으로 추론 시간에 작동하며, 모델의 가중치나 아키텍처를 변경할 필요가 없다. 이 과정은 세 단계로 구성된다: 첫째, 모델에 질문을 제시하고 단계별로 추론하도록 지시한다; 둘째, 모델을 0이 아닌 온도로 여러 번(종종 5~40회) 샘플링하여 다양한 추론 체인을 생성한다; 셋째, 각 체인의 최종 답변을 그룹화하고 가장 흔한 답변을 최종 출력으로 선택한다. 집계 단계는 단순한 다수결 투표일 수도 있고, 모델의 신뢰도나 추론 경로의 길이에 기반한 가중 투표를 사용할 수도 있다.
이 방법은 연쇄적 사고 프롬프팅과 결합할 때 특히 효과적이지만, 표준 프롬프트에도 적용할 수 있다. 실제로 샘플 수는 핵심 하이퍼파라미터이다: 샘플이 많을수록 일반적으로 정확도가 향상되지만 계산 비용이 증가한다. 연구에 따르면 많은 작업에서 약 40개 샘플을 넘어서면 수익이 감소하지만, 최적 값은 문제 유형과 모델 크기에 따라 다르다.
성능 향상
경험적 평가에 따르면 자기 일관성은 다양한 벤치마크에서 정확도를 크게 향상시킨다. 초등학교 수준의 수학 단어 문제 데이터셋인 GSM8K에서 이 기법은 540B 파라미터 모델에 적용했을 때 단일 연쇄적 사고 샘플의 약 56% 정확도를 40개 샘플을 사용한 자기 일관성으로 74% 이상으로 개선했다. SVAMP 데이터셋(약 79%에서 84%로)과 대수 단어 문제용 AQuA 데이터셋(약 39%에서 55%로)에서도 유사한 향상이 관찰되었다.
CommonsenseQA 및 StrategyQA 벤치마크와 같은 상식 추론 작업의 경우, 자기 일관성은 일관된 개선을 제공했지만 상대적 이득은 산술 문제보다 작았다. 이 방법은 약 100B 파라미터 범위의 소형 모델부터 최첨단 모델까지 다양한 모델 규모에서 작동하는 것으로 입증되었으며, 현재 많은 프로덕션 시스템에서 표준 테스트 시간 기법이 되었다.
다른 디코딩 방법과의 비교
자기 일관성은 빔 서치나 top-k 샘플링과 같은 다른 샘플링 기반 접근 방식과 다르며, 단일 고확률 시퀀스를 선택하는 대신 여러 완전한 추론 경로를 명시적으로 집계한다. 온도 스케일링이 무작위성을 제어하지만 여전히 하나의 출력을 생성하는 것과 달리, 자기 일관성은 온도를 사용하여 다양성을 생성한 다음 투표를 통해 이를 해결한다. 또한 RLHF 기반 방법과는 추가 훈련이나 보상 모델이 필요하지 않다는 점에서 구별된다.
이 기법은 별도의 모델이 후보 답변을 평가하는 검증자 기반 접근 방식과 상호 보완적이다. 일부 시스템은 학습된 검증자와 자기 일관성을 결합하여 투표에 가중치를 부여하지만, 원래 방법은 가중치가 없는 다수결 투표를 사용한다. 고정된 부분 시퀀스 집합을 탐색하는 빔 서치와 비교하여, 자기 일관성은 완전한 독립 궤적을 탐색하므로 추론의 국소적 오류에 더 강건하다.
응용 및 사용 사례
자기 일관성은 AI 연구와 산업에서 널리 채택되었다. 수학 문제 해결, 코드 생성, 의료 질문 응답과 같이 추론 정확도가 중요한 분야에서 특히 가치가 있다. 대규모 언어 모델 API에서 개발자는 종종 자기 일관성을 후처리 단계로 구현하여 여러 완성을 샘플링하고 응답을 반환하기 전에 결과를 집계한다.
이 기법은 추론 외에도 사실 검증 및 개방형 질문 응답과 같은 다른 작업으로 확장되었다. 이러한 설정에서 다수결 투표는 환각 또는 불일치 답변을 걸러내는 데 도움이 된다. 일부 생성형 AI 제품은 신뢰성을 개선하기 위해 내부적으로 자기 일관성을 사용하지만, 특히 대형 모델의 경우 추가 추론 비용이 상당할 수 있다.
한계 및 고려 사항
자기 일관성의 주요 단점은 계산 비용이다. 여러 샘플을 생성하면 추론 시간과 토큰 사용량이 배가되어 실시간 응용 프로그램이나 매우 큰 모델을 사용할 때 prohibitive할 수 있다. 연구자들은 확신 있는 다수결이 나타날 때 조기 중단하는 적응형 샘플링이나 초기 샘플링에 소형 모델을 사용하고 검증에 대형 모델을 사용하는 방법 등 이 오버헤드를 줄이는 방법을 탐구해 왔다.
또 다른 한계는 자기 일관성이 정확성을 보장하지 않는다는 점이다. 모델이 잘못된 답변에 체계적 편향이 있는 경우, 다수결 투표는 그 오류를 강화할 것이다. 이 방법은 또한 정답이 가장 빈번한 답변이라고 가정하는데, 이는 많은 그럴듯한 답변이 있거나 프롬프트가 모호한 작업에서는 성립하지 않을 수 있다. 또한 자기 일관성은 모델이 파싱 가능한 최종 답변을 생성해야 하며, 이는 자유 형식 생성 작업에서는 어려울 수 있다.
다른 테스트 시간 기법과의 관계
자기 일관성은 재훈련 없이 모델 성능을 개선하는 더 넓은 테스트 시간 계산 방법 계열의 일부이다. 이는 빔 서치 및 핵 샘플링과 밀접하게 관련되지만, 답변 집계에 독특하게 초점을 맞춘다. 이 기법은 프롬프트 엔지니어링 전략인 퓨샷 프롬프팅 및 연쇄적 사고와 결합할 수 있으며, 다양성과 일관성의 균형을 맞추기 위해 온도 튜닝과 함께 자주 사용된다.
최근 연구는 유사성에 따라 추론 경로를 클러스터링하거나 모델 자체의 신뢰도 점수를 사용하여 투표에 가중치를 부여하는 등 더 정교한 집계 방법을 탐구했다. 일부 접근 방식은 다수결을 모델에 다시 피드백하여 추가 추론을 수행함으로써 답변을 반복적으로 개선한다. 이러한 확장은 정확도와 효율성을 모두 개선하는 것을 목표로 하지만, 원래의 다수결 투표 공식이 여전히 가장 널리 사용된다.
AI 연구 및 실무에 미치는 영향
소개 이후, 자기 일관성은 추론 벤치마크의 표준 기준이 되었으며 머신 러닝 문헌에서 자주 인용된다. 이는 디코딩 전략만으로도 상당한 성능 향상을 달성할 수 있음을 보여주었으며, 일부 연구 초점을 모델 아키텍처에서 추론 시간 계산으로 전환했다. 이 기법은 이후 테스트 시간 훈련 및 적응형 계산에 대한 연구에 영향을 미쳤으며, 현재 OpenAI 및 Google DeepMind 연구 논문과 프로덕션 시스템에서 일반적인 구성 요소이다.
이 방법은 또한 샘플링의 다양성 중요성을 강조하여 온도, 샘플링 전략 및 프롬프트 변형이 추론 품질에 어떻게 영향을 미치는지에 대한 추가 연구로 이어졌다. 대규모 언어 모델이 계속 확장됨에 따라, 자기 일관성은 특히 계산 예산이 여러 샘플을 허용하는 환경에서 복잡한 작업의 정확도를 개선하는 실용적인 도구로 남아 있다.
미래 방향
진행 중인 연구는 자기 일관성을 더 효율적이고 강건하게 만드는 것을 목표로 한다. 한 방향은 자기 일관성이 도움이 될 때를 예측하는 학습으로, 시스템이 어려운 질문에만 선택적으로 적용할 수 있게 한다. 또 다른 방향은 답변 신뢰도와 추론 경로 품질을 고려하는 더 나은 집계 함수를 개발하는 것이다. 또한 자기 일관성을 다중 모달 모델과 다수결 투표가 덜 간단한 장문 생성 작업에 적용하는 데에도 관심이 있다.
2020년대 중반 현재, 자기 일관성은 여전히 활발한 연구 분야이며 새로운 변형이 정기적으로 등장한다. 그 단순성과 효과성 덕분에 AI 실무자의 도구 키트에서 필수 요소가 되었으며, 모델과 추론 기법이 발전함에 따라 계속 관련성을 유지할 가능성이 높다.