온도는 대규모 언어 모델에서 텍스트 생성 중 모델 출력의 무작위성을 제어하는 데 사용되는 하이퍼파라미터입니다. 이는 모델의 최종 계층이 생성한 로짓(원시적이고 정규화되지 않은 점수)에 적용되는 스케일링 요소로, 소프트맥스 함수가 이를 어휘에 대한 확률 분포로 변환하기 전에 적용됩니다. 온도를 조정함으로써 개발자와 사용자는 생성된 텍스트의 창의성과 예측 가능성 사이의 균형에 영향을 줄 수 있습니다.
이 개념은 통계 역학에서 유래했으며, 여기서 온도는 시스템의 엔트로피를 결정합니다. 기계 학습에서 온도는 '소프트맥스 온도'라고도 불리는 소프트맥스 함수의 변형으로 도입되어 출력 분포를 더 날카롭게 하거나 평평하게 만듭니다. 온도 1.0은 분포를 변경하지 않습니다. 1.0보다 큰 값은 엔트로피를 증가시켜 분포를 더 균일하게 만들고 따라서 더 무작위적으로 만듭니다. 1.0보다 작은 값은 엔트로피를 감소시켜 분포를 더 뾰족하게 만들고 따라서 더 결정론적으로 만듭니다. 온도 0.0(또는 0에 가까운 값)은 사실상 가장 높은 확률을 가