Gopher는 Google DeepMind의 연구팀이 개발한 대규모 언어 모델 계열이다. 이 계열은 4,400만 개의 매개변수에서 2,800억 개의 매개변수에 이르는 여섯 개의 트랜스포머 기반 모델로 구성되며, 가장 큰 모델은 기본적으로 "Gopher"라고 불린다. Gopher는 2021년 말에 발표되었으며, 대규모 언어 모델의 확장 법칙을 조사하기 위해 훈련되었고, 2022년 3월에 도입된 후속 Chinchilla 모델 계열의 기초를 형성했다.
Gopher 계열은 모델 성능이 매개변수와 훈련 데이터에 따라 어떻게 확장되는지에 대한 더 광범위한 연구 노력의 일환으로 설계되었다. 이 모델들은 본질적으로 GPT-2와 동일한 아키텍처를 사용하지만, LayerNorm 대신 RMSNorm을 사용하고 절대 위치 인코딩 대신 상대 위치 인코딩을 사용하는 등 약간의 수정이 있다. 가장 큰 Gopher 모델은 2,800억 개의 매개변수를 가지며, 약 3,000억 개의 토큰으로 훈련되었다.
확장 법칙과 훈련
Gopher의 개발은 대규모 언어 모델을 훈련할 때 컴퓨팅 자원을 최적으로 할당하는 방법에 대한 질문에서 동기가 부여되었다. Gopher 이전에는 OpenAI의 GPT-3를 포함한 많은 모델이 훈련 데이터를 상대적으로 고정하면서 모델 크기를 늘리는 데 초점을 맞추어 훈련되었다. 그러나 Gopher 연구팀은 경험적 연구를 통해 주어진 컴퓨팅 예산에 대해 최적의 모델 크기와 훈련 토큰 수가 특정 관계를 따른다는 것을 발견했다. 즉, 모델 크기를 두 배로 늘리면 훈련 토큰 수도 두 배로 늘려야 한다는 것이다. 이 발견은 나중에 Chinchilla 논문에서 공식화되었으며, 많은 기존 모델이 충분히 훈련되지 않았음을 시사했다.
Gopher의 훈련은 대규모 텍스트 데이터 말뭉치를 사용했으며, 이 모델은 다양한 자연어 처리 벤치마크에서 강력한 성능을 보여주었다. 그러나 Measuring Massive Multitask Language Understanding(MMLU) 벤치마크에서의 성능은 평균 정확도 60.5%였으며, 이 수치는 나중에 후속 모델인 Chinchilla에 의해 능가될 것이다.
아키텍처와 변형
Gopher 계열은 4,400만 개, 1억 1,700만 개, 4억 1,700만 개, 14억 개, 71억 개, 2,800억 개의 매개변수를 가진 여섯 개의 모델을 포함한다. 모든 모델은 트랜스포머 아키텍처를 기반으로 한 동일한 핵심 아키텍처를 공유하며, 특히 GPT-2와 유사하지만 언급된 수정 사항이 있다. 계산적으로 더 효율적인 레이어 정규화 변형인 RMSNorm의 사용과 더 긴 시퀀스에 대한 일반화를 개선할 수 있는 상대 위치 인코딩의 사용은 초기 트랜스포머 모델과의 주요 차이점이었다.
가장 큰 Gopher 모델은 수천 개의 가속기를 활용하는 분산 훈련 설정을 사용하여 훈련되었다. 훈련 과정은 자원 집약적이었으며, 이 모델은 추론과 미세 조정 모두에 상당한 계산 능력이 필요했으며, 이는 나중에 Chinchilla 개발의 동기가 된 한계였다.
성능과 평가
Gopher는 언어 모델링, 독해, 질문 응답을 포함한 다양한 벤치마크에서 평가되었다. 많은 영역에서 강력한 능력을 보여주었지만, 모든 작업에서 더 작은 모델보다 일관되게 우월한 성능을 보이지는 않았다. 예를 들어, 일부 추론 및 지식 집약적 작업에서는 Gopher가 잘 수행했지만, 사실적 일관성과 상식 추론과 같은 영역에서는 한계를 나타내기도 했다.
GPT-3와 비교하여 Gopher는 여러 벤치마크에서 경쟁력 있는 또는 더 나은 결과를 달성했지만, 차이는 항상 극적이지는 않았다. 연구팀은 Gopher의 성능 향상이 모델 크기의 큰 증가에 비해 종종 완만하다는 점을 지적했으며, 이는 훈련 데이터 확장의 중요성을 더욱 강조했다.
유산과 후속 모델
Gopher의 주요 유산은 언어 모델의 확장 법칙을 이해하는 데 기여한 것이다. Gopher 훈련에서 얻은 통찰은 1.4조 개의 토큰으로 훈련된 700억 개의 매개변수를 가진 모델 계열인 Chinchilla의 설계에 직접적으로 정보를 제공했다. 2022년 3월에 발표된 Chinchilla는 유사한 컴퓨팅 예산을 사용하면서 Gopher보다 더 높은 평균 정확도(MMLU에서 67.5%)를 달성하여 확장 법칙 권장 사항이 효과적임을 입증했다.
Chinchilla 계열은 Gopher와 동일한 아키텍처를 공유하지만 Adam 대신 AdamW 옵티마이저로 훈련되었다. Gopher는 또한 Gopher 계열의 구성 요소를 활용한 Flamingo 비전-언어 모델과 같은 다른 모델의 기초로도 사용되었다. 2023년 1월 기준으로 Chinchilla는 아직 테스트 단계에 있었으며, Gopher는 더 효율적인 후속 모델에 의해 대체되었다.