GPT-NeoX는 연구 집단 EleutherAI가 개발한 200억 개의 매개변수를 가진 대규모 언어 모델이다. 2022년 2월에 출시된 이 모델은 딥러닝 및 생성형 AI 연구를 발전시키기 위해 설계된 오픈소스 자기회귀 트랜스포머 모델이다. 이 모델은 독점 시스템에 대한 공개적으로 접근 가능한 대안을 제공하여 연구자들이 상업적 제한 없이 대규모 신경망을 연구할 수 있도록 만들어졌다.
GPT-NeoX는 초기 GPT 모델의 아키텍처 원리를 기반으로 하며, 멀티헤드 어텐션과 잔차 연결을 사용하는 디코더 전용 트랜스포머를 사용한다. 훈련에는 웹 텍스트, 서적 및 기타 출처의 다양한 말뭉치가 포함되었으며, 일반화를 개선하기 위해 광범위한 범위를 강조했다. 이 모델의 200억 개 매개변수는 대규모 언어 모델 중 중간 크기 범주에 속하며, 계산 비용과 성능 간의 균형을 유지한다.
아키텍처 및 설계
이 모델은 안정성과 효율성을 위한 여러 개선 사항이 포함된 표준 트랜스포머 아키텍처를 사용한다. 각 하위 레이어 이전에 적용되는 레이어 정규화를 사용하여 훈련 수렴을 개선한다. 위치 인코딩은 학습되며, 모델이 토큰 순서를 포착할 수 있게 한다. 어텐션 메커니즘은 멀티헤드 어텐션으로 구현되며, 200억 개의 매개변수를 64개 레이어와 레이어당 16개의 어텐션 헤드로 분할한다.
GPT-NeoX는 훈련 중 기울기 폭발을 방지하기 위해 기울기 클리핑을 통합하고, Adam을 옵티마이저로 사용하며, 워밍업과 코사인 감쇠를 포함한 학습률 스케줄을 사용한다. 모델의 은닉 크기는 6144이며, 피드포워드 레이어는 24,576 차원으로 확장된다. 이러한 선택은 모델 용량과 메모리 사용량 간의 균형을 반영하여 아마존 웹 서비스 클러스터에서 훈련을 가능하게 한다.
훈련 데이터 및 과정
EleutherAI는 GPT-NeoX를 22개의 다양한 출처에서 수집한 대규모 영어 말뭉치인 The Pile이라는 선별된 데이터셋으로 훈련했다. 여기에는 학술 논문, 서적, 웹 페이지 및 코드 저장소가 포함되며, 총 약 800기가바이트의 텍스트로 구성된다. 훈련 과정은 각각 2048개의 토큰을 가진 512개의 시퀀스 배치 크기를 사용했으며, 약 400,000단계로 실행되었다. 총 계산 비용은 96개의 NVIDIA A100 GPU 클러스터에서 실행된 1.2엑사플롭스로 추정되었다.
훈련은 견고성을 개선하기 위해 무작위 마스킹 및 토큰 드롭아웃과 같은 데이터 증강 기법을 사용했다. 대규모 모델 크기를 처리하기 위해 EleutherAI는 GPU 간 모델 병렬 처리를 사용하여 레이어와 어텐션 헤드를 분할하여 메모리 제약 내에 맞췄다. 최종 체크포인트는 오픈 라이선스로 공개되어 연구 및 상업적 응용에 무제한 사용이 가능하다.
성능 및 평가
GPT-NeoX는 언어 모델링 혼란도, 질문 응답 및 상식 추론 작업을 포함한 다양한 벤치마크에서 평가되었다. LAMBADA 데이터셋에서 3.99의 혼란도를 달성하여 강력한 다음 단어 예측을 입증했다. 제로샷 설정에서는 유사한 크기의 모델과 경쟁력 있는 성능을 보였지만, OpenAI 및 Google DeepMind의 더 큰 독점 모델에는 뒤처졌다.
이 모델은 훈련 데이터에 GitHub 코드가 포함된 덕분에 코드 생성 작업에서 특히 강점을 보였다. HumanEval 벤치마크에서 pass@1 점수 6.4%를 달성하여 기능적 코드 생성에서 중간 수준의 능력을 나타냈다. 머신 러닝 벤치마크에서의 성능은 오픈소스 모델이 재현 가능한 연구를 가능하게 하는 가치를 강조했으며, 결과는 커뮤니티에서 독립적으로 검증될 수 있었다.
영향 및 유산
GPT-NeoX는 이후 오픈소스 노력의 기반 모델로 사용되었으며, LLaMA 및 Falcon과 같은 후속 모델 개발에 영향을 미쳤다. 이 모델의 출시는 비상업적 조직이 고품질 대규모 언어 모델을 훈련할 수 있음을 입증하여 기술 대기업의 지배력에 도전했다. 모델의 공개 가중치는 인공지능 안전성, 해석 가능성 및 미세 조정 연구를 촉진했으며, 많은 연구에서 기준선으로 사용되었다.
이 프로젝트는 또한 오픈 모델의 벤치마크 테스트를 표준화한 EleutherAI 평가 하네스 개발을 포함한 오픈 AI 도구의 광범위한 생태계에 기여했다. GPT-NeoX의 아키텍처와 훈련 레시피는 상세히 문서화되어 다른 사람들이 복제하고 확장할 수 있는 청사진을 제공했다. 그 유산은 EleutherAI 및 다른 그룹의 후속 출시에서 볼 수 있듯이 투명하고 접근 가능한 AI 연구를 위한 지속적인 노력에 남아 있다.
한계 및 고려 사항
능력에도 불구하고 GPT-NeoX는 주목할 만한 한계가 있다. 200억 개의 매개변수는 많은 현대 모델보다 작아 복잡한 추론 작업에서 낮은 성능을 초래한다. 이 모델은 훈련 데이터의 편향을 반영하여 편향되거나 유해한 출력을 생성할 수 있다. 또한 상용 시스템에서 사용되는 미세 조정 및 정렬 기법이 부족하여 추가 안전 장치 없이 사용자 대면 응용 프로그램에 직접 배포하기에는 적합하지 않다.
GPT-NeoX를 사용하는 연구자는 추론 및 미세 조정에 상당한 계산 요구 사항을 고려해야 한다. 모델의 메모리 사용량은 일반적인 소비자 하드웨어를 초과하여 클라우드 인프라 또는 특수 가속기가 필요하다. 이러한 요소는 모델의 주요 용도를 생산 시스템이 아닌 연구 도구로 형성했지만, 대규모 트랜스포머 모델 연구를 위한 귀중한 자원으로 남아 있다.