영어에서 번역됨

Cerebras-GPT는 Cerebras Systems가 개발한 계산 최적 대규모 언어 모델 제품군으로, CS-2 웨이퍼 스케일 시스템에서 Chinchilla 스케일링 법칙을 사용하여 훈련되었습니다. 2023년에 출시되었으며, 111M에서 13B 파라미터까지의 모델을 포함하고 있으며, 효율적인 훈련과 오픈소스 제공을 위해 설계되었습니다.

Cerebras-GPT는 웨이퍼 스케일 신경망 가속기로 알려진 Cerebras Systems가 개발한 오픈소스 대규모 언어 모델 제품군이다. 이 모델들은 계산 최적 성능을 달성하도록 설계되었으며, 즉 Chinchilla 스케일링 법칙에 따라 모델 크기와 학습 데이터 양을 균형 있게 조정하여 훈련되었다. 이 법칙은 주어진 계산 예산에서 더 큰 모델과 비례적으로 더 많은 데이터가 더 나은 성능을 낸다고 명시한다. Cerebras-GPT는 2023년 3월에 출시되었으며, Cerebras의 CS-2 시스템이 대규모 최첨단 모델 훈련의 효율성을 입증하는 것을 목표로 했다.

이 제품군에는 1억 1100만 개에서 130억 개에 이르는 매개변수 수를 가진 모델이 포함되며, 구체적으로 111M, 256M, 590M, 1.3B, 2.7B, 6.7B, 13B가 있다. 모든 모델은 동일한 공개 데이터셋인 Pile로 훈련되었으며, 이는 책, 학술 논문, 웹 콘텐츠의 다양한 텍스트 모음이다. 훈련은 모델당 고정된 계산 예산을 사용했으며, 매개변수당 약 20개의 토큰이라는 Chinchilla 최적 비율을 따랐다. 이를 통해 각 모델이 크기에 맞는 적절한 데이터 양으로 훈련되어 성능을 극대화했다. 모델들은 Adam 옵티마이저코사인 학습률 스케줄그래디언트 클리핑을 사용하여 훈련 안정성을 확보했다.

아키텍처 및 훈련

Cerebras-GPT 모델은 표준 트랜스포머 아키텍처, 특히 생성 언어 모델에 일반적인 디코더 전용 변형을 사용한다. 각 모델은 멀티 헤드 어텐션, 레이어 정규화, 학습된 위치 임베딩을 사용한다. 모델들은 85만 개 이상의 코어를 가진 단일 실리콘 웨이퍼를 통합하는 CS-2 시스템에서 훈련되었으며, 이는 여러 GPU에 걸친 분산 훈련 없이 고처리량 훈련을 가능하게 한다. 이 아키텍처는 웨이퍼 스케일 설계가 통신 오버헤드를 줄이므로 Cerebras가 전통적인 GPU 클러스터에 비해 훨씬 적은 시간과 에너지로 모델을 훈련할 수 있게 했다.

훈련은 bfloat16 정밀도로 수행되었으며, 모델들은 사전 학습된 체크포인트 없이 처음부터 훈련되었다. 훈련 과정은 각각 2048개의 토큰 길이를 가진 256개의 시퀀스 배치 크기를 사용했으며, 각 모델의 총 훈련 토큰 수는 Chinchilla 공식에 따라 결정되었다. 예를 들어, 13B 모델은 약 2600억 개의 토큰으로 훈련되었고, 111M 모델은 약 22억 개의 토큰으로 훈련되었다. 훈련 데이터는 다양성을 보장하기 위해 셔플 및 처리되었으며, 모델들은 언어 모델링 혼란도 및 하위 작업과 같은 표준 벤치마크에서 평가되었다.

성능 및 벤치마크

Cerebras-GPT 모델은 언어 이해와 추론을 테스트하는 LAMBADA, HellaSwag, Winogrande를 포함한 여러 벤치마크에서 평가되었다. 결과는 모델들이 OpenAIAnthropic의 유사한 크기의 다른 오픈소스 모델과 경쟁력 있는 성능을 보였으며, 더 간단한 레시피로 훈련되었음에도 불구하고 그렇다는 것을 보여주었다. 예를 들어, 13B 모델은 LAMBADA 정확도 72.3%를 달성했으며, 이는 당시 다른 13B 모델과 비슷한 수준이다. 모델들은 또한 Pile의 보류 검증 세트에서 강력한 성능을 보였으며, 모델 크기가 증가함에 따라 혼란도가 감소하는 것이 예상대로 나타났다.

Cerebras-GPT의 주목할 만한 측면 중 하나는 계산 효율성에 대한 초점이다. 회사는 CS-2에서 13B 모델을 훈련하는 데 약 10일이 걸렸으며, 512개의 NVIDIA A100 GPU 클러스터에서 비슷한 훈련 실행은 약 30일이 걸릴 것이라고 보고했다. 이 효율성은 모델 병렬화의 필요성을 제거하고 칩 간 통신을 줄이는 웨이퍼 스케일 설계 덕분이다. 모델들은 Apache 2.0 라이선스로 출시되어 무제한 사용 및 수정이 가능했으며, 이는 오픈소스 커뮤니티의 연구 및 개발을 촉진하기 위한 의도적인 조치였다.

다른 모델과의 비교

출시 당시 Cerebras-GPT는 Chinchilla 스케일링 법칙을 준수하는 점에서 오픈소스 모델들 사이에서 두드러졌다. GPT-3와 같은 많은 초기 모델들은 계산 최적보다 더 많은 데이터로 훈련되어 비효율성을 초래했다. Cerebras-GPT는 계산 최적 접근 방식을 명시적으로 따르는 최초의 제품군 중 하나였으며, 이는 각 모델이 매개변수 수에 정확히 맞는 데이터 양으로 훈련되었음을 의미한다. 이 접근 방식은 모델들이 최적이 아닌 데이터 대 매개변수 비율로 훈련된 모델들과 비슷하거나 더 나은 성능을 달성했다는 사실로 검증되었다.

LLaMA와 같은 이후 모델들(2023년 후반에 출시)과 비교할 때, Cerebras-GPT는 최대 크기가 더 작았지만 스케일링에 대한 더 체계적인 연구를 제공했다. 모델들은 또한 훈련 코드와 구성이 오픈소스화되어 연구자들이 결과를 재현할 수 있었기 때문에 재현성으로 유명했다. 그러나 모델들은 지시 튜닝이나 채팅용 미세 조정이 되지 않았으므로, 주로 스케일링 법칙 및 효율적인 훈련에 대한 연구를 위한 것이지 애플리케이션 배포를 위한 것은 아니었다.

영향 및 유산

Cerebras-GPT는 적당한 하드웨어에서 실행할 수 있는 모델 제품군을 제공함으로써 대규모 언어 모델의 민주화라는 더 넓은 추세에 기여했다. 가장 작은 모델(111M)은 단일 GPU에서 미세 조정할 수 있었고, 가장 큰 모델(13B)은 다중 GPU 설정이 필요했지만 많은 연구 실험실에서 여전히 접근 가능했다. 이 출시는 또한 웨이퍼 스케일 통합과 같은 대체 하드웨어 아키텍처가 대규모 모델 훈련의 비용과 에너지 발자국을 줄이는 잠재력을 강조했다.

모델들은 오픈소스 특성 덕분에 쉬운 실험이 가능했기 때문에 이후 커리큘럼 학습데이터 증강 기술에 대한 연구에서 사용되었다. Cerebras Systems는 Cerebras-GPT 7B 및 이후 Cerebras-GPT 13B 변형과 같은 더 큰 모델을 계속 개발했지만, 원래 제품군은 계산 최적 훈련의 기준점으로 남아 있다. 회사는 또한 이 경험을 활용하여 2024년에 발표된 차세대 하드웨어 CS-3 개발에 정보를 제공했다.

가용성 및 사용

Cerebras-GPT 모델은 Hugging Face 및 Cerebras Model Zoo에서 사용할 수 있으며, 사전 훈련된 체크포인트와 추론 스크립트를 제공한다. 모델들은 PyTorch와 같은 표준 머신 러닝 프레임워크와 함께 사용할 수 있으며, 훈련 코드는 GitHub에서 제공된다. Apache 2.0 라이선스는 상업적 사용을 허용하므로, 라이선스 비용 없이 언어 모델을 배포하려는 스타트업 및 기업에게 매력적이다. 그러나 사용자는 모델이 인간의 선호도와 정렬되지 않았으므로 편향되거나 유해한 출력을 생성할 수 있으며, 배포 시 적절한 안전장치가 권장된다는 점을 인지해야 한다.

요약하면, Cerebras-GPT는 인공지능 분야에 중요한 기여를 하며, 특수 하드웨어로 계산 최적 훈련이 달성 가능함을 입증하고 스케일링 법칙 및 모델 효율성을 연구하는 연구자들에게 귀중한 자원을 제공한다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:large-language-models·open-source-ai·scaling-laws·wafer-scale-computing
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사