CPM-3은 베이징 인공지능 연구원(BAAI)이 개발한 대규모 사전 훈련 언어 모델로, 1750억 개의 매개변수를 보유하고 있다. CPM(중국 사전 훈련 모델) 시리즈의 일원으로, 텍스트 생성, 이해, 대화를 포함한 다양한 자연어 처리 작업을 처리하도록 설계되었다. 이 모델은 중국의 인공지능 연구 및 인프라 발전 노력의 일환으로, 오픈AI 및 구글 딥마인드의 모델과 같은 국제 모델에 대응하는 위치를 차지한다.
CPM-3은 대부분의 현대 대규모 언어 모델 시스템의 기반이 된 트랜스포머 아키텍처를 기반으로 한다. 1750억 개의 매개변수 규모는 공개적으로 알려진 가장 큰 중국어 모델 중 하나로, 복잡한 언어 패턴과 지식을 포착할 수 있게 한다. 이 모델은 다양한 중국어 말뭉치로 훈련되어 요약, 질의응답, 창의적 글쓰기와 같은 작업을 높은 유창성으로 수행할 수 있다.
아키텍처 및 훈련
CPM-3은 다른 최첨단 언어 모델과 유사하게 멀티 헤드 어텐션 메커니즘을 갖춘 밀집 트랜스포머 모델을 사용한다. 훈련 과정은 수천 개의 GPU를 수개월 동안 활용하는 막대한 계산 자원을 필요로 한다. BAAI는 정확한 훈련 데이터 세트 크기를 공개하지 않았지만, 중국어 웹 텍스트, 서적 및 기타 선별된 소스의 혼합이 포함된다. 이 모델은 위치 인코딩과 층 정규화를 사용하여 훈련을 안정화하고 수렴을 개선한다.
계산 비용을 줄이기 위해 혼합 전문가 층을 사용하는 일부 모델과 달리, CPM-3은 밀집 모델로, 추론 중에 모든 매개변수가 활성화된다. 이 설계 선택은 GPT-3과 같은 초기 대형 모델에서 볼 수 있는 추세에 부합하며, 효율성보다 모델 품질을 우선시한다. 훈련은 이 규모의 모델을 최적화하는 과제를 처리하기 위해 기울기 클리핑과 학습률 스케줄 기법을 활용했다.
기능 및 응용
CPM-3은 텍스트 완성, 번역, 감정 분석을 포함한 중국어 작업에서 뛰어난 성능을 보인다. 일관되고 맥락에 맞는 응답을 생성할 수 있어 챗봇과 가상 비서에 적합하다. 이 모델은 또한 시퀀스-투-시퀀스 작업을 지원하여 텍스트 요약 및 재구성과 같은 응용을 가능하게 한다. BAAI는 연구 목적으로 모델을 공개하여 학계에서 의학이나 법률과 같은 특정 분야에 맞게 미세 조정할 수 있게 했다.
실제 배포에서 CPM-3은 알리바바 클라우드 및 기타 중국 클라우드 플랫폼에서 기업 솔루션을 구동하는 데 사용되었다. 미묘한 중국어 관용구와 문화적 참조를 이해하는 능력은 주로 영어 데이터로 훈련된 모델보다 우위를 제공한다. 그러나 다른 대형 모델과 마찬가지로 편향되거나 부정확한 출력을 생성할 수 있으며, BAAI는 유해 콘텐츠를 완화하기 위해 안전 필터를 구현했다.
다른 모델과의 비교
CPM-3은 종종 1750억 개의 매개변수를 가진 오픈AI의 GPT-3과 비교된다. GPT-3은 다국어 데이터로 훈련되는 반면, CPM-3은 중국어에 중점을 두어 중국어 벤치마크에서 우수한 성능을 보인다. 대조적으로, 앤트로픽의 Claude와 구글 딥마인드의 Chinchilla와 같은 모델은 각각 안전성과 효율성을 우선시한다. CPM-3의 밀집 아키텍처는 유사한 규모지만 다른 훈련 전략을 사용하는 구글 딥마인드의 Gopher와 다르다.
CPM 시리즈 내에서 CPM-3은 더 작은 매개변수 수를 가진 CPM-1과 CPM-2를 따른다. 이러한 발전은 중국어 모델을 확장하려는 BAAI의 의지를 반영한다. 상업 제품에 통합된 알리바바 다먀오 아카데미의 모델과 달리, CPM-3은 주로 연구 산출물로 남아 있지만 이후 중국 모델에 영향을 미쳤다.
영향 및 평가
2021년 CPM-3의 출시는 중국 AI 커뮤니티에서 상당한 관심을 불러일으켰으며, 중국이 최첨단 규모의 모델을 생산할 수 있는 능력을 강조했다. 이 모델은 수많은 학술 논문에서 인용되었으며 중국 NLP 연구의 기준선 역할을 한다. 비평가들은 훈련 및 추론의 높은 계산 비용이 접근성을 제한한다고 지적했다. BAAI는 연구자를 위한 API를 제공하여 이 문제를 해결했지만, 오픈AI의 제공만큼 널리 사용 가능하지는 않다.
CPM-3은 또한 머신 러닝 분야 전반에 걸친 공유 우려인 대규모 훈련의 환경 영향에 대한 논의를 촉발했다. 이러한 과제에도 불구하고, 이 모델은 중국어 생성형 AI의 발전에 기여하여 CPM-4 및 상업 시스템과 같은 후속 모델의 길을 열었다.
향후 방향
BAAI는 CPM 시리즈를 계속 개발하고 있으며, 이후 버전은 효율성과 정렬의 개선을 통합한다. 향후 반복은 모델 가지치기와 데이터 증강과 같은 기법을 채택하여 자원 요구 사항을 줄일 수 있다. 조직은 또한 RLHF와 유사한 인간 피드백 기반 강화 학습을 통합하여 안전성과 유용성을 향상시키는 방안을 탐구한다. 중국이 AI 인프라에 막대한 투자를 함에 따라, CPM-3과 같은 모델은 국가의 디지털 경제를 형성하는 데 중추적인 역할을 할 것으로 기대된다.
연구자들은 또한 양자화 및 증류 방법을 포함하여 CPM-3을 더 접근 가능하게 만드는 방법을 조사하고 있다. 이러한 노력은 대규모 언어 모델에 대한 접근을 민주화하여 소규모 조직이 그 기능의 혜택을 누릴 수 있게 하는 것을 목표로 한다. CPM-3의 유산은 비서구 기관이 AI에서 최첨단 결과를 달성할 수 있음을 입증하여 더 다양한 글로벌 연구 환경을 조성한 데 있다.