CPM-2는 베이징 인공지능 연구원(BAAI)이 개발한 대규모 사전 학습 언어 모델이다. 2021년에 공개된 이 모델은 CPM-1의 후속 모델로, 1980억 개의 매개변수를 보유하여 당시 가장 큰 중국어 모델 중 하나로 주목받았다. CPM-2는 텍스트 생성, 이해, 대화 등 다양한 자연어 처리 작업을 처리하도록 설계되었으며, 중국어에 중점을 둔다.
단일 아키텍처에만 의존하는 많은 모델과 달리, CPM-2는 Transformer (architecture) 프레임워크 내에서 전문가 혼합(MoE) 방식을 사용한다. 이 설계는 각 입력에 대해 모델의 매개변수 하위 집합만 활성화하여 높은 성능을 유지하면서 계산 효율성을 향상시킨다. 이 모델은 웹 페이지, 서적 및 기타 출처를 포함한 다양한 중국어 텍스트 말뭉치로 학습되었으며, CLUE(중국어 언어 이해 평가)와 같은 벤치마크에서 강력한 결과를 보여주었다.
아키텍처 및 학습
CPM-2는 Transformer (architecture) 아키텍처를 기반으로 하며, 특히 생성 작업을 위해 디코더 전용 구조를 사용한다. 1980억 개의 매개변수는 여러 전문가 계층으로 구성되며, 각 토큰은 소수의 전문가에게 라우팅되어 추론당 실질적인 계산 비용을 줄인다. 이 모델은 중국어 하위 단어 단위의 어휘를 사용하며, 학습을 안정화하기 위해 Positional Encoding 및 Layer Normalization과 같은 기법을 통합한다.
학습 과정은 두 단계로 진행되었다. 먼저 대규모 말뭉치에 대한 밀집 사전 학습 단계를 거친 후, MoE 구조를 사용한 희소 미세 조정 단계를 거쳤다. 이 방법을 통해 BAAI는 밀집 아키텍처만으로는 실현 불가능한 규모로 모델을 확장할 수 있었다. 학습 데이터는 200기가바이트 이상의 중국어 텍스트로 구성되었으며, 모델은 GPU 클러스터에서 학습되었지만 구체적인 하드웨어 세부 사항은 공개되지 않았다.
기능 및 응용 분야
CPM-2는 텍스트 완성, 요약, 질문 응답 및 대화 생성과 같은 다양한 Large language model 작업에서 뛰어난 성능을 발휘한다. 평가에서 CLUE 리더보드와 같은 여러 중국어 벤치마크에서 최첨단 결과를 달성하여 특정 중국어 작업에서 GPT-3와 같은 이전 모델을 능가했다. 긴 맥락을 처리하고 일관되고 맥락에 맞는 텍스트를 생성하는 모델의 능력은 콘텐츠 제작, 고객 서비스 및 교육 도구와 같은 응용 분야에 적합하게 만들었다.
주목할 만한 기능 중 하나는 이중 언어 능력으로, CPM-2는 영어 텍스트도 처리할 수 있지만 주로 중국어에 중점을 둔다. 이러한 다재다능함은 학습 말뭉치에 영어 데이터가 포함되어 있어 교차 언어 전이가 가능하기 때문이다. 이 모델은 198B 매개변수 전체 버전과 더 작은 11B 매개변수 버전의 두 가지 버전으로 제공되며, 후자는 연구 및 배포에 더 접근성이 높다.
영향 및 평가
CPM-2는 오픈 소스 모델로 공개되어 가중치와 코드가 연구 커뮤니티에 제공되었다. 이러한 개방성은 특히 중국에서 학계 및 산업계에서의 채택에 기여했으며, 도메인별 작업에 대한 추가 미세 조정의 기반이 되었다. 이 모델의 공개는 또한 대규모 모델 학습의 환경적, 계산적 비용과 효율적인 추론 방법의 필요성에 대한 논의를 촉발했다.
OpenAI의 GPT-3와 같은 동시대 모델과 비교하여 CPM-2는 특정 언어에 초점을 맞추고 더 효율적인 MoE 아키텍처를 통해 경쟁력 있는 성능을 달성할 수 있음을 입증했다. 이러한 성공은 희소 모델에 대한 추가 연구를 장려하고 CPM-3과 같은 CPM 시리즈의 후속 모델 개발에 기여했다.
한계 및 윤리적 고려 사항
다른 대규모 언어 모델과 마찬가지로 CPM-2에는 학습 데이터의 잠재적 편향으로 인해 편향된 출력이 발생할 수 있는 한계가 있다. 또한 특히 전문 주제에서 부정확하거나 무의미한 응답을 생성할 수 있다. 모델의 큰 크기는 배포에 어려움을 주며, 추론에 상당한 계산 리소스가 필요하여 리소스가 제한된 환경에서의 사용을 제한한다.
BAAI는 이러한 문제를 인정하고 민감한 응용 분야에 모델을 배포하기 전에 신중한 평가를 권장한다. 또한 조직은 생성된 콘텐츠의 윤리적 영향을 고려하도록 연구자들에게 권장하며 책임 있는 사용을 강조한다. 2024년 현재 CPM-2는 중국어 AI 개발의 기준점으로 남아 있지만, 더 많은 매개변수와 향상된 기능을 갖춘 더 발전된 모델로 대체되었다.
유산 및 향후 방향
CPM-2의 공개는 특히 비영어 언어 모델 분야에서 Artificial intelligence 분야의 이정표가 되었다. 대규모 사전 학습이 영어 이외의 언어에도 효과적으로 적용될 수 있음을 입증하여 다른 언어에서의 유사한 노력의 길을 열었다. CPM-2에 사용된 MoE 아키텍처는 Alibaba DAMO Academy 및 기타 중국 AI 연구 기관의 모델 설계를 포함한 후속 모델 설계에 영향을 미쳤다.
CPM 시리즈의 향후 버전은 인간 피드백 기반 강화 학습(Reinforcement Learning from AI Feedback (RLAIF))과 같은 최신 기법과 더 효율적인 학습 방법을 통합하여 CPM-2의 기반 위에 구축되었다. CPM-2의 유산은 서양 기술 생태계 외부에서 확장 가능한 오픈 소스 AI 개발을 입증하여 보다 다양한 글로벌 AI 환경에 기여한 데 있다.