Huawei PanGu는 중국 기술 기업 화웨이가 개발한 대규모 언어 모델 계열이다. 이 시리즈는 2021년 4월 PanGu-α의 출시와 함께 도입되었으며, 2000억 개의 매개변수를 가진 모델로 당시 가장 큰 언어 모델 중 하나였다. PanGu 모델은 Transformer (architecture) 아키텍처를 기반으로 구축되었으며, 중국어와 영어 텍스트의 대규모 말뭉치로 훈련되었다. 이 모델들은 화웨이 클라우드를 통해 AI 서비스의 일부로 배포되며, 자연어 이해, 생성, 대화, 코드 완성 등의 응용 분야에 사용된다.
아키텍처 및 훈련
PanGu 시리즈는 PanGu-α, PanGu-Coder, PanGu-Σ와 같은 여러 모델 변형을 포함한다. 원래 모델인 PanGu-α는 밀집 트랜스포머 아키텍처를 사용하며 2.6테라바이트 말뭉치로 훈련되었다. 2022년에 출시된 PanGu-Coder는 코드 생성에 특화된 모델로, 오픈소스 코드 저장소로 훈련되었다. 2023년에 도입된 PanGu-Σ는 수천억 개의 매개변수를 가진 희소 트랜스포머 모델로, 계산 비용을 줄이기 위해 계층적 아키텍처를 기반으로 구축되었다. 훈련은 화웨이의 Ascend 910 AI 칩에서 수행되며, 안정성을 위해 잔차 연결과 층 정규화를 활용한다.
기능 및 응용 분야
PanGu 모델은 텍스트 요약, 기계 번역, 질문 응답, 대화 생성과 같은 작업을 지원한다. 2021년 평가에서 PanGu-α는 여러 중국어 자연어 이해 작업에서 벤치마킹되었으며, 여러 데이터셋에서 제로샷 및 퓨샷 설정에서 OpenAI의 GPT-3보다 우수한 성능을 보였다고 보고되었다. 화웨이는 PanGu 모델을 클라우드 서비스 제공에 통합했으며, 여기에는 기업이 맞춤형 AI 응용 프로그램을 구축할 수 있는 로우코드 및 노코드 도구를 제공하는 Pangu PanguStudio 플랫폼이 포함된다. 이 모델들은 금융, 의료, 제조와 같은 산업에서 사용되었으며, TomTom, Intuitive Surgical, Commure와 같은 파트너 기업에서 도메인 특정 작업에 배포된 것으로 보고되었지만, 구체적인 내용은 널리 공개되지 않았다.
아키텍처 개선
효율성을 개선하기 위해 PanGu-Σ는 "weight lifting"이라는 방법과 "병렬 어텐션" 메커니즘과 같은 혁신을 통합한다. 훈련 과정은 매개변수 비대를 줄이기 위해 가지치기와 데이터 증강 기술을 사용한다. 후기 버전에서는 사용자 선호도에 맞춰 출력을 정렬하기 위해 RLAIF(AI 피드백 기반 강화 학습)가 채택되었다. 모델은 또한 여러 층에 걸쳐 멀티헤드 어텐션과 크로스 어텐션 블록을 사용한다.
출시 역사 및 생태계
PanGu-α는 2021년에 처음 출시되었다. 2022년에는 화웨이가 PanGu-Coder와 비전용 PanGu-CV를 출시했다. 2023년에는 PanGu-Σ가 7000억 개의 매개변수를 가진 것으로 주장되며 출시되었다. 2024년에는 화웨이가 클라우드에서 PanGu Studio와 PanGu Foundation Model 서비스를 출시했으며, HarmonyOS 운영 체제와의 통합도 이루어졌다. 이 모델들은 클라우드 플랫폼 대응을 통해 접근할 수 있지만, 화웨이 클라우드를 통해 직접 제공되기도 한다. Alibaba Cloud 및 다른 제공업체와의 파트너십은 공개되지 않았다.
평가 및 논란
2021년, 초기 비판자들은 데이터셋의 크기와 가능한 훈련 데이터 누출에 대한 우려를 제기했다. 화웨이는 PanGu-α가 일부 중국어 벤치마크에서 GPT-3보다 우수하다고 주장하는 벤치마크 결과를 발표했지만, 독립적인 검증은 제한적이었다. 모델의 출시는 언어 모델 벤치마크와 결과 재현성에 대한 논쟁을 촉발했으며, 이는 DeepMind 및 다른 연구소를 둘러싼 유사한 논쟁을 반영한다. PanGu는 또한 중국의 국내 AI 역량 강화와 외국 저자에 대한 의존도 감소를 위한 노력의 일부이다. 2024년 현재, 모델은 여전히 활성 상태이며, 화웨이는 GPT-4 및 Anthropic과 같은 다른 LLM과 경쟁하기 위해 지속적인 개발에 투자하고 있다.