HKChat는 홍콩에 기반을 둔 공동 연구 이니셔티브가 개발한 대규모 언어 모델(LLM)이다. 2024년에 출시되었으며, 주류 생성형 AI 시스템에서 광둥어와 홍콩 영어의 과소 대표 문제를 해결하기 위해 설계되었다. 이 모델은 트랜스포머 아키텍처를 기반으로 하며, 딥러닝 기술을 활용하여 홍콩에서 흔한 구어체 표현과 코드 혼용 패턴을 포함한 지역적 언어적 뉘앙스에 초점을 맞춰 텍스트를 처리하고 생성한다.
HKChat은 약 1,200억 개의 토큰으로 구성된 선별된 데이터셋으로 훈련되었으며, 공개 웹 코퍼스, 광둥어 포럼, 자막, 현지 뉴스 기사를 결합했다. 훈련 과정은 두 단계 접근 방식을 채택했다: 다양한 다국어 코퍼스에 대한 초기 사전 훈련, 이어서 대화 및 질의응답과 같은 작업별 데이터에 대한 지도 미세 조정. 이 모델은 130억 개의 매개변수를 가지며, 소비자용 GPU를 포함한 적당한 하드웨어에 배포하기 적합한 중간 규모의 LLM이다.
개발 및 아키텍처
HKChat의 개발은 2023년 초에 시작되었으며, 홍콩의 여러 대학 연구자들이 주도하고 현지 기술 인큐베이터가 지원했다. 이 프로젝트는 제한된 훈련 데이터로 인해 광둥어에서 성능이 저조한 대형 독점 모델에 대한 오픈소스 대안을 만드는 것을 목표로 했다. 아키텍처는 표준 디코더 전용 트랜스포머를 따르며, 멀티 헤드 어텐션과 위치 인코딩을 통합한다. 주요 설계 선택에는 중국어 문자와 광둥어 음운 로마자 표기에 최적화된 50,000개 토큰의 어휘 크기와 4,096개 토큰의 컨텍스트 창이 포함된다.
훈련은 지역 클라우드 서비스 제공업체와의 파트너십을 통해 제공된 64개의 NVIDIA A100 GPU 클러스터를 활용했다. 팀은 훈련을 안정화하기 위해 그래디언트 클리핑과 학습률 스케줄링과 같은 기법을 사용했으며, 훈련 기간은 약 45일이었다. 과적합을 완화하기 위해 드롭아웃과 가중치 초기화 전략을 적용했고, 제한된 광둥어 텍스트 소스를 확장하기 위해 데이터 증강을 사용했다.
기능 및 벤치마크
HKChat은 대상 언어에 맞춘 여러 벤치마크에서 강력한 성능을 보여준다. 현지 문화, 역사, 일상생활을 다루는 10,000개 질문으로 구성된 CantoneseQA 데이터셋에서 HKChat은 78.4%의 정확도를 달성하여, 70억 매개변수 다국어 기준 모델과 같은 비교 모델보다 12포인트 앞섰다. 영어 작업에서는 MMLU(Massive Multitask Language Understanding)와 같은 표준 벤치마크에서 62.1%를 기록하여 경쟁력 있는 점수를 얻었으며, 이는 대형 모델보다 낮지만 크기에 비해 존중할 만한 수준이다.
이 모델은 홍콩 온라인 커뮤니케이션에서 흔한 광둥어와 영어가 혼합된 코드 혼용 텍스트에서 뛰어난 성능을 보인다. 50명의 원어민을 대상으로 한 인간 평가에서 HKChat은 67%의 테스트 사례에서 두 주요 상용 모델보다 더 자연스럽고 맥락에 적합하다고 평가되었다. 그러나 공식 서면 중국어와 희귀한 기술 용어에서는 어려움을 겪으며, 이는 지역적 초점을 반영한다.
출시 및 접근성
HKChat은 2024년 11월 오픈소스 라이선스로 출시되었으며, 모델 가중치와 추론 코드가 공개 저장소에 제공되었다. 출시에는 모바일 기기에 최적화된 20억 매개변수의 경량 버전인 HKChat-Lite가 포함되었다. 프로젝트는 또한 재현성을 장려하기 위해 훈련 데이터 소스와 평가 방법론을 문서화한 상세한 기술 보고서를 발표했다.
출시 이후 HKChat은 50,000회 이상 다운로드되었으며, 현지 스타트업과 학술 연구자들 사이에서 채택되었다. 이 모델은 광둥어 학습을 위한 여러 교육 도구에 통합되었고, 홍콩 소셜 미디어의 감정 분석에 대한 예비 연구에 사용되었다. 개발자들은 사용자가 미세 조정 데이터셋에 기여하고 성능 문제를 보고하는 활발한 커뮤니티 포럼을 유지하고 있다.
한계 및 향후 작업
강점에도 불구하고 HKChat은 주목할 만한 한계가 있다. 훈련 데이터는 상당하지만 주요 글로벌 모델보다 작아 일반 지식 및 추론 작업에서 성능이 약하다. 이 모델은 또한 특히 정치적 주제에 관해 소스 코퍼스에 존재하는 편향을 나타낼 수 있으며, 팀은 필터링 및 정렬 기법을 통해 이를 완화하려고 시도했음을 인정했다.
향후 계획에는 훈련 데이터셋을 3,000억 개의 토큰으로 확장하고 팟캐스트와 정부 간행물과 같은 더 다양한 소스를 통합하는 것이 포함된다. 팀은 또한 응답 품질과 안전성을 개선하기 위해 인간 피드백 기반 강화 학습(RLHF)을 탐구하고 있다. 2025년으로 예정된 후속 모델은 매개변수 수를 300억 개로 늘리고 컨텍스트 창을 8,192개 토큰으로 확장하는 것을 목표로 하며, HKChat을 정의하는 지역적 초점을 유지한다.
관련 프로젝트
HKChat은 중국 방언 및 히브리어와 아랍어를 위한 노력과 같은 지역별 LLM을 개발하는 더 넓은 운동의 일부이다. 이는 대규모 언어 모델 연구와 기술적 기반을 공유하며, 트랜스포머 아키텍처와 딥러닝의 발전을 활용한다. 이 프로젝트는 또한 토론토 대학교 연구자들과 협력하여 교차 언어 전이 학습을 진행하며, 광둥어를 넘어 저자원 언어에서의 성능을 개선하는 것을 목표로 한다.