HKChatは、香港を拠点とする共同研究イニシアチブによって開発された大規模言語モデル(LLM)である。2024年に公開され、主流の生成AIシステムにおける広東語と香港英語の過小評価に対処するために設計された。このモデルはトランスフォーマーアーキテクチャに基づいて構築されており、深層学習技術を活用して、香港で一般的な口語表現やコード混合パターンなど、地域の言語的ニュアンスに焦点を当てたテキストの処理と生成を行う。
HKChatは、公開ウェブコーパス、広東語フォーラム、字幕、地元のニュース記事を組み合わせた、約1200億トークンの厳選されたデータセットでトレーニングされた。トレーニングプロセスでは、多様な多言語コーパスでの初期事前学習と、それに続く対話や質問応答などのタスク固有データでの教師ありファインチューニングという2段階のアプローチを採用した。このモデルは130億のパラメータを持ち、コンシューマーグレードのGPUを含む控えめなハードウェアでの展開に適した中規模のLLMとなっている。
開発とアーキテクチャ
HKChatの開発は2023年初頭に始まり、香港の複数の大学の研究者が主導し、地元のテクノロジーインキュベーターが支援した。このプロジェクトは、トレーニングデータが限られているために広東語で性能が低いことが多い、より大規模なプロプライエタリモデルに代わるオープンソースの代替手段を創出することを目的とした。アーキテクチャは標準的なデコーダーのみのトランスフォーマーに従い、マルチヘッドアテンションと位置エンコーディングを組み込んでいる。主要な設計上の選択には、中国語の文字と広東語の音声ローマ字表記に最適化された50,000トークンの語彙サイズと、4,096トークンのコンテキストウィンドウが含まれる。
トレーニングには、地域のクラウドサービスプロバイダーとの提携を通じて提供された、64基のNVIDIA A100 GPUのクラスターが使用された。チームは、トレーニングを安定させるために勾配クリッピングや学習率スケジューリングなどの技術を採用し、トレーニングは約45日間続いた。過学習を軽減するために、ドロップアウトと重み初期化戦略を適用し、限られた広東語テキストソースを拡張するためにデータ拡張を使用した。
機能とベンチマーク
HKChatは、対象言語に合わせて調整されたいくつかのベンチマークで優れた性能を示している。地元の文化、歴史、日常生活をカバーする10,000の質問からなるCantoneseQAデータセットでは、HKChatは78.4%の精度を達成し、7Bパラメータの多言語ベースラインなどの同等モデルを12ポイント上回った。英語のタスクでは、MMLU(Massive Multitask Language Understanding)などの標準ベンチマークで競争力のあるスコアを記録し、62.1%に達している。これは大規模モデルには及ばないものの、そのサイズとしては立派な結果である。
このモデルは、広東語と英語が混在するコード混合テキストに優れており、これは香港のオンラインコミュニケーションで一般的な現象である。50人のネイティブスピーカーを対象とした人間による評価では、HKChatはテストケースの67%で、2つの主要な商用モデルよりも自然で文脈に適切であると評価された。しかし、正式な書き言葉の中国語や専門的な技術用語には苦労しており、その地域的な焦点を反映している。
リリースとアクセシビリティ
HKChatは2024年11月にオープンソースライセンスでリリースされ、モデルの重みと推論コードが公開リポジトリで利用可能になった。リリースには、モバイルデバイス向けに最適化された20億パラメータの軽量版であるHKChat-Liteも含まれていた。プロジェクトはまた、トレーニングデータのソースと評価方法論を文書化した詳細な技術レポートを公開し、再現性を促進した。
リリース以来、HKChatは50,000回以上ダウンロードされ、地元のスタートアップや学術研究者の間で採用されている。広東語学習のためのいくつかの教育ツールに統合され、香港のソーシャルメディアの感情分析に関する予備研究にも使用されている。開発者は活発なコミュニティフォーラムを維持しており、ユーザーはファインチューニング用データセットの提供やパフォーマンスの問題の報告に貢献している。
制限と今後の取り組み
その強みにもかかわらず、HKChatには顕著な制限がある。そのトレーニングデータは相当なものではあるが、主要なグローバルモデルのものよりは少なく、一般的な知識や推論タスクでの性能が弱い。モデルはまた、特に政治的なトピックに関して、ソースコーパスに存在するバイアスを示す可能性があり、チームはこれを認識し、フィルタリングとアライメント技術を通じて軽減を試みている。
今後の計画には、トレーニングデータセットを3000億トークンに拡大し、ポッドキャストや政府刊行物などのより多様なソースを組み込むことが含まれる。チームはまた、応答品質と安全性を向上させるために、人間からのフィードバックによる強化学習(RLHF)を調査している。2025年に予定されている後継モデルは、パラメータ数を300億に増やし、コンテキストウィンドウを8,192トークンに拡張することを目指しており、HKChatを定義する地域的な焦点を維持する。
関連プロジェクト
HKChatは、中国語方言向けのAlibaba DAMO Academyや、ヘブライ語とアラビア語向けのAI21 Labsなどの取り組みと同様に、地域特化型LLMを開発するより広範な運動の一部である。これは、大規模言語モデル研究と技術的基盤を共有し、トランスフォーマーアーキテクチャと深層学習の進歩を活用している。プロジェクトはまた、トロント大学の研究者とクロスリンガル転移学習で協力し、広東語を超えた低リソース言語での性能向上を目指している。