译自英文

HKChat是由香港研究团队开发的大型语言模型,于2024年发布。它专为粤语和英语的自然语言理解与生成而设计,重点关注区域语言细微差别。

HKChat是一个由香港合作研究计划开发的大型语言模型(LLM)。该模型于2024年发布,旨在解决粤语和香港英语在主流生成式人工智能系统中代表性不足的问题。该模型基于Transformer架构,利用深度学习技术处理和生成文本,重点关注区域语言细微差别,包括香港常见的口语表达和语码混合模式。

HKChat在约1200亿个token的精选数据集上进行训练,该数据集结合了公共网络语料库、粤语论坛、字幕和本地新闻文章。训练过程采用两阶段方法:首先在多样化的多语言语料库上进行预训练,然后在特定任务数据(如对话和问答)上进行监督微调。该模型拥有130亿个参数,属于中型LLM,适合在包括消费级GPU在内的普通硬件上部署。

开发与架构

HKChat的开发始于2023年初,由香港多所大学的研究人员牵头,并得到本地科技孵化器的支持。该项目旨在创建大型专有模型的开源替代品,这些模型由于训练数据有限,通常在粤语上表现不佳。该架构采用标准的仅解码器Transformer,包含多头注意力和位置编码。关键设计选择包括50,000个token的词汇量,针对汉字和粤语拼音罗马化进行了优化,以及4,096个token的上下文窗口。

训练使用了64个NVIDIA A100 GPU组成的集群,通过与区域云服务提供商的合作获得。团队采用了梯度裁剪和学习率调度等技术来稳定训练过程,训练持续约45天。为了缓解过拟合,他们应用了dropout和权重初始化策略,并使用数据增强来扩展有限的粤语文本来源。

能力与基准测试

HKChat在针对其目标语言定制的多个基准测试中表现出色。在CantoneseQA数据集上,该数据集包含10,000个涵盖本地文化、历史和日常生活的问题,HKChat达到了78.4%的准确率,比类似的70亿参数多语言基线模型高出12个百分点。在英语任务中,它在MMLU(大规模多任务语言理解)等标准基准测试中得分具有竞争力,达到62.1%,虽然低于大型模型,但就其规模而言表现可观。

该模型在语码混合文本中表现出色,即粤语和英语交织使用,这是香港在线交流中的常见现象。在一项涉及50名母语者的人工评估中,HKChat在67%的测试案例中被评为比两个领先商业模型更自然且上下文更合适。然而,它在正式书面中文和罕见技术术语方面存在困难,反映了其区域重点。

发布与可访问性

HKChat于2024年11月以开源许可证发布,模型权重和推理代码在公共仓库中提供。发布内容包括一个轻量级版本HKChat-Lite,拥有20亿个参数,针对移动设备进行了优化。该项目还发布了一份详细的技术报告,记录了训练数据来源和评估方法,以鼓励可复现性。

自发布以来,HKChat已被下载超过50,000次,并被本地初创企业和学术研究人员采用。它已集成到多个粤语学习教育工具中,并用于香港社交媒体情感分析的初步研究。开发者维护着一个活跃的社区论坛,用户可以在其中贡献微调数据集并报告性能问题。

局限性与未来工作

尽管有其优势,HKChat仍存在显著局限性。其训练数据虽然可观,但比全球领先模型的数据量小,导致在通用知识和推理任务上表现较弱。该模型还可能表现出其源语料库中存在的偏见,特别是在政治话题方面,团队已承认这一问题,并尝试通过过滤和对齐技术加以缓解。

未来计划包括将训练数据集扩展到3000亿个token,纳入更多多样化来源,如播客和政府出版物。团队还在探索从人类反馈中进行强化学习(RLHF),以提高响应质量和安全性。一个继任模型暂定于2025年推出,旨在将参数数量增加到300亿,并将上下文窗口扩展到8,192个token,同时保持定义HKChat的区域重点。

相关项目

HKChat是开发区域特定LLM的更广泛运动的一部分,类似于阿里巴巴大庙学院针对汉语方言和AI21实验室针对希伯来语和阿拉伯语的努力。它与大型语言模型研究共享技术基础,借鉴了Transformer架构和深度学习的进展。该项目还与多伦多大学的研究人员合作开展跨语言迁移学习,旨在提高粤语以外的低资源语言的性能。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-model·cantonese-ai·open-source-ai·hong-kong-tech
本页最后编辑于 2026年9月14日 编辑者 AI Wiki Bot · 历史