HKChat é um modelo de linguagem de grande porte (LLM) desenvolvido por uma iniciativa de pesquisa colaborativa sediada em Hong Kong. Lançado em 2024, foi projetado para abordar a sub-representação do cantonês e do inglês de Hong Kong nos sistemas mainstream de IA generativa. O modelo é construído sobre uma arquitetura de transformador, utilizando técnicas de aprendizado profundo para processar e gerar texto com foco em nuances linguísticas regionais, incluindo expressões coloquiais e padrões de mistura de código comuns em Hong Kong.
HKChat foi treinado em um conjunto de dados selecionado de aproximadamente 120 bilhões de tokens, combinando corpora web públicos, fóruns em cantonês, legendas e artigos de notícias de fontes locais. O processo de treinamento empregou uma abordagem em duas etapas: pré-treinamento inicial em um corpus multilíngue diversificado, seguido de ajuste fino supervisionado em dados específicos de tarefas, como diálogo e resposta a perguntas. O modelo possui 13 bilhões de parâmetros, tornando-o um LLM de médio porte adequado para implantação em hardware modesto, incluindo GPUs de nível consumidor.
Desenvolvimento e Arquitetura
O desenvolvimento do HKChat começou no início de 2023, liderado por pesquisadores de várias universidades de Hong Kong e apoiado por incubadoras de tecnologia locais. O projeto visava criar uma alternativa de código aberto a modelos proprietários maiores, que frequentemente têm desempenho ruim em cantonês devido a dados de treinamento limitados. A arquitetura segue um transformador padrão somente decodificador, incorporando atenção de múltiplas cabeças e codificação posicional. As principais escolhas de design incluem um tamanho de vocabulário de 50.000 tokens, otimizado para caracteres chineses e romanização fonética cantonesa, e uma janela de contexto de 4.096 tokens.
O treinamento utilizou um cluster de 64 GPUs NVIDIA A100, fornecido por meio de uma parceria com um provedor regional de serviços em nuvem. A equipe empregou técnicas como recorte de gradiente e agendamento de taxa de aprendizado para estabilizar o treinamento, que durou aproximadamente 45 dias. Para mitigar o sobreajuste, aplicaram estratégias de dropout e inicialização de pesos, e usaram aumento de dados para expandir as fontes limitadas de texto em cantonês.
Capacidades e Benchmarks
HKChat demonstra forte desempenho em vários benchmarks adaptados aos seus idiomas-alvo. No conjunto de dados CantoneseQA, uma coleção de 10.000 perguntas cobrindo cultura local, história e vida cotidiana, o HKChat alcançou uma precisão de 78,4%, superando modelos comparáveis, como uma linha de base multilíngue de 7B parâmetros, por 12 pontos. Em tarefas em inglês, ele pontua competitivamente em benchmarks padrão, como MMLU (Massive Multitask Language Understanding), atingindo 62,1%, abaixo de modelos maiores, mas respeitável para seu tamanho.
O modelo se destaca em texto com mistura de código, onde cantonês e inglês são intercalados, um fenômeno comum na comunicação online de Hong Kong. Em uma avaliação humana envolvendo 50 falantes nativos, o HKChat foi classificado como mais natural e contextualmente apropriado do que dois modelos comerciais líderes em 67% dos casos de teste. No entanto, ele tem dificuldades com chinês escrito formal e jargão técnico raro, refletindo seu foco regional.
Lançamento e Acessibilidade
O HKChat foi lançado sob uma licença de código aberto em novembro de 2024, com pesos do modelo e código de inferência disponibilizados em um repositório público. O lançamento incluiu uma versão leve, HKChat-Lite, com 2 bilhões de parâmetros, otimizada para dispositivos móveis. O projeto também publicou um relatório técnico detalhado, documentando as fontes de dados de treinamento e a metodologia de avaliação, para incentivar a reprodutibilidade.
Desde seu lançamento, o HKChat foi baixado mais de 50.000 vezes, com adoção entre startups locais e pesquisadores acadêmicos. Ele foi integrado a várias ferramentas educacionais para aprendizado da língua cantonesa e usado em estudos preliminares sobre análise de sentimentos de mídias sociais de Hong Kong. Os desenvolvedores mantêm um fórum comunitário ativo, onde os usuários contribuem para conjuntos de dados de ajuste fino e relatam problemas de desempenho.
Limitações e Trabalho Futuro
Apesar de seus pontos fortes, o HKChat tem limitações notáveis. Seus dados de treinamento, embora substanciais, são menores do que os dos principais modelos globais, resultando em desempenho mais fraco em tarefas de conhecimento geral e raciocínio. O modelo também pode exibir vieses presentes em seus corpora de origem, particularmente em relação a tópicos políticos, o que a equipe reconheceu e tentou mitigar por meio de técnicas de filtragem e alinhamento.
Os planos futuros incluem expandir o conjunto de dados de treinamento para 300 bilhões de tokens, incorporando fontes mais diversas, como podcasts e publicações governamentais. A equipe também está explorando aprendizado por reforço com feedback humano (RLHF) para melhorar a qualidade e a segurança das respostas. Um modelo sucessor, provisoriamente agendado para 2025, visa aumentar o número de parâmetros para 30 bilhões e estender a janela de contexto para 8.192 tokens, mantendo o foco regional que define o HKChat.
Projetos Relacionados
O HKChat faz parte de um movimento mais amplo para desenvolver LLMs específicos de região, semelhante a esforços como Academia Damiao da Alibaba para dialetos chineses e AI21 Labs para hebraico e árabe. Ele compartilha fundamentos técnicos com a pesquisa de modelos de linguagem de grande porte, baseando-se em avanços em arquiteturas de transformadores e aprendizado profundo. O projeto também colabora com pesquisadores da Universidade de Toronto em aprendizado de transferência entre línguas, visando melhorar o desempenho em línguas de baixos recursos além do cantonês.