BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) é um modelo de linguagem de grande porte de acesso aberto, lançado em 2022. Foi desenvolvido pela iniciativa BigScience, um esforço de pesquisa conduzido por voluntários, com o objetivo de fornecer uma alternativa transparente aos modelos proprietários de IA. Com 176 bilhões de parâmetros, o BLOOM é um modelo autorregressivo baseado em transformadores, projetado para gerar texto em 46 idiomas naturais e 13 linguagens de programação. O modelo é distribuído sob a "Licença de IA Responsável" do projeto.
Desenvolvimento
O BLOOM é o principal resultado da iniciativa BigScience, um workshop de pesquisa com duração de um ano, coordenado pela Hugging Face e financiado pelo governo francês. O projeto envolveu várias centenas de pesquisadores e engenheiros voluntários, provenientes da academia e do setor privado. O modelo foi treinado entre março e julho de 2022 no supercomputador público Jean Zay, na França, gerenciado pela GENCI e pela IDRIS (CNRS). Diferentemente de modelos anteriores, como o GPT-3, o BLOOM foi explicitamente treinado para ser multilíngue, abrangendo famílias linguísticas diversas, incluindo inglês, francês, espanhol, chinês, árabe, hindi e muitas outras.
Dados de Treinamento e Arquitetura
O corpus de treinamento do BLOOM, denominado ROOTS, combina dados extraídos da versão mais recente do corpus baseado na web OSCAR (38% do total) com dados coletados especificamente para o projeto, a partir de uma lista selecionada e documentada manualmente de fontes linguísticas. No total, o modelo foi treinado com aproximadamente 366 bilhões de tokens (1,6 TB de texto). A arquitetura é baseada no modelo transformador, especificamente um design autorregressivo somente com decodificador, semelhante ao GPT-3, mas com aprimoramentos para melhor desempenho multilíngue. O treinamento utilizou as bibliotecas de código aberto DeepSpeed e Megatron, que permitem o treinamento distribuído eficiente em milhares de GPUs.
Variantes e Aplicações
Após o lançamento do BLOOM, a iniciativa BigScience introduziu o xP3, um conjunto de dados multilíngue para aprendizado supervisionado, e o BLOOMZ, uma variante do BLOOM ajustada com o xP3 para seguir instruções. O BLOOMZ melhora a capacidade do modelo de executar tarefas com base em prompts em linguagem natural, aumentando sua usabilidade em aplicações conversacionais e outras áreas. O BLOOM também tem sido utilizado em chatbots, como o BLOOMChat e o HuggingChat, aproveitando suas capacidades multilíngues para fornecer respostas em vários idiomas. Sua natureza de acesso aberto o tornou uma escolha popular para pesquisa acadêmica e experimentação nas áreas de aprendizado de máquina e inteligência artificial.
Impacto e Significância
O BLOOM representa um marco na democratização da IA, oferecendo um modelo de alta capacidade disponível gratuitamente para pesquisa e uso comercial sob sua licença. Foi um dos primeiros modelos multilíngues de grande escala totalmente de código aberto, estabelecendo um precedente para iniciativas futuras. A ênfase do projeto na transparência - desde a coleta de dados até os procedimentos de treinamento - fornece um estudo de caso valioso para a comunidade de IA. Em comparação com modelos proprietários, como os da OpenAI ou da Anthropic, os pesos abertos do BLOOM permitem que pesquisadores inspecionem e ajustem o modelo sem restrições, fomentando a inovação em áreas como o processamento de línguas de baixos recursos e a segurança da IA. O desenvolvimento do modelo também destacou o potencial da pesquisa colaborativa e voluntária, em contraste com os esforços liderados por empresas.
Links Externos
- Projeto BigScience na Hugging Face (disponível em huggingface.co/bigscience)
Referências
- Projeto BigScience na Hugging Face
- Contribuidores da Wikipédia. "BLOOM (modelo de linguagem)." Wikipédia, a enciclopédia livre.