Falcon é uma família de modelos de linguagem de grande porte de código aberto desenvolvida pelo Technology Innovation Institute (TII) em Abu Dhabi. Lançados pela primeira vez em março de 2023, os modelos Falcon são construídos sobre uma arquitetura somente decodificadora e são treinados em dados web de alta qualidade, com ênfase em eficiência e desempenho. A série Falcon inclui modelos de tamanhos variados, de 1B a 180B de parâmetros, com os maiores modelos alcançando resultados competitivos em benchmarks padrão, exigindo menos recursos computacionais durante a inferência em comparação com alguns contemporâneos.
Os modelos Falcon são notáveis pelo uso de atenção multi-consulta (MQA) e atenção flash, que reduzem a largura de banda de memória e aceleram a decodificação. Eles são treinados no conjunto de dados Falcon RefinedWeb, um corpus filtrado em grande escala de texto web público. Os modelos Falcon foram lançados sob licenças permissivas, com os modelos menores sob a licença Apache 2.0 e os maiores sob uma licença personalizada que restringe o uso comercial. Os modelos foram amplamente adotados na comunidade de código aberto e serviram como base para várias variantes ajustadas.
Arquitetura e Treinamento
Os modelos Falcon empregam uma arquitetura padrão de transformador decodificador, mas com várias otimizações. Eles usam incorporações posicionais rotativas e uma combinação de atenção multi-consulta para os modelos maiores, que compartilham cabeças de chave e valor entre todas as cabeças de consulta, reduzindo o uso de memória e melhorando a velocidade de inferência. Os dados de treinamento são provenientes do conjunto de dados Falcon RefinedWeb, que compreende bilhões de tokens filtrados do Common Crawl, com fontes adicionais curadas para alguns modelos. O processo de treinamento usa o otimizador AdamW e um agendamento de taxa de aprendizado cosseno, com um comprimento máximo de sequência de 2048 tokens para a maioria dos modelos.
O maior modelo Falcon, o Falcon-180B, foi treinado em 3,5 trilhões de tokens usando 384 GPUs, e demonstra forte desempenho em tarefas de raciocínio, codificação e conhecimento geral. Apesar de seu tamanho, o Falcon-180B é projetado para ser eficiente, com foco na redução do número de parâmetros usados durante a inferência por meio da atenção multi-consulta.
Variantes de Modelo e Lançamentos
Os modelos Falcon foram lançados em vários tamanhos e configurações. O lançamento inicial em março de 2023 incluiu Falcon-1B e Falcon-7B, ambos sob a licença Apache 2.0. Em maio de 2023, o Falcon-40B foi lançado, que liderou o Open LLM Leaderboard na época. Posteriormente, em setembro de 2023, o Falcon-180B foi disponibilizado, com uma licença personalizada que permite uso gratuito para fins de pesquisa e não comerciais, mas restringe a implantação comercial. Variantes menores, como Falcon-3B e Falcon-11B, também foram lançadas, com o modelo de 11B usando um mecanismo de atenção diferente (atenção multi-consulta) e alcançando eficiência notável.
Todos os modelos Falcon estão disponíveis no Hugging Face Hub e foram integrados a vários frameworks de inferência, incluindo vLLM e TensorRT-LLM. Os modelos também foram ajustados para seguir instruções e aplicações de chat, com variantes oficiais como Falcon-7B-Instruct e Falcon-40B-Instruct.
Desempenho e Benchmarks
Os modelos Falcon demonstraram desempenho competitivo em uma variedade de benchmarks. O Falcon-40B, por exemplo, superou muitos modelos de código aberto existentes no benchmark MMLU (compreensão de linguagem multitarefa massiva), alcançando uma pontuação de 60,4%. O Falcon-180B melhorou ainda mais esses resultados, pontuando 70,4% no MMLU e 68,2% no HellaSwag, e teve desempenho comparável a modelos proprietários como PaLM-2 Large em várias tarefas. Em benchmarks de codificação, o Falcon-180B alcançou uma pontuação pass@1 de 19,3% no HumanEval, o que é competitivo com outros modelos grandes.
A eficiência dos modelos Falcon é um ponto de venda importante. O uso de atenção multi-consulta reduz a pegada de memória e acelera a inferência, tornando-os adequados para implantação em GPUs únicas. Por exemplo, o Falcon-40B pode ser executado em uma única GPU A100 com quantização, e o Falcon-180B requer várias GPUs, mas ainda oferece uma relação desempenho-recurso favorável.
Impacto e Ecossistema
Os modelos Falcon tiveram um impacto significativo no cenário de IA de código aberto. Eles foram usados como modelos base para inúmeras variantes ajustadas, incluindo modelos ajustados para instruções e chat, e foram integrados a plataformas como Hugging Face, Replicate e AWS SageMaker. O lançamento do Falcon-40B e do Falcon-180B ajudou a impulsionar mais inovações no design eficiente de modelos grandes, influenciando modelos subsequentes como Llama 2 e Mistral. Os modelos Falcon também fazem parte dos esforços de pesquisa mais amplos do TII em IA, que incluem trabalho em processamento de linguagem natural e visão computacional.
A licença permissiva dos modelos Falcon menores incentivou a adoção generalizada em aplicações de pesquisa e comerciais, enquanto os modelos maiores foram usados em estudos acadêmicos e pilotos industriais. A família Falcon continua sendo um ponto de referência importante no desenvolvimento de modelos de linguagem de grande porte de código aberto.