Traduit de l'anglais

Falcon est une famille de modèles de langage à grande échelle open-source développés par l'Institut d'innovation technologique (TII) à Abou Dabi, réputés pour leur efficacité et leurs performances solides sur les benchmarks de raisonnement et de codage.

Falcon est une famille de modèles de langage de grande taille open-source développée par le Technology Innovation Institute (TII) à Abu Dhabi. Publiée pour la première fois en mars 2023, la famille Falcon repose sur une architecture de décodeur uniquement et est entraînée sur des données web de haute qualité, en mettant l'accent sur l'efficacité et la performance. La série Falcon comprend des modèles de tailles variées, allant de 1B à 180B de paramètres, les plus grands modèles atteignant des résultats compétitifs sur des benchmarks standards tout en nécessitant moins de ressources de calcul lors de l'inférence par rapport à certains contemporains.

Les modèles Falcon se distinguent par leur utilisation de l'attention multi-requêtes (MQA) et de l'attention flash, qui réduisent la bande passante mémoire et accélèrent le décodage. Ils sont entraînés sur l'ensemble de données Falcon RefinedWeb, un corpus filtré à grande échelle de textes web publics. Les modèles Falcon ont été publiés sous des licences permissives, les modèles plus petits étant sous licence Apache 2.0 et les modèles plus grands sous une licence personnalisée restreignant l'utilisation commerciale. Ils ont été largement adoptés par la communauté open-source et ont servi de base à de nombreuses variantes affinées.

Architecture et entraînement

Les modèles Falcon utilisent une architecture de transformateur standard avec décodeur uniquement, mais intègrent plusieurs optimisations. Ils emploient des plongements positionnels rotatifs et une combinaison d'attention multi-requêtes pour les modèles plus grands, ce qui permet de partager les clés et valeurs entre toutes les têtes d'attention, réduisant ainsi l'utilisation mémoire et améliorant la vitesse d'inférence. Les données d'entraînement proviennent de l'ensemble Falcon RefinedWeb, qui comprend des milliards de jetons filtrés à partir de Common Crawl, complétés par des sources supplémentaires organisées pour certains modèles. Le processus d'entraînement utilise l'optimiseur AdamW et un calendrier de taux d'apprentissage en cosinus, avec une longueur de séquence maximale de 2048 jetons pour la plupart des modèles.

Le plus grand modèle, Falcon-180B, a été entraîné sur 3,5 billions de jetons en utilisant 384 GPU, et il démontre de solides performances en matière de raisonnement, de codage et de connaissances générales. Malgré sa taille, Falcon-180B est conçu pour être efficace, avec un accent sur la réduction du nombre de paramètres utilisés lors de l'inférence grâce à l'attention multi-requêtes.

Variantes et versions

Les modèles Falcon ont été publiés en plusieurs tailles et configurations. La version initiale de mars 2023 comprenait Falcon-1B et Falcon-7B, tous deux sous licence Apache 2.0. En mai 2023, Falcon-40B a été publié, se classant en tête du classement Open LLM Leaderboard à l'époque. Plus tard, en septembre 2023, Falcon-180B a été mis à disposition, avec une licence personnalisée autorisant une utilisation gratuite pour la recherche et des fins non commerciales, mais restreignant le déploiement commercial. Des variantes plus petites, telles que Falcon-3B et Falcon-11B, ont également été publiées, le modèle 11B utilisant un mécanisme d'attention différent (attention multi-requêtes) et atteignant une efficacité notable.

Tous les modèles Falcon sont disponibles sur le Hub Hugging Face et ont été intégrés dans divers frameworks d'inférence, notamment vLLM et TensorRT-LLM. Les modèles ont également été affinés pour des applications d'instruction et de chat, avec des variantes officielles comme Falcon-7B-Instruct et Falcon-40B-Instruct.

Performances et benchmarks

Les modèles Falcon ont démontré des performances compétitives sur une gamme de benchmarks. Falcon-40B, par exemple, a surpassé de nombreux modèles open-source existants sur le benchmark MMLU (massive multitask language understanding), obtenant un score de 60,4 %. Falcon-180B a encore amélioré ces résultats, atteignant 70,4 % sur MMLU et 68,2 % sur HellaSwag, et se comportant de manière comparable à des modèles propriétaires comme PaLM-2 Large sur plusieurs tâches. Sur les benchmarks de codage, Falcon-180B a obtenu un score pass@1 de 19,3 % sur HumanEval, ce qui est compétitif par rapport à d'autres grands modèles.

L'efficacité des modèles Falcon est un point clé de vente. L'utilisation de l'attention multi-requêtes réduit l'empreinte mémoire et accélère l'inférence, ce qui les rend adaptés au déploiement sur des GPU uniques. Par exemple, Falcon-40B peut être exécuté sur un seul GPU A100 avec quantification, tandis que Falcon-180B nécessite plusieurs GPU mais offre toujours un rapport performance/ressources favorable.

Impact et écosystème

Les modèles Falcon ont eu un impact significatif sur le paysage de l'IA open-source. Ils ont été utilisés comme modèles de base pour de nombreuses variantes affinées, notamment des modèles d'instruction et de chat, et ont été intégrés dans des plateformes comme Hugging Face, Replicate et AWS SageMaker. La publication de Falcon-40B et Falcon-180B a stimulé l'innovation dans la conception de modèles efficaces, influençant des modèles ultérieurs tels que Llama 2 et Mistral. Les modèles Falcon font également partie des efforts de recherche plus larges du TII en IA, qui incluent des travaux sur le traitement du langage naturel et la vision par ordinateur.

La licence permissive des modèles Falcon plus petits a encouragé leur adoption généralisée dans la recherche et les applications commerciales, tandis que les modèles plus grands ont été utilisés dans des études académiques et des projets pilotes industriels. La famille Falcon reste un point de référence important dans le développement des modèles de langage de grande taille open-source.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-models·open-source-ai·natural-language-processing·artificial-intelligence
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique