Zephyr est une famille de modèles de langage de grande taille à poids ouverts développée par l'équipe Hugging Face, conçue pour servir d'assistants utiles et alignés. Les modèles sont affinés à partir de modèles de base créés par Mistral AI, en utilisant une technique appelée optimisation directe des préférences distillées (dDPO). Cette approche exploite les retours d'un modèle enseignant plus grand et plus performant pour guider le processus d'affinage, visant à améliorer la capacité du modèle à suivre les instructions et à générer des réponses à la fois utiles et inoffensives.
Le premier modèle de la série, Zephyr-7B-alpha, a été publié en octobre 2023, suivi de Zephyr-7B-beta en novembre 2023. Ces modèles sont basés sur l'architecture Mistral-7B, un modèle Transformer (architecture) de 7 milliards de paramètres. La série Zephyr s'est distinguée par ses performances solides sur divers benchmarks par rapport à sa taille, rivalisant souvent avec des modèles beaucoup plus grands. Le projet met l'accent sur l'accès ouvert, avec des poids et un code d'entraînement rendus publics, contribuant à l'écosystème plus large de la recherche et du développement en IA générative.
Développement et entraînement
Les modèles Zephyr ont été entraînés selon un processus en plusieurs étapes. Initialement, le modèle de base Mistral-7B a été affiné sur un ensemble de données d'instructions et de réponses, en utilisant l'affinage supervisé (SFT) pour enseigner au modèle un comportement conversationnel et instructif de base. Cela a été suivi de l'application de la dDPO, une variante de l'apprentissage par renforcement à partir de retours humains (RLHF). Dans la dDPO, le modèle est optimisé pour s'aligner sur des préférences dérivées d'un modèle enseignant, tel que GPT-4, plutôt que sur des annotations humaines directes. Les données de préférences ont été construites en faisant générer plusieurs réponses à des invites par le modèle enseignant, puis en les classant, offrant ainsi un moyen évolutif d'améliorer l'alignement sans étiquetage humain intensif.
Un aspect clé de l'entraînement a été l'utilisation d'un ensemble de données organisé appelé UltraFeedback, contenant plus de 60 000 invites et paires de préférences. Le processus d'entraînement a également intégré des techniques comme RLHF et échantillonnage top-p lors de l'inférence pour équilibrer créativité et cohérence. Les développeurs ont souligné que la méthode dDPO est efficace sur le plan computationnel par rapport au RLHF traditionnel, car elle évite la nécessité d'un modèle de récompense séparé et d'un échantillonnage en ligne pendant l'entraînement.
Variantes de modèles et performances
Zephyr-7B-alpha et Zephyr-7B-beta sont les principales variantes publiées, toutes deux avec 7 milliards de paramètres. La version bêta a intégré des raffinements dans les données d'entraînement et les hyperparamètres, conduisant à des performances améliorées sur des benchmarks tels que MT-Bench, AlpacaEval et le Open LLM Leaderboard. Sur MT-Bench, Zephyr-7B-beta a obtenu un score de 7,34, surpassant de nombreux modèles de taille similaire et même certains modèles plus grands comme Llama-2-70B-chat. Les modèles sont conçus pour fonctionner sur du matériel grand public, les rendant accessibles aux chercheurs et aux amateurs.
La série Zephyr a également été utilisée comme base pour d'autres affinages par la communauté, démontrant son utilité comme fondation pour des applications spécialisées. Cependant, les modèles conservent des limitations courantes des LLM, notamment des biais potentiels et une tendance à générer des informations plausibles mais incorrectes, que les développeurs ont documentées dans les fiches de modèles.
Approche technique
La base technique de Zephyr réside dans l'architecture Mistral-7B, qui utilise l'attention par groupes de requêtes et l'attention à fenêtre glissante pour améliorer la vitesse d'inférence et l'efficacité mémoire. Le processus d'affinage a utilisé un calendrier de taux d'apprentissage avec échauffement, et écrêtage de gradient pour stabiliser l'entraînement. L'objectif dDPO est une optimisation directe d'une politique par rapport à un modèle de référence, utilisant une perte d'entropie croisée binaire sur des paires de préférences. Cette méthode est dérivée du cadre DPO (optimisation directe des préférences), qui simplifie le pipeline RLHF en éliminant la nécessité d'un modèle de récompense séparé.
L'inférence pour Zephyr utilise généralement mise à l'échelle de température avec une valeur autour de 0,7 et échantillonnage top-p avec une valeur de 0,95, comme recommandé par les développeurs pour obtenir des sorties équilibrées. Le modèle prend en charge une longueur de contexte de 8 192 jetons, permettant des conversations modérément longues.
Impact et réception
La publication de Zephyr a contribué à la tendance des modèles plus petits et efficaces pouvant rivaliser avec leurs homologues plus grands. Elle a mis en évidence l'efficacité des techniques d'optimisation des préférences pour aligner les modèles sur les valeurs humaines, et la nature open source du projet a facilité une adoption et une expérimentation généralisées. Le modèle a été cité dans la recherche académique et utilisé dans diverses applications, des chatbots aux outils éducatifs. Son succès a également stimulé d'autres travaux sur la dDPO et des méthodes d'alignement similaires au sein de la communauté apprentissage automatique.
Limitations et considérations éthiques
Comme pour d'autres LLM, Zephyr peut produire du contenu biaisé ou nuisible, et peut halluciner des faits. Les développeurs notent que le modèle ne convient pas à la prise de décision à enjeux élevés sans garanties supplémentaires. Les données d'entraînement, dérivées de sources publiques et de préférences synthétiques, peuvent refléter des biais sociétaux existants. Les utilisateurs sont encouragés à mettre en œuvre des mesures de sécurité appropriées lors du déploiement du modèle. Le projet s'aligne sur les efforts plus larges en intelligence artificielle pour démocratiser l'accès à des modèles performants tout en reconnaissant la nécessité d'une utilisation responsable.
Orientations futures
La série Zephyr a été succédée par d'autres modèles, mais sa méthodologie reste influente. L'accent mis sur l'alignement efficace et les poids ouverts a inspiré des projets similaires, et les techniques sont intégrées dans des pipelines d'entraînement à plus grande échelle. L'équipe Hugging Face continue d'explorer des améliorations dans l'optimisation des préférences et l'évaluation des modèles, avec un accent sur la robustesse et la sécurité.
Références et lectures complémentaires
Pour des informations techniques détaillées, les fiches de modèles Zephyr sur le Hub Hugging Face fournissent une documentation complète, y compris les détails d'entraînement, les résultats de benchmarks et des exemples d'utilisation. Le document de recherche associé, intitulé « Zephyr: Direct Distillation of LM Alignment », offre une analyse approfondie de la méthode dDPO et de ses résultats empiriques.