RedPajama est une initiative open-source lancée par Together AI, une entreprise spécialisée dans l'avancement de l'infrastructure de l'IA générative. L'objectif principal du projet est de fournir des ensembles de données et des points de contrôle de modèles entièrement transparents et reproductibles pour l'entraînement de grands modèles de langage. Il a été créé en réponse au besoin croissant d'alternatives ouvertes aux données d'entraînement propriétaires, souvent non divulguées par les grandes organisations de recherche en IA. En publiant à la fois les données et les modèles, RedPajama permet aux chercheurs et aux développeurs d'étudier, de reproduire et de construire sur les processus d'entraînement de modèles de langage de pointe sans les barrières des ressources à code source fermé.
Le projet a débuté en avril 2023 avec la publication de l'ensemble de données RedPajama, une collection de 1,2 billion de jetons conçue pour refléter la composition des données d'entraînement utilisées pour les modèles LLaMA. Cette première publication a été un effort collaboratif impliquant Together AI et plusieurs partenaires académiques, notamment le laboratoire d'IA de Stanford et le groupe recherche en IA de Berkeley. L'ensemble de données a été assemblé à partir de sources publiquement disponibles, telles que Common Crawl, Wikipédia, GitHub et des livres, et a été mis à disposition sous des licences permissives. Suite à cela, Together AI a publié la famille de modèles RedPajama-INCITE, qui sont des réseaux de neurones entraînés sur ces données, démontrant des performances compétitives par rapport à d'autres modèles ouverts de taille similaire.
Composition et construction de l'ensemble de données
L'ensemble de données RedPajama a été construit pour reproduire le mélange de données utilisé pour les modèles LLaMA originaux, détaillé dans un article de recherche mais non publié publiquement. L'ensemble comprend sept composants distincts : Common Crawl (un vaste extrait web), C4 (un autre corpus web), Wikipédia, le code GitHub, les articles ArXiv, StackExchange et les livres. Chaque composant a été traité pour garantir qualité et cohérence, avec déduplication et filtrage pour éliminer le contenu de faible qualité ou répétitif. L'ensemble final totalisait 1,2 billion de jetons, ce qui en faisait l'un des plus grands corpus ouvertement disponibles pour l'entraînement de modèles de langage à sa publication.
Une caractéristique clé de l'ensemble de données est son accent sur la transparence. Contrairement à de nombreux ensembles de données propriétaires, RedPajama fournit des métadonnées détaillées sur les sources et les étapes de prétraitement, permettant aux chercheurs de comprendre exactement sur quoi les modèles ont été entraînés. Cette transparence est cruciale pour auditer les biais, vérifier la qualité des données et permettre une recherche reproductible. L'ensemble de données est distribué dans un format compatible avec les cadres d'apprentissage automatique courants, facilitant son intégration dans les pipelines d'entraînement existants.
Modèles RedPajama-INCITE
En mai 2023, Together AI a publié la famille de modèles RedPajama-INCITE, entraînés sur l'ensemble de données RedPajama. Ces modèles étaient disponibles en plusieurs tailles, notamment 3B et 7B paramètres, et en variantes de base, ajustées par instructions et ajustées pour le chat. Les modèles ajustés par instructions ont été affinés en utilisant des techniques comme le apprentissage par renforcement à partir de retours d'IA et les retours humains, les rendant adaptés aux applications conversationnelles et orientées tâches. Les modèles ont été conçus pour être efficaces et accessibles, fonctionnant sur du matériel grand public et prenant en charge la quantification pour un déploiement sur des appareils de périphérie.
Les modèles INCITE ont été évalués par rapport à d'autres modèles ouverts, tels que ceux de AI21 Labs et Anthropic, et ont montré des performances compétitives sur des tâches standard de traitement du langage naturel comme la réponse aux questions et le raisonnement. Cependant, ils n'étaient pas conçus pour surpasser les plus grands modèles propriétaires, comme ceux de OpenAI ou Google DeepMind, mais plutôt pour fournir une base solide et reproductible pour la communauté open-source. La publication incluait des détails complets sur l'entraînement, y compris les hyperparamètres et les exigences de calcul, permettant à d'autres de reproduire le processus.
Expansion et variantes
Suite à la publication initiale, le projet RedPajama s'est étendu pour inclure des ensembles de données et des variantes de modèles supplémentaires. En juillet 2023, Together AI a publié RedPajama-V2, un ensemble de données mis à jour avec un filtrage amélioré et un corpus plus vaste, totalisant plus de 30 billions de jetons provenant uniquement de Common Crawl. Cette version a introduit un pipeline plus sophistiqué pour le nettoyage des données, utilisant des classificateurs pour identifier et éliminer le contenu de faible qualité ou dupliqué. L'ensemble V2 a été conçu pour soutenir l'entraînement de modèles encore plus grands et fournir une ressource plus complète pour la communauté de recherche.
De plus, le projet a introduit des modèles spécialisés, tels que RedPajama-INCITE-Base et RedPajama-INCITE-Chat, optimisés pour des cas d'utilisation spécifiques. Les variantes de chat ont été affinées sur des données conversationnelles et ont démontré des performances améliorées dans les tâches de dialogue multi-tours. Together AI a également publié des outils et des scripts pour le traitement des données, permettant aux utilisateurs de personnaliser l'ensemble de données selon leurs besoins, comme le filtrage par langue ou domaine.
Innovations techniques et contributions
Le projet RedPajama a contribué à plusieurs innovations techniques dans le domaine de l'IA open-source. Une contribution notable a été le développement de pipelines de traitement de données efficaces capables de gérer l'échelle massive de l'ensemble de données. L'équipe a utilisé le calcul distribué et des techniques optimisées de augmentation de données pour garantir un traitement rapide des données. Ils ont également publié une documentation détaillée sur les étapes de prétraitement, y compris la tokenisation et la déduplication, ce qui a été précieux pour d'autres chercheurs construisant des ensembles de données similaires.
Une autre contribution a été l'exploration de techniques d'entraînement de modèles sur l'ensemble de données ouvert. Les modèles INCITE utilisaient une architecture transformeur standard avec attention multi-têtes et encodage positionnel, mais le processus d'entraînement intégrait des pratiques modernes comme le écrêtage de gradient et l'optimisation du programme de taux d'apprentissage. Le projet a également publié du code pour l'ajustement fin et l'inférence, facilitant l'adaptation des modèles à des applications spécifiques par les développeurs.
Impact sur la communauté et l'écosystème
RedPajama a eu un impact significatif sur l'écosystème de l'IA open-source. En fournissant une alternative transparente et reproductible aux ensembles de données propriétaires, il a abaissé la barrière à l'entrée pour les chercheurs et les petites organisations. De nombreuses institutions académiques, y compris le CSAIL du MIT et l'université Carnegie Mellon, ont utilisé les données de RedPajama dans leurs propres projets de recherche. Le projet a également favorisé une communauté de contributeurs qui ont aidé à améliorer l'ensemble de données et les modèles grâce à des retours et des contributions de code.
La publication de RedPajama a également influencé d'autres initiatives open-source. Par exemple, il a été utilisé comme référence pour la qualité des données et les techniques de traitement, et son approche a été adoptée par d'autres projets cherchant à créer des ressources d'entraînement transparentes. L'accent mis par le projet sur la transparence a suscité des discussions plus larges dans la communauté de l'IA sur l'importance des données ouvertes pour garantir la responsabilité et l'équité dans les systèmes d'intelligence artificielle.
Défis et limites
Malgré ses succès, le projet RedPajama a rencontré plusieurs défis. Une limitation majeure est le biais inhérent présent dans les données sources, qui sont extraites d'Internet et peuvent contenir du contenu nuisible ou biaisé. Bien que le filtrage et la déduplication aident à atténuer certains problèmes, ils ne peuvent pas les éliminer complètement. Le projet a reconnu ces limites et encourage les utilisateurs à appliquer des mesures de sécurité supplémentaires lors du déploiement des modèles.
Un autre défi est le coût computationnel associé à l'entraînement de grands modèles sur un ensemble de données aussi massif. Bien que les modèles INCITE soient relativement petits, passer à des modèles plus grands nécessite des ressources de calcul importantes, qui peuvent ne pas être accessibles à tous les chercheurs. Le projet a abordé cela en fournissant des points de contrôle pré-entraînés et des outils pour un ajustement fin efficace, mais la barrière reste pour ceux qui cherchent à entraîner à partir de zéro.
Directions futures
En 2024, le projet RedPajama continue d'évoluer. Together AI a indiqué son intention de publier des ensembles de données et des modèles mis à jour, intégrant les retours de la communauté et les avancées de la recherche en apprentissage automatique. Les itérations futures pourraient inclure des sources de données plus diverses, des techniques de filtrage améliorées et un support pour les données multimodales. Le projet vise également à maintenir son engagement envers la transparence, en veillant à ce que toutes les ressources restent ouvertes et accessibles.
L'objectif plus large de RedPajama est de démocratiser l'accès à des données et des modèles d'entraînement de haute qualité, permettant à un plus large éventail de participants de contribuer au développement des grands modèles de langage. Ce faisant, il espère favoriser l'innovation et garantir que les avantages de l'IA soient partagés plus équitablement dans la société. Le succès continu du projet dépendra de l'engagement soutenu de la communauté et du développement de modèles de financement et de gouvernance durables.
Conclusion
RedPajama représente un effort marquant dans le mouvement de l'IA open-source, fournissant une ressource complète et transparente pour l'entraînement de modèles de langage. Son ensemble de données et ses modèles ont été largement adoptés et ont influencé la direction de la recherche en IA ouverte. Bien que des défis subsistent, l'engagement du projet envers l'ouverture et la reproductibilité a établi une nouvelle norme pour le domaine, et son impact est susceptible de se faire sentir pendant des années.