Jurassic-1 est une famille de grands modèles de langage (LLM) développée par la société israélienne d'intelligence artificielle AI21 Labs. Publiée en août 2021, elle a été l'un des premiers LLM commerciaux à rivaliser en ampleur avec le GPT-3 d'OpenAI, la variante la plus grande, Jurassic-1 Jumbo, contenant 178 milliards de paramètres. Les modèles sont conçus pour une large gamme de tâches de traitement du langage naturel, notamment la génération de texte, le résumé, la réponse à des questions et la génération de code, et sont accessibles via une API commerciale.
Jurassic-1 est construit sur l'architecture transformeur, plus précisément un modèle autorégressif décodeur seul, similaire à GPT-3. Il a été entraîné sur un grand corpus de textes et de codes disponibles publiquement, en mettant l'accent sur un filtrage de haute qualité et une déduplication. La famille de modèles comprend deux variantes principales : Jurassic-1 Jumbo (178B paramètres) et Jurassic-1 Large (7,5B paramètres), qui partagent toutes deux la même architecture mais diffèrent en échelle. Les modèles utilisent un tokeniseur avec un vocabulaire de 250 000 jetons, ce qui est plus grand que le vocabulaire de 50 000 jetons de GPT-3, permettant un encodage plus efficace du texte.
Architecture et entraînement
Les modèles Jurassic-1 emploient un transformeur décodeur seul standard avec une attention multi-têtes et des couches feed-forward. Ils utilisent la normalisation de couche et une structure de connexion résiduelle, avec une configuration similaire à celle d'autres LLM à grande échelle. Le processus d'entraînement a utilisé une combinaison d'optimisation Adam, de limitation de gradient et d'un programme de taux d'apprentissage avec échauffement et décroissance cosinusoïdale. Les modèles ont été entraînés sur un ensemble de données d'environ 300 milliards de jetons, provenant de pages web, de livres et d'autres textes publics, avec une portion significative en anglais mais incluant également d'autres langues.
AI21 Labs a mis l'accent sur l'utilisation d'un pipeline de filtrage de données personnalisé pour éliminer le contenu de faible qualité ou dupliqué. L'entraînement a été effectué sur un cluster de GPU NVIDIA, bien que les détails matériels spécifiques n'aient pas été entièrement divulgués. L'entreprise a également introduit une technique appelée « prompt structuré » pour améliorer la capacité du modèle à suivre des instructions et à effectuer des tâches comme la réponse à des questions et le raisonnement.
Capacités et performances
Jurassic-1 a démontré de solides performances sur une variété de benchmarks, notamment SuperGLUE et d'autres tâches de TALN, égalant ou dépassant souvent les résultats de GPT-3 sur des évaluations similaires. Le vocabulaire plus grand du modèle et ses données d'entraînement lui ont permis de gérer plus efficacement les mots rares et les textes multilingues. En plus de la génération de texte standard, Jurassic-1 pouvait effectuer des tâches telles que la reconnaissance d'entités nommées, l'analyse des sentiments et la classification de texte sans ajustement fin, en utilisant l'apprentissage en quelques exemples.
Le modèle prenait également en charge une fonctionnalité appelée raisonnement « zéro-shot », où il pouvait répondre à des questions ou résoudre des problèmes sans exemples préalables. AI21 Labs a publié un terrain de jeu public et une API, permettant aux développeurs d'intégrer Jurassic-1 dans des applications. L'API offrait des options pour le contrôle de la température, l'échantillonnage top-p et d'autres paramètres de génération.
Comparaison avec les contemporains
Lors de sa sortie, Jurassic-1 a été positionné comme un concurrent direct du GPT-3 d'OpenAI, publié en 2020. Alors que GPT-3 avait 175 milliards de paramètres, Jurassic-1 Jumbo en avait 178 milliards, ce qui le rendait légèrement plus grand. Cependant, le tokeniseur de Jurassic-1 utilisait un vocabulaire plus grand, ce qui réduisait le nombre de jetons nécessaires pour un texte donné, améliorant potentiellement la vitesse d'inférence et le coût. AI21 Labs a également souligné la capacité du modèle à gérer des contextes plus longs, avec une longueur maximale de séquence de 2 048 jetons, similaire à GPT-3.
Contrairement aux modèles ultérieurs d'Anthropic ou aux efforts de Google DeepMind, Jurassic-1 n'était pas axé sur l'apprentissage par renforcement à partir de retours humains (RLHF) au lancement, mais plutôt sur l'apprentissage supervisé et le prompting en quelques exemples. Cela le rendait plus similaire au GPT-3 original dans son approche.
Impact et héritage
Jurassic-1 a été l'un des premiers grands LLM d'une entreprise autre qu'OpenAI, contribuant à établir AI21 Labs comme un acteur significatif dans l'espace de l'IA générative. Il a été utilisé dans diverses applications commerciales, notamment l'aide à l'écriture, les chatbots de service client et la génération de contenu. La publication du modèle a également contribué à la tendance plus large d'augmentation de la taille des modèles et au développement des grands modèles de langage en tant que service.
Les modèles ultérieurs d'AI21 Labs, tels que Jurassic-2, ont bâti sur l'architecture et les leçons apprises de Jurassic-1, incorporant des améliorations dans les données d'entraînement et l'alignement. L'entreprise a continué à offrir Jurassic-1 via son API pendant un certain temps, bien qu'il ait finalement été abandonné au profit de modèles plus récents. Jurassic-1 reste une étape notable dans l'histoire de la recherche en intelligence artificielle, démontrant que des LLM compétitifs pouvaient être développés en dehors des plus grandes entreprises technologiques.
Réception et critiques
Jurassic-1 a reçu des critiques positives pour ses performances et son accessibilité, de nombreux développeurs louant la facilité d'utilisation de l'API et la capacité du modèle à générer un texte cohérent et contextuellement pertinent. Cependant, comme d'autres LLM, il a fait face à des critiques concernant les biais potentiels dans ses données d'entraînement et l'impact environnemental de l'entraînement de modèles aussi grands. AI21 Labs a reconnu ces préoccupations et publié une documentation sur l'utilisation responsable, mais n'a pas publié les poids du modèle publiquement, limitant la recherche indépendante.
Certains chercheurs ont noté que les performances de Jurassic-1 sur certaines tâches de raisonnement n'étaient pas significativement meilleures que celles de modèles plus petits, soulignant les limites de l'échelle seule. Malgré ces critiques, la publication du modèle a contribué à stimuler la concurrence sur le marché des LLM, conduisant à des avancées rapides dans le domaine.