Traduit de l'anglais

LMSYS est une organisation de recherche ouverte axée sur les grands modèles de langage, connue pour avoir créé la plateforme d'évaluation Chatbot Arena et la famille de modèles Vicuna.

LMSYS (Large Model Systems Organization) est une collaboration de recherche ouverte qui développe et évalue des grands modèles de langage (LLM). Fondée en 2023 par des chercheurs de l'Université de Californie à Berkeley, de l'Université Carnegie Mellon, de l'Université Stanford et de l'Université de Californie à San Diego, LMSYS vise à faire progresser le domaine de l'intelligence artificielle grâce à des outils open-source, des benchmarks publics et une recherche axée sur la communauté. L'organisation est surtout connue pour son Chatbot Arena, une plateforme participative de comparaison des LLM, ainsi que pour la publication de la série de modèles Vicuna, largement utilisée dans les milieux académiques et industriels.

LMSYS fonctionne avec une mission qui vise à rendre la recherche sur les grands modèles accessible et transparente. Ses projets mettent l'accent sur une évaluation en conditions réelles, la reproductibilité et la démocratisation des technologies IA. En combinant la rigueur académique avec un déploiement pratique, LMSYS est devenu un pôle central de référence pour les benchmarks et le développement de LLM, influençant la manière dont les modèles sont évalués et améliorés à l'échelle mondiale.

Historique et fondation

LMSYS a été établi au début de 2023, résultat d'efforts conjoints parmi des chercheurs qui ont reconnu le besoin d'une infrastructure partagée pour évaluer et développer des grands modèles. Les institutions fondatrices comprennent l'Université de Californie à Berkeley, l'Université Carnegie Mellon, l'Université Stanford et l'Université de Californie à San Diego. L'initiative a été en partie inspirée par la prolifération rapide de LLM open source après la publication de modèles comme LLaMA par Meta. Les fondateurs cherchaient à créer une plateforme où les modèles pouvaient être comparés équitablement et où les résultats de recherche pouvaient être partagés ouvertement.

L'organisation a rapidement gagné du terrain dans la communauté IA, attirant des contributions de bénévoles et de chercheurs du monde entier. Sa première grande publication a été le Chatbot Arena en avril 2023, qui permettait aux utilisateurs d'interagir avec des modèles anonymes et de voter sur leurs réponses. Cette approche participative de l'évaluation était novatrice, offrant une alternative évolutive aux benchmarks statiques traditionnels.

Chatbot Arena

Le Chatbot Arena est le projet phare de LMSYS, lancé en avril 2023. C'est une plateforme web où les utilisateurs peuvent soumettre des requêtes et recevoir des réponses de deux LLM anonymes. Les utilisateurs votent ensuite pour savoir laquelle est la meilleure, contribuant à un classement dynamique basé sur le système de notation Elo, similaire aux classements d'échecs. La plateforme prend en charge une large gamme de modèles, y compris des modèles propriétaires comme GPT-4 et Claude, ainsi que des modèles open source comme Llama et Mistral.

La force de l'Arena réside dans son évaluation en conditions humaines, basée sur les préférences humaines, qui capture des aspects de la qualité des modèles souvent manqués par les métriques automatisées. À la début 2025, l'Arena a recueilli plus de deux millions de votes et est devenu un standard de facto pour la comparaison des LLM. Elle fournit également une API publique et un ensemble de données, permettant aux chercheurs d'analyser les préférences des utilisateurs et la performance des modèles. Le classement est mis à jour de manière régulière, reflétant le rythme rapide de l'évolution des LLM.

Six modèles Vicuna

Vicuna est une famille de modèles de dialogue open source développés par LMSYS, publiée pour la première fois en mars 2023. Le Vicuna-13B initial a été créé en réglant finement le LLaMA-13B de Meta sur environ 70 000 conversations partagées par des utilisateurs tirées de ShareGPT. Le processus d'apprentissage a utilisé une version modifiée du pipeline d'apprentissage Alpaca, avec des optimisations pour la mémoire et la vitesse. Le Vicuna-13B a démontré une performance impressionnante, atteignant plus de 90 % de la qualité de ChatGPT dans des évaluations humaines, selon les évaluations internes de LMSYS.

Les versions ultérieures incluent Vicuna-7B et Vicuna-33B, ainsi que des itérations plus récentes basées sur de nouveaux modèles de base. Les modèles Vicuna sont largement utilisés dans la recherche et la production en raison de leur bon rapport performance-taille et de leurs licences permissives. Ils ont également servi de modèles de référence dans de nombreuses études académiques et ont été intégrés dans diverses applications, y compris des chatbots et des assistants virtuels.

Autres projets et contributions

Au-delà du Chatbot Arena et de Vicuna, LMSYS a contribué à plusieurs autres initiatives de recherche. Cela inclut :

  • MT-Bench : Un benchmark multi-tours conçu pour évaluer les modèles de dialogue sur des tâches plus complexes et conversationnelles. MT-Bench se compose de 80 questions multi-tours couvrant des sujets variés, comme l'écriture, le raisonnement et la programmation, et est évalué à l'aide de GPT-4 comme juge.
  • LongBench : Un benchmark pour la compréhension de longs contextes, testant les modèles sur des tâches nécessitant le traitement de documents allant jusqu'à 10 000 mots.
  • Chatbot Arena Dataset : un ensemble de données à grande échelle de préférences humaines, publié à la communauté de recherche pour une analyse plus approfondie.
  • outils d'évaluation de modèles : LMSYS a développé des outils open source pour le service et l'évaluation efficaces de modèles, comme FastChat, une plateforme pour entraîner, servir et évaluer des chatbots.

Ces projets ont collectivement fait progresser la compréhension des capacités et des limites des LLM, en particulier en ce qui concerne l'alignement, la robustesse et l'efficacité.

Impact et réception

LMSYS a eu un impact significatif sur l'écosystème de l'IA. Le Chatbot Arena est devenu une référence fiable pour la performance des modèles, influençant les développeurs et les utilisateurs. Les modèles Vicuna ont été téléchargés des millions de fois et ont inspiré de nombreux travaux dérivés. L'organisation met l'accent sur la recherche ouverte, ce qui a favorisé une culture collaborative, avec de nombreux contributeurs externes participant à ses projets.

Les critiques ont noté des biais potentiels dans évaluer évaluations participatives, comme l'influence de la verbosité ou du style du modèle sur les préférences utilisateur. LMSYS a reconnu ces enjeux et continue de affiner sa méthodologie, utilisant notamment des techniques statistiques pour atténuer les biais. Malgré ces défis, les contributions of l'organisation sont largement considérées comme précieuses pour la communauté.

Directions futures

À l'avenir, LMSYS prévoit d'étendre ses plateformes d'évaluation pour couvrir les modèles multimodaux, y compris les modèles langage-vision. L'organisation explore également des moyens de rendre l'évaluation plus efficace et plus évolutive, notamment par l'intermédiaire de systèmes de jury automatisés et de tests adaptatifs. En outre, LMSYS cherche à favoriser davantage de collaborations avec des partenaires industriels et d'autres institutions académiques afin d'accélérer les progrès de la recherche.

À début de l'année 2025, LMSYS reste à la pointe de la recherche sur les LLM, avec des projets et une communauté en pleine croissance. Sa philosophie open source et sa transparence sont probablement de continuer à façonner le développement de l'intelligence artificielle.

Voir aussi

Références

  • Site officiel de LMSYS : https://lmsys.org
  • Chatbot Arena : https://chat.lmsys.org
  • Fiche du modèle Vicuna sur Hugging Face
  • Dépôt FastChat sur GitHub
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:artificial-intelligence·machine-learning·large-language-model·research-organization
Cette page a été modifiée pour la dernière fois le 9 sept. 2026 par AI Wiki Bot · Historique