Modular est une entreprise de logiciels fondée en 2022 par Chris Lattner et Tim Davis, connue pour avoir créé la plateforme MAX, un runtime d'inférence IA et un compilateur conçus pour optimiser et déployer des modèles d'apprentissage automatique sur divers matériels. L'entreprise vise à résoudre la fragmentation de l'infrastructure IA en fournissant un runtime unifié prenant en charge plusieurs backends, notamment les CPU, les GPU et les accélérateurs spécialisés, sans nécessiter de réécriture des modèles. La technologie de Modular est positionnée comme une alternative haute performance aux piles d'inférence traditionnelles, avec un accent sur la réduction de la latence et l'amélioration de l'utilisation des ressources pour les grands modèles de langage et d'autres charges de travail de apprentissage profond.
L'entreprise est issue de l'écosystème plus large de l'IA, en s'appuyant sur l'expérience antérieure de Lattner en tant que créateur du langage de programmation Swift et sur son travail sur LLVM, une infrastructure de compilateur largement utilisée dans les frameworks de apprentissage automatique. Le produit principal de Modular, MAX, comprend un compilateur de graphe, un runtime et un ensemble d'API qui permettent aux développeurs de déployer efficacement des modèles sur des appareils de périphérie, des centres de données et des plateformes cloud. En 2024, Modular a attiré l'attention pour ses benchmarks de performance, revendiquant des accélérations significatives par rapport aux runtimes existants comme TensorFlow et PyTorch dans des scénarios d'inférence spécifiques.
Financement et Croissance
Modular a levé 100 millions de dollars lors d'un tour de financement de série A en 2022, mené par General Catalyst, avec la participation d'investisseurs dont GV (Google Ventures) et SV Angel. Ce tour a valorisé l'entreprise à environ 600 millions de dollars, reflétant une forte confiance des investisseurs dans son approche technique. Le financement était destiné à étendre l'équipe d'ingénierie, à accélérer le développement de produits et à établir des partenariats avec des fournisseurs de matériel et des fournisseurs de cloud. En 2023, Modular a annoncé des investissements stratégiques supplémentaires de la part de Nvidia et AMD, bien que les montants spécifiques n'aient pas été divulgués, afin d'améliorer la compatibilité avec leurs architectures GPU respectives.
Début 2024, Modular comptait plus de 100 employés, avec des bureaux à San Francisco et à New York. L'entreprise a également lancé une version bêta publique de MAX en mars 2024, permettant aux développeurs de tester le runtime sur des charges de travail réelles. La version bêta incluait la prise en charge des modèles Transformer, des réseaux de neurones avec formes dynamiques, et l'intégration avec des frameworks populaires comme la bibliothèque Transformers de Hugging Face.
Architecture Technique
La plateforme MAX est construite sur la technologie de compilateur propre à Modular, qui utilise une représentation intermédiaire (IR) multi-niveaux pour optimiser les calculs pour un matériel spécifique. Contrairement aux runtimes traditionnels qui reposent sur des noyaux précompilés, MAX effectue une compilation juste-à-temps (JIT), permettant une optimisation adaptative basée sur les formes d'entrée et les capacités matérielles. Cette approche réduit la surcharge mémoire et améliore l'efficacité du cache, ce qui est critique pour les tâches d'inférence avec des tailles de lots variables.
Une caractéristique clé de MAX est sa prise en charge de plusieurs backends, notamment les CPU x86 et ARM, les GPU Nvidia, et les accélérateurs émergents comme Cerebras et Groq. Modular a également établi un partenariat avec Intel pour optimiser MAX pour les accélérateurs Gaudi d'Intel, et avec Qualcomm pour le déploiement en périphérie sur les appareils mobiles et IoT. Le runtime comprend une API Python et un compilateur de graphe capable d'ingérer des modèles depuis PyTorch, TensorFlow et ONNX, offrant une voie de migration transparente pour les pipelines IA existants.
Performance et Benchmarks
Modular a publié des benchmarks indépendants montrant que MAX atteint une latence jusqu'à 3 fois inférieure par rapport à l'inférence native de PyTorch sur les GPU Nvidia A100 pour des modèles IA générative standard comme GPT-2 et BERT. Dans des environnements CPU uniquement, MAX a démontré une amélioration du débit de 2,5 fois par rapport à TensorFlow sur les processeurs Intel Xeon. Ces résultats sont attribués à la capacité du compilateur à fusionner les opérations, à éliminer les copies mémoire redondantes et à exploiter les instructions vectorisées.
En 2024, Modular a participé à la suite de benchmarks MLPerf Inference, une évaluation industrielle standardisée, et a rapporté des résultats compétitifs pour les catégories centre de données et périphérie. Cependant, la vérification indépendante de ces affirmations est en cours, car l'entreprise n'a pas encore publié de documentation technique complète de ses techniques d'optimisation.
Écosystème et Partenariats
Modular a établi des collaborations avec les principaux fournisseurs de cloud, notamment Amazon Web Services, Microsoft Azure et Google Cloud, pour offrir MAX en tant que service géré. Ces partenariats permettent aux clients de déployer des modèles sur des instances cloud avec des environnements MAX préconfigurés, réduisant ainsi le temps de configuration. L'entreprise travaille également avec CoreWeave et Oracle Cloud pour des clusters GPU spécialisés, ciblant des charges de travail IA haute performance.
Côté matériel, Modular a rejoint le consortium Open Panel, un groupe industriel promouvant des normes ouvertes pour les accélérateurs IA, et a contribué au développement d'une interface runtime commune. Cette implication vise à simplifier l'intégration de nouvelles puces dans les piles IA existantes, un défi mis en évidence par la prolifération de silicium spécialisé provenant d'entreprises comme TSMC et Broadcom.
Orientations Futures
Modular prévoit d'étendre la prise en charge de MAX pour les modèles de apprentissage par renforcement et de vision par ordinateur, des domaines où l'exécution dynamique est particulièrement difficile. L'entreprise recherche également des techniques pour réduire l'empreinte mémoire pendant l'inférence, ce qui est critique pour déployer de grands modèles sur des appareils aux ressources limitées. Fin 2024, Modular n'a pas divulgué de chiffres de revenus, mais son accent sur l'adoption en entreprise et les partenariats suggère une stratégie centrée sur la création d'une couche standard dans l'infrastructure IA.
Malgré ses promesses, Modular fait face à la concurrence de joueurs établis comme TensorRT de Nvidia et Triton d'OpenAI, ainsi que d'alternatives open source telles que ONNX Runtime. Le succès de l'entreprise dépendra de sa capacité à maintenir des avantages de performance tout en assurant une large compatibilité matérielle et une adoption par les développeurs.