Traduit de l'anglais

MobileNet est une famille d'architectures de réseaux de neurones convolutifs conçues pour une inférence efficace sur appareil dans les systèmes mobiles et embarqués, équilibrant précision et faible coût computationnel.

MobileNet est une famille d'architectures de réseau neuronal convolutif (CNN) développées pour la classification d'images, la détection d'objets et d'autres tâches de vision par ordinateur. Les modèles sont conçus pour être de petite taille, à faible latence et à faible consommation d'énergie, ce qui les rend adaptés à l'inférence sur appareil et à l'informatique de périphérie sur des dispositifs aux ressources limitées tels que les téléphones mobiles et les systèmes embarqués. À l'origine, ils ont été conçus pour fonctionner efficacement sur les appareils mobiles avec TensorFlow Lite, un runtime léger pour les modèles d'apprentissage automatique.

Le besoin de modèles d'apprentissage profond efficaces sur les appareils mobiles a conduit les chercheurs de Google à développer MobileNet. En juin 2025, la famille comprend cinq versions majeures, chacune s'appuyant sur la précédente pour améliorer les performances et l'efficacité tout en maintenant son adéquation aux environnements contraints.

Principes d'architecture

Les architectures MobileNet se concentrent sur la réduction du coût de calcul grâce à plusieurs techniques clés. L'innovation centrale est l'utilisation de convolutions séparables en profondeur, qui décomposent une convolution standard en deux opérations distinctes : une convolution en profondeur qui filtre chaque canal d'entrée indépendamment, et une convolution ponctuelle (une convolution 1×1) qui combine les sorties. Cette factorisation réduit considérablement le nombre de paramètres et d'opérations en virgule flottante par rapport aux convolutions standard, permettant une inférence efficace sur des appareils à puissance de traitement limitée.

Une autre stratégie importante est l'introduction d'hyperparamètres qui contrôlent la taille du modèle et la charge de calcul. Le multiplicateur de largeur (noté α) ajuste le nombre de canaux dans chaque couche ; des valeurs α plus petites produisent des modèles plus petits et plus rapides au détriment de la précision. Le multiplicateur de résolution (ρ) ajuste la résolution de l'image d'entrée, les résolutions plus faibles accélérant le traitement mais réduisant potentiellement la précision.

L'architecture intègre également des techniques telles que la normalisation par lots et l'augmentation des données pour améliorer la stabilité de l'entraînement et la généralisation. Ces choix de conception ont fait de MobileNet un choix populaire pour les applications en temps réel dans les contextes mobiles et embarqués.

MobileNetV1

MobileNetV1 a été publié en avril 2017. Sa principale innovation architecturale était l'incorporation de convolutions séparables en profondeur, un concept introduit pour la première fois par Laurent Sifre lors d'un stage chez Google Brain en 2013 comme une variante d'AlexNet destinée à améliorer la vitesse de convergence et à réduire la taille du modèle. La convolution séparable en profondeur décompose chaque convolution standard en un filtre en profondeur (fonctionnant par canal) et une combinaison ponctuelle (convolution 1×1) qui fusionne les sorties de la couche en profondeur.

Les valeurs par défaut pour MobileNetV1 incluaient un multiplicateur de largeur de 1,0 et un multiplicateur de résolution de 224x224. Cependant, en ajustant ces multiplicateurs, les développeurs pouvaient équilibrer entre facteur de forme et précision. L'architecture utilisait également des activations ReLU après chaque convolution et appliquait la normalisation par lots pour accélérer l'entraînement.

MobileNetV2

MobileNetV2, publié en mars 2019, a introduit deux raffinements importants : les couches résiduelles inversées et les goulots d'étranglement linéaires. Les résidus inversés inversent la structure des blocs résiduels traditionnels en élargissant d'abord les canaux d'entrée, puis en effectuant une convolution en profondeur, et enfin en projetant vers un nombre inférieur de canaux. Cette expansion permet à la convolution en profondeur de fonctionner dans un espace de dimension supérieure, préservant ainsi davantage le flux d'informations.

Les goulots d'étranglement linéaires suppriment l'activation ReLU des couches de projection, sur la base de l'intuition que les non-linéarités dans les espaces de faible dimension entraînent une perte d'informations. En maintenant ces couches linéaires, le modèle conserve plus de puissance expressive même lorsque le nombre de canaux est faible. Ces améliorations ont produit une précision supérieure et une latence plus faible que V1, faisant de V2 un choix courant pour les tâches de vision mobile.

MobileNetV3 et V4

MobileNetV3, publié en 2019, a introduit trois variantes : MobileNetV3-Large, MobileNetV3-Small et MobileNetEdgeTPU, cette dernière étant optimisée pour les smartphones Pixel 4. Ces modèles ont été découverts grâce à la recherche d'architecture neuronale (NAS) qui mesurait directement la latence mobile, obtenant un compromis souhaité entre précision et vitesse d'inférence. V3 incluait également des approximations linéaires par morceaux des activations swish et sigmoïde (h-swish et h-sigmoid), des modules squeeze-and-excitation, et héritait de la structure de goulot d'étranglement inversé de V2.

MobileNetV4, publié en septembre 2024, a élargi la famille avec de nombreuses architectures également trouvées par NAS. V4 a introduit l'attention multi-requêtes, inspirée des transformeurs de vision, et a proposé un nouveau bloc post-mix appelé le goulot d'étranglement inversé universel, qui unifie les concepts de résidu inversé et de goulot d'étranglement inversé des versions précédentes.

MobileNetV5 et orientations futures

L'architecture de MobileNetV5 a été annoncée peu après la sortie de Gemma 3n (un modèle de langage) en juin 2025. Bien que l'annonce ait mentionné qu'un rapport technique serait publié prochainement, en octobre 2025, aucun rapport de ce type n'avait été mis à disposition. Le réseau V5 serait environ dix fois plus grand que la plus grande variante V4, suggérant un déplacement vers des modèles à plus grande capacité tout en maintenant une efficacité réalisable pour le déploiement mobile.

Tout au long de son développement, MobileNet a influencé de nombreuses architectures et reste une pierre angulaire pour les systèmes de vision embarqués, permettant des applications pratiques dans des domaines tels que la conduite autonome, la robotique et la photographie mobile.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:convolutional-neural-networks·computer-vision·deep-learning·google
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique