Traduit de l'anglais

EfficientDet est une famille de modèles de détection d'objets introduite par Google en 2019, utilisant une mise à l'échelle composée pour équilibrer la profondeur, la largeur et la résolution du réseau afin d'atteindre une efficacité et une précision de pointe.

EfficientDet est une famille de modèles de détection d'objets développée par des chercheurs de Google et introduite en 2019. Les modèles sont conçus pour atteindre une haute précision tout en minimisant le coût computationnel, ce qui les rend adaptés au déploiement dans des environnements aux ressources limitées, tels que les appareils mobiles et les plateformes de calcul en périphérie. L'innovation centrale d'EfficientDet est l'application du scaling composé, une technique qui ajuste simultanément la profondeur, la largeur et la résolution d'entrée d'un réseau de neurones pour optimiser les performances sur une gamme de budgets de ressources.

L'architecture d'EfficientDet s'appuie sur le succès de travaux antérieurs en classification d'images efficace, en particulier la famille de modèles EfficientNet, qui a démontré qu'un scaling minutieux des dimensions du réseau peut produire des améliorations significatives en efficacité. EfficientDet étend ce principe à la détection d'objets, une tâche qui nécessite non seulement de classer les objets dans une image, mais aussi de les localiser avec des boîtes englobantes. L'architecture intègre un réseau de pyramide de caractéristiques (FPN) amélioré avec des connexions bidirectionnelles entre échelles et un mécanisme de fusion de caractéristiques pondérées, permettant au modèle de combiner efficacement les informations provenant de différentes échelles.

Architecture et conception

Le backbone d'EfficientDet est un modèle EfficientNet pré-entraîné, qui sert d'extracteur de caractéristiques. Le backbone traite l'image d'entrée et produit un ensemble de cartes de caractéristiques à plusieurs résolutions. Ces cartes sont ensuite introduites dans un réseau de pyramide de caractéristiques bidirectionnel (BiFPN), qui fusionne itérativement les caractéristiques de différents niveaux. Contrairement aux FPN traditionnels qui utilisent une simple sommation, le BiFPN applique des poids appris à chaque caractéristique d'entrée, permettant au réseau de mettre en avant les échelles les plus informatives.

La tête du modèle EfficientDet effectue simultanément la classification et la régression des boîtes englobantes. Elle utilise une tête convolutive partagée pour tous les niveaux de caractéristiques, ce qui réduit le nombre de paramètres et améliore l'efficacité. La conception inclut également une méthode de scaling composé qui met à l'échelle uniformément la profondeur du backbone, la profondeur et la largeur du BiFPN, ainsi que la résolution d'entrée, permettant d'adapter une architecture unique à différents compromis entre précision et vitesse.

Scaling composé

Le scaling composé est le principe clé derrière l'efficacité d'EfficientDet. La méthode, introduite pour la première fois dans EfficientNet, utilise un ensemble de coefficients de scaling pour contrôler la profondeur, la largeur et la résolution du réseau. Pour EfficientDet, les coefficients de scaling sont déterminés par une recherche par grille sur un ensemble de validation, avec pour objectif de maximiser la précision sous un budget computationnel donné (mesuré en FLOPs).

Cette approche contraste avec les modèles de détection d'objets antérieurs qui nécessitaient souvent un ajustement manuel de l'architecture pour chaque plateforme cible. En automatisant le processus de scaling, EfficientDet peut générer une famille de modèles, d'EfficientDet-D0 (le plus petit) à EfficientDet-D7 (le plus grand), chacun offrant un équilibre différent entre vitesse et précision. Par exemple, EfficientDet-D0 atteint une précision moyenne (mAP) de 34,6 sur le jeu de données COCO tout en ne nécessitant que 2,5 milliards de FLOPs, tandis qu'EfficientDet-D7 atteint 55,1 mAP avec 77 milliards de FLOPs.

Performances et comparaisons

EfficientDet a établi de nouveaux repères en matière d'efficacité pour la détection d'objets lors de sa sortie. Sur le jeu de données COCO, les modèles ont atteint une précision supérieure aux détecteurs précédents de pointe tels que YOLOv3 et Faster R-CNN tout en utilisant moins de FLOPs et de paramètres. Par exemple, EfficientDet-D2 a atteint 43,0 mAP avec 11 milliards de FLOPs, surpassant les 33,0 mAP de YOLOv3 avec 65 milliards de FLOPs.

Les gains d'efficacité étaient particulièrement notables sur les appareils en périphérie. Les variantes plus petites, telles que EfficientDet-D0 et D1, ont été conçues pour fonctionner en temps réel sur les CPU et GPU mobiles, ce qui les rend attrayantes pour des applications comme la conduite autonome, la surveillance et la réalité augmentée. Les modèles ont également démontré de fortes capacités d'apprentissage par transfert, performant bien sur d'autres ensembles de données de détection avec un ajustement minimal.

Applications et impact

L'introduction d'EfficientDet a influencé la recherche ultérieure en détection d'objets efficace et en vision par ordinateur. Ses principes de conception, en particulier l'utilisation de la fusion de caractéristiques bidirectionnelle pondérée et du scaling composé, ont été adoptés et étendus dans des modèles ultérieurs. EfficientDet a été largement utilisé dans l'industrie pour des tâches telles que la détection de défauts dans la fabrication, l'analyse d'images médicales et l'analytique de vente au détail.

L'efficacité du modèle en a également fait un choix populaire pour le déploiement sur des appareils basés sur ARM et d'autres matériels à faible consommation. Son implémentation open source, publiée sous la licence Apache 2.0, a facilité l'adoption par les chercheurs académiques et les praticiens de l'industrie. EfficientDet reste une référence pertinente pour comparer les nouvelles architectures de détection d'objets, en particulier celles visant l'efficacité.

Limitations et orientations futures

Bien qu'EfficientDet ait réalisé des améliorations significatives en efficacité, il présente des limitations. La méthode de scaling composé suppose une architecture fixe et peut ne pas être optimale pour toutes les tâches ou tous les matériels. De plus, les modèles ont été principalement conçus pour la détection d'objets 2D et ne traitent pas directement d'autres tâches telles que la segmentation d'instances ou la détection 3D, bien que le backbone puisse être adapté à ces fins.

Des travaux ultérieurs ont exploré la recherche d'architecture neuronale et l'apprentissage automatique automatisé pour optimiser davantage les modèles de détection. L'essor des détecteurs basés sur les transformers, tels que DETR et ses variantes, a également déplacé l'attention vers des approches de bout en bout qui simplifient le pipeline de détection. Néanmoins, les contributions d'EfficientDet à la conception de modèles efficaces continuent d'informer la recherche moderne en apprentissage profond.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:object-detection·deep-learning·computer-vision·google
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique