Segment Anything ViT

Traduit de l'anglais

Segment Anything ViT est un backbone de type vision transformer utilisé dans le modèle Segment Anything (SAM) de Meta pour la segmentation d'images. Il encode les images en embeddings que le décodeur de prompt du modèle utilise pour générer des masques.

Segment Anything ViT est une architecture de transformateur de vision qui sert de colonne vertébrale d'encodeur d'images pour le modèle Segment Anything (SAM), un système développé par Meta pour la segmentation d'images par invites. Le modèle utilise une conception basée sur transformateur pour convertir les images d'entrée en plongements de caractéristiques de haute dimension, qui sont ensuite traités par un décodeur de masques léger pour produire des masques de segmentation en fonction d'invites utilisateur telles que des points, des boîtes ou du texte. Cette colonne vertébrale a été introduite en 2023 aux côtés du cadre SAM et de l'ensemble de données Segment Anything, qui contient plus d'un milliard de masques sur 11 millions d'images.

Le Segment Anything ViT est construit sur la structure standard du transformateur de vision, qui divise une image en patchs de taille fixe et les traite à travers des couches empilées de attention multi-têtes. Contrairement aux colonnes vertébrales convolutionnelles antérieures telles que réseau résiduel ou U-Net, la colonne vertébrale ViT capture le contexte global sur l'ensemble de l'image à chaque couche, ce qui la rend bien adaptée aux tâches nécessitant la compréhension des limites et des relations entre objets. L'architecture inclut un encodage positionnel pour conserver les informations spatiales, et elle prend en charge plusieurs tailles de modèle - ViT-B, ViT-L et ViT-H - la version la plus grande ayant environ 632 millions de paramètres.

Architecture et Conception

Le Segment Anything ViT suit la conception originale du transformateur de vision proposée par Dosovitskiy et ses collègues, avec des modifications adaptées aux tâches de prédiction dense. Il utilise une taille de patch de 16x16 pixels, ce qui signifie qu'une image d'entrée de 1024x1024 est divisée en patchs de 64x64. Chaque patch est projeté linéairement en un vecteur de plongement, et un encodage positionnel apprenable est ajouté avant les blocs de transformateur. La colonne vertébrale emploie une structure interne encodeur-décodeur standard, mais dans le cadre SAM, elle agit purement comme un encodeur, produisant une carte de caractéristiques qui conserve la résolution spatiale grâce à un processus de suréchantillonnage par couches.

Un choix de conception clé est l'utilisation d'un mécanisme d'attention global plutôt qu'une attention fenêtrée. Cela permet au modèle de considérer l'image entière lors du calcul des caractéristiques pour un patch donné, ce qui est important pour segmenter des objets qui s'étendent sur de grandes zones ou ont des limites ambiguës. La colonne vertébrale intègre également un module de cou qui réduit la dimension des caractéristiques à un espace de plongement compact, généralement 256 canaux, avant de transmettre la sortie au décodeur de masques.

Entraînement et Données

Le Segment Anything ViT a été entraîné sur l'ensemble de données Segment Anything, une collection à grande échelle de 11 millions d'images avec plus d'un milliard de masques de segmentation. Cet ensemble de données a été créé à l'aide d'un moteur de données combinant la génération automatisée de masques avec un raffinement humain. Le processus d'entraînement utilisait une combinaison d'apprentissage supervisé sur les annotations de masques et une approche de modèle dans la boucle, où la colonne vertébrale ViT était améliorée de manière itérative à mesure que de nouveaux masques étaient générés.

L'entraînement employait des techniques standard de apprentissage profond, y compris optimiseur Adam pour l'optimisation, augmentation de données pour améliorer la généralisation, et écrêtage de gradient pour stabiliser l'entraînement. Le modèle a été entraîné sur un cluster de GPU, bien que les détails matériels spécifiques ne soient pas documentés publiquement. La variante ViT-H, avec sa plus grande capacité, a atteint la meilleure qualité de segmentation mais a nécessité plus de ressources computationnelles pour l'entraînement et l'inférence.

Applications et Impact

Le Segment Anything ViT a permis au modèle SAM d'effectuer une segmentation zéro-shot - la capacité de segmenter des objets dans des images sans affinage préalable sur des catégories spécifiques. Cela a des applications larges dans des domaines de l'intelligence artificielle tels que l'imagerie médicale, la conduite autonome et la robotique. Par exemple, la colonne vertébrale peut être combinée avec des mécanismes de attention croisée pour intégrer des invites textuelles, permettant aux utilisateurs de segmenter des objets en les décrivant en langage naturel.

La publication de SAM et de sa colonne vertébrale ViT a influencé la recherche ultérieure en segmentation interactive et en modèles de fondation pour la vision par ordinateur. Elle a démontré qu'un modèle unique entraîné sur des données diverses pouvait généraliser à des objets et scènes non vus, similaire à la façon dont les grands modèles de langage généralisent à travers les tâches textuelles. L'architecture a été adaptée pour d'autres tâches de prédiction dense, y compris l'estimation de profondeur et la détection de contours, et a été intégrée dans divers outils open-source.

Performance et Limitations

Dans les évaluations de référence, la colonne vertébrale Segment Anything ViT-H a atteint des performances solides sur les métriques de segmentation standard, telles que l'Intersection sur Union moyenne (mIoU), sur plusieurs ensembles de données. Cependant, le modèle présente des limitations connues. Il peut avoir du mal avec de très petits objets, des objets fortement occlus, ou des images avec des conditions d'éclairage inhabituelles. La colonne vertébrale ViT est également intensive en calcul, nécessitant une mémoire et une puissance de traitement substantielles, ce qui limite son utilisation sur des appareils périphériques sans optimisation.

La recherche a montré que les performances de la colonne vertébrale se dégradent lorsque les images d'entrée sont considérablement réduites, car les détails fins sont perdus dans le processus de plongement de patchs. De plus, le modèle ne comprend pas intrinsèquement la sémantique des objets - il segmente en fonction de motifs visuels plutôt que de connaissances de catégories, ce qui peut conduire à une sur-segmentation ou une sous-segmentation dans des cas ambigus.

Développements Connexes

Le Segment Anything ViT s'appuie sur des travaux antérieurs sur les transformateurs de vision, y compris le modèle ViT original et des améliorations ultérieures comme les conceptions hiérarchiques. Il se distingue des approches convolutionnelles telles que réseau résiduel et U-Net, qui traitent les images à travers des champs réceptifs locaux. La colonne vertébrale a également inspiré des modèles ultérieurs qui intègrent des mécanismes d'attention efficaces ou des transformateurs épars pour réduire le coût computationnel.

Dans le contexte plus large de la IA générative, le Segment Anything ViT représente un changement vers des modèles unifiés capables de gérer plusieurs tâches visuelles avec une seule architecture. Son succès a encouragé des efforts similaires dans d'autres domaines, tels que la segmentation audio et vidéo, et a contribué à l'écosystème croissant de modèles d'IA open-source.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·transformer·segmentation·meta-ai
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique