Traduit de l'anglais

Segment Anything est une série de modèles de fondation en vision par ordinateur open-source développés par Meta AI pour la segmentation d'images et de vidéos par invites, introduite en avril 2023 avec SAM, suivie de SAM 2 en 2024 et SAM 3 en 2025.

Segment Anything est une série de modèles de fondation en vision par ordinateur, open source, développée par Meta AI (anciennement Facebook AI Research, puis Meta Superintelligence Labs) pour la segmentation d'images et de vidéos. Le projet a été introduit en avril 2023 avec le Segment Anything Model(SAM), un modèle de segmentation promptable entraîné sur le jeu de données SA-1B, comprenant plus de 1.1 milliard de masques, et a depuis été étendu par SAM 2 (2024), qui a unifié la segmentation d'images et de vidéos, et SAM 3(2025), qui a ajouté la segmentation à partir de invites de concepts en langage naturel. Les modèles sont publiés sous la licence Apache 2.0 et ont été largement adoptés dans la recherche et l'industrie, notamment en imagerie médicale, en observation de la Terre, en robotique, et dans des outils d'édition de contenu.

Contexte

La segmentation d'images, la tâche consistant à déterminer quels pixels d'une image appartiennent à un objet, a traditionnellement exigé des modèles entraînés sur des jeux de données spécifiques à une tâche, tels que COCO, Cityscapes, ou Pascal VOC, chacun avec un ensemble fixe de catégories d'objets. Un modèle entraîné sur un jeu de données échoue généralement à se transférer à un autre. Le projet Segment Anything a proposé de traiter la segmentation comme un problème d'invitation, analogue à l'invitation dans les grands modèles de langage: au lieu de classer les pixels dans un vocabulaire fermé, le modèle produit un masque de segmentation pour tout objet que l'utilisateur indique.

SAM (2023)

Meta AI a publié le Segment Anything Model(SAM) le 5 avril 2023, avec le jeu de données SA-1B. SAM est promptable: étant donné une image et une invite, telle qu'un point de premier plan, une boîte englobante, ou un masque approximatif, il produit un masque de segmentation valide pour l'objet indiqué, même pour des objets et des distributions d'images non vus pendant l'entraînement, une capacité connue sous le nom de transfert zero-shot. Son architecture associe un encodeur d'images Vision Transformer lourd à un encodeur d'invites léger et un décodeur de masques, de sorte que l'encodage d'images coûteux est calculé une fois et que le modèle peut ensuite répondre à de nombreuses invites à faible coût. Cette conception s'est appuyée sur des avancées dans les architectures transformer et les techniques de apprentissage profond qui se sont révélées efficaces dans d'autres domaines de l'intelligence artificielle.

SAM 2 (2024)

Le 29 juillet 2024, Meta a publié SAM 2, qui a étendu la segmentation promptable à la vidéo. SAM 2 traite une image comme une vidéo à une seule image, unifiant la segmentation d'images et de vidéos dans une seule architecture. Il a remplacé l'encodeur Vision Transformer de SAM par un backbone hiérarchique Hiera et a ajouté un module de mémoire de streaming, comprenant un encodeur de mémoire, une banque de mémoire, et une attention de mémoire, qui stocke des embeddings d'images vidéo passées afin que les objets puissent être suivis à travers les occlusions. Les images sont traitées séquentiellement, permettant un fonctionnement en temps réel: Meta a rapporté environ 44 images par seconde sur la segmentation d'images. La capacité du modèle à gérer des données temporelles l'a rendu pertinent pour des domaines tels que la robotique et les systèmes autonomes, où le suivi d'objets à travers les images est critique.

SAM 3 (2025)

Le 19 novembre 2025, Meta a publié SAM 3, qui a introduit la Segmentation de Concepts Promptables(PCS): le modèle peut détecter, segmenter, et suivre toutes les instances d'un concept spécifié par une phrase nominale courte, telle que "bus scolaire jaune", une image d'exemple, ou une combinaison des deux, en plus des invites géométriques(points, boîtes, masques) supportées par les versions antérieures. Cette capacité s'aligne avec des tendances plus larges dans la IA générative et la compréhension multimodale, où les modèles interprètent de plus en plus des entrées en langage naturel pour effectuer des tâches visuelles. L'approche basée sur les concepts de SAM 3 réduit le besoin d'invitation explicite par objet, le rendant plus adapté à des applications comme l'édition de contenu automatisée et l'analyse d'images à grande échelle

Impact et Adoption

Les modèles Segment Anything ont été largement adoptés dans la recherche et l'industrie. En imagerie médicale, des chercheurs ont utilisé SAM pour segmenter des structures anatomiques dans des scans, tandis qu'en observation de la Terre, il a été appliqué à des images satellite pour la classification de la couverture terrestre. Des équipes de robotique ont intégré SAM pour la manipulation d'objets et la compréhension de scènes, et des outils d'édition de contenu ont exploité son interface promptable pour la génération de masques pilotée par l'utilisateur. La publication open source sous la licence Apache 2.0 a facilité l'intégration dans diverses pipelines de apprentissage automatique, et les modèles sont devenus une référence commune pour les tâches de segmentation. L'accent du projet sur la promptabilité et la généralisation zero-shot a influencé des travaux ultérieurs en vision par ordinateur, le positionnant comme une contribution fondamentale dans le domaine

Références

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·image-segmentation·meta-ai·open-source
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique