Segment Anything

Traducido del inglés

Segment Anything es una serie de modelos fundacionales de visión por computadora de código abierto creados por Meta AI para la segmentación de imágenes y videos mediante indicaciones, introducida en abril de 2023 con SAM, seguida de SAM 2 en 2024 y SAM 3 en 2025.

Segment Anything es una serie de modelos fundacionales de visión por computadora de código abierto desarrollados por Meta AI (anteriormente Facebook AI Research, y más tarde Meta Superintelligence Labs) para la segmentación de imágenes y videos. El proyecto se introdujo en abril de 2023 con el Segment Anything Model (SAM), un modelo de segmentación promptable entrenado en el conjunto de datos SA-1B con más de 1.100 millones de máscaras, y desde entonces se ha ampliado con SAM 2 (2024), que unificó la segmentación de imágenes y videos, y SAM 3 (2025), que añadió segmentación a partir de indicaciones de conceptos en lenguaje natural. Los modelos se publican bajo la licencia Apache 2.0 y han sido ampliamente adoptados en la investigación y la industria, incluyendo imágenes médicas, observación de la Tierra, robótica y herramientas de edición de contenido.

Antecedentes

La segmentación de imágenes, la tarea de determinar qué píxeles de una imagen pertenecen a un objeto, tradicionalmente requería modelos entrenados en conjuntos de datos específicos de la tarea, como COCO, Cityscapes o Pascal VOC, cada uno con un conjunto fijo de categorías de objetos. Un modelo entrenado en un conjunto de datos generalmente no lograba transferirse a otro. El proyecto Segment Anything propuso tratar la segmentación como un problema de indicaciones, análogo a las indicaciones en modelos de lenguaje grandes: en lugar de clasificar píxeles en un vocabulario cerrado, el modelo produce una máscara de segmentación para el objeto que el usuario indique.

SAM (2023)

Meta AI publicó el Segment Anything Model (SAM) el 5 de abril de 2023, junto con el conjunto de datos SA-1B. SAM es promptable: dada una imagen y una indicación, como un punto en primer plano, una caja delimitadora o una máscara aproximada, genera una máscara de segmentación válida para el objeto indicado, incluso para objetos y distribuciones de imágenes no vistas durante el entrenamiento, una capacidad conocida como transferencia de cero disparos. Su arquitectura combina un codificador de imágenes Vision Transformer de gran tamaño con un codificador de indicaciones ligero y un decodificador de máscaras, de modo que el costoso codificado de imágenes se calcula una vez y el modelo puede responder a muchas indicaciones de manera económica. Este diseño se basó en avances en arquitecturas transformer y técnicas de aprendizaje profundo que habían demostrado ser efectivas en otros dominios de la inteligencia artificial.

SAM 2 (2024)

El 29 de julio de 2024, Meta publicó SAM 2, que extendió la segmentación promptable a video. SAM 2 trata una imagen como un video de un solo fotograma, unificando la segmentación de imágenes y videos en una sola arquitectura. Reemplazó el codificador Vision Transformer de SAM con una columna vertebral jerárquica Hiera y añadió un módulo de memoria de transmisión, que comprende un codificador de memoria, un banco de memoria y atención de memoria, que almacena incrustaciones de fotogramas de video pasados para que los objetos puedan ser rastreados a través de occlusiones. Los fotogramas se procesan secuencialmente, lo que permite la operación en tiempo real: Meta informó aproximadamente 44 fotogramas por segundo en segmentación de imágenes. La capacidad del modelo para manejar datos temporales lo ha hecho relevante para campos como la robótica y los sistemas autónomos, donde el seguimiento de objetos a través de fotogramas es crítico.

SAM 3 (2025)

El 19 de noviembre de 2025, Meta publicó SAM 3, que introdujo la Segmentación de Conceptos Promptable (PCS): el modelo puede detectar, segmentar y rastrear todas las instancias de un concepto especificado por una frase nominal corta, como "autobús escolar amarillo", una imagen de ejemplo o una combinación de ambos, además de las indicaciones geométricas (puntos, cajas, máscaras) compatibles con versiones anteriores. Esta capacidad se alinea con tendencias más amplias en IA generativa y comprensión multimodal, donde los modelos interpretan cada vez más entradas de lenguaje natural para realizar tareas visuales. El enfoque basado en conceptos de SAM 3 reduce la necesidad de indicaciones explícitas por objeto, lo que lo hace más adecuado para aplicaciones como la edición de contenido automatizada y el análisis de imágenes a gran escala.

Impacto y Adopción

Los modelos Segment Anything han sido ampliamente adoptados en la investigación y la industria. En imágenes médicas, los investigadores han utilizado SAM para segmentar estructuras anatómicas en exploraciones, mientras que en observación de la Tierra se ha aplicado a imágenes satelitales para la clasificación de la cobertura del suelo. Equipos de robótica han integrado SAM para la manipulación de objetos y la comprensión de escenas, y las herramientas de edición de contenido han aprovechado su interfaz promptable para la generación de máscaras impulsada por el usuario. La publicación de código abierto bajo la licencia Apache 2.0 ha facilitado la integración en varios pipelines de aprendizaje automático, y los modelos se han convertido en una línea base común para tareas de segmentación. El énfasis del proyecto en la promptabilidad y la generalización de cero disparos ha influido en trabajos posteriores en visión por computadora, posicionándolo como una contribución fundacional en el campo.

Referencias

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·image-segmentation·meta-ai·open-source
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial