Segment Anything ViT es una arquitectura de vision transformer que sirve como columna vertebral del codificador de imágenes para el Segment Anything Model (SAM), un sistema desarrollado por Meta para la segmentación de imágenes mediante indicaciones. El modelo utiliza un diseño basado en transformers para convertir las imágenes de entrada en incrustaciones de características de alta dimensión, que luego son procesadas por un decodificador de máscaras ligero para producir máscaras de segmentación basadas en indicaciones del usuario, como puntos, cajas o texto. Esta columna vertebral se introdujo en 2023 junto con el marco SAM y el conjunto de datos Segment Anything, que contiene más de 1 mil millones de máscaras en 11 millones de imágenes.
El Segment Anything ViT se basa en la estructura estándar de vision transformer, que divide una imagen en parches de tamaño fijo y los procesa a través de capas apiladas de atención multi-cabeza. A diferencia de las columnas vertebrales convolucionales anteriores, como red residual o U-Net, la columna vertebral ViT captura el contexto global de toda la imagen en cada capa, lo que la hace adecuada para tareas que requieren comprender los límites y las relaciones de los objetos. La arquitectura incluye codificación posicional para retener la información espacial, y admite múltiples tamaños de modelo - ViT-B, ViT-L y ViT-H - con la versión más grande que tiene alrededor de 632 millones de parámetros.
Arquitectura y Diseño
El Segment Anything ViT sigue el diseño original de vision transformer propuesto por Dosovitskiy y sus colegas, con modificaciones adaptadas para tareas de predicción densa. Utiliza un tamaño de parche de 16x16 píxeles, lo que significa que una imagen de entrada de 1024x1024 se divide en parches de 64x64. Cada parche se proyecta linealmente en un vector de incrustación, y se añade una codificación posicional aprendible antes de los bloques del transformer. La columna vertebral emplea una estructura interna estándar de codificador-decodificador, pero en el marco SAM actúa puramente como codificador, generando un mapa de características que retiene la resolución espacial a través de un proceso de muestreo ascendente por capas.
Una elección de diseño clave es el uso de un mecanismo de atención global en lugar de atención por ventanas. Esto permite que el modelo considere toda la imagen al calcular las características para cualquier parche dado, lo que es importante para segmentar objetos que abarcan áreas grandes o tienen límites ambiguos. La columna vertebral también incorpora un módulo de cuello que reduce la dimensión de las características a un espacio de incrustación compacto, típicamente 256 canales, antes de pasar la salida al decodificador de máscaras.
Entrenamiento y Datos
El Segment Anything ViT fue entrenado en el conjunto de datos Segment Anything, una colección a gran escala de 11 millones de imágenes con más de 1 mil millones de máscaras de segmentación. Este conjunto de datos fue creado utilizando un motor de datos que combinaba la generación automática de máscaras con el refinamiento humano. El proceso de entrenamiento utilizó una combinación de aprendizaje supervisado en las anotaciones de máscaras y un enfoque de modelo en el bucle, donde la columna vertebral ViT se mejoraba iterativamente a medida que se generaban nuevas máscaras.
El entrenamiento empleó técnicas estándar de aprendizaje profundo, incluyendo optimizador Adam para la optimización, aumento de datos para mejorar la generalización, y recorte de gradientes para estabilizar el entrenamiento. El modelo fue entrenado en un clúster de GPU, aunque los detalles específicos del hardware no están documentados públicamente. La variante ViT-H, con su mayor capacidad, logró la mayor calidad de segmentación pero requirió más recursos computacionales tanto para el entrenamiento como para la inferencia.
Aplicaciones e Impacto
El Segment Anything ViT permitió que el modelo SAM realizara segmentación de disparo cero - la capacidad de segmentar objetos en imágenes sin ajuste fino previo en categorías específicas. Esto tiene amplias aplicaciones en campos de inteligencia artificial como imágenes médicas, conducción autónoma y robótica. Por ejemplo, la columna vertebral puede combinarse con mecanismos de atención cruzada para integrar indicaciones de texto, permitiendo a los usuarios segmentar objetos describiéndolos en lenguaje natural.
El lanzamiento de SAM y su columna vertebral ViT influyó en investigaciones posteriores sobre segmentación interactiva y modelos fundacionales para visión por computadora. Demostró que un solo modelo entrenado en datos diversos podía generalizar a objetos y escenas no vistos, similar a cómo los modelos de lenguaje grandes generalizan en tareas de texto. La arquitectura ha sido adaptada para otras tareas de predicción densa, incluyendo estimación de profundidad y detección de bordes, y ha sido integrada en varios kits de herramientas de código abierto.
Rendimiento y Limitaciones
En evaluaciones de referencia, la columna vertebral Segment Anything ViT-H logró un rendimiento sólido en métricas de segmentación estándar, como la Intersección sobre Unión media (mIoU), en múltiples conjuntos de datos. Sin embargo, el modelo tiene limitaciones conocidas. Puede tener dificultades con objetos muy pequeños, objetos fuertemente ocluidos o imágenes con condiciones de iluminación inusuales. La columna vertebral ViT también es computacionalmente intensiva, requiriendo memoria y potencia de procesamiento sustanciales, lo que limita su uso en dispositivos periféricos sin optimización.
La investigación ha demostrado que el rendimiento de la columna vertebral se degrada cuando las imágenes de entrada se reducen significativamente de escala, ya que los detalles finos se pierden en el proceso de incrustación de parches. Además, el modelo no comprende inherentemente la semántica de los objetos - segmenta basándose en patrones visuales en lugar de conocimiento de categorías, lo que puede llevar a sobre-segmentación o sub-segmentación en casos ambiguos.
Desarrollos Relacionados
El Segment Anything ViT se basa en trabajos anteriores sobre vision transformers, incluyendo el modelo ViT original y mejoras posteriores como diseños jerárquicos. Es distinto de los enfoques convolucionales como red residual y U-Net, que procesan imágenes a través de campos receptivos locales. La columna vertebral también ha inspirado modelos posteriores que incorporan mecanismos de atención eficientes o transformers dispersos para reducir el costo computacional.
En el contexto más amplio de IA generativa, el Segment Anything ViT representa un cambio hacia modelos unificados que pueden manejar múltiples tareas visuales con una sola arquitectura. Su éxito ha fomentado esfuerzos similares en otros dominios, como la segmentación de audio y video, y ha contribuido al creciente ecosistema de modelos de IA de código abierto.