Traducido del inglés

SUN397 es un conjunto de datos de referencia para el reconocimiento de escenas, que contiene 108,754 imágenes en 397 categorías de escenas, ampliamente utilizado para evaluar algoritmos de visión por computadora.

SUN397 es un conjunto de datos a gran escala para el reconocimiento de escenas, introducido en 2010 por investigadores del Laboratorio de Ciencias de la Computación e Inteligencia Artificial del MIT y la Universidad de Princeton. Contiene 108,754 imágenes distribuidas en 397 categorías de escenas distintas, lo que lo convierte en uno de los recursos más completos para evaluar algoritmos que clasifican imágenes según el tipo de entorno que representan, como un dormitorio, una estación de esquí o una biblioteca. El conjunto de datos fue diseñado para ampliar los límites de la comprensión de escenas más allá de las tareas centradas en objetos, enfatizando el contexto holístico de una imagen.

El conjunto de datos está organizado jerárquicamente, con categorías agrupadas en clases más amplias como interiores, exteriores naturales y exteriores artificiales. Cada categoría contiene al menos 100 imágenes, lo que garantiza muestras suficientes para el entrenamiento y las pruebas. Las imágenes provienen de colecciones públicas, incluyendo Flickr y otros repositorios en línea, y son curadas manualmente para asegurar su relevancia y calidad. SUN397 se utiliza comúnmente junto con el benchmark SUN, que también incluye atributos y anotaciones de objetos para un subconjunto de imágenes.

Construcción y Anotación

La creación de SUN397 implicó un proceso riguroso para garantizar diversidad y cobertura. Los investigadores primero compilaron una lista de categorías de escenas de diversas fuentes, incluyendo diccionarios y conjuntos de datos existentes, y luego la expandieron a 397 categorías. Las imágenes se recopilaron mediante búsquedas web y envíos de usuarios, y luego se filtraron para eliminar duplicados y contenido irrelevante. Cada imagen fue verificada manualmente para pertenecer a su categoría asignada. El conjunto de datos se dividió en conjuntos de entrenamiento y prueba, con un protocolo estándar de usar 50 imágenes por categoría para entrenamiento y 50 para prueba, aunque también se utilizan otras divisiones.

Papel en la Investigación del Reconocimiento de Escenas

SUN397 se ha convertido en un benchmark estándar en visión por computadora y aprendizaje automático. Se utiliza frecuentemente para evaluar redes neuronales convolucionales y otros modelos de aprendizaje profundo. El conjunto de datos desafía a los algoritmos a distinguir entre escenas visualmente similares, como diferentes tipos de cocinas o bibliotecas, y a generalizar a través de diversas condiciones de iluminación, perspectivas y oclusiones. Muchos modelos de última generación reportan su rendimiento en SUN397 como una métrica clave, logrando a menudo más del 90% de precisión en el conjunto de prueba.

Comparación con Otros Conjuntos de Datos

SUN397 complementa otros conjuntos de datos populares como Places365 y ImageNet. Mientras que ImageNet se centra en la clasificación de objetos, SUN397 enfatiza la comprensión a nivel de escena. Places365, introducido más tarde, es un conjunto de datos de escenas más grande con 365 categorías, pero SUN397 sigue siendo valioso debido a sus categorías más detalladas y su papel en la investigación temprana del reconocimiento de escenas. El conjunto de datos también incluye un subconjunto con etiquetas de atributos, lo que permite tareas como la predicción de atributos de escenas.

Impacto y Legado

La introducción de SUN397 impulsó avances significativos en el reconocimiento de escenas, contribuyendo al desarrollo de modelos que comprenden el contexto y la disposición. Se ha utilizado en aplicaciones que van desde la conducción autónoma hasta la recuperación de imágenes basada en contenido. El conjunto de datos está disponible públicamente para fines de investigación y es ampliamente citado en la literatura académica. Su estructura jerárquica y sus protocolos de evaluación claros lo han convertido en un recurso duradero, aún referenciado en estudios contemporáneos hasta 2025.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·dataset·scene-recognition·benchmark
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial