Traducido del inglés

Places365 es un conjunto de datos de reconocimiento de escenas a gran escala que contiene más de 1.8 millones de imágenes de 365 categorías de escenas, desarrollado por el MIT y utilizado para entrenar y evaluar modelos de aprendizaje profundo en la comprensión de escenas.

Lugares365 es un conjunto de datos a gran escala para el reconocimiento de escenas, que contiene más de 1,8 millones de imágenes de 365 categorías de escenas distintas. Fue introducido en 2016 por investigadores del Instituto de Tecnología de Massachusetts (MIT), entre ellos Bolei Zhou, Aditya Khosla, Aude Oliva y Antonio Torralba. El conjunto de datos está diseñado para avanzar en el campo de la visión por computadora, particularmente en el área de la comprensión de escenas, que implica identificar el contexto o el entorno en el que se captura una imagen. Lugares365 se ha convertido en un estándar de referencia para evaluar el rendimiento de los modelos de aprendizaje profundo en tareas de clasificación de escenas, complementando conjuntos de datos centrados en objetos como ImageNet.

El conjunto de datos se organiza en dos versiones: Lugares365-Estándar y Lugares365-Desafío. Lugares365-Estándar contiene aproximadamente 1,8 millones de imágenes de entrenamiento, con entre 3.000 y 5.000 imágenes por categoría. Lugares365-Desafío es una versión más grande con más de 8 millones de imágenes de entrenamiento, utilizada para el Desafío Lugares celebrado en la Conferencia sobre Visión por Computadora y Reconocimiento de Patrones (CVPR) en 2016. Las imágenes se obtienen de la web y se anotan con una de las 365 categorías de escenas, que van desde escenas naturales como "montaña" y "playa" hasta entornos interiores como "cocina" y "oficina". Las categorías se derivan del conjunto de datos Lugares2, que a su vez es una extensión del anterior Lugares205.

Desarrollo y Motivación

Lugares365 se creó para abordar la necesidad de un conjunto de datos completo para el reconocimiento de escenas. Mientras que el reconocimiento de objetos había experimentado avances significativos con conjuntos de datos como ImageNet, la comprensión de escenas seguía relativamente subdesarrollada. El equipo del MIT pretendía proporcionar un conjunto de datos grande, diverso y bien anotado que pudiera respaldar el entrenamiento de modelos de redes neuronales para la clasificación de escenas. El conjunto de datos se construyó recopilando imágenes de la web y utilizando una combinación de métodos automatizados y anotación humana. El conjunto final de 365 categorías se eligió para cubrir una amplia gama de entornos, garantizando que los modelos entrenados en Lugares365 pudieran generalizarse a aplicaciones del mundo real, como la conducción autónoma, la robótica y la recuperación de imágenes.

La creación de Lugares365 fue parte de un esfuerzo más amplio para construir la base de datos Lugares, que también incluye los conjuntos de datos Lugares205 y Lugares2. Lugares205, introducido en 2014, contenía 205 categorías de escenas y se utilizó como punto de partida. Lugares365 amplió esto a 365 categorías, proporcionando una cobertura más completa de los tipos de escenas. El conjunto de datos ha sido ampliamente adoptado por la comunidad investigadora, y su publicación ha estimulado numerosos avances en los algoritmos de clasificación de escenas.

Arquitectura y Contenido

Lugares365 consiste en imágenes con resoluciones variables, típicamente alrededor de 224×224 píxeles después del preprocesamiento. Cada imagen está etiquetada con una sola categoría de escena, lo que lo convierte en una tarea de clasificación de una sola etiqueta. El conjunto de datos incluye un conjunto de entrenamiento, un conjunto de validación y un conjunto de prueba. Los conjuntos de validación y prueba tienen 50 imágenes por categoría, mientras que el conjunto de entrenamiento tiene miles de imágenes por categoría. Las imágenes se almacenan en formato JPEG y se organizan en directorios por categoría.

Una característica distintiva de Lugares365 es su enfoque en el contexto a nivel de escena en lugar de objetos individuales. Esto lo hace distinto de los conjuntos de datos de reconocimiento de objetos, ya que los modelos deben aprender a reconocer el entorno general. El conjunto de datos también incluye una jerarquía semántica, agrupando las 365 categorías en 16 supercategorías como "interior", "naturaleza exterior" y "exterior artificial". Esta jerarquía permite una evaluación y un análisis más estructurados del rendimiento del modelo.

Aplicaciones e Impacto

Lugares365 se ha utilizado ampliamente en la investigación de aprendizaje automático, particularmente para entrenar redes neuronales convolucionales (CNN) para la clasificación de escenas. Muchos modelos de última generación, como ResNet y DenseNet, se han evaluado en Lugares365, y el conjunto de datos ha servido como punto de referencia para comparar diferentes arquitecturas. Más allá de la clasificación, Lugares365 se ha utilizado para tareas como la segmentación semántica, la transferencia de aprendizaje y la comprensión de escenas. Por ejemplo, los modelos preentrenados en Lugares365 se han ajustado para otras tareas de visión, incluida la detección de objetos y el subtitulado de imágenes.

El conjunto de datos también ha influido en el desarrollo de sistemas de inteligencia artificial en la industria. Empresas como Google DeepMind y OpenAI han incorporado capacidades de comprensión de escenas en sus modelos, y Lugares365 se ha utilizado para evaluar el rendimiento de los modelos de visión a gran escala. Además, el conjunto de datos se ha utilizado en estudios sobre percepción de escenas humanas, proporcionando información sobre cómo los humanos categorizan los entornos.

Limitaciones y Direcciones Futuras

A pesar de su éxito, Lugares365 tiene varias limitaciones. El conjunto de datos está sesgado hacia entornos occidentales y de habla inglesa, ya que las imágenes se recopilaron de la web, lo que puede no representar igualmente todos los entornos globales. Además, el formato de una sola etiqueta no captura la complejidad de las escenas del mundo real, que a menudo contienen múltiples contextos superpuestos. Los investigadores han propuesto extensiones y alternativas, como conjuntos de datos de escenas de múltiples etiquetas y conjuntos de datos con cobertura geográfica más diversa. A medida que la IA generativa y los modelos de lenguaje de gran tamaño continúan avanzando, existe un interés creciente en utilizar la comprensión de escenas para mejorar las capacidades multimodales, y Lugares365 sigue siendo un recurso relevante para entrenar y evaluar dichos sistemas.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·datasets·scene-recognition·deep-learning
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial