Traduzido do inglês

Places365 é um conjunto de dados de reconhecimento de cenas em larga escala, contendo mais de 1,8 milhão de imagens de 365 categorias de cenas, desenvolvido pelo MIT e utilizado para treinar e avaliar modelos de aprendizado profundo para compreensão de cenas.

Places365 é um conjunto de dados em larga escala para reconhecimento de cenas, contendo mais de 1,8 milhão de imagens de 365 categorias distintas de cenas. Foi introduzido em 2016 por pesquisadores do Instituto de Tecnologia de Massachusetts (MIT), incluindo Bolei Zhou, Aditya Khosla, Aude Oliva e Antonio Torralba. O conjunto de dados foi projetado para avançar o campo da visão computacional, particularmente na área de compreensão de cenas, que envolve identificar o contexto ou ambiente no qual uma imagem foi capturada. Places365 tornou-se um padrão de referência para avaliar o desempenho de modelos de aprendizado profundo em tarefas de classificação de cenas, complementando conjuntos de dados centrados em objetos, como o ImageNet.

O conjunto de dados é organizado em duas versões: Places365-Standard e Places365-Challenge. Places365-Standard contém aproximadamente 1,8 milhão de imagens de treinamento, com cada categoria tendo entre 3.000 e 5.000 imagens. Places365-Challenge é uma versão maior, com mais de 8 milhões de imagens de treinamento, usada para a competição Places Challenge realizada na Conferência sobre Visão Computacional e Reconhecimento de Padrões (CVPR) em 2016. As imagens são provenientes da web e são anotadas com uma das 365 categorias de cenas, variando de cenas naturais como "montanha" e "praia" a ambientes internos como "cozinha" e "escritório". As categorias são derivadas do conjunto de dados Places2, que por sua vez é uma extensão do conjunto de dados anterior Places205.

Desenvolvimento e Motivação

Places365 foi criado para atender à necessidade de um conjunto de dados abrangente para reconhecimento de cenas. Enquanto o reconhecimento de objetos havia visto progresso significativo com conjuntos de dados como o ImageNet, a compreensão de cenas permanecia relativamente subdesenvolvida. A equipe do MIT visava fornecer um conjunto de dados grande, diversificado e bem anotado que pudesse apoiar o treinamento de modelos de rede neural para classificação de cenas. O conjunto de dados foi construído coletando imagens da web e, em seguida, usando uma combinação de processos de anotação automatizados e baseados em humanos. O conjunto final de 365 categorias foi escolhido para cobrir uma ampla gama de ambientes cotidianos, garantindo que modelos treinados em Places365 pudessem generalizar para aplicações do mundo real, como direção autônoma, robótica e recuperação de imagens.

A criação de Places365 fez parte de um esforço mais amplo para construir o banco de dados Places, que também inclui o conjunto de dados Places205 e o conjunto de dados Places2. Places205, introduzido em 2014, continha 205 categorias de cenas e foi usado como um padrão de referência preliminar. Places365 expandiu isso para 365 categorias, fornecendo uma cobertura mais abrangente dos tipos de cenas. O conjunto de dados foi amplamente adotado pela comunidade de pesquisa, e seu lançamento estimulou numerosos avanços em algoritmos de reconhecimento de cenas.

Arquitetura e Conteúdo

Places365 consiste em imagens com resoluções variadas, tipicamente em torno de 224×224 pixels após o pré-processamento. Cada imagem é rotulada com uma única categoria de cena, tornando-a uma tarefa de classificação de rótulo único. O conjunto de dados inclui um conjunto de treinamento, um conjunto de validação e um conjunto de teste. Os conjuntos de validação e teste têm 50 imagens por categoria, enquanto o conjunto de treinamento tem milhares de imagens por categoria. As imagens são armazenadas em formato JPEG e são organizadas em diretórios por categoria.

Um aspecto notável de Places365 é seu foco no contexto em nível de cena, em vez de objetos individuais. Isso o torna distinto de conjuntos de dados de reconhecimento de objetos, pois os modelos devem aprender a reconhecer o ambiente geral. O conjunto de dados também inclui uma hierarquia semântica, agrupando as 365 categorias em 16 supercategorias, como "interno", "externo natural" e "externo feito pelo homem". Essa hierarquia permite uma avaliação e análise mais estruturadas do desempenho do modelo.

Aplicações e Impacto

Places365 tem sido usado extensivamente em pesquisa de aprendizado de máquina, particularmente para treinar redes neurais convolucionais (CNNs) para classificação de cenas. Muitos modelos de última geração, como ResNet e DenseNet, foram avaliados em Places365, e o conjunto de dados serviu como um padrão de referência para comparar diferentes arquiteturas. Além da classificação, Places365 tem sido usado para tarefas como análise de cenas, segmentação semântica e aprendizado por transferência. Por exemplo, modelos pré-treinados em Places365 foram ajustados para outras tarefas de visão, incluindo detecção de objetos e legenda de imagens.

O conjunto de dados também influenciou o desenvolvimento de sistemas de inteligência artificial na indústria. Empresas como Google DeepMind e OpenAI incorporaram capacidades de compreensão de cenas em seus modelos, e Places365 tem sido usado para avaliar o desempenho de modelos de visão em larga escala. Além disso, o conjunto de dados tem sido usado em estudos sobre percepção humana de cenas, fornecendo insights sobre como os humanos categorizam ambientes.

Limitações e Direções Futuras

Apesar de seu sucesso, Places365 tem várias limitações. O conjunto de dados é tendencioso em relação a contextos ocidentais e de língua inglesa, pois as imagens foram coletadas da web, o que pode não representar igualmente todos os ambientes globais. Além disso, o formato de rótulo único não captura a complexidade de cenas do mundo real, que frequentemente contêm múltiplos contextos sobrepostos. Pesquisadores propuseram extensões e alternativas, como conjuntos de dados de cenas com múltiplos rótulos e conjuntos de dados com cobertura geográfica mais diversificada. À medida que a IA generativa e os modelos de linguagem de grande escala continuam a avançar, há um interesse crescente em usar a compreensão de cenas para aprimorar modelos multimodais, e Places365 permanece um recurso relevante para treinar e avaliar tais sistemas.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-vision·datasets·scene-recognition·deep-learning
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico