Open Images é um conjunto de dados em larga escala criado pelo Google para pesquisa em visão computacional. Ele contém milhões de imagens anotadas com uma variedade de rótulos e metadados, projetado para treinar e avaliar modelos de aprendizado de máquina. O conjunto de dados é notável por sua escala e diversidade, abrangendo uma ampla gama de objetos e cenas do cotidiano, com anotações que incluem rótulos em nível de imagem, caixas delimitadoras de objetos e tripletos de relações visuais.
A primeira versão do Open Images foi lançada em 2016, contendo aproximadamente 9 milhões de imagens com rótulos em nível de imagem em quase 6.000 categorias. Versões posteriores expandiram o conjunto de dados para incluir mais de 30 milhões de imagens, com mais de 15 milhões de caixas delimitadoras demarcando objetos em mais de 600 classes. As anotações foram produzidas por meio de uma combinação de métodos automatizados e verificação humana, refletindo o investimento do Google em infraestrutura de dados em larga escala para avançar as capacidades de inteligência artificial.
Estrutura do Conjunto de Dados
O Open Images é estruturado para suportar múltiplas tarefas de visão computacional. Os componentes principais são a coleção de imagens, rótulos em nível de imagem que indicam a presença de objetos ou conceitos e anotações localizadas, como caixas delimitadoras e máscaras de segmentação. Para cada imagem, o conjunto de dados fornece um identificador único, a URL original e metadados, como a confiança prevista dos rótulos. As anotações de caixas delimitadoras são fornecidas em um formato padronizado, listando as coordenadas relativas às dimensões da imagem, juntamente com um rótulo para a classe do objeto.
Além disso, o conjunto de dados inclui um conjunto de anotações de relações visuais que descrevem interações entre objetos, como "pessoa montando cavalo" ou "cachorro perseguindo bola". Essas relações são formatadas como tripletos sujeito-predicado-objeto. Essa camada de anotação mais rica permite pesquisas em raciocínio relacional e compreensão de cenas, que são áreas ativas dentro do reconhecimento visual e da pesquisa em aprendizado profundo.
Metodologia de Anotação
A criação do Open Images dependeu de um pipeline semiautomático que combinou candidatos gerados por máquinas com curadoria humana. Os sistemas internos do Google primeiro geraram candidatos de rótulos ruidosos usando classificadores de imagens existentes e mineração de dados em escala web. Esses candidatos foram então apresentados a anotadores humanos por meio de plataformas de crowdsourcing, onde os trabalhadores verificaram ou corrigiram os rótulos e refinaram as caixas delimitadoras. Essa abordagem híbrida permitiu que o conjunto de dados escalasse para milhões de imagens, mantendo um nível de qualidade adequado para treinar redes neurais modernas.
Para caixas delimitadoras, os anotadores foram instruídos a desenhar a caixa mais justa possível ao redor de cada instância visível de uma classe alvo. As anotações finais foram validadas por meio de uma série de verificações de qualidade, incluindo uma análise de concordância entre múltiplos anotadores em um subconjunto de imagens. Como resultado, o conjunto de dados se tornou um referencial tanto para classificação de rótulo único quanto para classificação de múltiplos rótulos, bem como para detecção de objetos.
Impacto na Pesquisa
O Open Images tem sido amplamente utilizado por grupos de pesquisa acadêmicos e industriais. Ele serviu como base para vários desafios públicos de referência, incluindo o Open Images Challenge hospedado no Kaggle, que ocorreu em 2018 e 2019. Esses desafios atraíram centenas de equipes participantes e impulsionaram o estado da arte em detecção de objetos e detecção de relações visuais. O conjunto de dados foi citado em milhares de artigos de pesquisa, influenciando abordagens para treinamento de redes neurais em larga escala e aprendizado por transferência.
A disponibilidade de um conjunto de dados rotulado grande e diversificado também apoiou o desenvolvimento de sistemas de IA generativa que exigem fundamentação em conceitos visuais do mundo real. Modelos pré-treinados no Open Images foram usados para tarefas downstream, como legenda de imagens, resposta a perguntas visuais e percepção para direção autônoma. O conjunto de dados complementa outros recursos, como ImageNet e COCO, oferecendo um conjunto mais amplo de classes e uma distribuição mais realista de imagens do cotidiano.
Versões e Disponibilidade
O Google lançou várias versões do Open Images sob uma licença Creative Commons, tornando-o livremente disponível para pesquisa e uso comercial. A versão 4, introduzida em 2018, adicionou as anotações de relações visuais e expandiu o número de imagens para mais de 9 milhões, com 30 milhões de anotações em nível de caixa. A versão 5, lançada em 2019, aumentou o número de classes de caixas delimitadoras para 600 e adicionou máscaras de segmentação para um subconjunto de imagens. O conjunto de dados é acessível por meio da infraestrutura de armazenamento do Google e também pode ser explorado por meio de uma ferramenta de visualização interativa no site oficial.
Todos os arquivos são fornecidos em formato CSV, com arquivos separados para cada tipo de anotação. O conjunto de dados tem um artigo complementar apresentado pela primeira vez na Conferência de 2017 sobre Visão Computacional e Reconhecimento de Padrões, detalhando sua construção e estatísticas. O projeto tem sido mantido pela equipe do Google Research, com atualizações impulsionadas por feedback da comunidade e necessidades internas de pesquisa. Em 2025, o conjunto de dados permanece um ponto de referência padrão para benchmarks de reconhecimento visual em larga escala.
Limitações e Direções Futuras
Apesar de sua escala, o Open Images tem limitações inerentes. Os rótulos em nível de imagem são baseados em previsões geradas por máquinas e podem conter ruído, e a distribuição de classes é tendenciosa para objetos comuns encontrados em imagens da web. As anotações se concentram principalmente na presença de objetos e relações grosseiras, carecendo de atributos de granularidade fina ou grafos de cena detalhados disponíveis em alguns conjuntos de dados menores. Pesquisadores frequentemente complementam o Open Images com outras fontes ou aplicam técnicas de adaptação de domínio ao trabalhar em tarefas especializadas.
Direções futuras para o conjunto de dados podem incluir anotações de vídeo mais extensas, tipos de relações mais ricos ou incorporação de dados multimodais, como descrições de texto. O sucesso do Open Images inspirou esforços semelhantes de coleta de dados em larga escala, incluindo os de Amazon AI e outros provedores de nuvem, refletindo uma tendência mais ampla de tornar corpora anotados massivos acessíveis para acelerar o progresso em inteligência artificial.