LabelMe é um projeto originado do MIT Computer Science and Artificial Intelligence Laboratory que oferece um conjunto de dados de imagens digitais de acesso livre e em constante evolução, acompanhado de anotações geradas por usuários. Projetado principalmente para pesquisa em visão computacional, ele permite a rotulagem de múltiplos objetos em cenas arbitrárias usando contornos poligonais. Em 31 de outubro de 2010, o conjunto de dados compreendia 187.240 imagens, das quais 62.197 foram anotadas, contendo 658.992 objetos rotulados. O projeto é aberto à contribuição pública, permitindo que qualquer pessoa adicione ou edite anotações, tornando-o um recurso dinâmico para a comunidade de pesquisa.
A iniciativa LabelMe surgiu para abordar deficiências em conjuntos de dados de visão computacional anteriores, que eram frequentemente adaptados a problemas de pesquisa específicos e careciam de diversidade na aparência dos objetos e no contexto das cenas. Ao contrário de conjuntos de dados tradicionais que apresentavam imagens recortadas e normalizadas de objetos únicos, o LabelMe suporta o reconhecimento de classes de objetos em cenas complexas e não modificadas, oferecendo múltiplos ângulos, tamanhos e orientações. Ele também fornece uma grande variedade de classes de objetos e permite que os usuários criem novas facilmente.
Ferramenta de anotação
A ferramenta de anotação baseada na web do LabelMe permite que os usuários contribuam para o conjunto de dados sem exigir software especializado. Acessível por qualquer navegador web com suporte a JavaScript, a ferramenta exibe uma imagem selecionada aleatoriamente da coleção, sobrepondo anotações poligonais existentes em cores distintas. Os usuários podem desenhar novos polígonos clicando em pontos ao longo do contorno de um objeto e, em seguida, atribuir um rótulo de texto por meio de uma interface pop-up. Os rótulos são definidos pelo usuário, levando a variações como 'cachorro', 'canino' ou 'cão'. Os anotadores também podem editar ou excluir polígonos existentes, e as alterações são salvas imediatamente e disponibilizadas publicamente para download, promovendo um conjunto de dados orientado pela comunidade e em atualização contínua.
Motivação e princípios de design
O projeto foi impulsionado pelas limitações de conjuntos de dados de visão computacional publicamente disponíveis anteriores, que eram frequentemente adaptados a problemas de pesquisa específicos e exigiam que novos pesquisadores coletassem dados adicionais. O LabelMe foi projetado para suportar o reconhecimento de classes de objetos, em vez de instâncias únicas, abrangendo objetos em múltiplos ângulos, tamanhos e orientações em cenas arbitrárias. Ao contrário de conjuntos de dados com imagens recortadas ou normalizadas, o LabelMe permite a anotação de múltiplos objetos por imagem por meio de contornos poligonais, possibilitando a compreensão de cenas complexas. Ele também suporta um conjunto grande e em expansão de classes de objetos, inclui imagens diversas e fornece imagens sem direitos autorais com contribuições públicas abertas.
Ferramenta de anotação
A ferramenta de anotação opera em um navegador web padrão com suporte a JavaScript MSN, e os usuários podem acessá-la anonimamente ou com uma conta gratuita. Quando carregada, a ferramenta seleciona aleatoriamente uma imagem do conjunto de dados e exibe quaisquer rótulos de objetos existentes como polígonos coloridos sobrepostos à imagem, com cada rótulo distinto recebendo uma cor diferente. Para adicionar uma anotação, um usuário desenha um polígono clicando em pontos ao longo do contorno de um objeto e fecha a forma para acionar um prompt para inserir um rótulo. Os usuários podem escolher qualquer rótulo de texto que considerem adequado, e também podem editar ou excluir polígonos existentes clicando em seus contornos e modificando o texto do rótulo. As alterações são salvas imediatamente e se tornam publicamente disponíveis no conjunto de dados, contribuindo para uma coleção em evolução contínua. A interface inclui um link 'Mostre-me outra imagem' para prosseguir para a próxima imagem aleatória.
Características do conjunto de dados
Em 31 de outubro de 2010, o LabelMe continha 187.240 imagens, das quais 62.197 foram anotadas, com um total de 658.992 objetos rotulados. A natureza dinâmica do conjunto de dados significa que esses números cresceram desde então. As imagens são extraídas de uma ampla variedade de cenas, principalmente capturadas por fotógrafos humanos, resultando em distribuições desiguais de tamanhos e locais de objetos dentro dos quadros. O modelo de contribuição aberta introduz variabilidade no estilo de anotação: os anotadores decidem quais objetos rotular (por exemplo, se devem delinear objetos ocluídos), a precisão dos contornos poligonais e o texto exato usado para os rótulos. Essa variabilidade é intencional, pois os criadores acreditam que ela reflete hábitos naturais de rotulagem e ajuda os pesquisadores a desenvolver algoritmos robustos a tais inconsistências.
Trabalhos relacionados e impacto
O LabelMe baseou-se em esforços anteriores em conjuntos de dados de visão computacional, como os conjuntos de dados PASCAL VOC e Caltech, mas se distinguiu por sua escala e abertura. Sua natureza dinâmica e abordagem orientada pela comunidade influenciaram plataformas e conjuntos de dados de anotação subsequentes no campo. O projeto tem sido amplamente utilizado para treinar e avaliar algoritmos de detecção de objetos e segmentação, e contribuiu para o movimento mais amplo em direção a dados em grande escala e publicamente disponíveis em Machine learning e Artificial intelligence.
Problemas com os dados
O conjunto de dados exibe variabilidade devido à liberdade dada aos anotadores, o que introduz certos desafios. Os objetos podem variar em tamanho e localização na imagem, pois os fotógrafos tendem a centralizar assuntos interessantes. Os usuários podem escolher quais objetos rotular, levando a inconsistências, como se devem rotular objetos ocluídos ou o céu. A precisão da anotação também varia, pois os usuários decidem quão detalhados os polígonos devem ser. Os rótulos de texto são irrestritos, então o mesmo objeto pode receber nomes diferentes, como "pessoa", "homem" ou "pedestre". Os criadores deixaram intencionalmente essas decisões para os anotadores, acreditando que a variabilidade natural de rotulagem ajuda os pesquisadores a desenvolver algoritmos robustos a inconsistências do mundo real.
Organização dos dados e integração com WordNet
Para abordar a variabilidade nos rótulos de texto, a equipe do LabelMe integrou o WordNet ao banco de dados. O WordNet organiza palavras em uma hierarquia semântica estruturada, atribuindo cada palavra a um "sentido". A atribuição automática de sentidos mostrou-se não confiável, então os rótulos foram mapeados manualmente para os sentidos do WordNet. Esse esforço, embora trabalhoso, permaneceu gerenciável porque o número de palavras distintas crescia lentamente em relação ao número de polígonos. Com a integração do WordNet, as buscas se tornaram mais eficazes: consultar "animal" poderia recuperar objetos rotulados como cães, gatos e cobras, enquanto excluía correspondências irrelevantes como "cachorro passeando" ou objetos rotulados com frases complexas. O sistema também suportava a identificação de relações de parte-todo, como rodas como partes de veículos, aumentando a utilidade do conjunto de dados para pesquisa em reconhecimento de objetos.
Impacto e aplicações
O LabelMe tem sido amplamente utilizado em pesquisa de visão computacional, fornecendo um benchmark para tarefas como detecção de objetos, segmentação e compreensão de cenas. Sua natureza aberta e dinâmica o distingue de conjuntos de dados estáticos, permitindo expansão e refinamento contínuos. O projeto inspirou esforços semelhantes de anotação crowdsourced e permanece um recurso fundamental no campo. Pesquisadores aproveitaram o LabelMe para treinar e avaliar algoritmos para reconhecimento de objetos em contextos diversos do mundo real, contribuindo para avanços na compreensão de imagens e áreas relacionadas de machine learning e computer vision.