Open Images est un jeu de données à grande échelle conçu pour faire progresser la recherche en vision par ordinateur et en apprentissage automatique. Il fournit une vaste collection d'images annotées avec un ensemble riche d'étiquettes, de boîtes englobantes d'objets et d'informations sur les relations visuelles. Ce jeu de données est largement utilisé pour entraîner et évaluer des modèles dans des tâches telles que la détection d'objets, la classification d'images et la compréhension des relations visuelles. Son échelle et sa diversité en font une ressource fondamentale dans le domaine de l'intelligence artificielle et de l'apprentissage profond.
Open Images a été introduit par Google en 2016 et a connu plusieurs versions majeures. Le jeu de données est remarquable par sa taille, contenant plus de 9 millions d'images dans sa version complète, avec des annotations couvrant des milliers de classes d'objets. Les annotations proviennent d'une combinaison de méthodes automatisées et de vérification humaine, garantissant un équilibre entre échelle et qualité. Le jeu de données comprend une division d'entraînement, une division de validation et une division de test, permettant une évaluation standardisée des modèles.
Structure du jeu de données et annotations
Le jeu de données Open Images fournit plusieurs types d'annotations. L'annotation principale est constituée d'étiquettes au niveau de l'image, où chaque image est associée à un ensemble d'étiquettes de classe indiquant la présence de certains objets ou concepts. De plus, le jeu de données inclut des boîtes englobantes pour les objets, qui sont des rectangles alignés sur les axes localisant les instances d'objets dans une image. Ces boîtes englobantes sont fournies pour un sous-ensemble des images, permettant des tâches comme la détection d'objets. En outre, le jeu de données inclut des annotations de relations visuelles, qui décrivent des relations par paires entre objets, comme « chien sur une planche à roulettes » ou « personne tenant un parapluie ». Ces relations sont structurées en triplets sujet-prédicat-objet, facilitant la recherche en compréhension de scènes.
Les annotations sont organisées dans une taxonomie hiérarchique de classes, permettant une catégorisation allant du général au spécifique. Le jeu de données inclut également un ensemble d'étiquettes « négatives », indiquant qu'une classe particulière est absente d'une image, ce qui est utile pour entraîner des classificateurs avec des exemples négatifs. Les boîtes englobantes sont fournies dans un format normalisé, avec des coordonnées relatives aux dimensions de l'image, ce qui les rend faciles à utiliser avec les cadres d'apprentissage profond standard.
Versions et évolution
Open Images a été publié en plusieurs versions. La version initiale de 2016 comprenait environ 9 millions d'images avec des étiquettes au niveau de l'image. Une version ultérieure, Open Images v4, a étendu le jeu de données pour inclure 30 millions d'étiquettes au niveau de l'image couvrant 19 957 classes, et a ajouté 1,74 million de boîtes englobantes pour 600 classes. La version majeure la plus récente, Open Images v6, a encore augmenté le nombre de boîtes englobantes à plus de 12 millions pour 600 classes, et a ajouté des annotations de relations visuelles. Chaque version a été accompagnée d'un article détaillé décrivant la construction et les statistiques du jeu de données.
Le jeu de données a été élaboré avec un accent sur la diversité, incluant des images provenant de diverses sources et domaines. Les images proviennent de Flickr, sous une licence Creative Commons, garantissant une utilisation légale à des fins de recherche. Le processus d'annotation a impliqué une combinaison de modèles d'apprentissage automatique et d'annotateurs humains, avec un mécanisme de contrôle qualité pour assurer la précision.
Utilisation dans la recherche et l'industrie
Open Images est devenu une référence standard en vision par ordinateur. Il est fréquemment utilisé pour entraîner des modèles de détection d'objets, tels que ceux basés sur des architectures de réseau résiduel, et pour évaluer leurs performances. L'échelle importante du jeu de données et ses annotations diverses le rendent adapté à l'entraînement de modèles avec des millions de paramètres, en tirant parti de techniques comme la normalisation par lots et la augmentation de données. Les chercheurs ont utilisé Open Images pour développer des modèles qui se généralisent bien à d'autres jeux de données, comme COCO, en raison de la variété des objets et des scènes.
Dans l'industrie, Open Images est utilisé par des entreprises pour construire des systèmes de vision pour des applications comme la conduite autonome, la robotique et la modération de contenu. Par exemple, Waymo et Tesla ont développé des systèmes de perception qui bénéficient de jeux de données à grande échelle, bien qu'ils utilisent souvent également des données propriétaires. Le jeu de données est aussi utilisé dans la recherche académique dans des institutions comme le laboratoire d'IA de Stanford et le CSAIL du MIT pour explorer de nouvelles méthodes en apprentissage automatique.
Défis et limites
Malgré son échelle, Open Images présente certaines limites. Les annotations ne sont pas exhaustives ; de nombreux objets dans les images peuvent ne pas être étiquetés, ce qui peut entraîner des faux négatifs pendant l'entraînement. Les boîtes englobantes ne sont fournies que pour un sous-ensemble de classes, et les annotations de relations visuelles sont éparses. De plus, le jeu de données est biaisé vers les objets et les scènes couramment trouvés sur Flickr, ce qui peut ne pas représenter toutes les distributions du monde réel. Les chercheurs doivent souvent combiner Open Images avec d'autres jeux de données ou utiliser des techniques comme l'apprentissage progressif pour résoudre ces problèmes.
Un autre défi est le coût computationnel de l'entraînement sur un jeu de données aussi vaste. Les modèles nécessitent des ressources importantes, utilisant souvent du matériel spécialisé comme les processeurs AWS Trainium ou les TPU de Google Cloud. La taille du jeu de données pose également des défis de stockage et d'entrée-sortie, qui sont atténués en utilisant des pipelines de chargement de données efficaces et des techniques de élagage de modèles pour réduire la taille des modèles.
Impact et orientations futures
Open Images a eu un impact significatif sur le domaine de la vision par ordinateur, permettant le développement de modèles plus précis et plus robustes. Il a été cité dans des milliers d'articles de recherche et a influencé la conception de jeux de données ultérieurs. Le jeu de données continue d'être maintenu, avec des mises à jour périodiques pour inclure de nouvelles annotations et classes. Les orientations futures pourraient inclure l'expansion du jeu de données pour intégrer des données vidéo ou des annotations plus fines, comme des masques de segmentation. Alors que le domaine de l'IA générative se développe, Open Images pourrait également être utilisé pour entraîner des modèles qui génèrent ou modifient des images, bien que de telles applications nécessitent une réflexion attentive sur les implications éthiques.
Dans l'ensemble, Open Images reste une ressource fondamentale pour la recherche en vision par ordinateur, fournissant un ensemble riche et diversifié d'images qui repousse les limites de ce que les modèles d'apprentissage automatique peuvent accomplir.