Open Images es un conjunto de datos a gran escala diseñado para avanzar en la investigación en visión por computador y aprendizaje automático. Proporciona una vasta colección de imágenes anotadas con un rico conjunto de etiquetas, cajas delimitadoras de objetos e información sobre relaciones visuales. El conjunto de datos se utiliza ampliamente para entrenar y evaluar modelos en tareas como la detección de objetos, la clasificación de imágenes y la comprensión de relaciones visuales. Su escala y diversidad lo convierten en un recurso fundamental en el campo de la inteligencia artificial y el aprendizaje profundo.
Open Images fue introducido por Google en 2016 y ha pasado por varias versiones principales. El conjunto de datos es notable por su tamaño, ya que contiene más de 9 millones de imágenes en su versión completa, con anotaciones que cubren miles de clases de objetos. Las anotaciones se derivan de una combinación de métodos automatizados y verificación humana, lo que garantiza un equilibrio entre escala y calidad. El conjunto de datos incluye una partición de entrenamiento, una de validación y una de prueba, lo que permite una evaluación comparativa estandarizada de los modelos.
Estructura del conjunto de datos y anotaciones
El conjunto de datos Open Images proporciona múltiples tipos de anotaciones. La anotación principal son las etiquetas a nivel de imagen, donde cada imagen se asocia con un conjunto de etiquetas de clase que indican la presencia de ciertos objetos o conceptos. Además, el conjunto de datos incluye cajas delimitadoras para objetos, que son rectángulos alineados con los ejes que localizan instancias de objetos dentro de una imagen. Estas cajas delimitadoras se proporcionan para un subconjunto de las imágenes, lo que permite tareas como la detección de objetos. Además, el conjunto de datos incluye anotaciones de relaciones visuales, que describen relaciones por pares entre objetos, como "perro sobre patineta" o "persona sosteniendo un paraguas". Estas relaciones se estructuran como tripletas sujeto-predicado-objeto, lo que facilita la investigación en la comprensión de escenas.
Las anotaciones se organizan en una taxonomía jerárquica de clases, lo que permite una categorización de gruesa a fina. El conjunto de datos también incluye un conjunto de etiquetas "negativas", que indican que una clase particular está ausente de una imagen, lo cual es útil para entrenar clasificadores con ejemplos negativos. Las cajas delimitadoras se proporcionan en un formato normalizado, con coordenadas relativas a las dimensiones de la imagen, lo que facilita su uso con marcos de aprendizaje profundo estándar.
Versiones y evolución
Open Images se ha lanzado en varias versiones. El lanzamiento inicial en 2016 incluía alrededor de 9 millones de imágenes con etiquetas a nivel de imagen. Una versión posterior, Open Images v4, amplió el conjunto de datos para incluir 30 millones de etiquetas a nivel de imagen en 19,957 clases, y añadió 1.74 millones de cajas delimitadoras para 600 clases. La versión principal más reciente, Open Images v6, aumentó aún más el número de cajas delimitadoras a más de 12 millones para 600 clases, y añadió anotaciones de relaciones visuales. Cada versión ha estado acompañada de un artículo detallado que describe la construcción del conjunto de datos y sus estadísticas.
El conjunto de datos se ha curado con un enfoque en la diversidad, incluyendo imágenes de diversas fuentes y dominios. Las imágenes provienen de Flickr, bajo una licencia Creative Commons, lo que garantiza su uso legal para fines de investigación. El proceso de anotación involucró una combinación de modelos de aprendizaje automático y anotadores humanos, con un mecanismo de control de calidad para asegurar la precisión.
Uso en investigación e industria
Open Images se ha convertido en un estándar de referencia en visión por computador. Se utiliza frecuentemente para entrenar modelos de detección de objetos, como los basados en arquitecturas de red residual, y para evaluar su rendimiento. La gran escala del conjunto de datos y sus diversas anotaciones lo hacen adecuado para entrenar modelos con millones de parámetros, aprovechando técnicas como la normalización por lotes y la aumento de datos. Los investigadores han utilizado Open Images para desarrollar modelos que se generalizan bien a otros conjuntos de datos, como COCO, debido a la variedad de objetos y escenas.
En la industria, Open Images es utilizado por empresas para construir sistemas de visión para aplicaciones como la conducción autónoma, la robótica y la moderación de contenido. Por ejemplo, Waymo y Tesla han desarrollado sistemas de percepción que se benefician de conjuntos de datos a gran escala, aunque a menudo también utilizan datos propietarios. El conjunto de datos también se utiliza en la investigación académica en instituciones como Stanford AI Lab y MIT CSAIL para explorar nuevos métodos en aprendizaje automático.
Desafíos y limitaciones
A pesar de su escala, Open Images tiene ciertas limitaciones. Las anotaciones no son exhaustivas; muchos objetos en las imágenes pueden no estar etiquetados, lo que puede llevar a falsos negativos durante el entrenamiento. Las cajas delimitadoras se proporcionan solo para un subconjunto de clases, y las anotaciones de relaciones visuales son escasas. Además, el conjunto de datos está sesgado hacia objetos y escenas comúnmente encontrados en Flickr, lo que puede no representar todas las distribuciones del mundo real. Los investigadores a menudo necesitan combinar Open Images con otros conjuntos de datos o utilizar técnicas como el aprendizaje curricular para abordar estos problemas.
Otro desafío es el costo computacional de entrenar en un conjunto de datos tan grande. Los modelos requieren recursos significativos, a menudo utilizando hardware especializado como AWS Trainium o TPUs de Google Cloud. El tamaño del conjunto de datos también plantea desafíos de almacenamiento y E/S, que se mitigan mediante el uso de canalizaciones eficientes de carga de datos y técnicas de poda de modelos para reducir el tamaño del modelo.
Impacto y direcciones futuras
Open Images ha tenido un impacto significativo en el campo de la visión por computador, permitiendo el desarrollo de modelos más precisos y robustos. Ha sido citado en miles de artículos de investigación y ha influido en el diseño de conjuntos de datos posteriores. El conjunto de datos continúa siendo mantenido, con actualizaciones periódicas para incluir nuevas anotaciones y clases. Las direcciones futuras pueden incluir la expansión del conjunto de datos para incluir datos de video o anotaciones más detalladas, como máscaras de segmentación. A medida que el campo de la IA generativa crece, Open Images también puede utilizarse para entrenar modelos que generen o editen imágenes, aunque tales aplicaciones requieren una consideración cuidadosa de las implicaciones éticas.
En general, Open Images sigue siendo un recurso fundamental para la investigación en visión por computador, proporcionando un conjunto rico y diverso de imágenes que empujan los límites de lo que los modelos de aprendizaje automático pueden lograr.