ObjectNet es un conjunto de datos de referencia introducido en 2019 para evaluar la robustez de los modelos de reconocimiento de objetos ante cambios de distribución en el mundo real. A diferencia de conjuntos de datos estándar como ImageNet, que a menudo contienen imágenes con puntos de vista canónicos y fondos limpios, ObjectNet contiene deliberadamente imágenes de objetos fotografiados en entornos cotidianos, desde ángulos inusuales, con fondos desordenados y en orientaciones rotadas. El conjunto de datos comprende 50,000 imágenes en 313 categorías de objetos, cada una recopilada específicamente para desafiar a los modelos entrenados en conjuntos de datos convencionales. Su propósito principal es medir qué tan bien un modelo generaliza más allá de las regularidades estadísticas de su distribución de entrenamiento, una propiedad crítica para implementar sistemas de inteligencia artificial en entornos no controlados.
La creación de ObjectNet fue motivada por la observación de que muchos modelos de aprendizaje profundo de última generación logran alta precisión en puntos de referencia estándar, pero fallan drásticamente cuando se prueban en imágenes que difieren de maneras aparentemente menores. El conjunto de datos fue diseñado por un equipo liderado por Andrei Barbu en el Laboratorio de Ciencias de la Computación e Inteligencia Artificial del MIT (CSAIL), con colaboradores de otras instituciones. Las imágenes fueron obtenidas mediante crowdsourcing y luego filtradas para asegurar que cumplieran criterios estrictos de clase de objeto, punto de vista, fondo y rotación. Cada imagen fue anotada con metadatos que describen la rotación del objeto, el fondo de la escena y el punto de vista de la cámara, lo que permite a los investigadores analizar modos de fallo en detalle.
Diseño y Recopilación
La construcción de ObjectNet implicó un esfuerzo de crowdsourcing a gran escala. Se pidió a los trabajadores que fotografiaran objetos en sus hogares u otros entornos naturales, siguiendo instrucciones específicas para variar el ángulo, el fondo y la rotación de cada objeto. Este proceso produjo imágenes que son genuinamente fuera de distribución en relación con los conjuntos de entrenamiento típicos, porque capturan la variabilidad natural de las escenas del mundo real. El conjunto de datos incluye 313 categorías, muchas de las cuales se superponen con las clases de ImageNet, pero las imágenes en sí son completamente nuevas y no provienen de conjuntos de datos existentes. Los metadatos de cada imagen incluyen tres atributos clave: rotación (la orientación del objeto en el plano de la imagen), fondo (el tipo de escena, como cocina, baño u oficina) y punto de vista (el ángulo de la cámara relativo al objeto). Esta anotación estructurada permite una evaluación detallada del rendimiento del modelo en diferentes tipos de cambios de distribución.
Impacto en la Evaluación de Modelos
Cuando se lanzó ObjectNet, expuso vulnerabilidades significativas en los modelos de última generación. Por ejemplo, un modelo que lograba un rendimiento casi humano en ImageNet podía ver su precisión caer más de 40 puntos porcentuales en ObjectNet. Este contraste marcado destacó que muchos modelos dependían de correlaciones espurias, como señales de fondo o poses típicas de objetos, en lugar de aprender características visuales robustas. El conjunto de datos rápidamente se convirtió en un punto de referencia estándar para la investigación en robustez, junto con otros conjuntos de datos fuera de distribución como ImageNet-C e ImageNet-A. Los investigadores utilizaron ObjectNet para evaluar técnicas como la aumentación de datos, la adaptación de dominio y los cambios arquitectónicos, lo que llevó a mejoras en la generalización de los modelos. El conjunto de datos también impulsó el interés en comprender el papel de la forma, la textura y el contexto en el reconocimiento de objetos, con estudios que muestran que los modelos a menudo priorizan la textura sobre la forma, un sesgo que las condiciones variadas de ObjectNet ayudan a exponer.
Relación con Otros Puntos de Referencia
ObjectNet ocupa un nicho único entre los puntos de referencia de visión por computadora. A diferencia de los puntos de referencia de corrupción sintética que aplican ruido o desenfoque artificial a imágenes existentes, ObjectNet consiste enteramente en fotografías naturales, lo que lo convierte en una prueba más realista del rendimiento en el mundo real. Complementa puntos de referencia como COCO y Pascal VOC, que se centran en detección y segmentación, al proporcionar un entorno controlado pero naturalista para la clasificación. El énfasis del conjunto de datos en rotación y punto de vista también lo conecta con la investigación en comprensión de objetos 3D y la interpretabilidad de redes neuronales. Debido a que el conjunto de datos es relativamente pequeño en comparación con ImageNet, a menudo se utiliza como conjunto de prueba en lugar de conjunto de entrenamiento, aunque algunos estudios han explorado el ajuste fino en una parte de él para mejorar la robustez.
Limitaciones y Críticas
A pesar de sus contribuciones, ObjectNet tiene limitaciones. Las 313 categorías del conjunto de datos son un subconjunto de la taxonomía de objetos más amplia, y faltan algunas clases comunes. La naturaleza de crowdsourcing de las imágenes significa que la distribución de fondos y puntos de vista puede no representar completamente todos los escenarios del mundo real, y hay ruido inherente en el proceso de anotación. Además, debido a que ObjectNet se recopiló en entornos domésticos, puede subrepresentar entornos industriales, exteriores o extremos. Algunos investigadores han señalado que la dificultad del conjunto de datos puede mitigarse parcialmente entrenando en conjuntos de datos más grandes y diversos, lo que sugiere que la brecha entre ObjectNet y los puntos de referencia estándar se está reduciendo a medida que mejoran los modelos. No obstante, ObjectNet sigue siendo una herramienta valiosa para probar la resistencia de los modelos y para comprender la brecha entre el rendimiento en puntos de referencia y la fiabilidad en el mundo real.
Legado y Uso Continuo
ObjectNet se ha convertido en un punto de referencia en el esfuerzo continuo por construir sistemas de visión robustos. Se cita con frecuencia en artículos sobre generalización de dominio, robustez adversarial y aprendizaje autosupervisado. Los metadatos del conjunto de datos también han permitido estudios sobre el efecto de factores específicos, como la rotación o el fondo, en el rendimiento del modelo, proporcionando información que informa el diseño de arquitecturas más resilientes. A mediados de la década de 2020, ObjectNet continúa utilizándose en la investigación académica y por equipos de la industria que desarrollan productos de visión por computadora, particularmente en áreas como conducción autónoma, robótica y realidad aumentada, donde encontrar puntos de vista novedosos y escenas desordenadas es común. Su creación destacó la importancia de evaluar modelos más allá de su distribución de entrenamiento y contribuyó a un cambio más amplio en la comunidad de aprendizaje automático hacia la robustez y la generalización fuera de distribución como preocupaciones de primera clase.