Traducido del inglés

CutMix es una técnica de aumento de datos que recorta parches de una imagen de entrenamiento y los pega sobre otra, combinando las etiquetas proporcionalmente al área del parche. Mejora la robustez del modelo y la localización en tareas de visión por computadora.

CutMix es una técnica de aumento de datos para entrenar redes neuronales en tareas de clasificación de imágenes. Combina el recorte y pegado de parches de imagen con la estrategia de mezcla de etiquetas introducida por mixup. En cada iteración de entrenamiento, se recorta un parche rectangular de una imagen de entrenamiento y se pega sobre una segunda imagen, y la etiqueta de entrenamiento se ajusta para ser una combinación ponderada de las dos etiquetas originales, con el peso proporcional al área del parche pegado. Este enfoque anima a los modelos a centrarse en el objeto completo en lugar de depender de correlaciones espurias o características parciales, y se ha demostrado que mejora la precisión de clasificación, la robustez ante corrupción y el rendimiento de localización.

El método fue introducido en un artículo de 2019 por Sangdoo Yun, Dongyoon Han, Seong Joon Oh, Sanghyuk Chun, Junsuk Choe y Youngjoon Yoo, afiliados a Clova AI y NAVER Corporation. El artículo, titulado "CutMix: Regularization Strategy to Train Strong Classifiers with Localizable Features", fue presentado en la Conferencia Internacional de Visión por Computador (ICCV) de 2019 del IEEE/CVF. Desde su introducción, CutMix se ha convertido en un componente estándar en los pipelines de entrenamiento de muchos modelos de visión de última generación, a menudo utilizado junto con otras técnicas de aumento.

Mecanismo

La operación CutMix funciona de la siguiente manera. Dadas dos muestras de entrenamiento \(x_A\) y \(x_B\) con etiquetas one-hot \(y_A\) y \(y_B\), el algoritmo primero muestrea una máscara binaria \(M\) que indica qué píxeles tomar de cada imagen. La máscara se genera seleccionando coordenadas de caja delimitadora \((r_x, r_y, r_w, r_h)\) uniformemente al azar, con la relación de área de la caja \(\lambda\) muestreada de una distribución Beta, típicamente con parámetro \(\alpha = 1\). La nueva muestra de entrenamiento se forma tomando la región fuera de la caja de la imagen A y la región dentro de la caja de la imagen B. La etiqueta para la muestra combinada se calcula como \(\tilde{y} = \lambda y_A + (1 - \lambda) y_B\), donde \(\lambda\) es la fracción de píxeles retenidos de la imagen A.

Este proceso se aplica sobre la marcha durante el entrenamiento, lo que significa que cada mini-lote se aumenta aleatoriamente. La máscara se genera de forma independiente para cada muestra en el lote, lo que lleva a un conjunto diverso de imágenes mezcladas. La posición y el tamaño del recorte son uniformemente aleatorios, lo que asegura que el modelo vea una amplia variedad de oclusiones y combinaciones parciales.

Relación con otros aumentos

CutMix se basa en estrategias de aumento anteriores. El predecesor más directo es mixup, introducido por Hongyi Zhang, Moustapha Cisse, Yann N. Dauphin y David Lopez-Paz en 2018, que mezcla imágenes completas tomando una combinación convexa de valores de píxeles y etiquetas. Mixup fomenta un comportamiento lineal entre muestras de entrenamiento, pero puede producir imágenes poco naturales que son difíciles de interpretar para los humanos. CutMix, en contraste, mantiene la apariencia natural de las imágenes dentro de cada región, haciendo que las muestras aumentadas sean más coherentes semánticamente.

Otra técnica relacionada es Cutout, propuesta por Terrance DeVries y Graham W. Taylor en 2017, que enmascara aleatoriamente regiones rectangulares de una imagen, estableciéndolas a cero. Cutout actúa como una forma de dropout a nivel de píxel, forzando al modelo a depender de características menos prominentes. CutMix puede verse como una generalización que reemplaza las regiones rellenas con ceros por parches de otra imagen, proporcionando una señal supervisora adicional a través de la etiqueta mezclada.

Los autores de CutMix demostraron empíricamente que supera tanto a mixup como a Cutout en varios conjuntos de datos de referencia, incluyendo CIFAR-10, CIFAR-100 e ImageNet. También mostraron que CutMix mejora la capacidad del modelo para localizar objetos, medida por la métrica del juego de señalar, porque el modelo debe atender al objeto completo para clasificar correctamente la imagen mezclada.

Detalles de implementación

En la práctica, CutMix se implementa como una transformación simple que puede añadirse a cualquier bucle de entrenamiento de clasificación de imágenes. Para cada par de imágenes en un lote, el algoritmo:

  1. Muestrea una distribución Beta para obtener la relación de mezcla \(\lambda\).
  2. Calcula las coordenadas de la caja delimitadora basándose en \(\lambda\).
  3. Crea la imagen combinada copiando el parche de la imagen B dentro de la imagen A.
  4. Calcula la etiqueta mezclada como una suma ponderada.

La sobrecarga computacional es mínima, ya que la operación implica solo división y asignación de matrices. Esto hace que CutMix sea fácil de integrar en marcos existentes como PyTorch o TensorFlow. Existen muchas implementaciones de código abierto, y la técnica a menudo se combina con otros aumentos como recorte aleatorio, volteo y jitter de color.

Una consideración práctica es que el parámetro \(\alpha\) de la distribución Beta controla la fuerza del aumento. Con \(\alpha = 1\), la distribución es uniforme, lo que significa que todas las relaciones de mezcla son igualmente probables. Valores más pequeños de \(\alpha\) (por ejemplo, 0.2) producen mezclas más extremas donde una imagen domina, mientras que valores más grandes producen mezclas más equilibradas. El artículo original encontró que \(\alpha = 1\) funciona bien en todos los conjuntos de datos, pero algunos trabajos posteriores han ajustado este parámetro para tareas específicas.

Aplicaciones y extensiones

CutMix se ha aplicado más allá de la clasificación de imágenes. Se ha utilizado en detección de objetos, segmentación semántica e incluso en el entrenamiento de transformers para tareas de visión. La idea de mezclar parches se ha extendido a otras modalidades, como audio y texto, aunque con adaptaciones a la naturaleza discreta de esos datos.

Se han propuesto varias variantes. Por ejemplo, Puzzle Mix, introducido en 2020, utiliza una optimización más sofisticada para encontrar máscaras de mezcla que preserven los límites de los objetos y eviten cortar partes salientes. Otra variante, FMix, utiliza máscaras en el dominio de Fourier para crear patrones de mezcla irregulares. Co-Mixup, propuesto en 2021, extiende la idea a múltiples imágenes y fomenta la diversidad entre las muestras mezcladas.

En el contexto de Data Augmentation, CutMix a menudo se utiliza en combinación con otras técnicas como Dropout y Batch Normalization. Se ha demostrado que es particularmente efectivo al entrenar modelos grandes con datos limitados, ya que proporciona una forma de regularización que reduce el sobreajuste.

Impacto en la robustez del modelo

Uno de los beneficios clave de CutMix es la mejora de la robustez ante corrupción de entrada y perturbaciones adversariales. Al entrenar con imágenes que contienen parches de otras clases, el modelo aprende a depender de un conjunto más amplio de características. Esto reduce la tendencia a sobreajustarse a señales de fondo o patrones de textura que pueden no estar presentes en escenarios del mundo real.

Los estudios han mostrado que los modelos entrenados con CutMix logran mayor precisión en versiones corruptas de ImageNet, como ImageNet-C, en comparación con modelos entrenados con aumento estándar o mixup solo. La técnica también mejora la calibración, lo que significa que las probabilidades predichas por el modelo están más alineadas con la precisión real.

Además, se ha demostrado que CutMix mejora el rendimiento de los modelos en tareas de clasificación de grano fino, donde las diferencias sutiles entre clases son importantes. Las imágenes mezcladas fuerzan al modelo a atender a partes discriminativas en lugar de depender de estadísticas globales.

Adopción en la industria

CutMix ha sido ampliamente adoptado tanto en la investigación académica como en la industria. Está incluido en bibliotecas y marcos populares de aprendizaje profundo, como la biblioteca timm para modelos de imagen y la biblioteca de carga de datos NVIDIA DALI. Muchos modelos de última generación en el desafío ImageNet y otras competiciones han utilizado CutMix como parte de su receta de entrenamiento.

Empresas como Google DeepMind, OpenAI y Anthropic han incorporado CutMix en sus pipelines de visión por computador, aunque los detalles específicos a menudo son propietarios. La técnica también se utiliza en imágenes médicas, donde los datos son escasos y el aumento es crítico. Por ejemplo, CutMix se ha aplicado a la clasificación de radiografías de tórax y al análisis de imágenes de histopatología, mostrando una mejor generalización.

Limitaciones y consideraciones

A pesar de su efectividad, CutMix tiene algunas limitaciones. El recorte y pegado aleatorio puede a veces crear imágenes poco realistas, especialmente cuando el parche se coloca en una ubicación semánticamente inconsistente. Por ejemplo, pegar un parche de un coche sobre una imagen de un pájaro podría confundir al modelo si el parche cubre una parte crítica del pájaro. Sin embargo, la etiqueta mezclada mitiga esto al proporcionar un objetivo suave.

Otra consideración es que CutMix asume que la entrada es una cuadrícula de píxeles, lo que no es directamente aplicable a otros tipos de datos como grafos o nubes de puntos. Se han propuesto extensiones para estas modalidades, pero requieren estrategias de enmascaramiento más complejas.

Finalmente, la elección del parámetro de la distribución Beta puede afectar el rendimiento. Aunque \(\alpha = 1\) es un buen valor predeterminado, algunas tareas pueden beneficiarse de un ajuste. El artículo original proporciona orientación sobre esto, pero sigue siendo una elección empírica.

Conclusión

CutMix es una técnica de aumento de datos simple pero poderosa que se ha convertido en un elemento básico en la visión por computador moderna. Al combinar las fortalezas de mixup y Cutout, proporciona una manera de regularizar modelos y mejorar su robustez y habilidades de localización. Su facilidad de implementación y ganancias consistentes en benchmarks lo han convertido en una opción predeterminada para muchos profesionales. A medida que la investigación continúa, es probable que las variantes y extensiones de CutMix sigan siendo relevantes, especialmente en dominios con datos limitados o condiciones desafiantes.

Referencias

  • Yun, S., Han, D., Oh, S. J., Chun, S., Choe, J., & Yoo, Y. (2019). CutMix: Regularization Strategy to Train Strong Classifiers with Localizable Features. ICCV.
  • Zhang, H., Cisse, M., Dauphin, Y. N., & Lopez-Paz, D. (2018). mixup: Beyond Empirical Risk Minimization. ICLR.
  • DeVries, T., & Taylor, G. W. (2017). Improved Regularization of Convolutional Neural Networks with Cutout. arXiv.
  • Kim, J.-H., Choo, W., & Song, H. O. (2020). Puzzle Mix: Exploiting Saliency and Local Statistics for Optimal Mixup. ICML.
  • Harris, E., Marcu, A., Painter, M., Niranjan, M., Prügel-Bennett, A., & Hare, J. (2020). FMix: Enhancing Mixed Sample Data Augmentation. arXiv.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:data-augmentation·computer-vision·deep-learning·regularization
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial