Traducido del inglés

EfficientNet es una familia de redes neuronales convolucionales (CNN) para visión por computadora introducida por Google AI en 2019, conocida por su método de escalado compuesto que escala uniformemente la profundidad, el ancho y la resolución de la red para mejorar la eficiencia y la precisión.

EfficientNet es una familia de redes neuronales convolucionales (CNN) desarrolladas para tareas de visión por computadora, publicada por primera vez por investigadores de Google AI en 2019. Su característica definitoria es el escalado compuesto, una técnica que ajusta uniformemente todas las dimensiones de una red neuronal - profundidad, anchura y resolución - utilizando un único coeficiente. Este enfoque contrasta con las prácticas convencionales que escalan solo una dimensión, como añadir capas o aumentar el tamaño de entrada. Los modelos EfficientNet han sido ampliamente adoptados en dominios como la clasificación de imágenes, la detección de objetos y la segmentación semántica, y se destacan por lograr una alta precisión con un menor coste computacional en comparación con arquitecturas anteriores.

El artículo original de EfficientNet demostró que el escalado compuesto podía superar a los modelos con dimensiones ajustadas individualmente en el punto de referencia ImageNet. Al equilibrar cuidadosamente el crecimiento en múltiples ejes, la familia logra resultados de última generación mientras mantiene las operaciones de coma flotante (FLOPs) manejables. Los modelos se basan en una arquitectura de referencia descubierta mediante la búsqueda de arquitecturas neuronales, y el método de escalado se construye sobre esta base para producir un espectro de modelos, desde compactos hasta altamente precisos.

Arquitectura y escalado compuesto

La innovación central de EfficientNet es el método de escalado compuesto. En lugar de aumentar arbitrariamente la profundidad (número de capas), la anchura (número de canales) o la resolución (tamaño de imagen de entrada) individualmente, el método escala las tres simultáneamente. Dada una red de referencia, el multiplicador de profundidad d, el multiplicador de anchura w y el multiplicador de resolución r se definen como d = α^φ, w = β^φ y r = γ^φ, donde φ es un coeficiente compuesto que controla la escala general. Estos multiplicadores están restringidos por la condición α · β² · γ² ≈ 2, lo que garantiza que aumentar φ en un factor de φ₀ crezca el coste computacional total de la red en aproximadamente 2^φ₀ veces. Los hiperparámetros α, β y γ se establecen típicamente mediante una pequeña búsqueda de cuadrícula; el artículo original sugirió valores de 1.2, 1.1 y 1.15, respectivamente.

Arquitectónicamente, la línea base EfficientNet-B0 se encontró mediante la búsqueda de arquitecturas neuronales (NAS), que identificó la convolución de cuello de botella invertida (denominada MBConv) - un bloque de construcción previamente popularizado en MobileNet - como altamente efectiva. La familia completa de EfficientNet consiste en capas MBConv apiladas, con el número exacto y los tamaños de filtro determinados por las ecuaciones de escalado compuesto. La publicación original introdujo ocho modelos, EfficientNet-B0 a EfficientNet-B7, cada uno con mayor profundidad, anchura y resolución, lo que lleva a mejoras proporcionales en la precisión en tareas como clasificación de imágenes.

Variantes y adaptaciones

Más allá de los modelos originales B0-B7, EfficientNet se ha adaptado para hardware especializado mediante una búsqueda adicional de arquitecturas neuronales. Las variaciones se han ajustado para TPU de borde, que priorizan la baja latencia y la eficiencia energética, así como para clústeres centralizados de TPU o GPU donde el rendimiento es primordial. Estas adaptaciones a menudo intercambian ligeras reducciones de precisión por ganancias significativas en la velocidad de inferencia, lo que las hace adecuadas para aplicaciones en tiempo real en sistemas embebidos y servicios en la nube.

EfficientNet V2 se publicó en junio de 2021, introduciendo varios refinamientos arquitectónicos. El diseño actualizado incorporó un conjunto más amplio de tipos de capas convolucionales descubiertos mediante una búsqueda NAS expandida, incluidos bloques MBConv fusionados. Un avance notable fue un nuevo procedimiento de entrenamiento que aumenta progresivamente el tamaño de la imagen de entrada durante el entrenamiento, junto con técnicas de regularización como dropout, RandAugment y Mixup. Los autores informaron que este enfoque mitiga la degradación de precisión comúnmente observada al usar el redimensionado progresivo, lo que lleva a un entrenamiento más rápido y un mejor rendimiento final. EfficientNet V2 también introdujo variantes como S, M y L, que se dirigen a diferentes restricciones de recursos.

Impacto y aplicaciones

EfficientNet ha influido en la investigación posterior sobre escalado de modelos y diseño de arquitecturas en el campo del aprendizaje profundo. Su principio de escalado compuesto se ha aplicado a otras arquitecturas, incluidos los transformadores, donde ha inspirado estrategias de escalado multidimensional. En la práctica, los modelos EfficientNet se utilizan comúnmente como redes troncales para sistemas de detección de objetos como You Only Look Once (YOLO) y para modelos de segmentación como U-Net, debido a sus fuertes capacidades de extracción de características y su eficiencia. También se emplean frecuentemente en pipelines de aprendizaje por transferencia, donde los pesos preentrenados en grandes conjuntos de datos como ImageNet se ajustan finamente para tareas específicas de dominio.

El énfasis de la familia de modelos en la eficiencia computacional la ha convertido en una opción popular para la implementación en dispositivos móviles y hardware de borde, complementando el trabajo de empresas como Apple y Qualcomm en la optimización de la inferencia de redes neuronales. Su disponibilidad de código abierto, típicamente bajo licencias permisivas, ha facilitado una amplia adopción tanto en el ámbito académico como en la industria, consolidando su estatus como punto de referencia para el diseño moderno de CNN.

Limitaciones y direcciones futuras

A pesar de sus fortalezas, EfficientNet tiene limitaciones. El método de escalado compuesto se basa en una aproximación aproximada de FLOPs y puede no siempre producir el equilibrio óptimo para hardware o restricciones específicas. Además, las capas MBConv originales, aunque eficientes, pueden ser menos efectivas que los mecanismos más nuevos basados en atención encontrados en los modelos transformador. La investigación ha explorado desde entonces arquitecturas híbridas que integran bloques convolucionales con atención, con el objetivo de combinar la eficiencia de las CNN con la comprensión contextual de la atención de múltiples cabezas. En los últimos años, EfficientNet sigue siendo una línea base competitiva, pero los modelos más nuevos incorporan cada vez más ideas de la búsqueda de arquitecturas neuronales y el escalado automatizado para empujar los límites de precisión y eficiencia aún más lejos.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:convolutional-neural-network·computer-vision·model-scaling·google-ai
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial