Traducido del inglés

EfficientDet es una familia de modelos de detección de objetos introducida por Google en 2019, que utiliza escalado compuesto para equilibrar la profundidad, el ancho y la resolución de la red, logrando una eficiencia y precisión de vanguardia.

EfficientDet es una familia de modelos de detección de objetos desarrollada por investigadores de Google e introducida en 2019. Los modelos están diseñados para lograr una alta precisión mientras minimizan el costo computacional, lo que los hace adecuados para su implementación en entornos con recursos limitados, como dispositivos móviles y plataformas de computación en el borde. La innovación central de EfficientDet es la aplicación del escalado compuesto, una técnica que ajusta simultáneamente la profundidad, el ancho y la resolución de entrada de una red neuronal para optimizar el rendimiento en una variedad de presupuestos de recursos.

La arquitectura de EfficientDet se basa en el éxito de trabajos anteriores en clasificación de imágenes eficiente, particularmente la familia de modelos EfficientNet, que demostró que un escalado cuidadoso de las dimensiones de la red puede generar mejoras significativas en eficiencia. EfficientDet extiende este principio a la detección de objetos, una tarea que requiere no solo clasificar objetos dentro de una imagen, sino también localizarlos con cajas delimitadoras. La arquitectura incorpora una red de pirámide de características (FPN) mejorada con conexiones bidireccionales entre escalas y un mecanismo de fusión de características ponderado, lo que permite al modelo combinar eficazmente información de diferentes escalas.

Arquitectura y diseño

La columna vertebral de EfficientDet es un modelo EfficientNet preentrenado, que sirve como extractor de características. La columna vertebral procesa la imagen de entrada y produce un conjunto de mapas de características en múltiples resoluciones. Estos mapas de características se alimentan luego a una red de pirámide de características bidireccional (BiFPN), que fusiona iterativamente características de diferentes niveles. A diferencia de las FPN tradicionales que usan suma simple, BiFPN aplica pesos aprendidos a cada característica de entrada, lo que permite a la red enfatizar escalas más informativas.

La cabeza del modelo EfficientDet realiza la clasificación y la regresión de cajas delimitadoras simultáneamente. Utiliza una cabeza convolucional compartida para todos los niveles de características, lo que reduce el número de parámetros y mejora la eficiencia. El diseño también incluye un método de escalado compuesto que escala uniformemente la profundidad de la columna vertebral, la profundidad y el ancho de la BiFPN, y la resolución de entrada, lo que permite adaptar una sola arquitectura a diferentes compensaciones entre precisión y velocidad.

Escalado compuesto

El escalado compuesto es el principio clave detrás de la eficiencia de EfficientDet. El método, introducido por primera vez en EfficientNet, utiliza un conjunto de coeficientes de escalado para controlar la profundidad, el ancho y la resolución de la red. Para EfficientDet, los coeficientes de escalado se determinan mediante una búsqueda en cuadrícula sobre un conjunto de validación, con el objetivo de maximizar la precisión bajo un presupuesto computacional dado (medido en FLOPs).

Este enfoque contrasta con los modelos de detección de objetos anteriores, que a menudo requerían un ajuste manual de la arquitectura para cada plataforma objetivo. Al automatizar el proceso de escalado, EfficientDet puede generar una familia de modelos, desde EfficientDet-D0 (el más pequeño) hasta EfficientDet-D7 (el más grande), cada uno ofreciendo un equilibrio diferente entre velocidad y precisión. Por ejemplo, EfficientDet-D0 logra una precisión media promedio (mAP) de 34.6 en el conjunto de datos COCO mientras requiere solo 2.5 mil millones de FLOPs, mientras que EfficientDet-D7 alcanza 55.1 mAP con 77 mil millones de FLOPs.

Rendimiento y comparaciones

EfficientDet estableció nuevos estándares de eficiencia en la detección de objetos en el momento de su lanzamiento. En el conjunto de datos COCO, los modelos lograron una mayor precisión que los detectores de última generación anteriores, como YOLOv3 y Faster R-CNN, mientras usaban menos FLOPs y parámetros. Por ejemplo, EfficientDet-D2 logró 43.0 mAP con 11 mil millones de FLOPs, superando los 33.0 mAP de YOLOv3 con 65 mil millones de FLOPs.

Las ganancias en eficiencia fueron particularmente notables en dispositivos de borde. Las variantes más pequeñas, como EfficientDet-D0 y D1, fueron diseñadas para ejecutarse en tiempo real en CPU y GPU móviles, lo que las hace atractivas para aplicaciones como conducción autónoma, vigilancia y realidad aumentada. Los modelos también demostraron fuertes capacidades de aprendizaje por transferencia, funcionando bien en otros conjuntos de datos de detección con un ajuste fino mínimo.

Aplicaciones e impacto

La introducción de EfficientDet influyó en la investigación posterior en detección de objetos eficiente y visión por computadora. Sus principios de diseño, particularmente el uso de fusión de características bidireccional ponderada y escalado compuesto, fueron adoptados y extendidos en modelos posteriores. EfficientDet ha sido ampliamente utilizado en la industria para tareas como detección de defectos en manufactura, análisis de imágenes médicas y análisis minorista.

La eficiencia del modelo también lo hizo una opción popular para su implementación en dispositivos basados en ARM y otro hardware de bajo consumo. Su implementación de código abierto, publicada bajo la licencia Apache 2.0, facilitó su adopción tanto por investigadores académicos como por profesionales de la industria. EfficientDet sigue siendo una línea base relevante para comparar nuevas arquitecturas de detección de objetos, especialmente aquellas orientadas a la eficiencia.

Limitaciones y direcciones futuras

Aunque EfficientDet logró mejoras significativas en eficiencia, tiene limitaciones. El método de escalado compuesto asume una arquitectura fija y puede no ser óptimo para todas las tareas o hardware. Además, los modelos fueron diseñados principalmente para la detección de objetos en 2D y no abordan directamente otras tareas como la segmentación de instancias o la detección 3D, aunque la columna vertebral puede adaptarse para tales fines.

Trabajos posteriores han explorado la búsqueda de arquitecturas neuronales y el aprendizaje automático automatizado para optimizar aún más los modelos de detección. El auge de los detectores basados en transformers, como DETR y sus variantes, también ha desplazado el enfoque hacia enfoques de extremo a extremo que simplifican el flujo de trabajo de detección. No obstante, las contribuciones de EfficientDet al diseño de modelos eficientes continúan informando la investigación moderna en aprendizaje profundo.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:object-detection·deep-learning·computer-vision·google
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial