Traducido del inglés

MobileNet es una familia de arquitecturas de redes neuronales convolucionales diseñadas para la inferencia eficiente en dispositivos móviles y sistemas integrados, equilibrando la precisión con un bajo costo computacional.

MobileNet es una familia de arquitecturas de red neuronal convolucional (CNN) desarrolladas para la clasificación de imágenes, la detección de objetos y otras tareas de visión por computadora. Los modelos están diseñados para tener un tamaño pequeño, baja latencia y bajo consumo de energía, lo que los hace adecuados para la inferencia en el dispositivo y la computación en el borde en dispositivos con recursos limitados, como teléfonos móviles y sistemas embebidos. Originalmente, fueron diseñados para ejecutarse de manera eficiente en dispositivos móviles utilizando TensorFlow Lite, un runtime ligero para modelos de aprendizaje automático.

La necesidad de modelos de aprendizaje profundo eficientes en dispositivos móviles llevó a los investigadores de Google a desarrollar MobileNet. A partir de junio de 2025, la familia incluye cinco versiones principales, cada una construida sobre su predecesora para mejorar el rendimiento y la eficiencia, manteniendo al mismo tiempo la idoneidad para entornos con restricciones.

Principios de Arquitectura

Las arquitecturas MobileNet se centran en reducir el costo computacional mediante varias técnicas clave. La innovación central es el uso de convoluciones separables en profundidad, que descomponen una convolución estándar en dos operaciones separadas: una convolución en profundidad que filtra cada canal de entrada de forma independiente, y una convolución puntual (una convolución de 1×1) que combina las salidas. Esta factorización reduce significativamente el número de parámetros y operaciones de punto flotante en comparación con las convoluciones estándar, lo que permite una inferencia eficiente en dispositivos con capacidad de procesamiento limitada.

Otra estrategia significativa es la introducción de hiperparámetros que controlan el tamaño del modelo y la carga computacional. El multiplicador de ancho (denotado como α) ajusta el número de canales en cada capa; valores más pequeños de α producen modelos más pequeños y rápidos a costa de la precisión. El multiplicador de resolución (ρ) ajusta la resolución de la imagen de entrada, con resoluciones más bajas que aceleran el procesamiento pero potencialmente reducen la precisión.

La arquitectura también incorpora técnicas como la normalización por lotes y el aumento de datos para mejorar la estabilidad del entrenamiento y la generalización. Estas decisiones de diseño han hecho de MobileNet una opción popular para aplicaciones en tiempo real en contextos móviles y embebidos.

MobileNetV1

MobileNetV1 se publicó en abril de 2017. Su principal innovación arquitectónica fue la incorporación de convoluciones separables en profundidad, un concepto introducido por primera vez por Laurent Sifre durante una pasantía en Google Brain en 2013 como una variación de AlexNet destinada a mejorar la velocidad de convergencia y reducir el tamaño del modelo. La convolución separable en profundidad descompone cada convolución estándar en un filtro en profundidad (que opera por canal) y una combinación puntual (convolución de 1×1) que fusiona las salidas de la capa en profundidad.

Los valores predeterminados para MobileNetV1 incluían un multiplicador de ancho de 1.0 y un multiplicador de resolución de 224x224. Sin embargo, al ajustar estos multiplicadores, los desarrolladores podían equilibrar entre el factor de forma y la precisión. La arquitectura también utilizaba activaciones ReLU después de cada convolución y aplicaba normalización por lotes para acelerar el entrenamiento.

MobileNetV2

MobileNetV2, publicado en marzo de 2019, introdujo dos refinamientos importantes: capas residuales invertidas y cuellos de botella lineales. Las residuales invertidas invierten la estructura de los bloques residuales tradicionales al primero expandir los canales de entrada, luego realizar la convolución en profundidad y finalmente proyectar de vuelta a un número menor de canales. Esta expansión permite que la convolución en profundidad opere en un espacio de mayor dimensión, preservando más flujo de información.

Los cuellos de botella lineales eliminan la activación ReLU de las capas de proyección, basándose en la intuición de que las no linealidades en espacios de baja dimensión causan pérdida de información. Al mantener estas capas lineales, el modelo conserva más poder expresivo incluso cuando los números de canales son pequeños. Estas mejoras produjeron una mayor precisión y menor latencia que V1, haciendo de V2 una opción común para tareas de visión móvil.

MobileNetV3 y V4

MobileNetV3, lanzado en 2019, introdujo tres variantes: MobileNetV3-Large, MobileNetV3-Small y MobileNetEdgeTPU, esta última optimizada para los teléfonos inteligentes Pixel 4. Estos modelos se descubrieron mediante búsqueda de arquitectura neuronal (NAS) que medía directamente la latencia móvil, logrando un equilibrio deseado entre precisión y velocidad de inferencia. V3 también incluía aproximaciones lineales por tramos de las activaciones swish y sigmoide (h-swish y h-sigmoid), módulos de squeeze-and-excitation, y heredó la estructura de cuello de botella invertido de V2.

MobileNetV4, publicado en septiembre de 2024, expandió la familia con numerosas arquitecturas también encontradas por NAS. V4 introdujo la atención de consultas múltiples, inspirada en los transformadores de visión, y propuso un nuevo bloque post-mezcla llamado cuello de botella invertido universal, que unifica los conceptos de residual invertido y cuello de botella invertido de versiones anteriores.

MobileNetV5 y Direcciones Futuras

La arquitectura de MobileNetV5 se anunció poco después del lanzamiento de Gemma 3n (un modelo de lenguaje) en junio de 2025. Aunque el anuncio mencionaba que se publicaría pronto un informe técnico, a partir de octubre de 2025, no se había puesto a disposición dicho informe. Se informa que la red V5 es aproximadamente diez veces más grande que la variante V4 más grande, lo que sugiere un cambio hacia modelos de mayor capacidad mientras se mantiene una eficiencia alcanzable para el despliegue móvil.

A lo largo de su desarrollo, MobileNet ha influido en muchas arquitecturas y sigue siendo una piedra angular para los sistemas de visión embebidos, permitiendo aplicaciones prácticas en campos como la conducción autónoma, la robótica y la fotografía móvil.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:convolutional-neural-networks·computer-vision·deep-learning·google
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial