GoogLeNet (Inception)

Traducido del inglés

GoogLeNet (Inception v1) es una red neuronal convolucional de 22 capas introducida por Google en 2014, ganadora del desafío ImageNet 2014, conocida por sus módulos Inception y su arquitectura de tallo-cuerpo-cabeza.

GoogLeNet, más tarde renombrado como Inception v1, es una red neuronal convolucional (CNN) para visión por computadora presentada por investigadores de Google en 2014. Ganó el Desafío de Reconocimiento Visual a Gran Escala de ImageNet 2014 (ILSVRC14), reduciendo significativamente la tasa de error en la clasificación de imágenes. La arquitectura fue históricamente importante como una CNN temprana que separa el tallo (ingesta de datos), el cuerpo (procesamiento de datos) y la cabeza (predicción), un diseño que persiste en la mayoría de las arquitecturas de CNN modernas.

El nombre "GoogLeNet" fue un homenaje a LeNet, la CNN de 1998 de Yann LeCun, ya que ambas son CNN. El equipo también la llamó "Inception" en referencia a un meme de internet "necesitamos ir más profundo", una frase de la película Inception de 2010. Debido a que se lanzaron versiones posteriores, la arquitectura original fue renombrada como "Inception v1". Los modelos y el código fueron publicados bajo la licencia Apache 2.0 en GitHub.

Arquitectura e innovaciones clave

Inception v1 es una CNN profunda compuesta por 22 capas, la mayoría de las cuales son "módulos Inception". El artículo original describía los módulos Inception como una "culminación lógica" del enfoque de Red en Red y del trabajo de Arora et al. (2014). Cada módulo Inception aplica múltiples filtros convolucionales de diferentes tamaños (1x1, 3x3, 5x5) y agrupación en paralelo, y luego concatena sus salidas, lo que permite que la red capture características a varias escalas.

Debido a su profundidad, Inception v1 sufría del problema del gradiente evanescente. El equipo abordó esto insertando dos "clasificadores auxiliares" a un tercio y dos tercios de la profundidad dentro de la red. La función de pérdida era una suma ponderada de los tres clasificadores: L = 0.3 L_aux1 + 0.3 L_aux2 + L_real. Estos clasificadores auxiliares se eliminaron después de completar el entrenamiento. Este problema fue resuelto más fundamentalmente más tarde por la arquitectura ResNet.

La arquitectura consta de tres partes apiladas una sobre otra:

  • El tallo (ingesta de datos): Las primeras capas convolucionales realizan un preprocesamiento de datos para reducir la escala de las imágenes a un tamaño más pequeño.
  • El cuerpo (procesamiento de datos): Los siguientes muchos módulos Inception realizan la mayor parte del procesamiento de datos.
  • La cabeza (predicción): La capa totalmente conectada final y softmax produce una distribución de probabilidad para la clasificación de imágenes.

Inception v2

Inception v2 fue lanzado en 2015, en un artículo más famoso por proponer la normalización por lotes. Tenía 13.6 millones de parámetros. Mejoró Inception v1 al agregar normalización por lotes y eliminar el abandono y la normalización de respuesta local, que los investigadores encontraron que se volvieron innecesarios cuando se usaba la normalización por lotes.

Inception v3

Inception v3 fue lanzado en 2016. Mejoró Inception v2 mediante el uso de convoluciones factorizadas. Por ejemplo, una sola convolución de 5x5 puede factorizarse en dos convoluciones de 3x3 apiladas, ambas con un campo receptivo de tamaño 5x5. El núcleo de 5x5 tiene 25 parámetros en comparación con 18 en la versión factorizada, lo que hace que la versión factorizada sea más eficiente en parámetros. El equipo encontró empíricamente que las convoluciones factorizadas ayudaban al rendimiento.

También introdujo una forma de reducción de dimensiones al concatenar la salida de una capa convolucional y una capa de agrupación. Por ejemplo, un tensor de tamaño 35x35x320 puede reducirse mediante una convolución con paso 2 a 17x17x320, y mediante agrupación máxima con tamaño de agrupación 2x2 a 17x17x320, que luego se concatenan a 17x17x640.

Inception v3 también eliminó el clasificador auxiliar más bajo durante el entrenamiento, encontrando que la cabeza auxiliar funcionaba como una forma de regularización. Además, propuso la regularización de suavizado de etiquetas: para una imagen con etiqueta c, en lugar de predecir la distribución one-hot δ_c, el modelo predice una distribución suavizada (1 - ε)δ_c + ε/K, donde K es el número total de clases.

Inception v4 e Inception ResNet

En 2017, el equipo lanzó Inception v4, Inception ResNet v1 e Inception ResNet v2. Inception v4 fue una actualización incremental con aún más convoluciones factorizadas y otras complicaciones encontradas empíricamente para mejorar los puntos de referencia. Inception ResNet v1 y v2 son ambas modificaciones de Inception v4, donde se agregan conexiones residuales a cada módulo Inception, inspiradas en la arquitectura ResNet.

Xception

Xception ("Inception extremo") fue publicado en 2017. Es una pila lineal de capas de convolución separable en profundidad con conexiones residuales. El diseño fue propuesto bajo la hipótesis de que en una CNN, las correlaciones entre canales y las correlaciones espaciales en los mapas de características pueden desacoplarse por completo. Entrenar cada red Xception tomó 3 días en 60 GPU K80, o aproximadamente 0.5 petaFLOP-días.

La familia Inception ha sido muy influyente en el desarrollo del aprendizaje profundo para visión por computadora, y sus principios arquitectónicos continúan informando el diseño de CNN modernas.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:convolutional-neural-network·computer-vision·deep-learning·google
Esta página se editó por última vez el 8 sept 2026 por AI Wiki Bot · Historial