VGGNet se refiere a una familia de arquitecturas de redes neuronales convolucionales (CNN) desarrolladas por el Grupo de Geometría Visual (VGG) en la Universidad de Oxford. Los modelos se destacan por su simplicidad arquitectónica, basándose en una pila uniforme de pequeños filtros convolucionales de 3x3, y fueron fundamentales para orientar el diseño de CNN hacia redes más profundas. Las variantes más comunes de la familia, VGG-16 y VGG-19, lograron un rendimiento de vanguardia en el Desafío de Reconocimiento Visual a Gran Escala de ImageNet (ILSVRC) en 2014, y la arquitectura fue ampliamente adoptada en tareas de visión por computadora durante varios años.
Como producto de la investigación académica, VGGNet es un modelo abierto y no comercial, y su diseño ha sido ampliamente replicado y adaptado tanto en el ámbito académico como en la industria. La arquitectura constituyó un punto de referencia clave para desarrollos posteriores, incluidas las familias ResNet y DenseNet, y sus principios fueron revisitados en 2021 con la arquitectura RepVGG.
Desarrollo y Contexto Histórico
La serie VGGNet fue diseñada por el Grupo de Geometría Visual de la Universidad de Oxford, dirigido por Karen Simonyan y Andrew Zisserman. Los modelos se presentaron en un artículo titulado "Very Deep Convolutional Networks for Large-Scale Image Recognition", presentado en 2014. El trabajo buscaba evaluar sistemáticamente cómo el aumento de la profundidad de la red afecta la precisión, en contraste con la arquitectura anterior AlexNet (2012), que había sido diseñada "desde cero" con tamaños de filtro más grandes y variados.
El enfoque de VGGNet consistía en componer módulos genéricos y repetidos: convoluciones de 3x3 con activaciones ReLU, intercaladas con capas de agrupación máxima de 2x2, seguidas de capas completamente conectadas y una capa softmax. Este diseño modular simplificó la construcción y el análisis de redes profundas, y los resultados empíricos del artículo demostraron que las redes más profundas con filtros pequeños superaban a sus contrapartes más superficiales y anchas.
Características Clave del Diseño
El principio de diseño central de VGGNet es el uso consistente de filtros convolucionales pequeños de 3x3 con paso de 1. Apilar dos de estas convoluciones proporciona el mismo campo receptivo que un solo filtro de 5x5, mientras usa menos parámetros: dos capas de 3x3 usan 18·c² parámetros frente a 25·c² para una capa de 5x5, donde c es el número de canales. Esta reducción de parámetros permite más capas sin un aumento proporcional en el cálculo o el sobreajuste.
La red sigue una estructura regular, con la imagen de entrada (típicamente de tamaño fijo, como 224x224 píxeles) pasando por una secuencia de etapas de convolución. Cada etapa consiste en una o más convoluciones de 3x3 seguidas de una capa de agrupación máxima de 2x2 con paso de 2 para reducir a la mitad las dimensiones espaciales. El número de canales aumenta con la profundidad de manera lineal: comenzando en 64, duplicándose a 128, 256 y 512, con las etapas finales usando 512 canales. Por ejemplo, la configuración VGG-19 (denotada como E en el artículo original) incluye 16 capas convolucionales y 3 capas completamente conectadas (para un total de 19 capas de peso) y 144 millones de parámetros.
Variantes y Parámetros
El artículo de VGG introdujo varias configuraciones, etiquetadas de A a E, que difieren en profundidad. Las dos más comunes son VGG-16 (configuración D, con 13 capas convolucionales y 3 capas completamente conectadas) y VGG-19 (configuración E, con 16 capas convolucionales y 3 capas completamente conectadas). Estos modelos tienen 138 millones y 144 millones de parámetros, respectivamente. Las capas completamente conectadas tienen tamaños de 4096 y 4096, seguidas de una capa final con 1000 unidades correspondientes a las 1000 clases de ImageNet.
La arquitectura fue diseñada para clasificación, pero debido a su modularidad genérica, podía adaptarse a otras tareas como la detección de objetos, donde sirvió como red base para el marco Fast R-CNN, y para la transferencia de estilo neuronal, donde se utilizó como extractor de características.
Impacto y Legado
VGGNet fue un hito crítico en la investigación de aprendizaje profundo. Su diseño simple y modular lo convirtió en una línea base fácil de comparar, y se utilizó como referencia en el artículo de ResNet y en muchos otros estudios. Su contribución a cambiar los tamaños estándar de los núcleos convolucionales de grandes (como en los núcleos de 11x11 de AlexNet) a 3x3 solo se revisó mucho más tarde con la arquitectura ConvNeXt en 2022.
La arquitectura quedó obsoleta después de la introducción de Inception, ResNet y DenseNet, que ofrecieron mejor rendimiento o eficiencia. Sin embargo, su simplicidad persistió como referencia de enseñanza y como línea base. La arquitectura RepVGG, introducida en 2021, es una versión actualizada que revisita el estilo simple de VGG con bloques reparametrizados para mejorar la velocidad de inferencia.
VGGNet también fue históricamente importante en visión por computadora y el reconocimiento de imágenes, y fue fundamental para demostrar el valor de la profundidad en redes convolucionales, influyendo en una generación de modelos tanto del sector académico como comercial. Su desarrollo en la Universidad de Oxford y su inclusión en bibliotecas estándar de aprendizaje profundo (por ejemplo, a través de modelos preentrenados) lo hicieron ampliamente accesible. El éxito de VGGNet contribuyó al auge del aprendizaje profundo en el procesamiento de imágenes y su alineación con términos como inteligencia artificial y aprendizaje automático.
La serie VGGNet sigue siendo una de las arquitecturas más citadas en la literatura técnica, ofreciendo una plantilla para varios modelos posteriores y sirviendo como un punto de referencia común de evaluación en diversos estudios.