Perceptrón Multicapa

Traducido del inglés

Un perceptrón multicapa (MLP) es una red neuronal de avance con capas totalmente conectadas y funciones de activación no lineales, capaz de aprender patrones no lineales. Constituye la base del aprendizaje profundo y se entrena mediante retropropagación.

Un perceptrón multicapa (MLP) es un tipo de red neuronal feedforward compuesta por neuronas totalmente conectadas organizadas en capas, con funciones de activación no lineales. A diferencia de los perceptrones de una sola capa, que solo pueden clasificar datos linealmente separables, los MLP pueden distinguir datos que no son linealmente separables, lo que los convierte en una arquitectura fundamental en el aprendizaje profundo. Los MLP modernos se entrenan mediante retropropagación y a menudo se denominan coloquialmente redes neuronales "vanilla".

El MLP surgió de los esfuerzos por superar las limitaciones del perceptrón de una sola capa, que utilizaba una función escalón de Heaviside como activación. Sin embargo, la retropropagación requiere funciones de activación continuas, como la sigmoide o la unidad lineal rectificada (ReLU). Los MLP forman la base del aprendizaje profundo y son aplicables en una vasta gama de dominios, incluidos el reconocimiento de imágenes, el procesamiento del lenguaje natural y la predicción de series temporales.

Desarrollo Histórico

El concepto de neuronas artificiales se remonta a 1943, cuando Warren McCulloch y Walter Pitts propusieron una neurona binaria como modelo lógico de las redes neuronales biológicas. En 1958, Frank Rosenblatt introdujo el modelo de perceptrón multicapa, que tenía una capa de entrada, una capa oculta con pesos aleatorios que no aprendían, y una capa de salida con conexiones entrenables. El libro de Rosenblatt de 1962, Principles of Neurodynamics, describía variantes con hasta dos capas entrenables mediante "retropropagación de errores", pero esto no era el algoritmo moderno de retropropagación, y no existía un método general para entrenar múltiples capas en ese entonces.

En 1965, Alexey Grigorevich Ivakhnenko y Valentin Lapa publicaron el Método de Agrupamiento de Manejo de Datos, uno de los primeros métodos de aprendizaje profundo, utilizado para entrenar una red neuronal de ocho capas en 1971. En 1967, Shun'ichi Amari informó sobre la primera red neuronal multicapa entrenada mediante descenso de gradiente estocástico, capaz de clasificar clases de patrones no linealmente separables; su estudiante Saito realizó experimentos computacionales utilizando una red feedforward de cinco capas con dos capas de aprendizaje.

La retropropagación fue desarrollada de forma independiente varias veces a principios de la década de 1970. La primera instancia publicada fue la tesis de maestría de Seppo Linnainmaa en 1970. Paul Werbos la desarrolló de forma independiente en 1971, aunque tuvo dificultades para publicarla hasta 1982. En 1986, David E. Rumelhart y sus colegas popularizaron la retropropagación, lo que llevó a su adopción generalizada. El interés en las redes de retropropagación resurgió en 2003 debido a los éxitos del aprendizaje profundo en el modelado de lenguaje por parte de Yoshua Bengio y coautores.

Arquitectura y Funciones de Activación

Un MLP consta de tres o más capas: una capa de entrada, una capa de salida y una o más capas ocultas. Cada nodo en una capa se conecta con un cierto peso a cada nodo en la capa siguiente, lo que hace que la red esté totalmente conectada. Si todas las neuronas utilizaran funciones de activación lineales, el álgebra lineal muestra que cualquier número de capas podría reducirse a un modelo de entrada-salida de dos capas. Por lo tanto, los MLP utilizan funciones de activación no lineales, que fueron desarrolladas para modelar la frecuencia de disparo de las neuronas biológicas.

Históricamente, dos funciones de activación comunes eran las sigmoides: la tangente hiperbólica, que varía de -1 a 1, y la función logística, que varía de 0 a 1. Más recientemente, la unidad lineal rectificada (ReLU) se ha vuelto prevalente en el aprendizaje profundo, ya que ayuda a superar problemas numéricos asociados con las sigmoides. Otras alternativas incluyen softplus y funciones de base radial, estas últimas utilizadas en redes de base radial.

Aprendizaje mediante Retropropagación

El aprendizaje en un MLP ocurre ajustando los pesos de las conexiones después de procesar cada punto de datos, basándose en el error entre la salida y el resultado esperado. Esto es aprendizaje supervisado, llevado a cabo mediante retropropagación, una generalización del algoritmo de mínimos cuadrados medios utilizado en perceptrones lineales. El error para un nodo de salida j en el n-ésimo ejemplo de entrenamiento se define como e_j(n) = d_j(n) - y_j(n), donde d_j(n) es el objetivo deseado y y_j(n) es la salida real. El algoritmo propaga este error hacia atrás a través de la red para actualizar los pesos, típicamente utilizando métodos de optimización como el descenso de gradiente estocástico.

Variantes Modernas e Impacto

En 2021, los investigadores diseñaron MLP-Mixer, una arquitectura simple que combina dos MLP profundos con conexiones de salto y normalizaciones de capa. Sus realizaciones, con 19 a 431 millones de parámetros, se desempeñaron de manera comparable a los transformadores de visión de tamaño similar en ImageNet y tareas similares de clasificación de imágenes. Esto mostró que los MLP siguen siendo competitivos en el aprendizaje profundo moderno, a pesar del auge de los modelos transformador. Los MLP también son integrales en muchos sistemas de red neuronal, incluidos componentes de arquitecturas de modelo de lenguaje grande y marcos de aprendizaje profundo. Su simplicidad y efectividad los convierten en una línea base estándar en la investigación y aplicaciones de aprendizaje automático.

Limitaciones y Extensiones

Aunque los MLP son potentes, tienen limitaciones. Están totalmente conectados, lo que conduce a muchos parámetros y costo computacional para entradas de alta dimensionalidad como imágenes. Tampoco capturan inherentemente la estructura espacial o secuencial, lo que motivó arquitecturas como red residual y modelos secuencia a secuencia. Técnicas como abandono, normalización por lotes y normalización de capa se aplican a menudo para mejorar la estabilidad del entrenamiento y la generalización. A pesar de estos desafíos, los MLP siguen siendo un bloque de construcción fundamental en inteligencia artificial y continúan informando el diseño de arquitecturas más complejas.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:neural-networks·deep-learning·machine-learning·artificial-intelligence
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial