Jürgen Schmidhuber (nacido el 17 de enero de 1963) es un informático alemán conocido por su trabajo en inteligencia artificial, específicamente en redes neuronales artificiales. Ha sido descrito por los medios de comunicación como un pionero líder de la inteligencia artificial moderna. Es director científico del Instituto Dalle Molle de Investigación en Inteligencia Artificial en Suiza y director de la Iniciativa de Inteligencia Artificial de la Universidad de Ciencia y Tecnología Rey Abdalá (KAUST) en Arabia Saudita.
Schmidhuber es mejor conocido por su trabajo sobre la memoria a largo plazo (LSTM), un tipo de red neuronal que se convirtió en la técnica dominante para diversas tareas de procesamiento del lenguaje natural en investigaciones y aplicaciones comerciales en la década de 2010. También introdujo principios de redes neuronales dinámicas, meta-aprendizaje, redes generativas adversariales y transformadores lineales, todos los cuales están muy extendidos en la IA moderna.
Vida temprana y educación
Schmidhuber nació en Múnich, Alemania. Completó sus estudios de pregrado en 1987 y obtuvo su doctorado en 1991, ambos en la Universidad Técnica de Múnich. Sus asesores de doctorado fueron Wilfried Brauer y Klaus Schulten.
Carrera
Schmidhuber enseñó en la Universidad Técnica de Múnich desde 2004 hasta 2009. De 2009 a 2021, fue profesor de inteligencia artificial en la Università della Svizzera Italiana en Lugano, Suiza. Ha sido director del Instituto Dalle Molle de Investigación en Inteligencia Artificial (IDSIA), un laboratorio suizo de IA, desde 1995. Desde 2021, también ha sido director de la Iniciativa de IA en KAUST.
En 2014, Schmidhuber formó una empresa, NNAISENSE, para trabajar en aplicaciones comerciales de inteligencia artificial en campos como las finanzas, la industria pesada y los coches autónomos. Sepp Hochreiter, Jaan Tallinn y Marcus Hutter son asesores de la empresa. Las ventas fueron inferiores a 11 millones de dólares estadounidenses en 2016; sin embargo, Schmidhuber declaró que el énfasis estaba en la investigación más que en los ingresos. NNAISENSE recaudó su primera ronda de financiación de capital en enero de 2017. El objetivo general de Schmidhuber era crear una IA de propósito general entrenando una única IA en secuencia en una variedad de tareas estrechas, pero a partir de 2026 ha dicho que el enfoque de NNAISENSE ha pasado de la inteligencia artificial general a la gestión de activos.
Investigación
En la década de 1980, la retropropagación no funcionaba bien para el aprendizaje profundo con caminos largos de asignación de crédito en redes neuronales artificiales. Para superar este problema, Schmidhuber (1991) propuso una jerarquía de redes neuronales recurrentes (RNN) preentrenadas un nivel a la vez mediante aprendizaje autosupervisado. Utiliza codificación predictiva para aprender representaciones internas en múltiples escalas de tiempo autoorganizadas, facilitando el aprendizaje profundo posterior. La jerarquía de RNN se puede colapsar en una sola RNN destilando una red de fragmentación de nivel superior en una red de automatización de nivel inferior. En 1993, un fragmentador resolvió una tarea de aprendizaje profundo cuya profundidad superaba los 1000.
En 1991, Schmidhuber publicó redes neuronales adversariales que compiten entre sí en forma de un juego de suma cero, donde la ganancia de una red es la pérdida de la otra. La primera red es un modelo generativo que modela una distribución de probabilidad sobre los patrones de salida. La segunda red aprende mediante descenso de gradiente a predecir las reacciones del entorno a estos patrones. Esto se llamó "curiosidad artificial". En 2014, este principio se utilizó en la creación de la red generativa adversarial, que Schmidhuber describe como un caso especial de curiosidad artificial donde la reacción del entorno es 1 o 0 dependiendo de si la salida de la primera red está en un conjunto dado.
Schmidhuber supervisó la tesis de diploma de 1991 de su estudiante Sepp Hochreiter, que consideró "uno de los documentos más importantes en la historia del aprendizaje automático". Estudió el compresor de historia neuronal y analizó y superó el problema del gradiente que desaparece. Esto llevó a la creación de la memoria a largo plazo (LSTM), un tipo de red neuronal recurrente. El nombre LSTM se introdujo en un informe técnico en 1995, lo que llevó a la publicación de LSTM más citada, publicada en 1997 y coescrita por Hochreiter y Schmidhuber. La arquitectura estándar de LSTM se introdujo en 2000 por Felix Gers, Schmidhuber y Fred Cummins. La LSTM que utiliza retropropagación a través del tiempo se publicó con su estudiante Alex Graves en 2005, y su algoritmo de entrenamiento de clasificación temporal conexionista (CTC) en 2006. CTC se aplicó al reconocimiento de voz de extremo a extremo con LSTM.
En 2014, el estado del arte era entrenar "redes neuronales muy profundas" con 20 a 30 capas. Apilar demasiadas capas llevaba a una reducción pronunciada en la precisión de entrenamiento, conocida como el problema de "degradación". En mayo de 2015, Rupesh Kumar Srivastava, Klaus Greff y Schmidhuber utilizaron principios de LSTM para crear la red de autopistas, una red neuronal feedforward con cientos de capas, mucho más profunda que las redes anteriores. En diciembre de 2015, se publicó la red neuronal residual (ResNet), que es una variante de la red de autopistas.
En 1992, Schmidhuber publicó el programador de pesos rápidos, una alternativa a las redes neuronales recurrentes. Tiene una red neuronal feedforward lenta que aprende mediante descenso de gradiente a controlar los pesos rápidos de otra red neuronal a través de productos externos de patrones de activación autogenerados, y la red de pesos rápidos misma opera sobre las entradas. Esto se demostró más tarde que era equivalente al transformador lineal no normalizado.
En 2011, el equipo de Schmidhuber en IDSIA con su posdoc Dan Ciresan también logró aceleraciones dramáticas de las redes neuronales convolucionales (CNN) utilizando unidades de procesamiento gráfico (GPU), basadas en diseños de CNN introducidos mucho antes por Kunihiko Fukushima. Una CNN anterior en GPU de Chellapilla et al. (2006) era 4 veces más rápida que una implementación equivalente en CPU. La CNN profunda de Dan Ciresan et al. (2011) en IDSIA era 60 veces más rápida y logró el primer rendimiento superhumano en un concurso de visión por computadora en agosto de 2011. Entre el 15 de mayo de 2011 y el 10 de septiembre de 2012, estas CNN ganaron cuatro concursos de imágenes más y mejoraron el estado del arte en múltiples puntos de referencia de imágenes. El enfoque se ha vuelto central en el campo de la visión por computadora.
Disputas de crédito
Schmidhuber ha argumentado de manera controvertida que él y otros investigadores han sido privados de un reconocimiento adecuado por su contribución al campo del aprendizaje profundo, en favor de Geoffrey Hinton, Yoshua Bengio y Yann LeCun, quienes compartieron el Premio Turing de 2018 por su trabajo en aprendizaje profundo. Escribió un artículo "mordaz" en 2015 argumentando que Hinton, Bengio y LeCun "se citan mucho entre sí" pero "no reconocen a los pioneros del campo". En una declaración al New York Times, Yann LeCun escribió que "Jürgen está obsesionado maniáticamente con el reconocimiento y sigue reclamando crédito que no merece por muchas, muchas cosas".
Legado e impacto
El trabajo de Schmidhuber sobre LSTM ha tenido un impacto profundo en el aprendizaje automático y la inteligencia artificial. Las redes LSTM se han utilizado en aplicaciones que van desde el reconocimiento de voz y la traducción automática hasta el reconocimiento de escritura a mano y la predicción de series temporales. Sus contribuciones al meta-aprendizaje y al entrenamiento adversarial también han influido en el desarrollo de sistemas de IA modernos, incluidos los utilizados en grandes modelos de lenguaje y otras arquitecturas avanzadas.
A pesar de las controversias sobre el crédito, Schmidhuber sigue siendo una figura muy influyente en la investigación de la IA. Su insistencia en la precisión histórica y la atribución adecuada ha provocado discusiones importantes sobre el reconocimiento del trabajo fundacional en el campo. A partir de la era actual, sus ideas continúan dando forma a la dirección de la investigación y el desarrollo de la IA.