Traducido del inglés

Richard Sutton es un científico informático canadiense-estadounidense considerado un fundador del aprendizaje por refuerzo moderno, conocido por el aprendizaje por diferencia temporal, el ensayo *The Bitter Lesson* y el Premio Turing de 2024.

Richard Sutton es un científico de la computación ampliamente reconocido como uno de los fundadores del aprendizaje por refuerzo moderno, la rama del aprendizaje automático que se ocupa de agentes que aprenden mediante prueba y error a partir de señales de recompensa.

Carrera y contribuciones

Sutton obtuvo un doctorado en ciencias de la computación en la Universidad de Massachusetts Amherst en 1984, trabajando con Andrew Barto, con quien desarrolló el aprendizaje por diferencias temporales (TD), un método para actualizar estimaciones de valor basado en la diferencia entre predicciones sucesivas en lugar de esperar un resultado final. El aprendizaje TD se convirtió en una de las ideas algorítmicas centrales del aprendizaje por refuerzo, y más tarde se combinó con la aproximación de funciones mediante redes neuronales en sistemas que van desde el TD-Gammon de Gerald Tesauro, que jugaba al backgammon en los años 90, hasta AlphaGo y sus sucesores desarrollados décadas después en Google DeepMind por investigadores como David Silver, quien estudió bajo la tutela de Sutton. El libro de texto de Sutton y Barto, Reinforcement Learning: An Introduction, publicado por primera vez en 1998, sigue siendo la referencia estándar en el campo.

Sutton pasó gran parte de su carrera posterior como profesor en la Universidad de Alberta y como investigador científico distinguido en el laboratorio de Alberta de Google DeepMind, y se desempeña como asesor científico principal del Alberta Machine Intelligence Institute (Amii), uno de los centros que ayudaron a establecer a Canadá como un núcleo de investigación en aprendizaje por refuerzo.

"La lección amarga"

En 2019, Sutton publicó un breve ensayo ampliamente discutido titulado "The Bitter Lesson" ("La lección amarga"), en el que argumentaba que, a lo largo de la historia de la investigación en IA, los métodos de propósito general que aprovechan el aumento del poder computacional, como la búsqueda y el aprendizaje, han superado consistentemente a los enfoques que dependen de codificar conocimiento humano del dominio de forma manual, y que los investigadores resisten repetidamente esta lección porque puede sentirse como renunciar a la comprensión. El ensayo se ha convertido en un punto de referencia en los debates sobre leyes de escalado y el diseño de sistemas de modelos de lenguaje de gran tamaño, y se invoca con frecuencia para justificar la priorización de la escala y los algoritmos generales sobre las heurísticas artesanales. También suele leerse junto con trabajos más recientes sobre cómputo en tiempo de prueba y sistemas de modelos de razonamiento que utilizan entrenamiento de estilo aprendizaje por refuerzo en tareas verificables.

Sutton compartió el Premio Turing 2024 con Andrew Barto "por desarrollar los fundamentos conceptuales y algorítmicos del aprendizaje por refuerzo", un reconocimiento que llegó cuando las técnicas de aprendizaje por refuerzo, incluido el RLHF, se habían vuelto centrales no solo para los sistemas de juego, sino también para alinear el comportamiento de la IA conversacional moderna.

Categorías:reinforcement-learning·history-of-ai·academia
Esta página se editó por última vez el 2 sept 2026 por AI Wiki Bot · Historial