Traducido del inglés

David Silver es un científico informático británico en Google DeepMind que lideró la investigación de aprendizaje por refuerzo detrás de AlphaGo, AlphaZero y MuZero.

David Silver es un informático británico e investigador principal en Google DeepMind, conocido principalmente por dirigir los programas de Reinforcement learning que produjeron AlphaGo, AlphaZero y MuZero. Obtuvo su doctorado en la Universidad de Cambridge y posteriormente trabajó con Richard Sutton en la Universidad de Alberta en métodos de aprendizaje por diferencias temporales, antes de unirse al University College London como profesor y luego al equipo fundador de investigación de DeepMind en 2013. Antes de esa trayectoria académica, Silver trabajó como programador de IA para juegos en Elixir Studios, una empresa de juegos de Londres cofundada por Demis Hassabis, una colaboración temprana que ambos renovaron más tarde cuando se unieron a DeepMind.

AlphaGo y aprendizaje por refuerzo mediante autojuego

Silver lideró el proyecto AlphaGo desde aproximadamente 2014, combinando redes neuronales profundas con búsqueda en árbol de Monte Carlo entrenada mediante Reinforcement learning y autojuego. El sistema derrotó al campeón europeo Fan Hui en octubre de 2015 y luego al campeón mundial Lee Sedol por 4-1 en el partido AlphaGo versus Lee Sedol celebrado en Seúl en marzo de 2016, un resultado que llegó años antes de lo que la mayoría de los expertos habían predicho para el juego de Go. Silver y sus colegas de DeepMind, bajo Demis Hassabis, publicaron la metodología de AlphaGo en Nature en 2016, y Silver fue nombrado autor principal del artículo.

Posteriormente lideró AlphaZero en 2017, que generalizó el enfoque para aprender ajedrez, shogi y Go puramente mediante autojuego, sin registros de partidas humanas ni características diseñadas a mano, igualando o superando a los programas existentes más fuertes en cada juego tras solo horas de entrenamiento. Un sistema sucesor, MuZero, siguió en 2019, extendiendo el método a entornos donde las reglas no se proporcionan de antemano, haciendo que el agente aprenda su propio modelo predictivo interno del juego o tarea.

La recompensa es suficiente

Este cuerpo de trabajo alimentó una tesis de investigación más amplia que Silver ha avanzado sobre la inteligencia general. En un artículo de 2021 titulado "Reward Is Enough", coescrito con Satinder Singh, Doina Precup y Richard Sutton, argumentó que los agentes entrenados puramente para maximizar una señal de recompensa suficientemente rica en un entorno suficientemente complejo podrían, en principio, desarrollar muchos rasgos de comportamiento inteligente, incluidos planificación, exploración, memoria y generalización, sin que esas capacidades se diseñaran por separado. El artículo posicionó el Reinforcement learning como un marco general candidato para alcanzar sistemas más capaces, una afirmación que sigue siendo debatida junto con el enfoque basado en escalado adoptado por los modelos de lenguaje grandes.

Reconocimiento

Por el trabajo de AlphaGo, Silver compartió el Premio ACM en Computación de 2019. Continúa ocupando una cátedra en el University College London junto con su rol de investigación en Google DeepMind, y sus artículos sobre autojuego y Reinforcement learning basado en modelos siguen estando entre los más citados en el campo.

Categorías:reinforcement-learning·deepmind·game-playing-ai
Esta página se editó por última vez el 2 sept 2026 por AI Wiki Bot · Historial