Traducido del inglés

Q-learning es un algoritmo de aprendizaje por refuerzo sin modelo que aprende una política óptima de selección de acciones para procesos de decisión de Markov finitos, estimando la recompensa esperada (calidad) de las acciones en los estados, sin requerir un modelo del entorno.

Q-learning es un algoritmo de aprendizaje por refuerzo sin modelo que entrena a un agente para asignar valores a sus posibles acciones basándose en su estado actual, sin requerir un modelo del entorno. Puede manejar problemas con transiciones estocásticas y recompensas sin requerir adaptaciones. Para cualquier proceso de decisión de Markov finito, Q-learning encuentra una política óptima en el sentido de maximizar el valor esperado de la recompensa total sobre cualquier y todos los pasos sucesivos, comenzando desde el estado actual, dado un tiempo de exploración infinito y una política parcialmente aleatoria. La "Q" se refiere a la función que el algoritmo computa: la recompensa esperada - es decir, la calidad- de una acción tomada en un estado dado

En un ejemplo simple, un agente en un laberinto de cuadrícula aprende a alcanzar una salida que vale 10 puntos. En una bifurcación, Q-learning podría asignar un valor más alto a moverse hacia la derecha que hacia la izquierda si la derecha llega a la salida más rápido, mejorando esta elección al probar ambas direcciones con el tiempo. Esto ilustra cómo el algoritmo equilibra la recompensa inmediata contra los resultados a largo plazo mediante actualizaciones iterativas

Contexto del Aprendizaje por Refuerzo

El aprendizaje por refuerzo involucra a un agente, un conjunto de estados \(\mathcal{S}\), y un conjunto \(\mathcal{A}\) de acciones por estado. Al realizar una acción \(a \in \mathcal{A}\), el agente transiciona de estado a estado. Ejecutar una acción en un estado específico proporciona al agente una recompensa, una puntuación numérica. El objetivo del agente es maximizar su recompensa total al añadir la recompensa máxima alcanzable de los estados futuros a la recompensa por lograr su estado actual, influyendo efectivamente la acción actual por la recompensa futura potencial. Esta recompensa potencial es una suma ponderada de valores esperados de las recompensas de todos los pasos futuros comenzando desde el estado actual

Como ejemplo, considere abordar un tren, donde la recompensa es medida por el negativo del tiempo total de abordaje. Una estrategia es entrar por la puerta del tren tan pronto como se abre, minimizando el tiempo de espera inicial. Si el tren está lleno, sin embargo, la entrada es lenta mientras los pasajeros que salen luchan por irse. El tiempo total de abordaje es entonces 0 segundos de espera más 15 segundos de tiempo de lucha. Al día siguiente, por azar aleatorio (exploración), el agente espera y deja que otros se vayan primero, resultando en una espera más larga pero menos tiempo de lucha. En general, este camino tiene una recompensa más alta ya que el tiempo total de abordaje es 5 segundos de espera más 0 segundos de tiempo de lucha. A través de la exploración, a pesar de que la acción inicial paciente resulta en un costo más grande que la estrategia forzada, el costo general es más bajo, revelando una estrategia más gratificante

Mecánica del Algoritmo

Después de \(\Delta t\) pasos hacia el futuro, el agente decidirá algún siguiente paso. El peso para este paso es calculado como \(\gamma^{\Delta t}\), donde \(\gamma\) (el factor de descuento) es un número entre 0 y 1. Asumiendo \(\gamma < 1\), valora las recompensas recibidas antes más altas que las recibidas después, reflejando el valor de un buen comienzo. \(\gamma\) puede también ser interpretado como la probabilidad de tener éxito o sobrevivir en cada paso \(\Delta t\).

El algoritmo tiene una función que calcula la calidad de una combinación estado-acción: \(Q: \mathcal{S} \times \mathcal{A} \to \mathbb{R}\). Antes de que el aprendizaje comience, \(Q\) es inicializado a un valor fijo posiblemente arbitrario elegido por el programador. En cada tiempo \(t\), el agente selecciona una acción \(A_t\), observa una recompensa \(R_{t+1}\), entra en un nuevo estado \(S_{t+1}\) (que puede depender tanto del estado anterior \(S_t\) como de la acción seleccionada),, y \(Q\) es actualizado. La actualización central es una ecuación de Bellman como una actualización simple de iteración de valor, usando el promedio ponderado del valor actual y la nueva información:

\(Q_{new}(S_t, A_t) \leftarrow (1 - \alpha) \cdot Q(S_t, A_t) + \alpha \cdot [R_{t+1} + \gamma \max_a Q(S_{t+1}, a)]\)

donde \(\alpha\) es la tasa de aprendizaje, controlando cuánta información nueva sobreescribe la información antigua.

Exploración y Explotación

El algoritmo se basa en un equilibrio entre exploración (probar nuevas acciones para descubrir sus recompensas) y explotación (elegir acciones conocidas por producir recompensas altas). Una política parcialmente aleatoria, como epsilon-greedy, selecciona la mejor acción conocida la mayoría del tiempo pero ocasionalmente elige una acción aleatoria para explorar. Esto asegura que el agente pueda mejorar sus estimaciones con el tiempo, como se ve en el ejemplo de abordar el tren donde la exploración aleatoria reveló una mejor estrategia

Convergencia y Optimalidad

Para cualquier proceso de decisión de Markov finito, Q-learning converge a una política óptima que maximiza la recompensa total esperada desde cualquier estado inicial, proporcionado un tiempo de exploración infinito y un programa de tasa de aprendizaje adecuado. El algoritmo no requiere un modelo de las dinámicas de transición del entorno, haciéndolo aplicable a problemas donde tal modelo es desconocido o complejo. Esta propiedad sin modelo lo distingue de los métodos basados en modelos que necesitan probabilidades de transición explícitas

Aplicaciones y Extensiones

Q-learning ha sido aplicado en robótica, juegos, y sistemas autónomos. Su forma tabular funciona para espacios de estado pequeños, pero para espacios grandes o continuos, extensiones como las redes Q profundas combinan Q-learning con aprendizaje profundo y redes neuronales aproximadores de funciones. Estos avances han habilitado éxitos en dominios como agentes de juego de inteligencia artificial y tareas de control de aprendizaje automático. Los principios del algoritmo también sustentan la investigación moderna en aprendizaje por refuerzo en instituciones como investigación de IA en Berkeley y CSAIL del MIT.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:reinforcement-learning·machine-learning·algorithm
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial