Dilema de Exploración-Explotación

Traducido del inglés

El dilema de exploración-explotación es un equilibrio fundamental en la toma de decisiones entre elegir opciones conocidas y buenas (explotación) y probar otras nuevas (exploración) para maximizar los beneficios a largo plazo, siendo central en el aprendizaje por refuerzo.

El dilema de exploración-explotación, también conocido como el equilibrio entre explorar y explotar, es un concepto central en la toma de decisiones que aparece en campos que van desde la economía hasta la inteligencia artificial. Implica equilibrar dos estrategias opuestas: la explotación, que significa seleccionar la mejor opción basándose en el conocimiento actual (que puede ser incompleto o engañoso), y la exploración, que significa probar nuevas opciones que podrían conducir a mejores resultados futuros a costa de renunciar a una oportunidad de explotación. El objetivo de optimizar las recompensas a largo plazo requiere resolver este equilibrio de manera efectiva.

En el aprendizaje automático, el equilibrio es fundamental para el aprendizaje por refuerzo (RL), un tipo de aprendizaje donde un agente toma decisiones basándose en la retroalimentación de un entorno, que puede ser retrasada o escasa. El agente debe decidir si explotar una política actualmente conocida como la mejor o explorar nuevas políticas para mejorar el rendimiento futuro. El dilema aparece en dominios como la conducción autónoma, los sistemas de recomendación y la IA para juegos.

Métodos de Bandidos Multibrazo

El problema del bandido multibrazo (MAB) es un ejemplo clásico del equilibrio, y se han desarrollado muchos métodos para él. El épsilon-avaro es un enfoque simple donde el agente explota la mejor acción conocida la mayor parte del tiempo, pero elige una acción aleatoria con probabilidad épsilon. El muestreo de Thompson equilibra la exploración y la explotación manteniendo distribuciones posteriores sobre las recompensas y muestreando de ellas. Los algoritmos de límite superior de confianza (UCB) seleccionan acciones comparando las recompensas promedio con bonificaciones de incertidumbre.

En entornos más complejos, un agente puede tratar cada punto de decisión como un MAB donde el pago es la recompensa futura esperada. Por ejemplo, la búsqueda de árbol de Monte Carlo utiliza una variante de UCB para guiar la exploración del árbol de juego, como se ve en programas como los motores de ajedrez.

Problemas de Exploración

Ciertos entornos crean desafíos específicos para el equilibrio.

Recompensa escasa: si las recompensas aparecen solo raramente, los agentes pueden no persistir en explorar. Un ejemplo estándar es el juego de Atari Montezuma's Revenge, donde las recompensas claras son escasas.

Recompensa engañosa: cuando algunas acciones tempranas dan recompensas inmediatas pero pequeñas, y otras dan recompensas más grandes y retrasadas, los agentes pueden quedar atrapados explotando las pequeñas recompensas tempranas.

Problema de TV ruidosa: si algunas observaciones son irreductiblemente ruidosas, como una televisión con imágenes aleatorias, un agente puede quedarse atascado observando repetidamente esos estados impredecibles.

Estos problemas dificultan lograr un equilibrio óptimo, requiriendo técnicas adicionales para guiar la exploración.

Métodos de Recompensa por Exploración

Los métodos de recompensa por exploración convierten el dilema en un problema puramente explotativo al tratar la exploración como una forma de recompensa intrínseca. El agente entonces busca maximizar la suma de la recompensa extrínseca del entorno y la bonificación de exploración intrínseca. Las recompensas intrínsecas y extrínsecas se escriben como r_t^e y r_t^i en el paso de tiempo t.

Este enfoque difiere de la explotación de dos maneras clave: primero, la recompensa de exploración es diseñada libremente por el investigador, mientras que las recompensas externas son dadas por el entorno; segundo, mientras que las recompensas extrínsecas suelen ser estacionarias, las recompensas intrínsecas son no estacionarias, lo que significa que la misma acción produce cada vez menos bonificación a medida que se vuelve familiar.

La exploración basada en conteos mide cuántas veces se visita un estado y recompensa los estados menos visitados, pero esto solo es factible en espacios de estados pequeños y discretos. La exploración basada en densidad extiende esto utilizando un modelo de densidad, donde visitar un estado también da crédito parcial a estados cercanos.

La exploración de entropía máxima añade la entropía de la política del agente como un término intrínseco, fomentando una política que favorece acciones aleatorias o diversas.

Exploración Basada en Predicción

Un modelo de dinámica hacia adelante predice el siguiente estado a partir del estado y la acción actuales: f: (s_t, a_t) mapeado a s_{t+1}. A medida que el agente interactúa con el entorno, entrena este modelo para mejorar en predecir transiciones de estado para rutas familiares. Una bonificación de exploración basada en predicción define la recompensa intrínseca como el error entre las predicciones del modelo y los siguientes estados reales. Cuando un estado es novedoso, el error del modelo es alto, haciendo atractiva esa acción.

La exploración por predicción es particularmente útil en espacios de estados de alta dimensión donde no se pueden usar conteos. Los errores del modelo sirven como una estimación de la sorpresa, lo que anima al agente a buscar estados que son más difíciles de predecir, promoviendo una exploración más amplia sin guía externa. Este método se usa ampliamente en sistemas recientes de aprendizaje profundo por refuerzo.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:reinforcement-learning·decision-making·artificial-intelligence·optimization
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial