Optimización Directa de Preferencias

Traducido del inglés

La optimización directa de preferencias (DPO) es una técnica de aprendizaje automático que alinea los modelos de lenguaje grandes con las preferencias humanas utilizando datos de preferencias, ofreciendo una alternativa más simple al aprendizaje por refuerzo con retroalimentación humana (RLHF) al optimizar directamente la política sin un modelo de recompensa separado.

Optimización de Preferencias Directa (DPO) es una técnica de aprendizaje automático para alinear un agente inteligente, como un modelo de lenguaje grande, con las preferencias humanas. Es una alternativa más simple al aprendizaje por refuerzo a partir de retroalimentación humana (RLHF), ya que optimiza directamente la política utilizando datos de preferencias sin entrenar un modelo de recompensa separado ni depender de algoritmos de aprendizaje por refuerzo como la optimización de política proximal. DPO ha ganado popularidad en el campo de la IA generativa para mejorar la utilidad y la inocuidad de las salidas del modelo.

DPO fue introducido en 2023 por investigadores del Laboratorio de IA de Stanford y desde entonces ha sido adoptado por diversas organizaciones, incluyendo OpenAI y Anthropic, como un método rentable para la alineación de preferencias. Aprovecha la idea de que el modelo de recompensa en RLHF puede expresarse en términos de la política óptima, lo que permite reformular el objetivo de optimización de preferencias como una pérdida de clasificación simple. Esto elimina la necesidad de muestrear de la política durante el entrenamiento, haciendo que DPO sea más estable y computacionalmente eficiente.

Antecedentes y motivación

Optimizar un modelo basándose en retroalimentación humana es deseable cuando una tarea es difícil de especificar pero fácil de juzgar. Por ejemplo, uno puede querer entrenar un modelo para generar texto seguro que sea tanto útil como inofensivo, como carecer de sesgos, toxicidad o contenido dañino. Pedir a los humanos que creen manualmente ejemplos de texto inofensivo y dañino sería difícil y consumiría mucho tiempo. Sin embargo, los humanos son hábiles para evaluar y comparar rápidamente la nocividad de diferentes textos generados por IA. Por lo tanto, un objetivo más práctico es permitir que el modelo utilice este tipo de retroalimentación humana para mejorar su generación de texto.

El RLHF tradicional implica entrenar un modelo de recompensa para representar las preferencias humanas, y luego utilizar aprendizaje por refuerzo para optimizar la política contra este modelo de recompensa. Sin embargo, RLHF enfrenta desafíos, incluyendo la complejidad del aprendizaje por refuerzo, la necesidad de un ajuste cuidadoso de hiperparámetros y el costo computacional de muestrear de la política durante el entrenamiento. DPO aborda estos problemas derivando un mapeo directo entre el modelo de recompensa y la política, permitiendo la optimización de preferencias sin modelado de recompensa explícito ni aprendizaje por refuerzo.

Cómo funciona DPO

DPO formula el problema de optimización de preferencias como una tarea de clasificación binaria. Dado un prompt y dos respuestas candidatas, donde una es preferida por los humanos sobre la otra, DPO actualiza la política para aumentar la probabilidad de la respuesta preferida y disminuir la probabilidad de la respuesta no preferida. La función de pérdida se deriva del modelo de Bradley–Terry–Luce de preferencias por pares, que asume que la probabilidad de preferir una respuesta sobre otra es proporcional al exponencial de sus puntuaciones de recompensa.

La idea matemática clave es que, bajo una cierta restricción de regularización (como la divergencia KL con una política de referencia), el modelo de recompensa óptimo puede expresarse en términos de la política óptima. Esto permite que DPO elimine el modelo de recompensa y optimice directamente la política utilizando una pérdida logística simple. El proceso de entrenamiento requiere solo un conjunto de datos estático de preferencias, lo que lo hace más simple y estable que RLHF, que a menudo requiere muestreo iterativo y actualizaciones del modelo de recompensa.

Comparación con RLHF

RLHF es un proceso de múltiples etapas: primero, se entrena un modelo de recompensa con datos de preferencias humanas; segundo, la política se optimiza contra este modelo de recompensa utilizando aprendizaje por refuerzo, a menudo con optimización de política proximal. Este enfoque ha sido exitoso en alinear modelos como InstructGPT y Claude. Sin embargo, RLHF tiene desventajas: es computacionalmente intensivo, sensible a hiperparámetros y puede sufrir de hacking de recompensa, donde la política explota el modelo de recompensa para lograr puntuaciones altas sin satisfacer genuinamente las preferencias humanas.

DPO simplifica esto optimizando directamente la política, evitando la necesidad de un modelo de recompensa separado y aprendizaje por refuerzo. Esto reduce la sobrecarga computacional y mejora la estabilidad. Estudios han demostrado que DPO puede lograr un rendimiento comparable o mejor que RLHF en tareas como resumen de texto y generación de diálogos, siendo más simple de implementar y ajustar. Sin embargo, DPO no está exento de limitaciones; puede ser menos efectivo cuando los datos de preferencias son ruidosos o cuando la política necesita explorar nuevos comportamientos, ya que no incorpora exploración en línea.

Aplicaciones

DPO se ha aplicado en diversos dominios del aprendizaje automático, particularmente en el procesamiento del lenguaje natural. Se utiliza para ajustar modelos de lenguaje grandes en tareas como resumen de texto, agentes conversacionales y seguimiento de instrucciones. Por ejemplo, Anthropic ha utilizado DPO para alinear sus modelos con las preferencias humanas en cuanto a utilidad e inocuidad. Además, DPO se ha explorado para tareas de visión por computadora, como la generación de texto a imagen, donde ayuda a alinear las imágenes generadas con las preferencias estéticas humanas.

La técnica también es relevante para desarrollar sistemas de IA generativa que requieran alineación con valores humanos, como reducir sesgos y toxicidad. Al utilizar datos de preferencias, DPO puede guiar a los modelos para producir salidas que tengan más probabilidades de ser juzgadas como de alta calidad por los humanos, sin necesidad de una ingeniería extensa de recompensas.

Requisitos de datos y desafíos

Al igual que RLHF, DPO depende de datos de preferencias de alta calidad, que típicamente se recopilan de anotadores humanos que clasifican o comparan las salidas del modelo. Recopilar tales datos es costoso y consume tiempo. Además, si los datos no se recopilan cuidadosamente de una muestra representativa, el modelo resultante puede exhibir sesgos no deseados. DPO requiere una cantidad relativamente pequeña de datos de comparación para ser efectivo, pero la calidad y diversidad de los datos son cruciales.

Un desafío en DPO es que los datos de preferencias pueden ser ruidosos o inconsistentes, lo que lleva a una alineación subóptima. Además, DPO asume que el modelo de preferencias sigue el modelo de Bradley–Terry–Luce, lo que puede no siempre cumplirse en la práctica. Los investigadores han propuesto extensiones para manejar estructuras de preferencias más complejas, como comparaciones K-wise utilizando el modelo de Plackett–Luce.

Desarrollos recientes e investigación

Desde su introducción, DPO ha generado un interés significativo en la investigación. Se han propuesto variantes y mejoras, como incorporar estrategias de recopilación de datos fuera de línea y en línea, y combinar DPO con otras técnicas de alineación. Por ejemplo, algunos trabajos han explorado el uso de DPO junto con aprendizaje curricular para aumentar gradualmente la dificultad de las tareas de preferencias. Otros han investigado las propiedades teóricas de DPO, proporcionando límites de complejidad de muestra y garantías de convergencia bajo diferentes modelos de retroalimentación.

La investigación también ha comparado DPO con RLHF en términos de robustez y exploración. Mientras que DPO es más eficiente en muestras en entornos fuera de línea, RLHF puede ser más adecuado para tareas que requieren exploración en línea, donde el agente interactúa con el entorno para descubrir nuevos comportamientos. A partir de 2025, DPO sigue siendo un área activa de investigación, con esfuerzos continuos para escalarlo a modelos más grandes y tareas más complejas.

Conclusión

La Optimización de Preferencias Directa ofrece un enfoque simplificado para alinear sistemas de IA con las preferencias humanas, abordando algunas de las limitaciones clave de RLHF. Su simplicidad y efectividad lo han convertido en una opción popular en la comunidad de inteligencia artificial, particularmente para ajustar modelos de lenguaje grandes. Si bien persisten desafíos, como la calidad de los datos y los supuestos teóricos, DPO representa un avance significativo para hacer que la alineación basada en preferencias sea más accesible y práctica.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:machine-learning·alignment·preference-optimization·large-language-models
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial