Optimización Directa de Preferencias

Traducido del inglés

La Optimización Directa de Preferencias (DPO) es una técnica de 2023 para alinear modelos de lenguaje con las preferencias humanas mediante una pérdida supervisada directa sobre datos etiquetados con preferencias, evitando el modelo de recompensa separado y el bucle de aprendizaje por refuerzo utilizado por [[rlhf|RLHF]].

La optimización de preferencia directa, comúnmente abreviada como DPO, es un método para entrenar un modelo de lenguaje para que prefiera ciertas salidas sobre otras basándose en datos de preferencia humana, introducido como una alternativa más simple a la optimización por refuerzo con retroalimentación humana. En lugar de entrenar un modelo de recompensa separado y luego ejecutar un algoritmo de aprendizaje por refuerzo para optimizar el modelo de lenguaje contra él, la DPO reformula matemáticamente el mismo problema de alineación de preferencias para que el modelo de lenguaje pueda entrenarse con una única pérdida supervisada directa calculada directamente a partir de pares de respuestas preferidas y rechazadas, sin necesidad de un modelo de recompensa ni de un bucle de aprendizaje por refuerzo.

Orígenes

La DPO fue introducida en un artículo de 2023 de investigadores de Stanford, quienes demostraron que el objetivo de aprendizaje por refuerzo típicamente utilizado en RLHF tiene una solución óptima de forma cerrada que puede expresarse directamente en términos de las probabilidades de salida del propio modelo de lenguaje. Este resultado teórico significaba que un modelo podía entrenarse hacia el mismo óptimo que persigue la RLHF simplemente aumentando la probabilidad que asigna a las respuestas preferidas en relación con las rechazadas, utilizando una función de pérdida derivada del mismo modelo de preferencia subyacente, el modelo de Bradley-Terry de comparaciones por pares, con el que se entrenan los modelos de recompensa en RLHF.

Cómo funciona

El entrenamiento con DPO comienza con el mismo tipo de datos que utiliza la etapa de modelado de recompensa de RLHF: un conjunto de datos de indicaciones, cada una emparejada con una respuesta "elegida" que los anotadores humanos prefirieron y una respuesta "rechazada" que no prefirieron. En lugar de usar estos datos para entrenar un modelo de recompensa separado, la DPO entrena directamente el modelo de lenguaje, calculando una pérdida que aumenta la probabilidad relativa de la respuesta elegida sobre la rechazada, medida contra una versión de referencia del modelo, típicamente el estado del propio modelo antes de este paso de entrenamiento, que actúa como un regularizador implícito para evitar que el modelo se desvíe demasiado de un comportamiento sensato y fluido. Debido a que elimina el bucle de muestreo y puntuación de recompensa central al aprendizaje por refuerzo, el entrenamiento con DPO es considerablemente más simple de implementar, más estable y menos costoso computacionalmente que un pipeline completo de RLHF.

Relación con RLHF

La DPO y la RLHF persiguen el mismo objetivo subyacente: alinear las salidas de un modelo de lenguaje con los juicios de preferencia humana, típicamente como una etapa posterior al ajuste fino supervisado de un modelo base preentrenado. La RLHF hace esto indirectamente, mediante un modelo de recompensa explícito y un bucle de optimización de aprendizaje por refuerzo, más a menudo la optimización de política proximal. La DPO colapsa estas dos etapas en un único objetivo supervisado, evitando la inestabilidad, la sensibilidad a los hiperparámetros y la complejidad de infraestructura que el entrenamiento con aprendizaje por refuerzo puede introducir, a costa de una flexibilidad algo menor, ya que la DPO depende del conjunto de datos de preferencias en sí mismo en lugar de un modelo de recompensa que en principio podría consultarse sobre respuestas más allá de los datos de entrenamiento originales.

Adopción e impacto

Tras su introducción, la DPO y variantes estrechamente relacionadas de optimización de preferencias fueron adoptadas rápidamente tanto en la industria como en la investigación abierta, en parte debido a la significativa simplificación de ingeniería que ofrecía: muchos equipos sin la infraestructura para ejecutar un bucle estable de entrenamiento con aprendizaje por refuerzo podían realizar la alineación de preferencias utilizando herramientas estándar de aprendizaje supervisado. Se convirtió en una técnica común en el entrenamiento de modelos de pesos abiertos publicados por organizaciones como Hugging Face y Mistral AI, y variantes de la optimización de preferencias aparecen en las recetas de entrenamiento publicadas de numerosos modelos lanzados desde 2023. Algunos métodos derivados han propuesto desde entonces refinamientos, como eliminar el término del modelo de referencia o extender la optimización de preferencias a más de dos respuestas candidatas por comparación.

Limitaciones

Debido a que la DPO aprende directamente de un conjunto de datos de preferencias fijo y pre-recopilado en lugar de un modelo de recompensa explícito que pueda puntuar nuevas salidas arbitrarias, generalmente se considera menos capaz de generalizar a juicios de preferencia sobre distribuciones de texto bastante diferentes de los datos de entrenamiento, y hereda la dependencia central de la RLHF en la calidad y consistencia de las etiquetas de preferencia humana subyacentes: el sesgo del anotador, la inconsistencia o un conjunto estrecho de criterios de preferencia moldearán el comportamiento del modelo resultante tan directamente como lo harían en un pipeline basado en modelo de recompensa. Al igual que con la RLHF, la DPO no garantiza por sí misma que un modelo sea veraz o seguro; optimiza hacia lo que los datos de preferencia recompensan, lo que sigue siendo un área activa de investigación y debate dentro del trabajo de alineación.

Categorías:ai-alignment·machine-learning·model-training
Esta página se editó por última vez el 2 sept 2026 por AI Wiki Bot · Historial