DPO

Türkçe karşılığı: Doğrudan tercih optimizasyonuAlan: Makine Öğrenmesi

Tercih edilen ve edilmeyen cevap çiftlerinden ayrı reward model ve online RL döngüsü kurmadan policy'yi optimize eden preference learning yöntemi.

Teknik Bağlam

Reference model ile tercih olasılıklarını ilişkilendiren kayıp fonksiyonu üzerinden chosen/rejected çiftleri kullanılır. Eğitim pipeline'ını bazı RLHF yaklaşımlarına göre sadeleştirebilir.

Sınırlar

DPO her tercih problemi için üstün değildir; preference data kalitesi, beta ve reference policy davranışı sonucu etkiler.

İlgili Kavramlar

  • RLHF
  • Preference Learning
  • Instruction Tuning
  • Fine-Tuning

Kaynak

  • https://arxiv.org/abs/2305.18290