DPO
Tercih edilen ve edilmeyen cevap çiftlerinden ayrı reward model ve online RL döngüsü kurmadan policy'yi optimize eden preference learning yöntemi.
Makine Öğrenmesi Bağlamı
Reference model ile tercih olasılıklarını ilişkilendiren kayıp fonksiyonu üzerinden chosen/rejected çiftleri kullanılır. Eğitim pipeline'ını bazı RLHF yaklaşımlarına göre sadeleştirebilir.
Genelleme ve Ölçüm Sınırı
DPO her tercih problemi için üstün değildir; preference data kalitesi, beta ve reference policy davranışı sonucu etkiler.
İlişkili Makine Öğrenmesi Kavramları
- RLHF
- Preference Learning
- Instruction Tuning
- Fine-Tuning
Kaynak
- https://arxiv.org/abs/2305.18290