DPO
Tercih edilen ve edilmeyen cevap çiftlerinden ayrı reward model ve online RL döngüsü kurmadan policy'yi optimize eden preference learning yöntemi.
Teknik Bağlam
Reference model ile tercih olasılıklarını ilişkilendiren kayıp fonksiyonu üzerinden chosen/rejected çiftleri kullanılır. Eğitim pipeline'ını bazı RLHF yaklaşımlarına göre sadeleştirebilir.
Sınırlar
DPO her tercih problemi için üstün değildir; preference data kalitesi, beta ve reference policy davranışı sonucu etkiler.
İlgili Kavramlar
- RLHF
- Preference Learning
- Instruction Tuning
- Fine-Tuning
Kaynak
- https://arxiv.org/abs/2305.18290