DPO

Türkçe karşılığı: Doğrudan tercih optimizasyonuAlan: Makine Öğrenmesi

Tercih edilen ve edilmeyen cevap çiftlerinden ayrı reward model ve online RL döngüsü kurmadan policy'yi optimize eden preference learning yöntemi.

Makine Öğrenmesi Bağlamı

Reference model ile tercih olasılıklarını ilişkilendiren kayıp fonksiyonu üzerinden chosen/rejected çiftleri kullanılır. Eğitim pipeline'ını bazı RLHF yaklaşımlarına göre sadeleştirebilir.

Genelleme ve Ölçüm Sınırı

DPO her tercih problemi için üstün değildir; preference data kalitesi, beta ve reference policy davranışı sonucu etkiler.

İlişkili Makine Öğrenmesi Kavramları

Kaynak

  • https://arxiv.org/abs/2305.18290

İlgili teknik yayınlar

Başlık veya özetinde bu kavrama doğrudan karşılık gelen yayınlar.