RLHF

Türkçe karşılığı: İnsan geri bildirimiyle pekiştirmeli öğrenmeAlan: Makine Öğrenmesi

İnsan tercih verisini kullanarak model davranışını tercih edilen cevaplara doğru optimize eden eğitim yaklaşımı ailesi.

Teknik Bağlam

Klasik pipeline supervised fine-tuning, preference/reward model ve policy optimization aşamalarını içerebilir. Amaç yalnız doğruluk değil yardımseverlik, format ve güvenlik gibi tercih boyutlarını öğrenmektir.

Sınırlar

RLHF tek sabit algoritma değildir; DPO gibi doğrudan preference yöntemlerinden ayrılır ve reward hacking gibi failure mode'lar taşır.

İlgili Kavramlar

  • DPO
  • Instruction Tuning
  • Preference Model
  • Reward Model