RLHF
İnsan tercih verisini kullanarak model davranışını tercih edilen cevaplara doğru optimize eden eğitim yaklaşımı ailesi.
Teknik Bağlam
Klasik pipeline supervised fine-tuning, preference/reward model ve policy optimization aşamalarını içerebilir. Amaç yalnız doğruluk değil yardımseverlik, format ve güvenlik gibi tercih boyutlarını öğrenmektir.
Sınırlar
RLHF tek sabit algoritma değildir; DPO gibi doğrudan preference yöntemlerinden ayrılır ve reward hacking gibi failure mode'lar taşır.
İlgili Kavramlar
- DPO
- Instruction Tuning
- Preference Model
- Reward Model