RLHF
İnsan tercih verisini kullanarak model davranışını tercih edilen cevaplara doğru optimize eden eğitim yaklaşımı ailesi.
Makine Öğrenmesi Bağlamı
Klasik pipeline supervised fine-tuning, preference/reward model ve policy optimization aşamalarını içerebilir. Amaç yalnız doğruluk değil yardımseverlik, format ve güvenlik gibi tercih boyutlarını öğrenmektir.
Genelleme ve Ölçüm Sınırı
RLHF tek sabit algoritma değildir; DPO gibi doğrudan preference yöntemlerinden ayrılır ve reward hacking gibi failure mode'lar taşır.
İlişkili Makine Öğrenmesi Kavramları
- DPO
- Instruction Tuning
- Preference Model
- Reward Model
Tercih Sinyalinin Sınırı
Yaygın RLHF akışında önce supervised fine-tuning ile başlangıç davranışı oluşturulur; daha sonra insan karşılaştırmalarından tercih verisi toplanır, bu sinyali yaklaşıklaştıran bir reward model eğitilebilir ve policy bu ödüle göre optimize edilir. InstructGPT çalışması bu çok aşamalı yapının iyi belgelenmiş örneklerinden biridir.
İnsan tercihleri "doğru cevabın matematiksel oracle'ı" değildir. Etiketleyici dağılımı, yönerge, örnek seçimi ve reward model hataları öğrenilen tercihi etkileyebilir. Bu nedenle daha yüksek reward, dış dünyada doğruluğun kanıtı değildir. Ayrıca DPO gibi yöntemler tercih verisini kullanabilse de ayrı bir reward-model + RL aşamasını zorunlu kılmaz; bütün preference optimization yöntemlerini RLHF ile eşitlemek doğru değildir. Kaynak: Ouyang et al..