Instruction Tuning
Modeli doğal dil talimatlarını izleyen cevap davranışına uyarlamak için talimat-girdi-çıktı örnekleriyle fine-tuning yapma.
Teknik Bağlam
Çeşitli görev formatları modelin zero-shot/few-shot instruction following kapasitesini artırabilir. Veri çeşitliliği, kalite ve format tutarlılığı önemlidir.
Sınırlar
Instruction tuning ile preference optimization aynı şey değildir; ilki supervised örnekleri, ikincisi tercih sinyalini kullanabilir.
İlgili Kavramlar
- Fine-Tuning
- RLHF
- DPO
- Supervised Fine-Tuning