RLHF
Reinforcement Learning from Human Feedback, a model-alignment approach that uses human preference signals to optimize model behavior through a reward-driven training stage.
Related Concepts
- DPO
- Instruction Tuning
- Preference Model
- Reward Model
Reinforcement Learning from Human Feedback, a model-alignment approach that uses human preference signals to optimize model behavior through a reward-driven training stage.