Slides / VideoIntermediate
Reinforcement Learning from Human Feedback
RLHF fine-tunes language models using human preference ratings to make responses more helpful and aligned.
1 / 6
RLHF fine-tunes language models using human preference ratings to make responses more helpful and aligned.