Explore Library
Slides / VideoIntermediate

Reinforcement Learning from Human Feedback

RLHF fine-tunes language models using human preference ratings to make responses more helpful and aligned.

Slide 1
1 / 6