Which technique enables LLMs to learn from human feedback to align with preferences?
- Supervised Fine-Tuning
- RLHF
- Prompt Engineering
- All of these
Answer: RLHF
Reinforcement Learning from Human Feedback (RLHF) trains reward models from human rankings, then optimizes LLM to maximize rewards. Critical for aligning AI with human values and safety.