Alignment & Preference Optimization
← Question BankSign in to bookmark Sign in to bookmark Sign in to bookmark
Deep Learning & Generative AI
Generative AI & Large Language Models (LLMs) Interview Questions
Interview questions on Generative AI & Large Language Models (LLMs) Interview Questions.
4 questions
All subtopicsLLM Architectures & FoundationsTokenization & EmbeddingsAttention, KV Cache & Efficient InferenceLLM Training & Pre-trainingDecoding Strategies & Prompt EngineeringFine-Tuning & Model AdaptationRAG & Vector DatabasesAlignment & Preference OptimizationLLM Evaluation & BenchmarkingAgents, Tool Use & MemoryMultimodal Generative AILLM Safety & SecurityLLMOps & Production
Sign in to bookmark
Alignment & Preference Optimization
Q2. What is a reward model, and how does it automate preference evaluation in LLM alignment?
Alignment & Preference Optimization
Q3. What is Proximal Policy Optimization (PPO) in preference tuning, and how does it work?
Alignment & Preference Optimization