FrontierAI.Engineer
← All quizzes

Evaluation & Guardrails

Evaluation & Guardrails

Assess your knowledge of LLM evaluation methods, LLM-as-judge patterns, and production guardrails.

1. What is 'LLM-as-judge' evaluation?

2. What bias commonly affects LLM-as-judge evaluations?

3. Which evaluation metric measures whether every claim in the answer appears in the source documents?

4. What is red teaming in the context of LLM safety evaluation?

5. What is a guardrail in an LLM application?

6. Why is a static benchmark dataset insufficient for ongoing production evaluation?

7. What does 'context precision' measure in RAG evaluation?