← Prompt Engineering
Guardrail Prompt
Also known as: safety prompt, policy prompt
A guardrail prompt is an instruction or system-level policy statement embedded in the prompt that defines boundaries on the model's behavior — prohibiting certain topics, requiring specific disclaimers, enforcing personas, or mandating refusal for defined request types. Unlike a separate content-filtering layer, a guardrail prompt relies on the model's instruction-following ability, making it convenient to deploy but potentially vulnerable to jailbreak attacks that bypass in-prompt constraints.