Dynamic Deep Prompt Optimization for Defending Against Jailbreak Attacks on LLMs
Experiments demonstrate that DDPO significantly outperforms static prompt optimization methods, particularly on weakly aligned models and when handling semantically ambiguous benign prompts, successfully distinguishing them from genuinely harmful requests.