Preprint
Aug 2026
Capability-Routed Guard: Defending Large Reasoning Models Against Reasoning-Centric Jailbreaks
Capability-Routed Guard is introduced, a model-agnostic inference-time guardrail for closed-source LRMs, where defenders cannot inspect hidden reasoning traces or modify model weights, and its components contribute complementary benefits, highlighting the importance of coordinated defense mechanisms for securing large reasoning models.
Yiyong Liu, Yixin Wu, J. Sakuma
· 0 citations