Preprint
Jul 2026
Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates
This work comprehensively investigates computation-efficient strategies to speed up latent adversarial training from two complementary perspectives, and reduces per-step adversarial-training FLOPs by 48.1% while requiring only 0.0118% trainable parameters.
Weiyi He, Yuping Lin, Jiliang Tang et al.
· 0 citations