Preprint
Aug 2026
Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization
Environment-Regularized Policy Optimization (ERPO) replaces the standard Policy-KL regularizer while achieving effective control over query distribution drift, delivering stronger accuracy and substantially more stable behavior under high-temperature decoding and long-horizon training.
Xianlei Zhou, Xiangdi Meng, Yu He et al.
· 0 citations