Preprint
Aug 2026
Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL
Influence Calibration for Self-Distillation (ICSD) improves all matched aggregate metrics over trust-only allocation under Group Relative Policy Optimization (GRPO) and Group-in-Group Policy Optimization (GiGPO) and raises cosine compatibility with the RL gradient.
Qi-Zhen Lan, Xi Xiao, Xiang-Chen Guan et al.
· 2 citations