Preprint
Jul 2026
Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning
ProGPO (Progress- and Reliability-Oriented Group Policy Optimization), a learned-critic-free method for context-consistent step-level learning that improves over matched agentic RL baselines under comparable computational overhead.
Mingxuan Fan, Peiyang Liu
· 0 citations