Prompt Distribution Design for RLOO Countdown Reasoning
This work studies two prompt-distribution interventions while keeping the SFT initialization, verifier, and RLOO objective fixed, and compares uniform RLOO, a static curriculum, and an adaptive curriculum.
Zhibo Dai, Yikai Cao
· 0 citations