Rubric-to-Code Credit Assignment for Reinforcement Learning
A reinforcement learning framework that converts rubric-level functional feedback into localized optimization signals over generated code and aligns evaluator-generated textual attributions with responsible code spans and generated tokens is proposed.
Rui Jin, Jikai Chen, Yihang Chen et al.
· 0 citations