Preprint
Jul 2026
TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
On long-horizon complex search, TRACE substantially improves base-model tool-use ability using pure RL, without a cold-start supervised fine-tuning stage, an agentic mid-training stage, or training on live-web data.
Leitian Tao, Baolin Peng, Wenlin Yao et al.
· 4 citations