Reinforcement Learning for Diffusion Policies in Robotics: A Survey and State-Based Locomotion Reproduction
Diffusion policies model multimodal robot action sequences, but behavioral cloning does not directly optimize task return. We present a structured scoping review of reinforcement learning for generative robot policies and a bounded state-based locomotion reproduction. Four documented routes yielded 178 records, 162 uni...