Near-Optimal Reinforcement Learning with Multi-Step Transition Lookahead
The problem remains hard for every discount factor, and for every fixed discount factor, exact planning remains NP-hard, and a randomized polynomial-time approximation scheme is introduced for every fixed look-ahead depth.
Corentin Pla, Hugo Richard, Marc Abeille et al.
· 0 citations