Sparse Additive Off-Policy Evaluation for Reinforcement Learning with Potentially Limited Number of Trajectories
A new framework for flexible, nonlinear, and interpretable off-policy evaluation for infinite-horizon reinforcement learning is developed and a group-sparsity-based feature screening procedure is proposed that identifies, with high probability, a reduced feature set containing all relevant covariates.