Data-Driven Synthesis of Probabilistic Controlled Invariant Sets for Linear Markov Decision Processes
We study data-driven computation of <italic>probabilistic controlled invariant sets</italic> (PCIS) for safety-critical reinforcement learning under unknown dynamics. Assuming a linear MDP model, we use regularized least squares and self-normalized confidence bounds to construct a conservative estimate of the states fr...