Victor G. Lopez, Matthias Albrecht Müller: An Efficient Off-Policy Reinforcement Learning Algorithm for the Continuous-Time LQR Problem. CDC 2023: 13-19