Jinna Li, Zhenfei Xiao, Jialu Fan, Tianyou Chai, Frank L. Lewis: Off-policy Q-learning: Solving Nash equilibrium of multi-player games with network-induced delay and unmeasured state. Autom. 136: 110076 (2022)