Sreejith Balakrishnan, Quoc Phong Nguyen, Bryan Kian Hsiang Low, Harold Soh: Efficient Exploration of Reward Functions in Inverse Reinforcement Learning via Bayesian Optimization. NeurIPS 2020