Antoine Yang, Antoine Miech, Josef Sivic, Ivan Laptev, Cordelia Schmid: TubeDETR: Spatio-Temporal Video Grounding with Transformers. CVPR 2022: 16421-16432