Zihang Meng, Licheng Yu, Ning Zhang, Tamara L. Berg, Babak Damavandi, Vikas Singh, Amy Bearman: Connecting What to Say With Where to Look by Modeling Human Attention Traces. CoRR abs/2105.05964 (2021)