Qiushan Guo, Shalini De Mello, Hongxu Yin, Wonmin Byeon, Ka Chun Cheung, Yizhou Yu, Ping Luo, Sifei Liu: RegionGPT: Towards Region Understanding Vision Language Model. CVPR 2024: 13796-13806