Ji Lin, Hongxu Yin, Wei Ping, Pavlo Molchanov, Mohammad Shoeybi, Song Han: VILA: On Pre-training for Visual Language Models. CVPR 2024: 26679-26689