Yue Zhang, Xiangyu Li, Wanshu Fan, Xin Yang, Dongsheng Zhou: DDVT: Dynamic Dual-Level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering. CGI (3) 2025: 441-456