


default search action
Jiaqi Wang 0003
Person information
- affiliation: Shanghai Artificial Intelligence Laboratory, China
- affiliation (PhD): Chinese University of Hong Kong, Multimedia Laboratory, Hong Kong
Other persons with the same name
- Jiaqi Wang — disambiguation page
- Jiaqi Wang 0001
— University of Southampton, UK - Jiaqi Wang 0002
— Pennsylvania State University, PA, USA - Jiaqi Wang 0004 — Tongji University, Shanghai, China
- Jiaqi Wang 0005
— Jinling Institute of Technology, Nanjing, China (and 2 more) - Jiaqi Wang 0006
— Beijing Jiaotong University, Beijing, China - Jiaqi Wang 0007
— Sun Yat-sen University, School of Pharmaceutical Sciences (Shenzhen), China - Jiaqi Wang 0008 — Zhejiang University, China
- Jiaqi Wang 0009
— Fudan University, Shanghai, China - Jiaqi Wang 0010
— Northwestern Polytechnical University, School of Computer Science, Xi'an, China - Jiaqi Wang 0011
— Northeastern University, School of Computer Science and Engineering, Shenyang, China - Jiaqi Wang 0012 — Chinese University of Hong Kong, Department of Computer Science and Engineering, Hong Kong
- Jiaqi Wang 0013
— Northeastern University, School of Computer Science and Engineering, MoE Key Laboratory of Intelligent Computing in Medical Image, Shenyang, China - Jiaqi Wang 0014
— Zhejiang Energy R&D Institute Co., Ltd, China (and 1 more) - Jiaqi Wang 0015 — Wuhan University, LIEMARS, China
- Jiaqi Wang 0016
— Beihang University, School of Instrumentation and Optoelectronic Engineering, China - Jiaqi Wang 0017 — University of Technology Sydney, NSW, Australia
Refine list

refinements active!
zoomed in on ?? of ?? records
view refined list in
2020 – today
- 2026
[j11]Nana Zhang
, Jiaqi Wang
, Dandan Zhu
, Kun Zhu
, Xiongkuo Min
, Guangtao Zhai
:
Beyond catastrophic forgetting: A continual learning-driven multi-modal fusion model for saliency prediction in dynamic scenes. Expert Syst. Appl. 328: 132881 (2026)
[j10]Xiongri Shen
, Jiaqi Wang, Yi Zhong, Zhenxi Song
, Leilei Zhao, Ahmed M. Anter
, Yichen Wei, Lingyan Liang, Demao Deng, Baiying Lei
, Shuqiang Wang, Zhiguo Zhang:
Diagnostically faithful fMRI-dMRI synthesis using disease-informed diffusion priors. Inf. Fusion 133: 104301 (2026)
[j9]Jiaqi Wang
, Liutao Yu, Liwei Huang, Chenlin Zhou, Han Zhang
, Zhenxi Song, Honghai Liu, Min Zhang, Zhengyu Ma, Zhiguo Zhang
:
Efficient speech command recognition leveraging spiking neural networks and progressive time-scaled curriculum distillation. Neural Networks 195: 108253 (2026)
[j8]Ziyu Liu
, Zeyi Sun
, Yuhang Zang
, Wei Li, Pan Zhang, Xiaoyi Dong, Yuanjun Xiong
, Dahua Lin
, Jiaqi Wang
:
RAR: Retrieving and Ranking Augmented MLLMs for Visual Recognition. IEEE Trans. Image Process. 35: 388-401 (2026)
[c79]Jiaqi Wang, Liutao Yu, Xiongri Shen
, Sihang Guo, Chenlin Zhou, Leilei Zhao, Yi Zhong, Zhiguo Zhang, Zhengyu Ma:
SpikCommander: A High-performance Spiking Transformer with Multi-view Learning for Efficient Speech Command Recognition. AAAI 2026: 2119-2127
[c78]Chenlin Zhou, Liutao Yu, Zhaokun Zhou, Han Zhang, Jiaqi Wang, Huihui Zhou, Zhengyu Ma, Yonghong Tian:
Spikingformer: A Key Foundation Model for Spiking Neural Networks. AAAI 2026: 2236-2244
[c77]Zhangyang Qi, Jinsong Li, Hongjian Wu, Jiaqi Wang, Hengshuang Zhao:
Game Ground Bench: Probing the Limits of LVLMs in Complex Semantic Grounding Across Game Universes. AAAI 2026: 8493-8501
[c76]Yifei Gao, Junhong Ye, Yifan Yang, Jiaqi Wang, Yi Zhang, Ruichen Zhang, Jitao Sang:
WebSynthesis: World Model-Guided Monte Carlo Tree Search for Efficient WebAgent Trajectory Synthesis. ACL (1) 2026: 25241-25258
[i146]Yibin Wang, Yuhang Zang, Feng Han, Jiazi Bu, Yujie Zhou, Cheng Jin, Jiaqi Wang:
Unified Personalized Reward Model for Vision Generation. CoRR abs/2602.02380 (2026)
[i145]Yuhao Dong, Shulin Tian, Shuai Liu, Shuangrui Ding, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Jiaqi Wang, Ziwei Liu:
Demo-ICL: In-Context Learning for Procedural Video Knowledge Acquisition. CoRR abs/2602.08439 (2026)
[i144]Jinsong Li, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Jiaqi Wang, Dahua Lin:
Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing. CoRR abs/2602.16455 (2026)
[i143]Jiazi Bu, Pengyang Ling, Yujie Zhou, Yibin Wang, Yuhang Zang, Tianyi Wei, Xiaohang Zhan, Jiaqi Wang, Tong Wu, Xingang Pan, Dahua Lin:
From Sparse to Dense: Multi-View GRPO for Flow Models via Augmented Condition Space. CoRR abs/2603.12648 (2026)
[i142]Ziyu Liu, Shengyuan Ding, Xinyu Fang, Xuanlang Dai, Penghui Yang, Jianze Liang, Jiaqi Wang, Kai Chen, Dahua Lin, Yuhang Zang:
Visual-ERM: Reward Modeling for Visual Equivalence. CoRR abs/2603.13224 (2026)
[i141]Chenlin Zhou, Sihang Guo, Jiaqi Wang, Dongyang Ma, Kaiwei Che, Baiyu Chen, Qingyan Meng, Zhengyu Ma, Yonghong Tian:
Winner-Take-All Spiking Transformer for Language Modeling. CoRR abs/2604.11321 (2026)
[i140]Chenlin Zhou, Sihang Guo, Jiaqi Wang, Dongyang Ma, Jin Cheng, Qingyan Meng, Zhengyu Ma, Yonghong Tian:
Adaptive Spiking Neurons for Vision and Language Modeling. CoRR abs/2604.12365 (2026)
[i139]Shuangrui Ding, Xuanlang Dai, Long Xing, Shengyuan Ding, Ziyu Liu, Yang JingYi, Penghui Yang, Zhixiong Zhang, Xilin Wei, Xinyu Fang, Yubo Ma, Haodong Duan, Jing Shao, Jiaqi Wang, Dahua Lin, Kai Chen, Yuhang Zang:
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation. CoRR abs/2605.10912 (2026)
[i138]Sihang Guo, Chenlin Zhou, Jiaqi Wang, Kehai Chen, Qingyan Meng, Zhengyu Ma:
BiSpikCLM: A Spiking Language Model integrating Softmax-Free Spiking Attention and Spike-Aware Alignment Distillation. CoRR abs/2605.13859 (2026)
[i137]Zhixiong Zhang, Yizhuo Li, Shuangrui Ding, Yuhang Zang, Shengyuan Ding, Long Xing, Yibin Wang, Qiaosheng Zhang, Jiaqi Wang:
SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction. CoRR abs/2605.20110 (2026)
[i136]Tianhang Wang, Yitong Chen, Wei Song, Zuxuan Wu, Min Li, Jiaqi Wang:
DecQ: Detail-Condensing Queries for Enhanced Reconstruction and Generation in Representation Autoencoders. CoRR abs/2605.22777 (2026)
[i135]Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin:
ETCHR: Editing To Clarify and Harness Reasoning. CoRR abs/2605.23897 (2026)
[i134]Wei Song, Tianhang Wang, Yitong Chen, Tong Zhang, Zuxuan Wu, Min Li, Jiaqi Wang, Kaicheng Yu:
Channel-wise Vector Quantization. CoRR abs/2605.26089 (2026)
[i133]Xiongri Shen, Jiaqi Wang, Zhenxi Song, Yi Zhong, Leilei Zhao, Xin He, Baiying Lei, Zhiguo Zhang:
Brain-Atlas-Guided Generative Counterfactual Attention for Explainable Cognitive Decline Diagnosis Using Multimodal Connectomes. CoRR abs/2606.01237 (2026)
[i132]Jiazi Bu, Pengyang Ling, Yujie Zhou, Yibin Wang, Yuhang Zang, Tianyi Wei, Xiaohang Zhan, Jiaqi Wang, Tong Wu, Xingang Pan, Dahua Lin:
AdaGRPO: A Capability-Aware Adaptive Enhancement for Flow-based GRPO. CoRR abs/2606.06828 (2026)
[i131]Xiongri Shen, Zhenxi Song, Jiaqi Wang, Yi Zhong, Leilei Zhao, Chenqi Xu, Linling Li, Yichen Wei, Lingyan Liang, Demao Deng, Luping Song, Ping Luan, Ahmed M. Anter, Shuqiang Wang, Baiying Lei, Zhiguo Zhang:
NeuroAlign: Hierarchical Multimodal Fusion of Dynamic and Structural Neuroimaging for MCI Analysis. CoRR abs/2606.07635 (2026)
[i130]Penghui Yang, Long Xing, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Yibin Wang, Yujie Zhou, Jiazi Bu, Jianze Liang, Qidong Huang, Jiaqi Wang, Feng Wu, Dahua Lin:
CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning. CoRR abs/2606.09393 (2026)
[i129]Shuai Yang, Bingjie Gao, Ziwei Liu, Jiaqi Wang, Dahua Lin, Tong Wu:
PermaVid: Consistent Video Generation Across Edits via Disentangled Context Memory. CoRR abs/2606.16449 (2026)
[i128]Shengyuan Ding, Xilin Wei, Xinyu Fang, Haodong Duan, Dahua Lin, Jiaqi Wang, Yuhang Zang:
Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games. CoRR abs/2606.19338 (2026)
[i127]Xinlei Yu, Gen Li, Qingyi Si, Guibin Zhang, Yuqi Xu, Congcong Wang, Shuai Dong, Kaiwen Tuo, Xiangyu Zeng, Kaituo Feng, Qunzhong Wang, Yang Shi, Xiaobin Hu, Xiangyu Yue, Jiaqi Wang, Shuicheng Yan:
DOPD: Dual On-policy Distillation. CoRR abs/2606.30626 (2026)- 2025
[j7]Zhao Yang
, Jiaqi Wang
, Xubing Ye
, Yansong Tang
, Kai Chen
, Hengshuang Zhao
, Philip H. S. Torr
:
Language-Aware Vision Transformer for Referring Segmentation. IEEE Trans. Pattern Anal. Mach. Intell. 47(7): 5238-5255 (2025)
[j6]Zhibing Li
, Mengchen Zhang
, Tong Wu
, Jing Tan
, Jiaqi Wang
, Dahua Lin
:
SS4D: Native 4D Generative Model via Structured Spacetime Latents. ACM Trans. Graph. 44(6): 244:1-244:12 (2025)
[c75]Runchuan Zhu, Zhipeng Ma, Jiang Wu, Junyuan Gao, Jiaqi Wang
, Dahua Lin, Conghui He:
Utilize the Flow Before Stepping into the Same River Twice: Certainty Represented Knowledge Flow for Refusal-Aware Instruction Tuning. AAAI 2025: 26157-26165
[c74]Jilong Li, Zhenxi Song, Jiaqi Wang, Meishan Zhang, Honghai Liu, Min Zhang, Zhiguo Zhang:
BrainECHO: Semantic Brain Signal Decoding through Vector-Quantized Spectrogram Reconstruction for Whisper-Enhanced Text Generation. ACL (Findings) 2025: 2762-2778
[c73]Yuhang Zang, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Ziyu Liu, Shengyuan Ding, Shenxi Wu, Yubo Ma, Haodong Duan, Wenwei Zhang, Kai Chen, Dahua Lin, Jiaqi Wang:
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model. ACL (Findings) 2025: 6547-6563
[c72]Shuangrui Ding, Zihan Liu, Xiaoyi Dong, Pan Zhang, Rui Qian, Junhao Huang, Conghui He, Dahua Lin, Jiaqi Wang
:
SongComposer: A Large Language Model for Lyric and Melody Generation in Song Composition. ACL (1) 2025: 7108-7127
[c71]Xiangyu Zhao, Shengyuan Ding, Zicheng Zhang, Haian Huang, Maosongcao, Jiaqi Wang, Weiyun Wang, Xinyu Fang
, Wenhai Wang, Guangtao Zhai, Hua Yang, Haodong Duan, Kai Chen:
OmniAlign-V: Towards Enhanced Alignment of MLLMs with Human Preference. ACL (1) 2025: 18490-18515
[c70]Yubo Ma, Jinsong Li, Yuhang Zang, Xiaobao Wu, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Haodong Duan, Jiaqi Wang, Yixin Cao, Aixin Sun:
Towards Storage-Efficient Visual Document Retrieval: An Empirical Study on Reducing Patch-Level Embeddings. ACL (Findings) 2025: 19568-19580
[c69]Jiazi Bu, Pengyang Ling, Pan Zhang, Tong Wu, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang:
ByTheWay: Boost Your Text-to-Video Generation Model to Higher Quality in a Training-free Way. CVPR 2025: 12999-13008
[c68]Long Xing, Qidong Huang, Xiaoyi Dong, Jiajie Lu, Pan Zhang, Yuhang Zang, Yuhang Cao, Conghui He, Jiaqi Wang
, Feng Wu, Dahua Lin:
Conical Visual Concentration for Efficient Large Vision-Language Models. CVPR 2025: 14593-14603
[c67]Junbo Niu, Yifei Li, Ziyang Miao, Chunjiang Ge, Yuanhang Zhou, Qihao He, Xiaoyi Dong, Haodong Duan, Shuangrui Ding, Rui Qian, Pan Zhang, Yuhang Zang, Yuhang Cao, Conghui He, Jiaqi Wang
:
OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding? CVPR 2025: 18902-18913
[c66]Rui Qian, Shuangrui Ding, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang
:
Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction. CVPR 2025: 24045-24055
[c65]Qidong Huang, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Jiaqi Wang, Weiming Zhang, Nenghai Yu:
Deciphering Cross-Modal Alignment in Large Vision-Language Models Via Modality Integration Rate. ICCV 2025: 218-227
[c64]Shengyuan Ding, Shenxi Wu, Xiangyu Zhao, Yuhang Zang, Haodong Duan, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Dahua Lin, Jiaqi Wang:
MM-IFEngine: Towards Multimodal Instruction Following. ICCV 2025: 1099-1109
[c63]Ziyu Liu, Zeyi Sun, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Haodong Duan, Dahua Lin, Jiaqi Wang:
Visual-RFT: Visual Reinforcement Fine-Tuning. ICCV 2025: 2034-2044
[c62]Yujie Zhou, Jiazi Bu, Pengyang Ling, Pan Zhang, Tong Wu, Qidong Huang, Jinsong Li, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Anyi Rao, Jiaqi Wang, Li Niu:
Light-a-Video: Training-Free Video Relighting via Progressive Light Fusion. ICCV 2025: 13315-13325
[c61]Shuangrui Ding, Rui Qian, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Yuwei Guo, Dahua Lin, Jiaqi Wang:
SAM2LONG: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory Tree. ICCV 2025: 13614-13624
[c60]Zeyi Sun, Tong Wu, Pan Zhang, Yuhang Zang, Xiaoyi Dong, Yuanjun Xiong, Dahua Lin, Jiaqi Wang:
Bootstrap3D: Improving Multi-View Diffusion Model with Synthetic Data. ICCV 2025: 15714-15726
[c59]Zeyi Sun, Ziyang Chu, Pan Zhang, Tong Wu, Yuhang Zang, Xiaoyi Dong, Yuanjun Xiong, Dahua Lin, Jiaqi Wang:
X-Prompt: Generalizable Auto-Regressive Visual Learning with In-Context Prompting. ICCV 2025: 17268-17280
[c58]Zhibing Li, Tong Wu, Jing Tan, Mengchen Zhang, Jiaqi Wang, Dahua Lin:
IDArb: Intrinsic Decomposition for Arbitrary Number of Input Views and Illuminations. ICLR 2025
[c57]Pengyang Ling, Jiazi Bu, Pan Zhang, Xiaoyi Dong, Yuhang Zang, Tong Wu, Huaian Chen, Jiaqi Wang, Yi Jin:
MotionClone: Training-Free Motion Cloning for Controllable Video Generation. ICLR 2025
[c56]Ziyu Liu, Yuhang Zang, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Haodong Duan, Conghui He, Yuanjun Xiong, Dahua Lin, Jiaqi Wang:
MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models. ICLR 2025
[c55]Zhiyuan Zhao, Bin Wang, Linke Ouyang, Xiaoyi Dong, Jiaqi Wang, Conghui He:
Beyond Multimodal Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization. ICME 2025: 1-6
[c54]Zhiyuan Zhao, Bin Wang, Linke Ouyang, Yiqi Lin, Pan Zhang, Xiaoyi Dong, Jiaqi Wang, Conghui He:
MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation. ICME 2025: 1-6
[c53]Zihan Liu, Shuangrui Ding, Zhixiong Zhang, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang:
SongGen: A Single Stage Auto-regressive Transformer for Text-to-Song Generation. ICML 2025
[c52]Xilin Wei, Xiaoran Liu, Yuhang Zang, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Jian Tong, Haodong Duan, Qipeng Guo, Jiaqi Wang, Xipeng Qiu, Dahua Lin:
VideoRoPE: What Makes for Good Video Rotary Position Embedding? ICML 2025
[c51]Yi Zhong, Xubin Zheng, Xiongri Shen
, Jiaqi Wang, Leilei Zhao, Zhenxi Song, Zhiguo Zhang:
Thread the Needle: Genomics-Guided Prompt-Bridged Attention Model for Survival Prediction of Glioma Based on MRI Images. MICCAI (7) 2025: 625-635
[c50]Jiazi Bu, Pengyang Ling, Yujie Zhou, Pan Zhang, Tong Wu, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang:
HiFlow: Training-free High-Resolution Image Generation with Flow-Aligned Guidance. NeurIPS 2025
[c49]Jiaqi Wang, Kevin Qinghong Lin, James Cheng, Mike Zheng Shou:
Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models. NeurIPS 2025
[c48]Yibin Wang, Zhimin Li, Yuhang Zang, Chunyu Wang, Qinglin Lu, Cheng Jin, Jiaqi Wang:
Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning. NeurIPS 2025
[c47]Jiaqi Wang, Zhengyu Ma, Xiongri Shen, Chenlin Zhou, Leilei Zhao, Han Zhang, Yi Zhong, Siqi Cai, Zhenxi Song, Zhiguo Zhang:
S$^2$M-Former: Spiking Symmetric Mixing Branchformer for Brain Auditory Attention Detection. NeurIPS 2025
[i126]Zhangyang Qi, Zhixiong Zhang, Ye Fang, Jiaqi Wang, Hengshuang Zhao:
GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models. CoRR abs/2501.01428 (2025)
[i125]Rui Qian, Shuangrui Ding, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang
:
Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction. CoRR abs/2501.03218 (2025)
[i124]Beichen Zhang, Yuhong Liu, Xiaoyi Dong, Yuhang Zang, Pan Zhang, Haodong Duan, Yuhang Cao, Dahua Lin, Jiaqi Wang:
BoostStep: Boosting mathematical capability of Large Language Models via improved single-step reasoning. CoRR abs/2501.03226 (2025)
[i123]Yifei Li, Junbo Niu, Ziyang Miao, Chunjiang Ge, Yuanhang Zhou, Qihao He, Xiaoyi Dong, Haodong Duan, Shuangrui Ding, Rui Qian, Pan Zhang, Yuhang Zang, Yuhang Cao, Conghui He, Jiaqi Wang
:
OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding? CoRR abs/2501.05510 (2025)
[i122]Yuhang Zang, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Ziyu Liu, Shengyuan Ding, Shenxi Wu, Yubo Ma, Haodong Duan, Wenwei Zhang, Kai Chen, Dahua Lin, Jiaqi Wang
:
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model. CoRR abs/2501.12368 (2025)
[i121]Ye Fang, Zeyi Sun, Shangzhan Zhang, Tong Wu, Yinghao Xu, Pan Zhang, Jiaqi Wang, Gordon Wetzstein, Dahua Lin:
RelightVid: Temporal-Consistent Diffusion Model for Video Relighting. CoRR abs/2501.16330 (2025)
[i120]Xilin Wei, Xiaoran Liu, Yuhang Zang, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Jian Tong, Haodong Duan, Qipeng Guo, Jiaqi Wang
, Xipeng Qiu, Dahua Lin:
VideoRoPE: What Makes for Good Video Rotary Position Embedding? CoRR abs/2502.05173 (2025)
[i119]Yujie Zhou, Jiazi Bu, Pengyang Ling, Pan Zhang, Tong Wu, Qidong Huang, Jinsong Li, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Anyi Rao, Jiaqi Wang
, Li Niu:
Light-A-Video: Training-free Video Relighting via Progressive Light Fusion. CoRR abs/2502.08590 (2025)
[i118]Zihan Liu, Shuangrui Ding, Zhixiong Zhang, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang
:
SongGen: A Single Stage Auto-regressive Transformer for Text-to-Song Generation. CoRR abs/2502.13128 (2025)
[i117]Xiangyu Zhao, Shengyuan Ding, Zicheng Zhang, Haian Huang, Maosong Cao, Weiyun Wang, Jiaqi Wang
, Xinyu Fang, Wenhai Wang, Guangtao Zhai, Haodong Duan, Hua Yang, Kai Chen:
OmniAlign-V: Towards Enhanced Alignment of MLLMs with Human Preference. CoRR abs/2502.18411 (2025)
[i116]Ziyu Liu, Zeyi Sun, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Haodong Duan, Dahua Lin, Jiaqi Wang
:
Visual-RFT: Visual Reinforcement Fine-Tuning. CoRR abs/2503.01785 (2025)
[i115]Yibin Wang, Yuhang Zang, Hao Li, Cheng Jin, Jiaqi Wang:
Unified Reward Model for Multimodal Understanding and Generation. CoRR abs/2503.05236 (2025)
[i114]Jiazi Bu, Pengyang Ling, Yujie Zhou, Pan Zhang, Tong Wu, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang
:
HiFlow: Training-free High-Resolution Image Generation with Flow-Aligned Guidance. CoRR abs/2504.06232 (2025)
[i113]Shengyuan Ding, Shenxi Wu, Xiangyu Zhao, Yuhang Zang, Haodong Duan, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Dahua Lin, Jiaqi Wang
:
MM-IFEngine: Towards Multimodal Instruction Following. CoRR abs/2504.07957 (2025)
[i112]Yibin Wang, Zhimin Li, Yuhang Zang, Chunyu Wang, Qinglin Lu, Cheng Jin, Jiaqi Wang:
Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning. CoRR abs/2505.03318 (2025)
[i111]Jiaqi Wang, Yusen Zhang, Xi Li:
NeuroGen: Neural Network Parameter Generation via Large Language Models. CoRR abs/2505.12470 (2025)
[i110]Ziyu Liu, Yuhang Zang, Yushan Zou, Zijian Liang, Xiaoyi Dong, Yuhang Cao, Haodong Duan, Dahua Lin, Jiaqi Wang:
Visual Agentic Reinforcement Fine-Tuning. CoRR abs/2505.14246 (2025)
[i109]Jiaqi Wang, Kevin Qinghong Lin, James Cheng, Mike Zheng Shou:
Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models. CoRR abs/2505.16854 (2025)
[i108]Tong Wang, Jiaqi Wang, Shu Kong:
Active Learning via Vision-Language Model Adaptation with Open Data. CoRR abs/2506.01724 (2025)
[i107]Yubo Ma, Jinsong Li, Yuhang Zang, Xiaobao Wu, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Haodong Duan, Jiaqi Wang
, Yixin Cao, Aixin Sun:
Towards Storage-Efficient Visual Document Retrieval: An Empirical Study on Reducing Patch-Level Embeddings. CoRR abs/2506.04997 (2025)
[i106]Zhangyang Qi, Zhixiong Zhang, Yizhou Yu, Jiaqi Wang, Hengshuang Zhao:
VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning. CoRR abs/2506.17221 (2025)
[i105]Long Xing, Qidong Huang, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Jinsong Li, Shuangrui Ding, Weiming Zhang, Nenghai Yu, Jiaqi Wang, Feng Wu, Dahua Lin:
ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing. CoRR abs/2506.19848 (2025)
[i104]Zhixiong Zhang, Shuangrui Ding, Xiaoyi Dong, Songxin He, Jianfan Lin, Junsong Tang, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang:
SeC: Advancing Complex Video Object Segmentation via Progressive Concept Construction. CoRR abs/2507.15852 (2025)
[i103]Jinsong Li, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Jiaqi Wang, Dahua Lin:
Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language Models. CoRR abs/2508.00819 (2025)
[i102]Zeyi Sun, Ziyu Liu, Yuhang Zang, Yuhang Cao, Xiaoyi Dong, Tong Wu, Dahua Lin, Jiaqi Wang:
SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience. CoRR abs/2508.04700 (2025)
[i101]Jiaqi Wang, Zhengyu Ma, Xiongri Shen, Chenlin Zhou, Leilei Zhao, Han Zhang, Yi Zhong, Siqi Cai, Zhenxi Song, Zhiguo Zhang:
S2M-Former: Spiking Symmetric Mixing Branchformer for Brain Auditory Attention Detection. CoRR abs/2508.05164 (2025)
[i100]Jiazi Bu, Pengyang Ling, Yujie Zhou, Yibin Wang, Yuhang Zang, Tong Wu, Dahua Lin, Jiaqi Wang:
DiCache: Let Diffusion Model Determine Its Own Cache. CoRR abs/2508.17356 (2025)
[i99]Zeyi Sun, Yuhang Cao, Jianze Liang, Qiushi Sun, Ziyu Liu, Zhixiong Zhang, Yuhang Zang, Xiaoyi Dong, Kai Chen, Dahua Lin, Jiaqi Wang:
CODA: Coordinating the Cerebrum and Cerebellum for a Dual-Brain Computer Use Agent with Decoupled Reinforcement Learning. CoRR abs/2508.20096 (2025)
[i98]Yibin Wang, Zhimin Li, Yuhang Zang, Yujie Zhou, Jiazi Bu, Chunyu Wang, Qinglin Lu, Cheng Jin, Jiaqi Wang:
Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning. CoRR abs/2508.20751 (2025)
[i97]Xilin Wei, Xiaoran Liu, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Jiaqi Wang, Xipeng Qiu, Dahua Lin:
SIM-CoT: Supervised Implicit Chain-of-Thought. CoRR abs/2509.20317 (2025)
[i96]Junbo Niu, Zheng Liu, Zhuangcheng Gu, Bin Wang, Linke Ouyang, Zhiyuan Zhao, Tao Chu, Tianyao He, Fan Wu, Qintong Zhang, Zhenjiang Jin, Guang Liang, Rui Zhang, Wenzheng Zhang, Yuan Qu, Zhifei Ren, Yuefeng Sun, Yuanhong Zheng, Dongsheng Ma, Zirui Tang, Boyu Niu, Ziyang Miao, Hejun Dong, Siyi Qian, Junyuan Zhang, Jingzhou Chen, Fangdong Wang, Xiaomeng Zhao
, Liqun Wei, Wei Li, Shasha Wang, Ruiliang Xu, Yuanyuan Cao, Lu Chen, Qianqian Wu, Huaiyu Gu, Lindong Lu, Keming Wang, Dechen Lin, Guanlin Shen, Xuanhe Zhou, Linfeng Zhang, Yuhang Zang, Xiaoyi Dong, Jiaqi Wang, Bo Zhang, Lei Bai, Pei Chu, Weijia Li, Jiang Wu, Lijun Wu, Zhenxiang Li, Guangyu Wang, Zhongying Tu, Chao Xu, Kai Chen, Yu Qiao, Bowen Zhou, Dahua Lin, Wentao Zhang, Conghui He:
MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing. CoRR abs/2509.22186 (2025)
[i95]Ziyu Liu, Yuhang Zang, Shengyuan Ding, Yuhang Cao, Xiaoyi Dong, Haodong Duan, Dahua Lin, Jiaqi Wang:
SPARK: Synergistic Policy And Reward Co-Evolving Framework. CoRR abs/2509.22624 (2025)
[i94]Long Xing, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Jianze Liang, Qidong Huang, Jiaqi Wang, Feng Wu, Dahua Lin:
CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning. CoRR abs/2509.22647 (2025)
[i93]Zhixiong Zhang, Shuangrui Ding, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Jiaqi Wang:
2nd Place Report of MOSEv2 Challenge 2025: Concept Guided Video Object Segmentation via SeC. CoRR abs/2509.23838 (2025)
[i92]Yujie Zhou, Pengyang Ling, Jiazi Bu, Yibin Wang, Yuhang Zang, Jiaqi Wang, Li Niu, Guangtao Zhai:
G2RPO: Granular GRPO for Precise Reward in Flow Models. CoRR abs/2510.01982 (2025)
[i91]Yibin Wang, Zhimin Li, Yuhang Zang, Jiazi Bu, Yujie Zhou, Yi Xin, Junjun He, Chunyu Wang, Qinglin Lu, Cheng Jin, Jiaqi Wang:
UniGenBench++: A Unified Semantic Evaluation Benchmark for Text-to-Image Generation. CoRR abs/2510.18701 (2025)
[i90]Zihan Liu, Zhikang Niu, Qiuyang Xiao, Zhisheng Zheng, Ruoqi Yuan, Yuhang Zang, Yuhang Cao, Xiaoyi Dong, Jianze Liang, Xie Chen, Leilei Sun, Dahua Lin, Jiaqi Wang:
STAR-Bench: Probing Deep Spatio-Temporal Reasoning as Audio 4D Intelligence. CoRR abs/2510.24693 (2025)
[i89]Yuhong Liu, Beichen Zhang, Yuhang Zang, Yuhang Cao, Long Xing, Xiaoyi Dong, Haodong Duan, Dahua Lin, Jiaqi Wang:
Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning. CoRR abs/2510.27606 (2025)
[i88]Xiongri Shen, Jiaqi Wang, Yi Zhong, Zhenxi Song, Leilei Zhao, Yichen Wei, Lingyan Liang, Shuqiang Wang, Baiying Lei, Demao Deng, Zhiguo Zhang:
Pattern-Aware Diffusion Synthesis of fMRI/dMRI with Tissue and Microstructural Refinement. CoRR abs/2511.04963 (2025)
[i87]Xiongri Shen, Jiaqi Wang, Yi Zhong, Zhenxi Song, Leilei Zhao, Liling Li, Yichen Wei, Lingyan Liang, Shuqiang Wang, Baiying Lei, Demao Deng, Zhiguo Zhang:
BrainCSD: A Hierarchical Consistency-Driven MoE Foundation Model for Unified Connectome Synthesis and Multitask Brain Trait Prediction. CoRR abs/2511.05630 (2025)
[i86]Jiaqi Wang, Liutao Yu, Xiongri Shen, Sihang Guo, Chenlin Zhou, Leilei Zhao, Yi Zhong, Zhengyu Ma, Zhiguo Zhang:
SpikCommander: A High-performance Spiking Transformer with Multi-view Learning for Efficient Speech Command Recognition. CoRR abs/2511.07883 (2025)
[i85]Beichen Zhang, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Haodong Duan, Dahua Lin, Jiaqi Wang:
Think Visually, Reason Textually: Vision-Language Synergy in ARC. CoRR abs/2511.15703 (2025)
[i84]Han Zhang, Qingyan Meng, Jiaqi Wang, Baiyu Chen, Zhengyu Ma, Xiaopeng Fan:
Temporal-adaptive Weight Quantization for Spiking Neural Networks. CoRR abs/2511.17567 (2025)
[i83]Shengyuan Ding, Xinyu Fang, Ziyu Liu, Yuhang Zang, Yuhang Cao, Xiangyu Zhao, Haodong Duan, Xiaoyi Dong, Jianze Liang, Bin Wang, Conghui He, Dahua Lin, Jiaqi Wang:
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning. CoRR abs/2512.05111 (2025)
[i82]Jiaqi Wang, Weijia Wu, Yi Zhan, Rui Zhao, Ming Hu, James Cheng, Wei Liu, Philip Torr, Kevin Qinghong Lin:
Video Reality Test: Can AI-Generated ASMR Videos fool VLMs and Humans? CoRR abs/2512.13281 (2025)
[i81]Zhibing Li, Mengchen Zhang, Tong Wu, Jing Tan, Jiaqi Wang, Dahua Lin:
SS4D: Native 4D Generative Model via Structured Spacetime Latents. CoRR abs/2512.14284 (2025)- 2024
[j5]Min Zhou
, Jiaqi Wang, Jiahao Shi, Guangtao Zhai, Xiaowen Zhou, Lulu Ye, Lunhao Li
, Menghan Hu
, Yixiong Zhou:
Prediction model of radiotherapy outcome for Ocular Adnexal Lymphoma using informative features selected by chemometric algorithms. Comput. Biol. Medicine 170: 108067 (2024)
[j4]Zhe Chen, Weiyun Wang
, Hao Tian, Shenglong Ye
, Zhangwei Gao, Erfei Cui, Wenwen Tong, Kongzhi Hu, Jiapeng Luo, Zheng Ma, Ji Ma, Jiaqi Wang
, Xiaoyi Dong, Hang Yan, Hewei Guo, Conghui He, Botian Shi, Zhenjiang Jin, Chao Xu, Bin Wang, Xingjian Wei, Wei Li, Wenjian Zhang, Bo Zhang, Pinlong Cai, Licheng Wen, Xiangchao Yan, Min Dou, Lewei Lu, Xizhou Zhu
, Tong Lu, Dahua Lin, Yu Qiao, Jifeng Dai, Wenhai Wang:
How far are we to GPT-4V? Closing the gap to commercial multimodal models with open-source suites. Sci. China Inf. Sci. 67(12) (2024)
[j3]Dingzirui Wang, Longxu Dou, Wanxiang Che
, Jiaqi Wang, Jinbo Liu, Lixin Li, Jingan Shang, Lei Tao, Jie Zhang, Cong Fu, Xuri Song:
ConDA: state-based data augmentation for context-dependent text-to-SQL. Int. J. Mach. Learn. Cybern. 15(8): 3157-3168 (2024)
[c46]Zhangyang Qi, Jiaqi Wang
, Xiaoyang Wu, Hengshuang Zhao:
OCBEV: Object-Centric BEV Transformer for Multi-View 3D Object Detection. 3DV 2024: 1188-1197
[c45]Bin Wang
, Fan Wu, Xiao Han, Jiahui Peng, Huaping Zhong, Pan Zhang, Xiaoyi Dong, Weijia Li, Wei Li, Jiaqi Wang
, Conghui He:
VIGC: Visual Instruction Generation and Correction. AAAI 2024: 5309-5317
[c44]Jiaqi Wang
, Zhenxi Song, Zhengyu Ma, Xipeng Qiu, Min Zhang, Zhiguo Zhang:
Enhancing EEG-to-Text Decoding through Transferable Representations from Pre-trained Contrastive EEG-Text Masked Autoencoder. ACL (1) 2024: 7278-7292
[c43]Zeyi Sun, Ye Fang, Tong Wu, Pan Zhang, Yuhang Zang
, Shu Kong, Yuanjun Xiong, Dahua Lin, Jiaqi Wang
:
Alpha-CLIP: A CLIP Model Focusing on Wherever you Want. CVPR 2024: 13019-13029
[c42]Qidong Huang, Xiaoyi Dong, Pan Zhang, Bin Wang, Conghui He, Jiaqi Wang
, Dahua Lin, Weiming Zhang, Nenghai Yu:
OPERA: Alleviating Hallucination in Multi-Modal Large Language Models via Over-Trust Penalty and Retrospection-Allocation. CVPR 2024: 13418-13427
[c41]Zhangyang Qi, Ye Fang, Zeyi Sun, Xiaoyang Wu, Tong Wu, Jiaqi Wang
, Dahua Lin, Hengshuang Zhao:
GPT4Point: A Unified Framework for Point-Language Understanding and Generation. CVPR 2024: 26407-26417
[c40]Jiaming Han, Kaixiong Gong, Yiyuan Zhang, Jiaqi Wang
, Kaipeng Zhang
, Dahua Lin, Yu Qiao, Peng Gao, Xiangyu Yue:
OneLLM: One Framework to Align All Modalities with Language. CVPR 2024: 26574-26585
[c39]Jiaming Zhang, Xingjun Ma, Xin Wang, Lingyu Qiu, Jiaqi Wang, Yu-Gang Jiang, Jitao Sang:
Adversarial Prompt Tuning for Vision-Language Models. ECCV (45) 2024: 56-72
[c38]Yuan Liu, Haodong Duan, Yuanhan Zhang, Bo Li, Songyang Zhang, Wangbo Zhao, Yike Yuan, Jiaqi Wang
, Conghui He, Ziwei Liu, Kai Chen, Dahua Lin:
MMBench: Is Your Multi-modal Model an All-Around Player? ECCV (6) 2024: 216-233
[c37]Beichen Zhang, Pan Zhang, Xiaoyi Dong, Yuhang Zang, Jiaqi Wang
:
Long-CLIP: Unlocking the Long-Text Capability of CLIP. ECCV (51) 2024: 310-325
[c36]Lin Chen, Jinsong Li, Xiaoyi Dong, Pan Zhang, Conghui He, Jiaqi Wang
, Feng Zhao, Dahua Lin:
ShareGPT4V: Improving Large Multi-modal Models with Better Captions. ECCV (17) 2024: 370-387
[c35]Dachuan Shi, Chaofan Tao, Anyi Rao, Zhendong Yang, Chun Yuan, Jiaqi Wang:
CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language Transformers. ICML 2024: 44960-44990
[c34]Yifei Gao
, Jiaqi Wang
, Zhiyu Lin
, Jitao Sang
:
AIGCs Confuse AI Too: Investigating and Explaining Synthetic Image-induced Hallucinations in Large Vision-Language Models. ACM Multimedia 2024: 9010-9018
[c33]Haodong Duan
, Junming Yang
, Yuxuan Qiao
, Xinyu Fang
, Lin Chen
, Yuan Liu
, Xiaoyi Dong
, Yuhang Zang
, Pan Zhang
, Jiaqi Wang
, Dahua Lin
, Kai Chen
:
VLMEvalKit: An Open-Source ToolKit for Evaluating Large Multi-Modality Models. ACM Multimedia 2024: 11198-11201
[c32]Lin Chen, Xilin Wei, Jinsong Li, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Zehui Chen, Haodong Duan, Lin Bin, Zhenyu Tang, Li Yuan, Yu Qiao, Dahua Lin, Feng Zhao, Jiaqi Wang:
ShareGPT4Video: Improving Video Understanding and Generation with Better Captions. NeurIPS 2024
[c31]Lin Chen, Jinsong Li, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Zehui Chen, Haodong Duan, Jiaqi Wang, Yu Qiao, Dahua Lin, Feng Zhao:
Are We on the Right Way for Evaluating Large Vision-Language Models? NeurIPS 2024
[c30]Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Bin Wang, Linke Ouyang, Songyang Zhang, Haodong Duan, Wenwei Zhang, Yining Li, Hang Yan, Yang Gao, Zhe Chen, Xinyue Zhang, Wei Li, Jingwen Li, Wenhai Wang, Kai Chen, Conghui He, Xingcheng Zhang, Jifeng Dai, Yu Qiao, Dahua Lin, Jiaqi Wang:
InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD. NeurIPS 2024
[c29]Ye Fang, Zeyi Sun, Tong Wu, Jiaqi Wang, Ziwei Liu, Gordon Wetzstein, Dahua Lin:
Make-it-Real: Unleashing Large Multimodal Model for Painting 3D Objects with Realistic Materials. NeurIPS 2024
[c28]Ziyu Liu, Tao Chu, Yuhang Zang, Xilin Wei, Xiaoyi Dong, Pan Zhang, Zijian Liang, Yuanjun Xiong, Yu Qiao, Dahua Lin, Jiaqi Wang:
MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs. NeurIPS 2024
[c27]Yubo Ma, Yuhang Zang, Liangyu Chen, Meiqi Chen, Yizhu Jiao, Xinze Li, Xinyuan Lu, Ziyu Liu, Yan Ma, Xiaoyi Dong, Pan Zhang, Liangming Pan, Yu-Gang Jiang, Jiaqi Wang, Yixin Cao, Aixin Sun:
MMLONGBENCH-DOC: Benchmarking Long-context Document Understanding with Visualizations. NeurIPS 2024
[c26]Rui Qian, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Shuangrui Ding, Dahua Lin, Jiaqi Wang:
Streaming Long Video Understanding with Large Language Models. NeurIPS 2024
[c25]Yuxuan Qiao, Haodong Duan, Xinyu Fang, Junming Yang, Lin Chen, Songyang Zhang, Jiaqi Wang, Dahua Lin, Kai Chen:
Prism: A Framework for Decoupling and Assessing the Capabilities of VLMs. NeurIPS 2024
[c24]Tong Wu, Yinghao Xu, Ryan Po, Mengchen Zhang, Guandao Yang, Jiaqi Wang, Ziwei Liu, Dahua Lin, Gordon Wetzstein:
FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models. NeurIPS 2024
[i80]Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Bin Wang, Linke Ouyang, Xilin Wei, Songyang Zhang
, Haodong Duan, Maosong Cao, Wenwei Zhang, Yining Li, Hang Yan, Yang Gao, Xinyue Zhang, Wei Li, Jingwen Li, Kai Chen, Conghui He, Xingcheng Zhang, Yu Qiao, Dahua Lin, Jiaqi Wang:
InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model. CoRR abs/2401.16420 (2024)
[i79]Ying Jin, Jiaqi Wang, Dahua Lin:
SepRep-Net: Multi-source Free Domain Adaptation via Model Separation And Reparameterization. CoRR abs/2402.08249 (2024)
[i78]Yuhang Cao, Pan Zhang, Xiaoyi Dong, Dahua Lin, Jiaqi Wang:
DualFocus: Integrating Macro and Micro Perspectives in Multi-modal Large Language Models. CoRR abs/2402.14767 (2024)
[i77]Jiaqi Wang, Zhenxi Song, Zhengyu Ma, Xipeng Qiu, Min Zhang, Zhiguo Zhang:
Enhancing EEG-to-Text Decoding through Transferable Representations from Pre-trained Contrastive EEG-Text Masked Autoencoder. CoRR abs/2402.17433 (2024)
[i76]Shuangrui Ding, Zihan Liu, Xiaoyi Dong, Pan Zhang, Rui Qian, Conghui He, Dahua Lin, Jiaqi Wang
:
SongComposer: A Large Language Model for Lyric and Melody Composition in Song Generation. CoRR abs/2402.17645 (2024)
[i75]Ziyu Liu, Zeyi Sun, Yuhang Zang, Wei Li, Pan Zhang, Xiaoyi Dong, Yuanjun Xiong, Dahua Lin, Jiaqi Wang:
RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition. CoRR abs/2403.13805 (2024)
[i74]Beichen Zhang, Pan Zhang, Xiaoyi Dong, Yuhang Zang, Jiaqi Wang
:
Long-CLIP: Unlocking the Long-Text Capability of CLIP. CoRR abs/2403.15378 (2024)
[i73]Zheng Cai, Maosong Cao, Haojiong Chen, Kai Chen, Keyu Chen, Xin Chen, Xun Chen, Zehui Chen, Zhi Chen, Pei Chu, Xiaoyi Dong, Haodong Duan, Qi Fan, Zhaoye Fei, Yang Gao
, Jiaye Ge, Chenya Gu, Yuzhe Gu, Tao Gui, Aijia Guo, Qipeng Guo, Conghui He, Yingfan Hu, Ting Huang, Tao Jiang, Penglong Jiao, Zhenjiang Jin, Zhikai Lei, Jiaxing Li, Jingwen Li, Linyang Li, Shuaibin Li, Wei Li, Yining Li, Hongwei Liu, Jiangning Liu, Jiawei Hong, Kaiwen Liu, Kuikun Liu, Xiaoran Liu, Chengqi Lv, Haijun Lv, Kai Lv, Li Ma, Runyuan Ma, Zerun Ma, Wenchang Ning, Linke Ouyang, Jiantao Qiu, Yuan Qu, Fukai Shang, Yunfan Shao, Demin Song, Zifan Song, Zhihao Sui, Peng Sun, Yu Sun, Huanze Tang, Bin Wang, Guoteng Wang
, Jiaqi Wang, Jiayu Wang, Rui Wang
, Yudong Wang, Ziyi Wang, Xingjian Wei, Qizhen Weng
, Fan Wu, Yingtong Xiong, Xiaomeng Zhao
, et al.:
InternLM2 Technical Report. CoRR abs/2403.17297 (2024)
[i72]Lin Chen, Jinsong Li, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Zehui Chen, Haodong Duan, Jiaqi Wang
, Yu Qiao, Dahua Lin, Feng Zhao:
Are We on the Right Way for Evaluating Large Vision-Language Models? CoRR abs/2403.20330 (2024)
[i71]Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Bin Wang, Linke Ouyang, Songyang Zhang
, Haodong Duan, Wenwei Zhang, Yining Li, Hang Yan, Yang Gao, Zhe Chen, Xinyue Zhang, Wei Li, Jingwen Li, Wenhai Wang, Kai Chen, Conghui He, Xingcheng Zhang, Jifeng Dai, Yu Qiao, Dahua Lin, Jiaqi Wang
:
InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD. CoRR abs/2404.06512 (2024)
[i70]Tao Chu, Pan Zhang, Xiaoyi Dong, Yuhang Zang, Qiong Liu, Jiaqi Wang:
Unified Scene Representation and Reconstruction for 3D Large Language Models. CoRR abs/2404.13044 (2024)
[i69]Zhe Chen, Weiyun Wang
, Hao Tian, Shenglong Ye
, Zhangwei Gao, Erfei Cui, Wenwen Tong, Kongzhi Hu, Jiapeng Luo, Zheng Ma, Ji Ma, Jiaqi Wang
, Xiaoyi Dong, Hang Yan, Hewei Guo, Conghui He, Botian Shi, Zhenjiang Jin, Chao Xu, Bin Wang, Xingjian Wei, Wei Li, Wenjian Zhang, Bo Zhang, Pinlong Cai, Licheng Wen, Xiangchao Yan, Min Dou, Lewei Lu, Xizhou Zhu, Tong Lu, Dahua Lin, Yu Qiao, Jifeng Dai, Wenhai Wang:
How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites. CoRR abs/2404.16821 (2024)
[i68]Ye Fang, Zeyi Sun, Tong Wu, Jiaqi Wang
, Ziwei Liu, Gordon Wetzstein, Dahua Lin:
Make-it-Real: Unleashing Large Multimodal Model's Ability for Painting 3D Objects with Realistic Materials. CoRR abs/2404.16829 (2024)
[i67]Ying Jin, Pengyang Ling, Xiaoyi Dong, Pan Zhang, Jiaqi Wang, Dahua Lin:
ReasonPix2Pix: Instruction Reasoning Dataset for Advanced Image Editing. CoRR abs/2405.11190 (2024)
[i66]Rui Qian, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Shuangrui Ding, Dahua Lin, Jiaqi Wang
:
Streaming Long Video Understanding with Large Language Models. CoRR abs/2405.16009 (2024)
[i65]Zeyi Sun, Tong Wu, Pan Zhang, Yuhang Zang, Xiaoyi Dong, Yuanjun Xiong, Dahua Lin, Jiaqi Wang
:
Bootstrap3D: Improving 3D Content Creation with Synthetic Data. CoRR abs/2406.00093 (2024)
[i64]Lin Chen, Xilin Wei, Jinsong Li, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Zehui Chen, Haodong Duan, Bin Lin, Zhenyu Tang, Li Yuan, Yu Qiao, Dahua Lin, Feng Zhao, Jiaqi Wang
:
ShareGPT4Video: Improving Video Understanding and Generation with Better Captions. CoRR abs/2406.04325 (2024)
[i63]Pengyang Ling, Jiazi Bu, Pan Zhang, Xiaoyi Dong, Yuhang Zang, Tong Wu, Huaian Chen, Jiaqi Wang
, Yi Jin:
MotionClone: Training-Free Motion Cloning for Controllable Video Generation. CoRR abs/2406.05338 (2024)
[i62]Jiaqi Wang, Yuhang Zang, Pan Zhang, Tao Chu, Yuhang Cao, Zeyi Sun, Ziyu Liu, Xiaoyi Dong, Tong Wu, Dahua Lin, Zeming Chen, Zhi Wang, Lingchen Meng, Wenhao Yao, Jianwei Yang, Sihong Wu, Zhineng Chen, Zuxuan Wu, Yu-Gang Jiang, Peixi Wu, Bosong Chai, Xuan Nie, Longquan Yan, Zeyu Wang, Qifan Zhou, Boning Wang, Jiaqi Huang, Zunnan Xu, Xiu Li, Kehong Yuan, Yanyan Zu, Jiayao Ha, Qiong Gao, Licheng Jiao:
V3Det Challenge 2024 on Vast Vocabulary and Open Vocabulary Object Detection: Methods and Results. CoRR abs/2406.11739 (2024)
[i61]Ziyu Liu, Tao Chu, Yuhang Zang, Xilin Wei, Xiaoyi Dong, Pan Zhang, Zijian Liang, Yuanjun Xiong, Yu Qiao, Dahua Lin, Jiaqi Wang
:
MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs. CoRR abs/2406.11833 (2024)
[i60]Yuxuan Qiao, Haodong Duan, Xinyu Fang, Junming Yang, Lin Chen, Songyang Zhang
, Jiaqi Wang
, Dahua Lin, Kai Chen:
Prism: A Framework for Decoupling and Assessing the Capabilities of VLMs. CoRR abs/2406.14544 (2024)
[i59]Yubo Ma, Yuhang Zang, Liangyu Chen, Meiqi Chen, Yizhu Jiao, Xinze Li, Xinyuan Lu, Ziyu Liu, Yan Ma, Xiaoyi Dong, Pan Zhang, Liangming Pan
, Yu-Gang Jiang, Jiaqi Wang
, Yixin Cao, Aixin Sun:
MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations. CoRR abs/2407.01523 (2024)
[i58]Pan Zhang, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Rui Qian, Lin Chen, Qipeng Guo, Haodong Duan, Bin Wang, Linke Ouyang, Songyang Zhang
, Wenwei Zhang, Yining Li, Yang Gao, Peng Sun, Xinyue Zhang, Wei Li, Jingwen Li, Wenhai Wang, Hang Yan, Conghui He, Xingcheng Zhang, Kai Chen, Jifeng Dai, Yu Qiao, Dahua Lin, Jiaqi Wang:
InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output. CoRR abs/2407.03320 (2024)
[i57]Zhangyang Qi, Yunhan Yang, Mengchen Zhang, Long Xing, Xiaoyang Wu, Tong Wu, Dahua Lin, Xihui Liu
, Jiaqi Wang, Hengshuang Zhao:
Tailor3D: Customized 3D Assets Editing and Generation with Dual-Side Images. CoRR abs/2407.06191 (2024)
[i56]Haodong Duan, Junming Yang, Yuxuan Qiao, Xinyu Fang, Lin Chen, Yuan Liu, Xiaoyi Dong, Yuhang Zang, Pan Zhang, Jiaqi Wang, Dahua Lin, Kai Chen:
VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models. CoRR abs/2407.11691 (2024)
[i55]Jiazi Bu, Pengyang Ling, Pan Zhang, Tong Wu, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang
:
BroadWay: Boost Your Text-to-Video Generation Model in a Training-free Way. CoRR abs/2410.06241 (2024)
[i54]Runchuan Zhu, Zhipeng Ma, Jiang Wu, Junyuan Gao, Jiaqi Wang
, Dahua Lin, Conghui He:
Utilize the Flow before Stepping into the Same River Twice: Certainty Represented Knowledge Flow for Refusal-Aware Instruction Tuning. CoRR abs/2410.06913 (2024)
[i53]Qidong Huang, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Jiaqi Wang
, Dahua Lin, Weiming Zhang, Nenghai Yu:
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate. CoRR abs/2410.07167 (2024)
[i52]Jilong Li, Zhenxi Song, Jiaqi Wang, Min Zhang, Zhiguo Zhang:
BrainECHO: Semantic Brain Signal Decoding through Vector-Quantized Spectrogram Reconstruction for Whisper-Enhanced Text Generation. CoRR abs/2410.14971 (2024)
[i51]Shuangrui Ding, Rui Qian, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Yuwei Guo, Dahua Lin, Jiaqi Wang
:
SAM2Long: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory Tree. CoRR abs/2410.16268 (2024)
[i50]Long Xing, Qidong Huang, Xiaoyi Dong, Jiajie Lu, Pan Zhang, Yuhang Zang, Yuhang Cao, Conghui He, Jiaqi Wang
, Feng Wu, Dahua Lin:
PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction. CoRR abs/2410.17247 (2024)
[i49]Ziyu Liu, Yuhang Zang, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Haodong Duan, Conghui He, Yuanjun Xiong, Dahua Lin, Jiaqi Wang
:
MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models. CoRR abs/2410.17637 (2024)
[i48]Zeyi Sun, Ziyang Chu, Pan Zhang, Tong Wu, Xiaoyi Dong, Yuhang Zang, Yuanjun Xiong, Dahua Lin, Jiaqi Wang
:
X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models. CoRR abs/2412.01824 (2024)
[i47]Jiahua Dong, Tong Wu, Rui Qian, Jiaqi Wang:
SimC3D: A Simple Contrastive 3D Pretraining Framework Using RGB Images. CoRR abs/2412.05274 (2024)
[i46]Tong Wu, Yinghao Xu, Ryan Po, Mengchen Zhang, Guandao Yang, Jiaqi Wang
, Ziwei Liu, Dahua Lin, Gordon Wetzstein:
FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models. CoRR abs/2412.07674 (2024)
[i45]Pan Zhang, Xiaoyi Dong, Yuhang Cao, Yuhang Zang, Rui Qian, Xilin Wei, Lin Chen, Yifei Li, Junbo Niu, Shuangrui Ding, Qipeng Guo, Haodong Duan, Xin Chen, Han Lv, Zheng Nie, Min Zhang, Bin Wang, Wenwei Zhang, Xinyue Zhang, Jiaye Ge, Wei Li, Jingwen Li, Zhongying Tu, Conghui He, Xingcheng Zhang, Kai Chen, Yu Qiao, Dahua Lin, Jiaqi Wang:
InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions. CoRR abs/2412.09596 (2024)
[i44]Zhibing Li, Tong Wu, Jing Tan, Mengchen Zhang, Jiaqi Wang
, Dahua Lin:
IDArb: Intrinsic Decomposition for Arbitrary Number of Input Views and Illuminations. CoRR abs/2412.12083 (2024)
[i43]Jiaqi Wang, Liutao Yu, Liwei Huang, Chenlin Zhou, Han Zhang, Zhenxi Song, Min Zhang, Zhengyu Ma, Zhiguo Zhang:
Efficient Speech Command Recognition Leveraging Spiking Neural Network and Curriculum Learning-based Knowledge Distillation. CoRR abs/2412.12858 (2024)- 2023
[c23]Zhao Yang, Jiaqi Wang
, Yansong Tang, Kai Chen, Hengshuang Zhao, Philip H. S. Torr:
Semantics-Aware Dynamic Localization and Refinement for Referring Image Segmentation. AAAI 2023: 3222-3230
[c22]Yujie Zhou, Haodong Duan, Anyi Rao
, Bing Su, Jiaqi Wang
:
Self-Supervised Action Representation Learning from Partial Spatio-Temporal Skeleton Sequences. AAAI 2023: 3825-3833
[c21]Tong Wu, Jiarui Zhang, Xiao Fu
, Yuxin Wang
, Jiawei Ren, Liang Pan, Wayne Wu, Lei Yang, Jiaqi Wang
, Chen Qian, Dahua Lin, Ziwei Liu:
OmniObject3D: Large-Vocabulary 3D Object Dataset for Realistic Perception, Reconstruction and Generation. CVPR 2023: 803-814
[c20]Tao Chu, Pan Zhang, Qiong Liu, Jiaqi Wang
:
BUOL: A Bottom-Up Framework with Occupancy-Aware Lifting for Panoptic 3D Scene Reconstruction From a Single Image. CVPR 2023: 4937-4946
[c19]Shilong Zhang, Xinjiang Wang, Jiaqi Wang
, Jiangmiao Pang, Chengqi Lyu, Wenwei Zhang, Ping Luo, Kai Chen:
Dense Distinct Query for End-to-End Object Detection. CVPR 2023: 7329-7338
[c18]Ying Jin, Jiaqi Wang
, Dahua Lin:
Multi-Level Logit Distillation. CVPR 2023: 24276-24285
[c17]Jiaqi Wang
, Pan Zhang, Tao Chu, Yuhang Cao, Yujie Zhou, Tong Wu, Bin Wang
, Conghui He, Dahua Lin:
V3Det: Vast Vocabulary Visual Detection Dataset. ICCV 2023: 19787-19797
[c16]Tong Wu, Jiaqi Wang, Xingang Pan, Xudong Xu, Christian Theobalt
, Ziwei Liu, Dahua Lin:
Voxurf: Voxel-based Efficient and Accurate Neural Surface Reconstruction. ICLR 2023
[c15]Dachuan Shi, Chaofan Tao, Ying Jin, Zhendong Yang, Chun Yuan, Jiaqi Wang:
UPop: Unified and Progressive Pruning for Compressing Vision-Language Transformers. ICML 2023: 31292-31311
[c14]Yujie Zhou
, Wenwen Qiang
, Anyi Rao
, Ning Lin
, Bing Su
, Jiaqi Wang
:
Zero-shot Skeleton-based Action Recognition via Mutual Information Estimation and Maximization. ACM Multimedia 2023: 5302-5310
[c13]Tong Wu
, Zhibing Li
, Shuai Yang
, Pan Zhang
, Xingang Pan
, Jiaqi Wang
, Dahua Lin
, Ziwei Liu
:
HyperDreamer: Hyper-Realistic 3D Content Generation and Editing from a Single Image. SIGGRAPH Asia 2023: 53:1-53:10
[i42]Ying Jin, Jiaqi Wang
, Dahua Lin:
Semi-Supervised Semantic Segmentation via Gentle Teaching Assistant. CoRR abs/2301.07340 (2023)
[i41]Tong Wu, Jiarui Zhang, Xiao Fu, Yuxin Wang, Jiawei Ren, Liang Pan
, Wayne Wu, Lei Yang, Jiaqi Wang
, Chen Qian, Dahua Lin, Ziwei Liu:
OmniObject3D: Large-Vocabulary 3D Object Dataset for Realistic Perception, Reconstruction and Generation. CoRR abs/2301.07525 (2023)
[i40]Dachuan Shi, Chaofan Tao, Ying Jin, Zhendong Yang, Chun Yuan, Jiaqi Wang:
UPop: Unified and Progressive Pruning for Compressing Vision-Language Transformers. CoRR abs/2301.13741 (2023)
[i39]Yujie Zhou, Haodong Duan, Anyi Rao, Bing Su, Jiaqi Wang
:
Self-supervised Action Representation Learning from Partial Spatio-Temporal Skeleton Sequences. CoRR abs/2302.09018 (2023)
[i38]Zhao Yang, Jiaqi Wang
, Yansong Tang, Kai Chen, Hengshuang Zhao, Philip H. S. Torr:
Semantics-Aware Dynamic Localization and Refinement for Referring Image Segmentation. CoRR abs/2303.06345 (2023)
[i37]Shilong Zhang, Xinjiang Wang, Jiaqi Wang
, Jiangmiao Pang, Chengqi Lyu, Wenwei Zhang, Ping Luo, Kai Chen:
Dense Distinct Query for End-to-End Object Detection. CoRR abs/2303.12776 (2023)
[i36]Jiaqi Wang
, Pan Zhang, Tao Chu, Yuhang Cao, Yujie Zhou, Tong Wu, Bin Wang, Conghui He, Dahua Lin:
V3Det: Vast Vocabulary Visual Detection Dataset. CoRR abs/2304.03752 (2023)
[i35]Dachuan Shi, Chaofan Tao, Anyi Rao, Zhendong Yang, Chun Yuan, Jiaqi Wang
:
CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language Transformers. CoRR abs/2305.17455 (2023)
[i34]Tao Chu, Pan Zhang, Qiong Liu, Jiaqi Wang
:
BUOL: A Bottom-Up Framework with Occupancy-aware Lifting for Panoptic 3D Scene Reconstruction From A Single Image. CoRR abs/2306.00965 (2023)
[i33]Zhangyang Qi, Jiaqi Wang, Xiaoyang Wu, Hengshuang Zhao:
OCBEV: Object-Centric BEV Transformer for Multi-View 3D Object Detection. CoRR abs/2306.01738 (2023)
[i32]Yuan Liu, Haodong Duan, Yuanhan Zhang, Bo Li, Songyang Zhang
, Wangbo Zhao, Yike Yuan, Jiaqi Wang
, Conghui He, Ziwei Liu, Kai Chen, Dahua Lin:
MMBench: Is Your Multi-modal Model an All-around Player? CoRR abs/2307.06281 (2023)
[i31]Yujie Zhou, Wenwen Qiang, Anyi Rao, Ning Lin, Bing Su, Jiaqi Wang
:
Zero-shot Skeleton-based Action Recognition via Mutual Information Estimation and Maximization. CoRR abs/2308.03950 (2023)
[i30]Conghui He, Zhenjiang Jin, Chao Xu, Jiantao Qiu, Bin Wang, Wei Li, Hang Yan, Jiaqi Wang, Dahua Lin:
WanJuan: A Comprehensive Multimodal Dataset for Advancing English and Chinese Large Models. CoRR abs/2308.10755 (2023)
[i29]Bin Wang, Fan Wu, Xiao Han, Jiahui Peng, Huaping Zhong, Pan Zhang, Xiaoyi Dong, Weijia Li, Wei Li, Jiaqi Wang
, Conghui He:
VIGC: Visual Instruction Generation and Correction. CoRR abs/2308.12714 (2023)
[i28]Zhiyuan Zhao, Linke Ouyang, Bin Wang, Siyuan Huang, Pan Zhang, Xiaoyi Dong, Jiaqi Wang, Conghui He:
MLLM-DataEngine: An Iterative Refinement Approach for MLLM. CoRR abs/2308.13566 (2023)
[i27]Pan Zhang, Xiaoyi Dong, Bin Wang, Yuhang Cao, Chao Xu, Linke Ouyang, Zhiyuan Zhao, Shuangrui Ding, Songyang Zhang
, Haodong Duan, Wenwei Zhang, Hang Yan, Xinyue Zhang, Wei Li, Jingwen Li, Kai Chen, Conghui He, Xingcheng Zhang, Yu Qiao, Dahua Lin, Jiaqi Wang:
InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition. CoRR abs/2309.15112 (2023)
[i26]Jiaming Zhang, Xingjun Ma, Xin Wang, Lingyu Qiu, Jiaqi Wang, Yu-Gang Jiang, Jitao Sang:
Adversarial Prompt Tuning for Vision-Language Models. CoRR abs/2311.11261 (2023)
[i25]Lin Chen, Jinsong Li, Xiaoyi Dong, Pan Zhang, Conghui He, Jiaqi Wang
, Feng Zhao, Dahua Lin:
ShareGPT4V: Improving Large Multi-Modal Models with Better Captions. CoRR abs/2311.12793 (2023)
[i24]Zhiyuan Zhao, Bin Wang, Linke Ouyang, Xiaoyi Dong, Jiaqi Wang, Conghui He:
Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization. CoRR abs/2311.16839 (2023)
[i23]Qidong Huang, Xiaoyi Dong, Pan Zhang, Bin Wang, Conghui He, Jiaqi Wang
, Dahua Lin, Weiming Zhang, Nenghai Yu:
OPERA: Alleviating Hallucination in Multi-Modal Large Language Models via Over-Trust Penalty and Retrospection-Allocation. CoRR abs/2311.17911 (2023)
[i22]Zhangyang Qi, Ye Fang, Zeyi Sun
, Xiaoyang Wu, Tong Wu, Jiaqi Wang
, Dahua Lin, Hengshuang Zhao:
GPT4Point: A Unified Framework for Point-Language Understanding and Generation. CoRR abs/2312.02980 (2023)
[i21]Jiaming Han, Kaixiong Gong
, Yiyuan Zhang, Jiaqi Wang
, Kaipeng Zhang
, Dahua Lin, Yu Qiao, Peng Gao, Xiangyu Yue:
OneLLM: One Framework to Align All Modalities with Language. CoRR abs/2312.03700 (2023)
[i20]Zeyi Sun
, Ye Fang, Tong Wu, Pan Zhang, Yuhang Zang, Shu Kong, Yuanjun Xiong, Dahua Lin, Jiaqi Wang
:
Alpha-CLIP: A CLIP Model Focusing on Wherever You Want. CoRR abs/2312.03818 (2023)
[i19]Tong Wu, Zhibing Li, Shuai Yang, Pan Zhang, Xingang Pan, Jiaqi Wang
, Dahua Lin, Ziwei Liu:
HyperDreamer: Hyper-Realistic 3D Content Generation and Editing from a Single Image. CoRR abs/2312.04543 (2023)
[i18]Zhangyang Qi, Ye Fang, Mengchen Zhang
, Zeyi Sun
, Tong Wu, Ziwei Liu, Dahua Lin, Jiaqi Wang, Hengshuang Zhao:
Gemini vs GPT-4V: A Preliminary Comparison and Combination of Vision-Language Models Through Qualitative Cases. CoRR abs/2312.15011 (2023)- 2022
[j2]Jiaqi Wang
, Kai Chen, Rui Xu
, Ziwei Liu, Chen Change Loy
, Dahua Lin:
CARAFE++: Unified Content-Aware ReAssembly of FEatures. IEEE Trans. Pattern Anal. Mach. Intell. 44(9): 4674-4687 (2022)
[c12]Zhao Yang, Jiaqi Wang
, Yansong Tang, Kai Chen, Hengshuang Zhao, Philip H. S. Torr:
LAVT: Language-Aware Vision Transformer for Referring Image Segmentation. CVPR 2022: 18134-18144
[c11]Haodong Duan, Jiaqi Wang
, Kai Chen, Dahua Lin:
PYSKL: Towards Good Practices for Skeleton Action Recognition. ACM Multimedia 2022: 7351-7354
[c10]Ying Jin, Jiaqi Wang, Dahua Lin:
Semi-Supervised Semantic Segmentation via Gentle Teaching Assistant. NeurIPS 2022
[i17]Yuhang Cao, Jiaqi Wang, Yiqi Lin, Dahua Lin:
MINI: Mining Implicit Novel Instances for Few-Shot Object Detection. CoRR abs/2205.03381 (2022)
[i16]Haodong Duan, Jiaqi Wang
, Kai Chen, Dahua Lin:
PYSKL: Towards Good Practices for Skeleton Action Recognition. CoRR abs/2205.09443 (2022)
[i15]Shilong Zhang, Xinjiang Wang, Jiaqi Wang, Jiangmiao Pang, Kai Chen:
What Are Expected Queries in End-to-End Object Detection? CoRR abs/2206.01232 (2022)
[i14]Tong Wu, Jiaqi Wang
, Xingang Pan, Xudong Xu, Christian Theobalt
, Ziwei Liu, Dahua Lin:
Voxurf: Voxel-based Efficient and Accurate Neural Surface Reconstruction. CoRR abs/2208.12697 (2022)
[i13]Haodong Duan, Jiaqi Wang, Kai Chen, Dahua Lin:
DG-STGCN: Dynamic Spatial-Temporal Modeling for Skeleton-based Action Recognition. CoRR abs/2210.05895 (2022)- 2021
[j1]Rui Xu
, Minghao Guo, Jiaqi Wang
, Xiaoxiao Li, Bolei Zhou, Chen Change Loy
:
Texture Memory-Augmented Deep Patch-Based Image Inpainting. IEEE Trans. Image Process. 30: 9112-9124 (2021)
[c9]Jiaqi Wang
, Wenwei Zhang, Yuhang Zang, Yuhang Cao, Jiangmiao Pang, Tao Gong, Kai Chen, Ziwei Liu, Chen Change Loy, Dahua Lin:
Seesaw Loss for Long-Tailed Instance Segmentation. CVPR 2021: 9695-9704
[c8]Xin Liu, Jiancheng Li, Jiaqi Wang, Ziwei Liu:
MMFashion: An Open-Source Toolbox for Visual Fashion Analysis. ACM Multimedia 2021: 3755-3758
[c7]Yuhang Cao, Jiaqi Wang, Ying Jin, Tong Wu, Kai Chen, Ziwei Liu, Dahua Lin:
Few-Shot Object Detection via Association and DIscrimination. NeurIPS 2021: 16570-16581
[i12]Yuhang Cao, Jiaqi Wang, Ying Jin, Tong Wu, Kai Chen, Ziwei Liu, Dahua Lin:
Few-Shot Object Detection via Association and DIscrimination. CoRR abs/2111.11656 (2021)
[i11]Zhao Yang, Jiaqi Wang, Yansong Tang, Kai Chen, Hengshuang Zhao, Philip H. S. Torr:
LAVT: Language-Aware Vision Transformer for Referring Image Segmentation. CoRR abs/2112.02244 (2021)- 2020
[c6]Jiaqi Wang
, Wenwei Zhang, Yuhang Cao, Kai Chen, Jiangmiao Pang, Tao Gong, Jianping Shi, Chen Change Loy, Dahua Lin:
Side-Aware Boundary Localization for More Precise Object Detection. ECCV (4) 2020: 403-419
[i10]Xin Liu, Jiancheng Li, Jiaqi Wang, Ziwei Liu:
MMFashion: An Open-Source Toolbox for Visual Fashion Analysis. CoRR abs/2005.08847 (2020)
[i9]Jiaqi Wang, Wenwei Zhang, Yuhang Zang, Yuhang Cao, Jiangmiao Pang, Tao Gong, Kai Chen, Ziwei Liu, Chen Change Loy, Dahua Lin:
Seesaw Loss for Long-Tailed Instance Segmentation. CoRR abs/2008.10032 (2020)
[i8]Rui Xu, Minghao Guo, Jiaqi Wang, Xiaoxiao Li, Bolei Zhou, Chen Change Loy:
Texture Memory-Augmented Deep Patch-Based Image Inpainting. CoRR abs/2009.13240 (2020)
[i7]Jiaqi Wang, Kai Chen, Rui Xu, Ziwei Liu, Chen Change Loy, Dahua Lin:
CARAFE++: Unified Content-Aware ReAssembly of FEatures. CoRR abs/2012.04733 (2020)
2010 – 2019
- 2019
[c5]Jiaqi Wang
, Kai Chen, Shuo Yang, Chen Change Loy, Dahua Lin:
Region Proposal by Guided Anchoring. CVPR 2019: 2965-2974
[c4]Kai Chen, Jiangmiao Pang, Jiaqi Wang
, Yu Xiong, Xiaoxiao Li, Shuyang Sun, Wansen Feng, Ziwei Liu, Jianping Shi, Wanli Ouyang
, Chen Change Loy, Dahua Lin:
Hybrid Task Cascade for Instance Segmentation. CVPR 2019: 4974-4983
[c3]Jiaqi Wang
, Kai Chen, Rui Xu, Ziwei Liu, Chen Change Loy, Dahua Lin:
CARAFE: Content-Aware ReAssembly of FEatures. ICCV 2019: 3007-3016
[i6]Jiaqi Wang, Kai Chen, Shuo Yang, Chen Change Loy, Dahua Lin:
Region Proposal by Guided Anchoring. CoRR abs/1901.03278 (2019)
[i5]Kai Chen, Jiangmiao Pang, Jiaqi Wang, Yu Xiong, Xiaoxiao Li, Shuyang Sun, Wansen Feng, Ziwei Liu, Jianping Shi, Wanli Ouyang, Chen Change Loy, Dahua Lin:
Hybrid Task Cascade for Instance Segmentation. CoRR abs/1901.07518 (2019)
[i4]Jiaqi Wang, Kai Chen, Rui Xu, Ziwei Liu, Chen Change Loy, Dahua Lin:
CARAFE: Content-Aware ReAssembly of FEatures. CoRR abs/1905.02188 (2019)
[i3]Kai Chen, Jiaqi Wang, Jiangmiao Pang, Yuhang Cao, Yu Xiong, Xiaoxiao Li, Shuyang Sun, Wansen Feng, Ziwei Liu, Jiarui Xu, Zheng Zhang, Dazhi Cheng, Chenchen Zhu, Tianheng Cheng, Qijie Zhao, Buyu Li, Xin Lu, Rui Zhu, Yue Wu, Jifeng Dai, Jingdong Wang, Jianping Shi, Wanli Ouyang, Chen Change Loy, Dahua Lin:
MMDetection: Open MMLab Detection Toolbox and Benchmark. CoRR abs/1906.07155 (2019)
[i2]Jiaqi Wang, Wenwei Zhang
, Yuhang Cao, Kai Chen, Jiangmiao Pang, Tao Gong, Jianping Shi, Chen Change Loy, Dahua Lin:
Side-Aware Boundary Localization for More Precise Object Detection. CoRR abs/1912.04260 (2019)- 2018
[c2]Kai Chen, Jiaqi Wang
, Shuo Yang, Xingcheng Zhang, Yuanjun Xiong, Chen Change Loy, Dahua Lin
:
Optimizing Video Object Detection via a Scale-Time Lattice. CVPR 2018: 7814-7823
[c1]Zeju Wu, Wenjing Liu, Jiaqi Wang
, Xuhu Wang:
A Height Correction Algorithm Applied in Underwater Photometric Stereo Reconstruction. ICSPCC 2018: 1-6
[i1]Kai Chen, Jiaqi Wang, Shuo Yang, Xingcheng Zhang, Yuanjun Xiong, Chen Change Loy, Dahua Lin:
Optimizing Video Object Detection via a Scale-Time Lattice. CoRR abs/1804.05472 (2018)
Coauthor Index

manage site settings
To protect your privacy, all features that rely on external API calls from your browser are turned off by default. You need to opt-in for them to become active. All settings here will be stored as cookies with your web browser. For more information see our F.A.Q.
Unpaywalled article links
Add open access links from
to the list of external document links (if available).
Privacy notice: By enabling the option above, your browser will contact the API of unpaywall.org to load hyperlinks to open access articles. Although we do not have any reason to believe that your call will be tracked, we do not have any control over how the remote server uses your data. So please proceed with care and consider checking the Unpaywall privacy policy.
Archived links via Wayback Machine
For web page which are no longer available, try to retrieve content from the
of the Internet Archive (if available).
Privacy notice: By enabling the option above, your browser will contact the API of archive.org to check for archived content of web pages that are no longer available. Although we do not have any reason to believe that your call will be tracked, we do not have any control over how the remote server uses your data. So please proceed with care and consider checking the Internet Archive privacy policy.
Reference lists
Add a list of references from
,
, and
to record detail pages.
load references from crossref.org and opencitations.net
Privacy notice: By enabling the option above, your browser will contact the APIs of crossref.org, opencitations.net, and semanticscholar.org to load article reference information. Although we do not have any reason to believe that your call will be tracked, we do not have any control over how the remote server uses your data. So please proceed with care and consider checking the Crossref privacy policy and the OpenCitations privacy policy, as well as the AI2 Privacy Policy covering Semantic Scholar.
Citation data
Add a list of citing articles from
and
to record detail pages.
load citations from opencitations.net
Privacy notice: By enabling the option above, your browser will contact the API of opencitations.net and semanticscholar.org to load citation information. Although we do not have any reason to believe that your call will be tracked, we do not have any control over how the remote server uses your data. So please proceed with care and consider checking the OpenCitations privacy policy as well as the AI2 Privacy Policy covering Semantic Scholar.
OpenAlex data
Load additional information about publications from
.
Privacy notice: By enabling the option above, your browser will contact the API of openalex.org to load additional information. Although we do not have any reason to believe that your call will be tracked, we do not have any control over how the remote server uses your data. So please proceed with care and consider checking the information given by OpenAlex.
last updated on 2026-07-23 22:41 CEST by the dblp team
all metadata released as open data under CC0 1.0 license
see also: Terms of Use | Privacy Policy | Imprint


Google
Google Scholar
Semantic Scholar
Internet Archive Scholar
CiteSeerX
ORCID






