Dezhi Peng, Chongyu Liu, Yuliang Liu, Lianwen Jin: ViTEraser: Harnessing the Power of Vision Transformers for Scene Text Removal with SegMIM Pretraining. AAAI 2024: 4468-4477