Zhouhong Gu, Xingzhou Chen, Xiaoran Shi, Tao Wang, Suhang Zheng, Tianyu Li, Hongwei Feng, Yanghua Xiao: GAPO: Learning Preferential Prompt through Generative Adversarial Policy Optimization. ACL (1) 2025: 282-296