Jiwoo Hong, Noah Lee, Eunki Kim, Guijin Son, Woojin Chung, Aman Gupta, Shao Tang, James Thorne: On the Robustness of Reward Models for Language Model Alignment. ICML 2025