Zaid Marji, John Licato: Evaluating large language models' ability to generate interpretive arguments. Argument Comput. 16(3): 362-404 (2025)