Hyung-Seok Oh, Sang-Hoon Lee, Seong-Whan Lee: DiffProsody: Diffusion-Based Latent Prosody Generation for Expressive Speech Synthesis With Prosody Conditional Adversarial Training. IEEE ACM Trans. Audio Speech Lang. Process. 32: 2654-2666 (2024)