Minsu Kim, Jeong Hun Yeo, Yong Man Ro: Distinguishing Homophenes Using Multi-Head Visual-Audio Memory for Lip Reading. AAAI 2022: 1174-1182