SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human GenerationYouliang Zhang, Li Xiu, Jiahe Zhang et al.|arXiv (Cornell University)|2025Cited by 0