SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human GenerationYouliang Zhang, Li Xiu, Gang Yu et al.|arXiv (Cornell University)|2025Cited by 0
UniVerse-1: Unified Audio-Video Generation via Stitching of ExpertsGang Yu, Wei Zuo, A. F. Li et al.|arXiv (Cornell University)|2025Cited by 0
Training-Free Text-Guided Color Editing with Multi-Modal Diffusion TransformerZixin Yin, Heung‐Yeung Shum, Gang Yu et al.|arXiv (Cornell University)|2025Cited by 0