Video-Text as Game Players: Hierarchical Banzhaf Interaction for Cross-Modal Representation LearningPeng Jin, Jie Chen, Chang Liu et al.|Unknown|2023Cited by 69
DiffusionRet: Generative Text-Video Retrieval with Diffusion ModelPeng Jin, Jie Chen, Zesen Cheng et al.|Unknown|2023Cited by 64
Text-Video Retrieval with Disentangled Conceptualization and Set-to-Set AlignmentPeng Jin, Jie Chen, Hao Li et al.|Unknown|2023Cited by 38
TG-VQA: Ternary Game of Video Question AnsweringHao Li, Jie Chen, Peng Jin et al.|Unknown|2023Cited by 12
WiCo: Win-win Cooperation of Bottom-up and Top-down Referring Image SegmentationZesen Cheng, Jie Chen, Xiangyang Ji et al.|Unknown|2023Cited by 4