Video-Text as Game Players: Hierarchical Banzhaf Interaction for Cross-Modal Representation LearningPeng Jin, Jie Chen, Chang Liu et al.|Unknown|2023Cited by 69
Text-Video Retrieval with Disentangled Conceptualization and Set-to-Set AlignmentPeng Jin, Jie Chen, Hao Li et al.|Unknown|2023Cited by 38