Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model
Guoqing Ma(First Affiliated Hospital of Heilongjiang University of Chinese Medicine), Jiahao Gong, Haiyang Feng(Dalian University of Technology), Zheng Ge(Southeast University), Xing Chen, Huixin Xiong, Nan Duan(Microsoft Research Asia (China)), Brian Y. Li, Haonan Jia, Guangnan Huang, Jian Zhou, Hanpeng Hu, Qiling Wu, Hanqi Chen, Hongcheng Guo, Huilin Xiong, Deshan Sun, Changyi Wan, Yanan Wei, A. F. Li(Hirosaki University), Chen Xu(City University of Hong Kong), Xin Han, Mei Chen(Guangzhou Medical University), Bo Wang(Chinese Academy of Sciences), Bin Wang(Ocean University of China), Wen Sun, Heng Wang(Dalian Ocean University), Kang An(Nanjing University of Chinese Medicine), Wei Ji, Liangyu Chen(Jilin Agricultural University), Shengming Yin(City University of Hong Kong), Dapeng Shi, Chenfei Wu, Dingyuan Hu(Lund University), Yu Zhou(Harbin Institute of Technology), Xiaoniu Song, Haolong Yan, Chenguang Yu(Changchun University of Technology), Hao Nie, Kun Yan, Haoyang Huang, Kaijun Tan, Deyu Zhou(Southeast University), Changxing Miao(Institute of Applied Physics and Computational Mathematics), Ge Yang
Cited by 0
Related Papers
CodeBERT: A Pre-Trained Model for Programming and Natural Languages
|Unknown|2020|2.5k
CLIP4Clip: An empirical study of CLIP for end to end video clip retrieval and captioning
|Neurocomputing|2022|676
UniXcoder: Unified Cross-Modal Pre-training for Code Representation
|Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)|2022|554
CodeXGLUE: A Machine Learning Benchmark Dataset for Code Understanding and Generation
|arXiv (Cornell University)|2021|415
GraphCodeBERT: Pre-training Code Representations with Data Flow
|Unknown|2021|332