Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines

Zhixin Zhang(China-Japan Friendship Hospital), Xiangyu Yue, Xiaohan Ding(George Mason University), Yiyuan Zhang(Changchun University of Science and Technology)
arXiv (Cornell University)
October 28, 2024
Cited by 0


Related Papers