Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines
Zhixin Zhang(China-Japan Friendship Hospital), Xiangyu Yue, Xiaohan Ding(George Mason University), Yiyuan Zhang(Changchun University of Science and Technology)
Cited by 0
Related Papers
RepVGG: Making VGG-style ConvNets Great Again
|Unknown|2021|2.5k
ACNet: Strengthening the Kernel Skeletons for Powerful CNN via Asymmetric Convolution Blocks
|Unknown|2019|828
Centripetal SGD for Pruning Very Deep Convolutional Networks With Complicated Structure
|Unknown|2019|203
ResRep: Lossless CNN Pruning via Decoupling Remembering and Forgetting
|2021 IEEE/CVF International Conference on Computer Vision (ICCV)|2021|179