Grounding Everything: Emerging Localization Properties in Vision-Language Transformers

Walid Bousselham(IBM (United States)), Hilde Kuehne(University of Bonn), Felix Petersen(Stanford University), Vittorio Ferrari(Fondazione Audiologica Varese)
arXiv (Cornell University)
December 1, 2023
Cited by 0


Related Papers