Grounding Everything: Emerging Localization Properties in Vision-Language Transformers

Walid Bousselham(IBM (United States)), Hilde Kuehne(University of Bonn), Felix Petersen(Stanford University), Vittorio Ferrari(Fondazione Audiologica Varese)
Unknown
June 16, 2024
Cited by 38


Related Papers