Grounding Everything: Emerging Localization Properties in Vision-Language Transformers
Walid Bousselham(IBM (United States)), Hilde Kuehne(University of Bonn), Felix Petersen(Stanford University), Vittorio Ferrari(Fondazione Audiologica Varese)
Cited by 38
Related Papers
Efficient Self-Ensemble for Semantic Segmentation
|arXiv (Cornell University)|2021|15
Efficient Self-Ensemble Framework for Semantic Segmentation
|arXiv (Cornell University)|2021|12
Learning Situation Hyper-Graphs for Video Question Answering
|Unknown|2023|8
LeGrad: An Explainability Method for Vision Transformers via Feature Formation Sensitivity
|Unknown|2025|6
Learning Situation Hyper-Graphs for Video Question Answering
|arXiv (Cornell University)|2023|4