Grounding Everything: Emerging Localization Properties in Vision-Language TransformersWalid Bousselham, Hilde Kuehne, Felix Petersen et al.|Unknown|2024Cited by 38
Learning Situation Hyper-Graphs for Video Question AnsweringAisha Urooj Khan, Mubarak Shah, Walid Bousselham et al.|Unknown|2023Cited by 8
LeGrad: An Explainability Method for Vision Transformers via Feature Formation SensitivityWalid Bousselham, Hilde Kuehne, Angie Boggust et al.|Unknown|2025Cited by 6
Learning Situation Hyper-Graphs for Video Question AnsweringAisha Urooj Khan, Mubarak Shah, Hilde Kuehne et al.|arXiv (Cornell University)|2023Cited by 4
MaskInversion: Localized Embeddings via Optimization of Explainability MapsWalid Bousselham, Hilde Kuehne, Sofian Chaybouti et al.|arXiv (Cornell University)|2024Cited by 1