When LLaVA Meets Objects: Token Composition for Vision-Language-Models
Soumya Jahagirdar, Hilde Kuehne(IBM (United States)), Walid Bousselham(IBM (United States)), Anna Kukleva
arXiv (Cornell University)
February 4, 2026
Cited by 0
Related Papers
Grounding Everything: Emerging Localization Properties in Vision-Language Transformers
|Unknown|2024|38
Efficient Self-Ensemble for Semantic Segmentation
|arXiv (Cornell University)|2021|15
Efficient Self-Ensemble Framework for Semantic Segmentation
|arXiv (Cornell University)|2021|12
Learning Situation Hyper-Graphs for Video Question Answering
|Unknown|2023|8