When LLaVA Meets Objects: Token Composition for Vision-Language-Models

Soumya Jahagirdar, Hilde Kuehne(IBM (United States)), Walid Bousselham(IBM (United States)), Anna Kukleva
Zenodo (CERN European Organization for Nuclear Research)
February 4, 2026
Cited by 0


Related Papers