When LLaVA Meets Objects: Token Composition for Vision-Language-ModelsSoumya Jahagirdar, Hilde Kuehne, Anna Kukleva et al.|Zenodo (CERN European Organization for Nuclear Research)|2026Cited by 0
When LLaVA Meets Objects: Token Composition for Vision-Language-ModelsSoumya Jahagirdar, Hilde Kuehne, Walid Bousselham et al.|arXiv (Cornell University)|2026Cited by 0