Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis
Hila Chefer(Tel Aviv University), Robin Rombach(Heidelberg University), Patrick Esser(Oxford Brookes University), Antonio Torralba(Citigroup), Vinh Tong, Vikash Raja, Dominik Lorenz, Dustin Podell
arXiv (Cornell University)
March 6, 2026
Cited by 0
Related Papers
Attend-and-Excite: Attention-Based Semantic Guidance for Text-to-Image Diffusion Models
|ACM Transactions on Graphics|2023|384
Lumiere: A Space-Time Diffusion Model for Video Generation
|Unknown|2024|120
Transformer Interpretability Beyond Attention Visualization
|Unknown|2021|44
Image-Based CLIP-Guided Essence Transfer
|Lecture notes in computer science|2022|34
No Token Left Behind: Explainability-Aided Image Classification and Generation
|Lecture notes in computer science|2022|22