Machine Mental Imagery
Empower Multimodal Reasoning with Latent Visual Tokens
UMass PhD | Current Intern @ Samsung | Previous @ THU
Joined May 2022
- VLMs can think visually without generating pixels! I am thrilled to announce Mirage, a multimodal reasoning framework that interleaves latent visual representations among text tokens!VLM can think visually without generating pixels! VLM can think visually without generating pixels! VLM can think visually without generating pixels! 📢 We introduce Machine Mental Imagery (Mirage): a new framework that enables VLM to imagine using latent visual



