Search papers, labs, and topics across Lattice.
2
0
3
0
MLLMs struggle with visual prompts, showing a 17.8-point accuracy drop when questions are embedded in images, revealing a critical semantic gap in multimodal reasoning.
Continuous latent visual representations can drastically improve multimodal reasoning efficiency and performance, outpacing traditional discrete output methods.