Search papers, labs, and topics across Lattice.
2
0
4
2
Visual reasoning in multimodal models is highly variable, with accuracy plummeting over 10 points when feedback is corrupted, revealing hidden dependencies on visual states.
Ditch the pixel-level rendering and external executors: LatentGeo learns continuous latent visual representations to internalize auxiliary geometric constructions for multimodal geometric reasoning, boosting performance on complex geometry problems.