Search papers, labs, and topics across Lattice.
1
0
2
4
Vision-language models struggle with spatial reasoning, achieving only 32% accuracy in grounding tasks, revealing a critical flaw in candidate localization.