Search papers, labs, and topics across Lattice.
1
0
3
Masking just 20 Visual Retrieval Heads in VLMs can lead to an 80-point drop in grounding accuracy, revealing their critical role in visual information extraction.