Search papers, labs, and topics across Lattice.
2
0
4
Visual identity discrimination is the missing link in Universal Multimodal Embeddings, and this work provides a robust framework to integrate it seamlessly.
VLMs reason better when shown visually similar examples with synonymous questions, enabling a new self-training approach that beats state-of-the-art visual reasoning datasets.