Search papers, labs, and topics across Lattice.
4
0
6
Visual identity discrimination is the missing link in Universal Multimodal Embeddings, and this work provides a robust framework to integrate it seamlessly.
VC-Tooler achieves unprecedented adaptability in visual tool use, outperforming existing models by 60% in agentic reasoning tasks.
EchoStyle achieves high-quality video stylization without the content leakage and style drift that plague existing methods, even outperforming many proprietary systems.
VLMs reason better when shown visually similar examples with synonymous questions, enabling a new self-training approach that beats state-of-the-art visual reasoning datasets.