Search papers, labs, and topics across Lattice.
3
0
6
AVSCap-7B achieves superior audio-visual synergy, outperforming existing models by effectively linking non-speech sounds to visual actions.
Achieving state-of-the-art performance in long-horizon video world models, CaR flexibly retrieves memory while minimizing computational costs.
VLMs reason better when shown visually similar examples with synonymous questions, enabling a new self-training approach that beats state-of-the-art visual reasoning datasets.