Search papers, labs, and topics across Lattice.
4
0
7
9
TRA achieves up to 2.05x faster video generation by intelligently mapping query entropy to token-specific attention budgets, revolutionizing efficiency in VDiTs.
Zero-shot VLMs falter at geometric reasoning, with only one out of five models surpassing random performance on basic jigsaw puzzles, revealing a scaling cliff in their capabilities.
Fr茅chet Distance, previously deemed impractical for training, unlocks surprisingly high-fidelity image generation when optimized in representation space with decoupled batch sizes.
Finally, a model that can generate realistic videos of human-object interactions, like pouring liquid, by conditioning on actions, text, and images.