Search papers, labs, and topics across Lattice.
4
2
4
10
Video generation models could be the key to unlocking general-purpose vision intelligence, outperforming specialized models with far less training data.
Visuomotor control can now generalize to unseen environments and instructions by grounding world models in a vision-language latent space, outperforming standard vision-language approaches by a large margin.
Explicitly modeling depth in world-action models significantly boosts planning robustness and future prediction quality for autonomous driving.
DrivingGen reveals that current generative driving world models either look good but break physics, or capture motion realistically but lack visual fidelity, exposing a critical trade-off for autonomous driving applications.