Search papers, labs, and topics across Lattice.
The Hong Kong University of Science and Technology
2
0
3
Recognizing complex, simultaneous camera movements in video clips is now feasible without the heavy computational cost of 3D models at inference.
Aligning pretraining with prompt-conditioned generation can recover significant performance in diffusion language models without altering inference methods.