Search papers, labs, and topics across Lattice.
HKUST
5
0
4
4
Embedding reference tokens at semantic positions allows for unprecedented precision in multi-reference video editing, setting a new benchmark for instruction quality.
FlowCIR slashes training resource requirements by 90% while boosting robustness against negation in zero-shot image retrieval tasks.
LISA accelerates training and enhances output quality in visual-condition generation by aligning side network features with likelihood scores, all without extra inference costs.
Decoupling radial and angular dynamics in vision-language model adaptation unlocks significant gains in few-shot performance, outperforming existing flow matching methods.
Achieve high-fidelity, training-free visual generation from coarse inputs by cleverly steering pretrained diffusion models with a noise-adaptive h-transform.