Search papers, labs, and topics across Lattice.
6
0
4
4
Injecting diffusion representations into CLIP pipelines boosts CZSL performance, revealing the untapped potential of generative models in zero-shot learning tasks.
Embedding reference tokens at semantic positions allows for unprecedented precision in multi-reference video editing, setting a new benchmark for instruction quality.
FlowCIR slashes training resource requirements by 90% while boosting robustness against negation in zero-shot image retrieval tasks.
LISA accelerates training and enhances output quality in visual-condition generation by aligning side network features with likelihood scores, all without extra inference costs.
Decoupling radial and angular dynamics in vision-language model adaptation unlocks significant gains in few-shot performance, outperforming existing flow matching methods.
Achieve high-fidelity, training-free visual generation from coarse inputs by cleverly steering pretrained diffusion models with a noise-adaptive h-transform.