Search papers, labs, and topics across Lattice.
Korea University
3
0
3
Aligning text with action-relevant video segments, TF-CADE significantly boosts performance in zero-shot action detection, outperforming existing methods.
Direct composition learning in DiCE-CIR achieves state-of-the-art zero-shot image retrieval without the overhead of projection methods, streamlining the process significantly.
By explicitly modeling relationships between multiple relevant video segments, ClipTBP significantly improves video moment retrieval, especially when queries are ambiguous.