Search papers, labs, and topics across Lattice.
Affiliation:
2
0
3
Visually grounded linguistic guidance transforms dense video captioning by dynamically adapting to semantic changes, leading to superior event localization.
LLM-augmented training with similarity-aware masking lets weakly-supervised video captioning models generate more accurate event descriptions and temporal boundaries, even with sparse training data.