Search papers, labs, and topics across Lattice.
University of Wisconsin-Madison
4
0
7
Jointly optimizing visual token selection and LLM computation can drastically reduce inference costs while enhancing performance in multimodal tasks.
TOFFEE can synthesize high-quality data agent trajectories that significantly improve LLM performance in unfamiliar analytical workflows.
Current vision-language models falter in streaming interaction understanding, with alarming mis-calibration leading to confidently incorrect predictions.
Unlocking video generation in any temporal order, UniTemp enables innovative workflows like bidirectional extensions and visual story generation without sacrificing performance.