Search papers, labs, and topics across Lattice.
Nanjing University, AI Laboratory
4
0
7
TimeLens2 outperforms models with up to 397B parameters by effectively grounding temporal evidence in videos, redefining expectations for multimodal LLM capabilities.
Current MLLMs fail to provide adequate support for visually impaired individuals, particularly in anticipating navigation-critical events in real-time.
VideoChat3 achieves unprecedented generalization in video understanding while maintaining high efficiency, outperforming larger models with just 4 billion parameters.
DOPD reveals that intelligently routing supervision based on advantage gaps can significantly enhance capability transfer in distillation, outperforming conventional methods.